EP183 · Jev 系统一模型、AI 软件工厂、工作流程资产
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Jev 用可校准决策接入代码,Warp 把开发做成可度量工厂,UiPath 沉淀工作地图;借此判断生产 AI 的控制点。
本期内容
20 条Jev:面向生产软件的快速决策模型
TypeSafe AI CEO Diogo Almeida 在 Latent.Space 访谈中,把 Jev 定义为供代码直接调用的 System One 模型。其路线强调校准决策、结构化状态和小决策分解,以提升可测与可靠性。他也将可靠性理解为相近输入获得相近结果,并主张把复杂任务拆成可分别验证的语义单元;对开发者而言,价值在于重审 AI 如何嵌入既有控制流。
工程团队的 AI 软件工厂实战手册 | Warp CEO Zach Lloyd
Warp CEO Zach Lloyd 在 How I AI 展示的软件工厂,把 Slack 发起、Linear 跟踪、实现、PR 与计算机使用 QA 放进同一条公开流程。团队还对运行记录打分、回放任务比较成本和质量,并用观察者更新工厂定义;启发在于把 Agent 产出转成可度量、可迭代的工程系统。
Daniel Dines:工作流程而非模型才是 AI 时代最有价值的资产
UiPath CEO Daniel Dines 在 20VC 访谈中认为,企业的关键资产是记录实际流程的工作地图,而不是孤立地追逐最新模型。它把业务语境交给 Agent,并以编排与自动化轨道约束执行;这解释了为什么流程文档、上下文和治理会成为 AI 落地的长期基础。
智能体控制框架:生产级 AI 智能体的控制平面、不变量与审批边界
OpenAI 基础设施工程师 Vinoth Govindarajan 借助真实的 OpenClaw 缺陷报告指出,生产级 AI 智能体需要一个控制框架——状态归属、有序变更、有界工作与限定范围的审批——因为模型负责提议,而控制框架必须负责提交并留下凭证。
Loop engineering:把 agent 放进工程循环
文章系统拆解了 Loop engineering 这一理念,提出工程循环的六个必备动作与六大支撑组件,并给出自动化判定标准、失败模式与权限分层建议。
10 个人加一套 AI 软件,做出 100 个人的增长:AI 时代企业服务的算账逻辑
深演智能创始人黄晓南指出,企业级 AI 虽聪明但“涉世未深”,需 FDE 将客户痛点产品化,并强调大模型无法获取企业数据、知识和工作流是核心护城河,未来企业服务将由“Agentic Software”驱动,实现“10 个人做 100 人的增长”,关键在于甲方能否找到核心增长点并与大模型建立“垂直”关系。
阿里达摩院医疗 AI,十年拼出一张图
阿里达摩院医疗 AI 团队十年磨一剑,从单病模型突围,经「一扫多查」策略落地多癌筛查,最新推出通用医疗影像模型 RADAR 登上 Science,实现腹部增强 CT 上 146 种病症的专家级识别与零样本诊断。
通过要求智能体加速代码,写出比最先进库更快的 Rust 代码
通过给智能体式 LLM 设定明确的通过/失败性能约束和防作弊护栏,Max Woolf 让它们迭代优化 Rust 代码,在机器学习和日常软件领域实现了比最先进库快 2 倍到 20 倍的速度。
不换机器,也不造机器人:这家公司让几十年前的老工厂直接接进 AI
美国创业公司 Harmoni 通过在旧工厂机床旁安装平板电脑,将人、机器、订单与 ERP 数据打通,在不更换设备的前提下实现工业 AI 落地。
为下一阶段 AI 制定标准
OpenAI 呼吁美国牵头全球努力,为前沿 AI 制定国际技术标准,涵盖递归自我改进,涉及评估、人类监督和事件报告。
从 AI Coding 到 Harness Engineering 的端到端工程开发实践
腾讯应用宝活动平台团队在系统重构中落地 Harness Engineering,通过知识库工程与状态文件驱动的端到端开发工程,将 AI 从对话式编码升级为覆盖需求拆解到代码提交的全流程自动化系统。
机器人领域的 OpenAI,竟然是 OpenAI 自己?
GPT-6 Astra 无需专门机器人训练即可充当机械臂「大脑」,在抓取任务中达 95% 成功率,但在精密接触任务上骤降至 10%,揭示通用大模型与物理身体之间的能力断层。
面试官皱眉:“你用过 LangChain 里的 Deep Research 吗?”,我:“就是多搜索几次,再让模型生成一篇更长的报告”
Deep Research 不是 LangChain 核心包里的固定开关,而是一类研究型 Agent 架构,核心在于动态规划、子课题隔离、证据核验与统一写作,而非简单多搜几次。
面向智能体的前沿 AI 推理云:FriendliAI 的生产级架构
FriendliAI 创始人 Gon Chun 认为,生产级智能体应以端到端任务延迟而非单次对话请求速度为核心,并通过开放权重模型与前缀缓存、KV 缓存管理、缓存感知路由和智能体感知优化降低推理成本。
从“看见文字”到“读懂画面”:AI MediaKit 如何实现视频字幕无痕擦除
火山引擎 AI MediaKit 以多模态语义理解判断文字角色、以自研 ReFM 残差流匹配做受控生成修复,实现复杂花字、水印的精准擦除与场景固有文字的完整保留。
清华初创&UIUC 学者用 7B 模型在预测市场上自我蒸馏,跑赢 GPT-5.6 和 Opus 5
UIUC 与清华初创团队 Astraculum 提出 Social World Model (SWM) 框架,通过自蒸馏微调 (SDFT) 机制在预测市场数据上进行持续学习,使 7B 模型在 390 天滚动回测中击败了 GPT-5.6 和 Claude Opus 5 等前沿模型。
开源个 Skill,帮你用代码低成本生成产品宣传片
作者开源了一个名为 guizang-product-video-skill 的 AI Skill,能够通过读取代码库的组件、样式和品牌色,利用 React 渲染和 Python 波形合成,低成本生成与产品审美高度一致的宣传视频。
一万字 Jev 工程实践长文:把 Agent 的「判断题」从大模型里拆出来
作者通过阅读资料、拆解 fast-jev-compaction 并仿写 Demo,论证 Jev 的价值不在替代大模型,而在于把 Agent 中高频、封闭、可回退的判断从生成链路里拆成独立的「快判断层」。
像物理学家一样剪枝 LLM:将模块移除视为伊辛优化问题
本文提出了一种 LLM 模块移除方法,将其重新表述为映射到伊辛玻璃的约束二元优化问题,从而实现高效、高性能的深度剪枝,并考虑了模块间的相互作用。
腾讯开源记忆系统 T-Mem:用「预演」触发器补齐联想性召回盲区
腾讯团队开源长期记忆系统 T-Mem,指出四代记忆架构检索配方相同、联想性召回是结构性盲区,通过写入时生成四族 trigger 补上这一半,在 LoCoMo-Plus 联想子集上大幅领先。