EP114 · 代理长程验证、工程训练车间、产品判断力 · 07-11 早报
本期导语
当编码代理能独立跑上数小时,团队该把信任放在哪里?Cognition 的答案是工程师试用与真实约束,快手则展示了用可运行仓库训练和验证长程任务的路径。另一篇访谈把视线转向产品判断与推荐透明度,适合分别从工程、训练和产品三个角度展开阅读。
本期内容
42 条Cognition 用真实工程验证 Claude Fable 5 的长程编程能力
Cognition 用自建 Frontier Code 与工程师日常试用判断模型,而非只看通用基准。其团队称 Claude Fable 5 能在杂乱日志中定位根因、说明未知项,并可连续工作约八小时仍推进任务。文章提供的价值不在分数,而在考察长程编码代理是否值得托付的具体标准:能否守住约束、验证结果并在不确定时停下。
KAT-Coder-V2.5 正式发布:从“写代码”到“做工程”,Agentic 能力全面提升
快手把代码智能体的训练重点从单文件补全转向可运行的真实仓库:AutoBuilder 在隔离环境中生成配置、验证测试并迭代修复,使环境构建成功率提升至57.2%,覆盖12种语言和超过10万个仓库。再结合多框架训练、分层奖励与失败轨迹回收,文章给出了一套针对长程工程任务的训练管线及其指标。
AI 时代品味、人类真实感与判断力的崛起
Adam Mosseri 在访谈中把 AI 工具普及后的产品工作拆成两个问题:执行成本下降时,团队仍需用有争议、可被反驳的策略判断决定做什么;推荐系统则可借助 LLM 把难以解释的向量偏好转成用户可理解、可调整的兴趣概念。对产品和内容团队而言,这是一份关于人类品味、身份标识与推荐透明度的观察。
全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!
蚂蚁灵波发布全球首个具身原生预训练VA基座模型LingBot-VA 2.0,通过预判物理世界变化实现机器人高效闭环控制。
从模型到 Harness:WorkBuddy 如何把 Agent 做成可用产品
本文从产品视角完整拆解 WorkBuddy 如何通过 Context Engineering、Memory 系统、Harness Engineering 等机制,将 LLM 模型能力转化为稳定可用的 Agent 产品,而非仅依赖模型或提示词。
使用 NVIDIA NeMo 进行金融 AI 研究的合成数据生成
本文详细介绍了一个迭代流程,使用 NVIDIA NeMo Data Designer、Curator 和 Nemotron 模型生成跨越 13 个类别的 500k 条多样化金融新闻标题。
意识 × Loop:让 Loop 跨 Session 自进化的最佳实践
本文以 FDE 公司调研实践为例,提出通过「意识层」(AGENTS.md / MEMORY.md / USER.md)实现 Agent Loop 跨会话自进化的方法论,并详细阐述三层对齐、手动阀门保留及搭建步骤。
【揭秘】如何打造一支凌晨 3 点还在交付的 AI 军团
本文详细介绍了腾讯基于 Multica 构建 AI Agent 协作平台的实践,从工作流设计到多 Agent 接力,探讨如何让 AI 真正学会“工作”并形成超级组织雏形。
科技爱好者周刊(第 403 期):为什么 Dropbox 不成功
本文以 Dropbox 为案例,深入分析其从云盘先驱到增长停滞的根本原因——将自己定位为消费者工具而非企业生产力工具,并汇总本周科技动态、工具、AI 相关及资源。
AI 推理成本首次算清:GPU 利用率不到 52%,千万别自建!
本文通过五维成本模型和真实案例,首次系统推导出 AI 推理自建 vs API 的盈亏平衡利用率临界点为 52%,并揭示 API 厂商利用客户认知不对称的定价策略。