EP180 · 研发进度指标、业务评测、端到端交付
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
从前沿实验室的研发指标,到大淘宝的评测治理、菜鸟的端到端交付,读出 Agent 落地的观察口径与实施路径。
本期内容
20 条理解前沿实验室 AI 研发进度的衡量指标
Anthropic 把实验室内部的研发进展拆成 AI 参与研发、对智能体行动的监督和算力分配三组可持续披露的指标。它关注的是模型如何被开发,而非只评估模型能做什么;原文也承认跨实验室可比性仍受方法与自评限制。对中文读者而言,这提供了观察前沿能力扩张与安全投入时可追问的共同口径。
让 Agent 可评、可控、可迭代:业务效果导向的评测体系与场景实践
大淘宝团队聚焦会直接影响业务指标的策略类 Agent:离线判断合理,线上效果仍可能失准。文章把评测展开为从输入约束到业务效果的分层对象、问题归因和上线治理,并以自动挖掘、筛选与验证规则的方式校准 Judge。它的启发在于,把评测结果接回准入、灰度和回归,才能让改进有可追踪的落点。
AI Coding 贡献率超 90%,需求交付却只快了 10%:菜鸟如何用 Agent 托管端到端交付?
菜鸟的复盘给出一个很具体的提醒:代码生成占比提升,并不会自动缩短需求交付。它把瓶颈放回需求澄清、测试、部署和人工交接等整条链路,继而用通用 Agent、Plugin、Playbook 与结构化任务状态组织云端托管交付。对团队而言,值得先判断哪些小而边界清楚的任务适合交给系统闭环完成。
LoRA 一作、OpenAI o1 核心成员的新工作:首次公开 397B 模型的 Agent RL 训练配方
LoRA一作、OpenAI o1核心成员联合发布的首份397B知识工作Agent RL训练配方,系统公开了从Harness治理、Token对齐到异步训练调优的完整流程,Pass@1相对提升70%,并论证了Agent RL本质是系统工程而非算法选型。
Claude 如何提升生物分子建模能力
Anthropic 展示了 Claude 如何优化 30 多个开源生物分子模型,实现平均 4 倍的加速,并支持在单个 GPU 节点上对大规模分子系统进行建模。
日志服务 TLS AgentLoop:让多模态调用清晰可见
火山引擎日志服务 TLS AgentLoop 通过将多模态媒体内容(图、音、视)直接关联至会话与调用链,解决了多模态 Agent 调试中由于缺乏视觉上下文而导致的排查困难问题。
Canto:为真实世界打造的语音模型 | Wispr Flow
Wispr AI Lab 推出了 Canto,这是一个针对挑战性真实口述环境优化的实时语音模型,利用监督微调(SFT)和基于 GRPO 的强化学习,在嘈杂和低音量条件下表现优于竞争对手。
DoorDash 利用多智能体 LLM 清理 60,000 个特性标志
DoorDash 构建了一个基于 Claude 和 MCP 的多智能体 LLM 系统,用于自动化清理过时的特性标志(Feature Flags),将单个标志的平均清理时间从约 1.5 小时缩短至 13.8 分钟。
为智能体重建 Web:MCP Apps 与面向意图的互联网
Liad Yosef 认为,面向智能体的 Web 需要意图级 API、可发现的资源,以及只在仍需人工判断时把品牌化 UI 通过 MCP Apps 带回对话。
同样的时间与预算,做 3 条还是做 30 条?AI 如何改写内容的生产逻辑
通过星榜创始人刘思洋的实践案例拆解AI内容生产的「系统工程」逻辑,揭示废片率50%仍可盈利的工业账本及「假降本」陷阱,提出从创意到交付的核心在于控制无效调用、复用经验与数据反馈闭环。
迈向自驱动代码库 | Detail
作者认为,目前 AI 智能体无法实现软件工程自动化的原因在于开发环境不足而非模型限制,并提出转向「智能体可读」的技术栈以实现自驱动代码库。
换一套 Harness,比换两代模型还管用
本文系统性地阐述了 Agent Harness(模型外工程层)的设计架构,主张模型决定上限而 Harness 决定实际产出,详细解析了 Agentic Loop、工具系统、记忆与上下文管理及护栏四大子系统的构建原则与工程实践。
Qwen 发布 Qwen3.8-Omni-Flash:一款具备智能体能力的全模态模型
阿里巴巴 Qwen 推出 Qwen3.8-Omni-Flash,这是一款原生音视频全模态模型,具备智能体能力、1M 上下文窗口,并大幅降低了视频输入成本。
Figure 租了 30 套房,让机器人挨家“考核家务”
Figure 发布 Helix 2.5 神经网络,在 30 套陌生住宅中零样本完成整理客厅、铺床、折毛巾等长时程家务,成功率从 9% 提升至 56%,并首次在人形机器人上验证了「人类到机器人迁移缩放定律」。
九问 ScienceDiscovery:从纳米抗体到大飞机,AI 如何从「给答案」走向「做研究」
华为 openJiuwen ScienceDiscovery 通过记忆图谱与产物自迭代两套机制,把纳米抗体研发和民机气动设计改造成可追溯、可闭环的科研工作流,让 AI 从「给答案」走向「做研究」。
Amazon SageMaker HyperPod Inference Gateway 正式发布 | Amazon Web Services
AWS 推出了 Amazon SageMaker HyperPod Inference Gateway,这是一个 Kubernetes 原生的 GPU 感知路由系统,通过利用实时指标消除轮询瓶颈并降低首字延迟,从而优化 LLM 推理。
解密 Cybercab:马斯克的 “车养人” 生意,账算得过来吗?
文章追溯马斯克十年来关于Robotaxi的反复承诺,结合Cybercab奥斯汀首发的最新进展,对单车运营成本、平台抽成和回本周期做情景测算,结论是「车养人」的账远没有听起来那么简单。
于是转身向具身走去|对话王家伟:深朴智能 00 后首席科学家
深朴智能首席科学家王家伟分享其从大模型转向具身智能的思考,探讨了具身基础模型的预训练、Action Policy 的必要性以及全栈研发的逻辑。
别再按 2022 年的方式切分:让多尺度索引适配不同问题
Yuval Belfer 将切分定义为依赖查询的有损压缩,说明没有一种固定大小适用于所有检索问题,并提出用多尺度索引结合倒数排名融合,在增加存储的同时扩大召回覆盖。
BM25 为何对 Agentic Search 出奇有效:面向智能体的检索基础设施
Jo Kristian Bergum 认为,BM25 之所以对 Agentic Search 出奇有效,是因为强大的语言模型能够构造、检查并改写词法查询,同时受益于精确、低成本且可解释的检索。