BestBlogs.dev 第 114 期:过剩与短板
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
大家好!欢迎阅读 BestBlogs.dev 第 114 期 AI 精选文章推荐。
上期谈「模型之外的尺子」,说的是检查、约束与责任并不住在模型权重里。本周把这条线推到了一个更刺眼的位置:模型这一侧还在加速变便宜,价值兑现那一侧却几乎没有跟着变快。
一夜之间三款模型落地,Opus 5.5 典型负载成本比上代降 40%,GPT-6 Sol 与 Luna 比同款便宜 50%,Grok 4.7 干脆价格与速度都不动、只加能力。但另一半内容给出的是另一组数字:网易内部个人 AI coding 提效 300% 到 500%,软件交付却只从 20 天缩短到 17 天;Anthropic 说现代化项目的瓶颈已经从产出变更转移到围绕变更动员组织;Claire Vo 说执行过剩、信念稀缺。
这就是本期的「过剩与短板」。过剩的是算力、Token 与代码产出,短板是流程、评测、上下文与判断。其余内容恰好都在补中间那一层:评测怎么和线上指标对齐,loop 怎么设计才不只是烧 Token,组织知识怎么变成 Agent 能调用的东西,推理请求怎么在跨区余量之间被路由。
以下是本周最值得关注的 10 个精彩亮点:
💸 降价成了本周的共同动作,但账要一家一家算。 Anthropic 官方发布 Claude Opus 5.5:多数任务对齐 Fable 5.1,典型负载成本降 40%,缓存读取降 60%,一位测试者在不到一天内完成 68 万行代码迁移。xAI 的 Grok 4.7 则价格与速度都按住不动,把提升压在更大基座与更长强化学习上。一篇中文实测把三家放进同一张成本表,也点出蒸馏档的陷阱:Opus 5.5 卡住时会持续疯狂尝试,反而更烧钱。
🧪 开源这一侧把算力投进了可验证任务。 小米 MiMo-V2.6 不靠数据复制,而是从更大 Batch、更多复杂环境、更大 Grader 算力三个维度扩 RL,指向递归自我改进,Pro 在 AA 综合智能指数拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max。材料设计与 Lean 形式化证明的案例说明,这条路线已经能接住专业任务。
⚖️ 有人开始把判断从昂贵的生成模型里拆出来。 Diogo Almeida 的诊断是 RLHF 把人写进了训练回路,目标是让人满意而不是让软件自主运行,所以 Jev 只输出 Choice、Score 与 Null,让代码成为输出的消费者。LangChain 的实测补上另一半证据:方差比 LLM 评委低 92 到 913 倍,单次 0.00035 美元、延迟 0.44 秒。便宜且一致的评委,解锁的是在线全量评估。
🧬 Agent 已经能在真实科学里提出值得验证的假设。 Anthropic 生命科学实验室让约 950 个 Claude 智能体用 21 小时、2.1 亿 Token 扫过 20 万条逆转录酶序列,收敛到 3500 个候选,其中一个注意到异常 RT 旁的串联重复阵列,团队据此命名 ART 酶系统。功能未定、工作仍是预印本,真正可迁移的是这条 AI 生成假设加湿实验验证的链路。
🍜 工业级落地的标准仍然是数字。 美团 MTFM 把外卖首页、拼好饭等长期独立建模的场景收进一个统一推荐基座:异构 Tokenizer 免对齐,混合注意力压算力,样本粒度升到用户级。线上订单量最高提升超过 6%,推理成本降低 24%。这是可复盘的生产方案,不是模型名片。
🏛️ 瓶颈已经从写变更,转移到围绕变更动员组织。 Anthropic 前置部署工程师把代码现代化的开工前准备拆成六步,两个概念最值得抄:证书是每个变更必须满足、且无需人在回路即可自动检查的条件集合;晋升策略按影响半径与置信度分层评审,关键路径仍保留完整人审。这是本期主题最直接的工程注脚。
📏 评测要和业务指标对齐,loop 要有停止条件。 大淘宝的策略 Agent 评测给出五层对象、四步归因与三阶段治理,用 AutoRubrics 替掉黑盒 Rewa
本期内容
20 条一夜三连发,Claude Opus 5.5、GPT-6 Sol 和 Luna 全部都来了。
同一夜三款模型落地,卡兹克把它们放进一张成本表里读:Opus 5.5 输入输出为每百万 Token 4 与 20 美元、典型负载成本较上代降 40%,GPT-6 Sol 与 Luna 比 GPT-5.6 同款便宜 50%,共同主题是把旗舰能力下放到更便宜的档位。他也点出蒸馏档的陷阱:Opus 5.5 每任务输出 Token 暴涨,卡住时会持续疯狂尝试,反而比旗舰更烧钱。文末按能不能稳定订阅 Claude,给出三套规划加执行的模型组合。 适合谁:需要在多模型并存下做选型与成本控制的开发者
本文记录了 2026 年 9 月 23 日凌晨 OpenAI 与 Anthropic 的「一夜三连发」:Anthropic 推出 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna。作者认为这轮发布的共同主题是把旗舰模型的能力下放到更快、更便宜的档位,即「帕累托前沿」之争。文章梳理了 Opus 5.5 的定价(输入 4 美元、输出 20 美元/百万 Token,成本较上代降 40%)、1M 上下文与 Coding 类基准的 SOTA 表现,也指出其每任务输出 Token 暴涨、陷入困境时反而更烧钱的陷阱;随后分析 GPT-6 Sol/Luna 的降价幅度(较 GPT-5.6 同款便宜 50%)、Luna 在批量自动化任务上的性价比,以及 Sol 在审美与细节上的明显降级。最后给出三套选型建议:能稳定订阅 Claude 者用 Fable 5.1 规划 + Opus 5.5 执行;被封号者转向 ChatGPT 体系;只能订阅国产模型者按习惯选择并只买月卡。
Introducing Claude Opus 5.5
Anthropic 官方发布页,也是本周降价潮最硬的一手依据:多数任务对齐 Fable 5.1,典型负载成本较 Opus 5 降 40%,缓存读取降 60%,输出速度提升超过 30%。真正值得记住的是长任务证据,一位早期测试者在不到一天内完成 68 万行代码迁移,页面加载优化任务 40 次中成功 39 次。更少见的是官方自陈:在当前能力水平上,基准分差已经不是真实差异的可靠指引。 适合谁:做模型选型、编码与 Agent 工作流的开发者与研究者
Anthropic 推出 Claude Opus 5.5,这是 Claude 5.5 家族的第一个模型,也是公司公开呼吁「为前沿踩刹车」之后的首次发布,上线前由 Frontier Design 与 METR 等外部评测方测试。性能上,一位早期测试者用它在不到一天内完成 68 万行代码迁移,这类工作原本需要工程团队数周;在压低 Web 应用各页面加载时间的任务上,Opus 5.5 成功 39 次、失败 1 次,而 Opus 5 改进幅度更小且会改变应用行为。基准方面,Terminal-Bench 4.0 达 66.4%、CursorBench 4.0 达 57.8%、GDPval-AA v2.1 达 1846,均领先 Fable 5.1;但在 AutomationBench(40.0% 对 41.4%)与 Terminal-Bench-Science(58.7% 对 64.6%)上落后于 GPT-6 Astra。官方罕见地主动指出,在当前能力水平下基准分差已不是真实差异的可靠指引,自用中 Opus 5.5 与 Fable 5.1 的差距比分数看起来更小。安全上,它在自动化行为审计这一最全面的对齐测试中取得历史最好成绩,更不易采取难以撤销的动作,抗提示注入强于 Opus 5;因生物与网络安全能力接近 Claude Mythos 5.1,部署时采用与 Fable 5.1 相当的防护。成本上,输入与输出为每百万 Token 4 美元与 20 美元(较 Opus 5 降 20%),缓存读取降至 0.20 美元(降 60%),典型负载综合成本降约 40%,输出速度提升超过 30%,Pro、Max、Team 与按席位的 Enterprise 方案五小时用量上限同步提高。Claude Sonnet 5.5 与 Haiku 5.5 将在未来几周跟进。
Introducing Grok 4.7
xAI 把 Grok 4.7 的价格与速度按住不动,与 Grok 4.6 持平,为每百万输入 2 美元、输出 6 美元,把提升全部压在更大基座与更长强化学习上。榜单诚实地有输有赢:EEBench 64.0% 与 Harvey 法律 Agent 19.6% 领先,CursorBench 4.0 的 46.3% 与 Terminal-Bench 4.0 的 37.6% 则明显落后 Fable 5.1。安全是核心卖点,在 LatchBio 生物安全基准上以 62.4% 居首,仅放行 3.3% 的高风险两用网络提示词。 适合谁:按预算做前沿模型选型、同时需要看安全指标的团队
xAI 发布 Grok 4.7,称其是面向编程与知识工作能力最强的模型,定价与速度与 Grok 4.6 保持一致。提升来自更大的基座模型,以及在更难、常需数小时完成的任务上做更长的强化学习训练,使模型更擅长验证自身工作与管理长上下文;它还被训练为原生理解 Grok Bot 运行框架。官方称在侧重长时编程任务的 CursorBench 4.0 上,它相对 Fable 5.1、Opus 5、GPT-5.6 Sol 与 Sonnet 5 处于性价比前沿。基准结果有输有赢:EEBench 64.0%、Harvey Legal Agent Benchmark 19.6%、AA Briefcase v1.1 为 1657,领先对照模型;但 CursorBench 4.0 为 46.3%、落后 Fable 5.1 的 51.8%,Terminal-Bench 4.0 为 37.6%、大幅落后 Fable 5.1 的 57.9%,HealthBench Professional 为 56.7%、落后 GPT-5.6 Sol 的 60.5%。GDPval 上 Grok 4.7 xhigh 的 Elo 为 1695,高于 Grok 4.6 的 1605,低于 Fable 5.1 max 的 1735。安全是核心卖点:xAI 称其为迄今测试过在拒答与抗越狱方面最强的模型,在 LatchBio 生物安全基准上以 62.4% 位居榜首,仅放行 3.3% 的高风险两用网络提示词,同时极少拦截合法的安全工作。定价为每百万输入 Token 2 美元、输出 6 美元,另有速度与价格均翻倍的快速版本;模型已在 Cursor、Grok Build、Grok API、第三方编程运行框架、模型路由器与云平台上线。
Xiaomi MiMo-V2.6:扩展强化学习规模,迈向自我提升
小米讲清 MiMo-V2.6 的路线选择:不靠数据复制,而是把算力投进可验证的复杂任务做大规模强化学习,从更大 Batch 与吞吐、更多任务与复杂环境、更大的 Grader 算力三个维度扩容,指向递归自我改进。Pro 在 AA 综合智能指数拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max。随附的材料设计、Lean 形式化证明与 Computer Use 案例,说明这条路线已经能接住专业任务。 适合谁:做开源模型、RL 训练与 Agent 能力评估的工程师
小米正式发布 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个全模态模型。该版本的核心在于探索 RSI(递归自我改进)路径,通过可验证的复杂任务进行规模化强化学习(RL),让模型在持续反馈中拓展边界。在性能上,MiMo-V2.6-Pro 在 AA 综合智能指数中获得46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强开源模型。技术上,团队从更大 Batch 与更高吞吐、更多任务与复杂环境、更大的 Grader 算力三个维度扩展了 RL 算力。此外,模型在 3D 游戏、Blender 3D 建模、具身智能、Computer Use Agent 以及科研领域(如材料设计、数学形式化证明)展现了强大的应用潜力。
Diogo Almeida:我为什么要做 Jev?
Diogo Almeida 曾在 OpenAI 把 RLHF 推向大规模应用,现在他的诊断是 RLHF 把人写进了训练回路:目标是让人满意,而不是让软件自主运行,所以模型能解未解的数学题,客服却仍离不开人。TypeSafe 因此走第三条后训练路线,不优化人类偏好也不只优化可验证正确性,而是优化经过校准的决策,用 Choice、Score 与 Null 让代码成为输出的消费者。公司 9 月 15 日结束两年隐身期,同时完成 4000 万美元种子轮。 适合谁:设计 Agent 路由与判决层、思考模型分工的人
Jev 是 TypeSafe 在 9 月 15 日结束两年隐身期时发布的模型,同时宣布完成由 DCVC 领投的 4000 万美元种子轮。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 与 GPT-4 等研究,是把 RLHF 推向大规模应用的核心研究者之一,离开后却选择了几乎相反的方向:不再训练一个更会说话的模型,而是做一个完全不生成文字的模型。本文由 Founder Park 综合他的公开演讲、播客访谈,以及 Foundation Capital 合伙人 Jaya Gupta 的文章整理。他的核心论证是:模型能解出尚未解出的数学题,客服却仍然需要人在回路,原因不在能力而在训练目标。RLHF 的做法是收集人类偏好再针对人类偏好优化,等于真正把人放进了训练回路,目标是让人满意而不是让软件自主运行;他用「有人给 ChatGPT 发一段放屁音效并要求诚实评价,模型回答它营造出诡异氛围感」说明模型在不知道答案时会倾向于给出最符合人类偏好的回应,而无论错得多离谱都会努力让自己看起来是对的。由此他划出辅助与自动化的分界,并认为 Claude Code 虽强,仍属于辅助时代。如果把后训练看作一棵树,RLHF 优化人类偏好,RLVR 优化可验证的正确性与尽可能低的错误率,TypeSafe 做的是第三种:优化经过校准的决策。Jev 被描述为「机器原生、大型、可编程」的 System 1 模型,目标是让代码成为输出的消费者,提供 Choice(从预设选项中选择)、Score 与 Null 三类输出,追求每美元获得尽可能多的智能。Jaya Gupta 则把它放进更大的变化里:在模型越来越智能也越来越昂贵时,Jev 带来的可能是一场新的「智能大拆分」。
MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践
美团把外卖首页、拼好饭等长期独立建模的场景收进一个统一推荐基座:异构 Tokenizer 免去跨业务特征对齐,Target 与 Full 按 3 比 1 的混合注意力压住长序列算力,样本粒度从曝光升级到用户级,让同一用户在多业务的曝光共享长序列计算。工程侧给出深度感知初始化、Muon 优化器与定制 Triton Kernel 的具体做法,线上订单量最高提升超过 6%,推理成本降低 24%。 适合谁:做推荐与广告精排、要把多场景模型统一起来的算法与架构师
本文详细介绍了美团统一推荐基座大模型 MTFM 的设计与落地实践。针对推荐系统在多场景建模中的规模可扩展性、场景可延展性与架构高效性挑战,MTFM 采用了类 Transformer 骨干网络,通过异构 Tokenizer 实现多场景特征免对齐,引入混合注意力机制(Full Attention 与 Target Attention 堆叠)降低计算复杂度,并提出 Target Token Scale-Up 增强模型能力。在工程实现上,MTFM 升级为 User-Level 样本训练范式,并针对深层网络训练稳定性、多业务联合训练及 GPU 算子(如 FA 镜像、GLN Kernel)进行了深度优化。实验结果显示,MTFM 在外卖多个核心业务中取得显著收益,订单量提升最高超 6%,推理成本降低 24%,且验证了在层数、维度和序列长度上的 Scaling Law。
Claude discovers a novel enzyme system with CRISPR-like repeats
Anthropic 生命科学实验室的一手记录:约 950 个 Claude 智能体用 21 小时、2.1 亿 Token 扫过 20 万条逆转录酶序列,收敛到 3500 个候选系统与 20 份报告,其中一个注意到异常 RT 旁边的串联重复阵列,团队据此命名 ART 酶系统。文章诚实标注边界,功能尚未确定,工作仍是预印本。真正可迁移的,是 AI 生成假设加湿实验验证这条可核查的链路。 适合谁:关注 AI for Science 与生物信息工作流的读者
Anthropic 介绍了其新成立的生命科学研究团队及湾区实验室,该团队利用 Claude 挖掘 DNA 数据库中的未表征蛋白质家族,并在实验台上测试候选对象。在一个早期项目中,约 950 个 Claude 智能体花费 21 小时、消耗 2.1 亿 token 搜索一个大型 RT 数据库,收集了超过 200,000 个逆转录酶,逐步缩小至 3,500 个候选系统,最终形成 20 份报告。其中一个智能体注意到一个不寻常的 RT,其两侧有类似 CRISPR 阵列的串联重复序列。经过文献检索和实验室实验,团队将该系统命名为阵列相关逆转录酶(ART),主要存在于噬菌体中,由一个 RT、一个伙伴基因和均匀间隔的 DNA 重复序列组成,这些重复序列被表达为短 RNA。其功能仍然未知,但这些特征的组合迄今为止仅出现在能够切割、复制或粘贴 DNA 的可编程系统中。CRISPR 先驱张锋称这一发现引人入胜,值得进一步研究。Anthropic 发布了预印本,并将这一结果视为 AI 智能体能够自主检测异常并发起生物学发现的证据。
How to prepare for AI-driven code modernization projects | Claude by Anthropic
Anthropic 前置部署工程师把真实客户项目的开工前准备拆成六步,核心判断很硬:Agent 加速写变更之后,瓶颈转移到围绕变更动员组织。最值得抄的是两件事,一是「证书」,即每个变更必须满足、且无需人在回路即可自动检查的条件集合,从原测试套件、对抗式评审到新旧版本同输入同输出;二是「晋升策略」,按影响半径与 Agent 置信度分层评审,关键路径仍保留完整人审。 适合谁:要在受监管或高风险系统上跑 Agent 迁移的工程负责人
这是 Anthropic「Notes from the Field」系列文章,由前置部署工程师根据真实客户部署总结大型代码现代化项目的准备工作。作者指出,过去按数年、全员投入规划的现代化项目如今可能几个月甚至几周完成,但项目两端的组织工作并没有变:关键银行系统的每一次变更仍要走变更管理、评审与审批,而这些流程正是让关键系统可信的原因,它们建立在「人写每一次变更、人审每一个 diff」的假设之上。当 Agent 加速了变更的产出,瓶颈就从产出变更转移到围绕变更动员组织。文章把开工前的准备拆成六步。第一步定义目标,先判断属于 uplift、transform 还是 reimagine 三类现代化中的哪一类,绘制代码库依赖图并写下行为规格;作者强调风险削减通常比降本更重要,讨论要不要做时应先考虑不做的风险,例如未修补漏洞、不再受支持的运行时以及懂这套系统的工程师越来越少。第二步定义「证书」,即每个变更必须满足的一组条件,每条都要能在无人参与的情况下自动检查,来源包括原测试套件通过、Claude 新写测试通过、覆盖率达标、性能在约定区间、多次独立对抗式评审无阻断问题、新旧版本同输入同输出、持久化状态与线上格式可往返、staging 期间错误率与延迟无回退、静态分析与安全扫描无新增发现等;证书要和最终评审并放行变更的人一起写,检验标准是他们是否愿意只凭证书的证据就合并。第三步设定晋升策略,即预先写下并达成一致的分层评审路径,按影响半径与 Agent 置信度分层,关键路径保留完整人工评审,反复出现的告警应回到工作流或证书里修根因而不是逐个评审,并把稀缺的领域专家时间集中到高风险层。第四步铺好前置条件:环境、代码库与 CI/CD、团队与评审带宽、安全与合规。第五步围绕目标、证书与晋升策略构建定制的 Claude Code 动态工作流,把现代化拆给大量并行子 Agent。第六步先在代码库的一个小分区端到端跑通,再扩量。
Routing LLM Inference in Production: From Engine Signals to Policy — Qianru Lao & Lu Zhang, OpenAI
OpenAI 推理工程师讲清 IRB 为什么要重做:早期用类 P 控制器的反馈环调权重,看似自适应,实际难以解释和调参,流量来回抖动还会破坏 KV Cache 复用。重设计把全局视角交给控制面,把基于异步刷新快照的选路交给数据面,优化器在 TTFT、TBOT、健康度、容量与跨区余量之间最小化端到端延迟。一个 RPS 例子很直观:发到更远但有余量的引擎,可能比在过载邻居后排队更快。 适合谁:自建或采购推理网关、负责 GPU 集群调度的平台工程师
Lu Zhang 与 Qianru Lao 介绍 OpenAI 的推理负载均衡器 IRB。它位于 CPU 前端集群与多区域 GPU 引擎集群之间,需要在 TTFT、TBOT、健康度、利用率和 KV Cache 本地性等约束下选择引擎。早期路由采用加权一致性哈希,权重来自类似 P 控制器的周期性反馈环:性能优于集群平均水平的引擎会获得更高权重,受限引擎的流量也会自动重新平衡。但这种适应性方案难以解释和调试,与异构 GPU SKU 的组合效果不佳,还会产生破坏 KV Cache 复用的振荡。重设计后的系统将全局视图交给控制面,将基于异步刷新本地路由权重的选路交给数据面。面对异构容量和地域需求失衡,轮询与仅选最近引擎的策略都会失效;一个 RPS 案例表明,把请求发送到更远但有余量的引擎,可能比在过载的邻近引擎后排队更快。优化器根据需求、网络延迟、容量、健康度以及 TTFT 和 TBOT 负载曲线,最小化预期端到端延迟,同时满足完整承接需求、容量上限和权重非负等约束。生产保护机制包括对异常值引擎施加惩罚、设置动态重试预算以避免重试风暴,以及主动削减过量流量,让系统能够平稳降级。
Can Jev Be a Better Agent Evaluator?
LangChain 把 Jev 当作代码规则与 LLM-as-judge 之外的第三种评估器来实测,结论集中在稳定性与成本:Jev 的质量打分方差比 Claude Sonnet 4.6、GPT-5.6 等低 92 到 913 倍,单次调用平均 0.00035 美元、延迟 0.44 秒。作者也把边界说清楚,方差低不等于更准,评委仍可能稳定地错,而且实验只跑了小样本的天气智能体。便宜且一致的评委,真正解锁的是在线全量评估。 适合谁:搭 Agent 评测体系、想把线上 trace 变成反馈的工程师
本文探讨了 Jev(一种非自回归的「系统一」模型)作为 AI 智能体评估的第三种选择,旨在替代基于代码和 LLM-as-judge 的评估方式。与生成文本的 LLM 不同,Jev 直接返回类型化答案和概率。在利用天气智能体和 LangSmith 数据集的受控实验中,Jev 展现出与人类专家几乎一致的准确率,在连续评分中的方差极低(比某些 LLM 低 913 倍),且成本和延迟显著降低。作者认为,这种高信号、低成本的评估能够解锁可扩展的在线监控,并缩短智能体开发生命周期中的反馈循环,但同时也提醒需要针对更多样化的工作流进行进一步测试。
《AI Native 研发范式实践手册》重磅发布
阿里在云栖大会发布的手册,正面回答了本周反复出现的一个问题:模型能力到企业 10x 效能之间差什么。它把 gap 指到三处,Agent 基础设施是否让 Agent 安全访问内部系统,工作流与历史知识是否让 Agent 拿到清晰上下文,组织文化与激励是否跟上。论据是 AIDC 数字投手、千问用增 Agent 与万有无界三个真实案例,再展开 Harness、知识库、Sandbox、身份权限、Guardrail 与可观测的技术全景。 适合谁:负责企业级 Agent 基础设施与研发效能的技术管理者
本文是《AI Native 研发范式实践手册》的发布说明,手册在云栖大会「智启原生 研见未来」阿里巴巴集团 AI Native 研发实践论坛上正式发布。文章先梳理两年来的范式转折:2024 年中主流形态仍是 Copilot,GitHub Copilot、Cursor、通义灵码解决的是单点编码效率;同年 Cognition 发布 Devin 首次提出「AI 软件工程师」,把叙事拉向自主 Agent;2024 年 11 月 Anthropic 发布 MCP 建立工具连接的开放标准,2025 年初 Claude Code 以 CLI 形态把 Agent Harness 框架推到前台,OpenAI Codex CLI、Google Gemini CLI 与 Jules、Cursor 转向 Agent 模式,共同标志行业进入 Agentic 时代。模型能力提供了基础:截至 2026 年中,主流模型在 SWE-bench Verified 上的通过率已从两年前不足 30% 攀升至 80% 左右,在 Terminal-Bench 2.1 等更贴近真实工程的评测中,Claude、GPT-5.6 Sol、Qwen3 等均突破 85%,瓶颈因此从生成代码本身转移到需求理解、环境构建、测试验证、发布运维等占研发生命周期 70% 到 80% 的环节。与此同时企业级 Agent 基础设施成为新的竞争焦点:Anthropic 于 2026 年 5 月推出 Claude Managed Agents,Microsoft Entra 开始把 Agent 作为企业目录中的独立身份管理,MCP 授权规范纳入 OAuth 2.1,OWASP 专门整理了 Agentic AI 威胁模型。阿里的核心判断是,仅靠模型能力的自然溢出不足以带来 10x 效能,中间存在三方面的 gap:是否建成让 Agent 安全可靠访问内部系统的基础设施,是否通过重塑工作流与整理历史知识让 Agent 拿到围绕目标的清晰上下文,是否重塑了组织文化、人才画像、激励机制与协同模式。手册据此从 AIDC 数字投手智能营销助手、千问用增 Agent 与万有无界平台三个真实业务案例出发,提炼环境与验证驱动、平台能力升级、提效度量、数字员工与组织配套五个共性挑战,最后展开企业级 AI 研发基础设施的技术全景:Harness 框架、企业知识库、工具体系(MCP / Skill / CLI)、Sandbox 与 Coding 环境、身份与权限、生产安全 Guardrail 以及可观测能力。
让 Agent 可评、可控、可迭代:业务效果导向的评测体系与场景实践
大淘宝把策略类 Agent 的评测做成闭环:五层评测对象定义评什么,四步归因解决评完怎么办,三阶段治理管住怎么上线。技术核心是 AutoRubrics,用 LLM 从偏好对里自动挖掘并演化结构化评分标准,替掉黑盒 Reward Model,让判分可追溯。文章还把 LLM-as-Judge 的三个坑写透:位置偏差用 A/B 随机化消除,选择过拟合用 Stability Selection 与交叉验证防住,多轮一致性当作天然的置信度过滤器。 适合谁:为 Agent 效果负责、苦于离线分数与线上指标对不上的产品与算法
针对策略类 Agent 在反馈信号稀缺、多维权衡及离线线上脱节等挑战,文章构建了从 Prompt 约束到业务效果的五层评测对象,配套四步质量归因闭环(诊断-定位-优化-验证)和三阶段上线治理流程。核心技术突破在于引入 AutoRubrics 机制,通过从偏好对数据中自动挖掘、筛选并演化结构化评估标准(Rubrics),替代黑盒 Reward Model。文章详细分析了 LLM-as-Judge 中的位置偏差、选择过拟合及一致性陷阱,并提出了包括稳定性筛选和交叉验证在内的三层 Rubric Judge 构建方案,实现了策略效果的可信评估与规模化迭代。
Loop engineering:把 agent 放进工程循环
与其再写一句更好的提示,不如设计提示 Agent 的循环。文章给出可工作的工程 loop 必备六个动作:读状态、判断下一步、执行、验证、写回状态、判断停止条件。缺状态写回只是一次会话,缺停止条件就是烧 Token 的定时器。往下拆成 Automations、Worktrees、Skills、Plugins、Sub-agents 与 Memory 六个组件,并把权限按 observe、propose、act with approval、autonomous 四级分层,建议多数团队先把前两级做扎实。 适合谁:正在把 coding agent 接进持续工程流程的开发者与团队负责人
文章从「不要再只是提示 agent,要设计提示 agent 的 loop」这句话切入,指出当 coding agent 能自己读代码、改代码、跑测试、开 PR 后,工程师的重心应从逐轮操作转向设计自动化循环。作者先界定概念:一个可工作的工程 loop 至少包含读取外部状态、判断下一步、执行任务、验证结果、写入状态、判断停止条件六个动作,缺少状态写入只是一次会话,缺少停止条件就是烧 token 的定时器。文章把 loop 与 prompt engineering、context engineering、harness engineering 做了区分,并引用 Addy Osmani、Birgitta Böckeler、OpenAI Cookbook、Amplitude Ralph loop 及两篇论文作为背景。随后详细拆解六大组件:Automations 负责唤醒并需同时写 feedforward 与 feedback;Worktrees 解决并行文件冲突但不解决 review 带宽;Skills 把项目知识移出对话上下文;Plugins 与 connectors 让 loop 接触真实工具并需按风险分层授权;Sub-agents 分离 maker 与 checker;Memory 保证状态在对话之外持久化。最后给出 CI triage、review comment、harness maintenance 三个可落地示例,五个自动化筛选条件,以及目标函数过粗、验证被吞、状态无人读、并行制造理解债、成本无上限五类失败模式。
腾讯 15 年资深后台工程师,转战大模型推理的抉择
一位腾讯 15 年资深后台工程师自述为什么归零转做大模型推理,以及具体怎么入门:从 Transformer 结构切进去,把推理工程分成业务层、调度层与算子层,用分层降低复杂系统的认知负担。他的判断值得后端读者记下,AI Infra 本质是通用 Infra 的延伸,而 Agent 带来的长会话调度、状态持久化、长短记忆与工具沙箱,正是传统分布式与系统设计能力的用武之地。 适合谁:想转 AI Infra、推理工程或 Agent Infra 的后端工程师
作者作为拥有15年经验的资深后台工程师,记录了其在AI浪潮下转型大模型推理领域的过程。文章详细分析了资深开发者在面对技术变革时的困境,并提出了推理工程的入门建议:从理解Transformer结构入手,建立分层工程体系(业务、调度、算子层),并深入研究模型结构的演进趋势。同时,作者指出AI Infra本质上是通用Infra的延伸,而Agent Infra将成为传统后台工程师发挥分布式与系统设计优势的新战场。
Context Engineering at LinkedIn: How We Built an Organizational Context Layer for AI Agents with MCP
LinkedIn 工程师把编码 Agent 在成熟巨仓里失效的根因说清楚,不是模型不够强,而是缺组织上下文。新工程师尚且需要一周 bootcamp,而模型只学过开源代码。他们先把代码搜索等系统封成 MCP 工具,再用 playbook 解决部落知识难寻、上下文过载与缺乏长期记忆三个问题:以 name、description、instructions 描述怎么完成一类任务,自包含且可组合,让 Agent 按需渐进加载,并在发现过时内容时自己回写。 适合谁:为编码 Agent 建组织级上下文层与内部工具平台的工程师
LinkedIn 软件工程师 Ajay Prakash 在演讲中分享了 LinkedIn 如何让编码智能体真正理解其庞大而成熟的内部代码库。早期的 vibe coding 在 LinkedIn 遭遇失败,因为智能体缺乏内部上下文,只能产出低质或幻觉代码,工程师被迫「保姆式」引导。Anthropic 开源 MCP 后,LinkedIn 将已有的代码搜索引擎封装为 MCP 工具,让智能体能检索 1000 多个仓库的代码、文档、功能开关、任务管理和数据平台。但工具增多带来了部落知识难寻、上下文过载、缺乏长期记忆三大问题。为此 LinkedIn 提出「程序性记忆」概念,落地为 playbook:以 name、description、instructions 描述如何完成特定任务,通过 MCP 作为工具被智能体调用,任何人可创建并提交到中央仓库共享。好的 playbook 遵循自包含与可组合两条设计哲学,后者带来复用与上下文渐进披露两大优势,最终形成可导航的 playbook 图谱。智能体还能在发现过时信息或边缘情况时自行改进并回写 playbook,形成持续优化的飞轮。架构上采用本地 MCP 服务器,区分中央 playbook 与仓库本地 playbook。
How to build products on a moving frontier | Dan Shipper (Every)
Dan Shipper 在 Lenny's Summit 的演讲把问题定义得很清楚:探索前沿是发散的、多数产出要被丢掉,执行路线图是收敛的,让同一支团队同时做,等于朝相反方向用力。他的解法是实验室与产品团队分离,实验室预期丢掉九成产出,产品团队只采纳一成;实验室以一到两人的 two-slice 团队为佳,海盗负责快速试错,架构师负责把可行部分做成可扩展系统。晋升判据也很实:有人持续回来用、比现有方案好十倍、规模化成本内能服务。 适合谁:在模型每月刷新的节奏里要护住路线图的产品负责人
Every 联合创始人兼 CEO Dan Shipper 以他所谓的「技术革命时期照常营业的极度无效」开篇:Fable 5.1、Astra 6 等前沿模型不断重置可能性边界,产品负责人既无法忽视,也不能任其扰乱路线图。他的诊断是,探索(发散、重演示、大部分产出会被丢弃)与执行(收敛、围绕既定路线图交付)是两种对立的工作方式,因此组织应通过实验室团队实现关注点分离:实验室在新模型发布时探索能力上限,预期丢弃约 90% 的产出;产品团队采纳其中约 10%,并保持上线产品的连贯性——AI 让一人实验室也成为可能。他给出具体做法:以一至两人的 two-slice 团队取代传统 two-pizza 团队,让海盗式的人(快速、凌乱的价值猎手)与架构师(把可行原型塑造成可扩展系统)配对;通过自己先用获得最紧的反馈回路;并行运行相互竞争的实验;把被丢弃的实验转化为对外内容或早期用户计划,使整体 ROI 为正。随后由研究管线把赢家从内部使用推向早期客户、再进入正式产品,晋升判据明确:是否有持续使用与回流、是否比现有方案好 10 倍、能否在规模化成本内提供服务。他用 Every 的 Kate Bench(自动化主编的文稿润色,使其此类编辑工作逐月减少 12%)以及 Anthropic Labs(Claude Code、MCP、Skills)与 OpenAI(Codex 从主线之外的小团队成长为 ChatGPT 这个 8 亿日活应用的基石)佐证这一循环正在真实运转。
The last roadmap | Claire Vo
去年宣布产品管理已死之后,Claire Vo 这次在 Lenny's Summit 对准路线图本身。她运营着由编程智能体、40 个 Grok bot 与自动化客诉修复组成的 AI 工厂,发布速度空前,却坦承想不出值得做的好点子:执行已经过剩,信念反而成了稀缺品,而路线图恰恰诞生于工程稀缺的年代。她点名积压、趋同与流失三个陷阱,替代方案是持久信念配可抛弃功能、预先定义证据标准,并把每次发布诚实标注为探针、实验或承诺。 适合谁:正在重构路线图与 OKR 的产品负责人与 AI 转型团队
在去年 Lenny's Summit 上宣布「产品管理已死」之后,ChatPRD 创始人 Claire Vo 这次把矛头对准了更大的靶子——路线图本身。她运营着一个由编程智能体、40 个 Grok bot 与自动化客诉修复组成的 AI 工厂,发布速度空前,却坦承自己已经想不出值得做的好点子:执行能力已经过剩,信念反而成了稀缺品,这颠倒了路线图赖以成立的工程稀缺前提。她用自己为 ChatPRD 几乎一次成型搭建的 Product Graph 作例证:功能对齐竞品、看起来漂亮,却理应进垃圾桶,因为 token 只是执行了她的赌注,从未检验她的信念。在近乎无限的执行力下,她警告三个陷阱:积压陷阱(AI 会把整个 backlog 全部建完,却并不等于业务进展)、趋同陷阱(竞品吸收同样的洞察、做出同样显而易见的产品)与流失陷阱(发了就弃、从不复利)——从内部看一切都很高产,实际却在加速走向平庸。她提出 roadmap zero:当每个可见功能都可被构建,努力程度就不再是重要性的代理指标,RICE 式优先级排序也不再是战略,旧路线图叠加 AI 工厂会以机器速度把弱判断的后果送到你家门口。替代方案是:持久信念配可抛弃功能、预先定义证明或停止的证据标准、把工厂放到流程中正确的位置,并对每次发布诚实标注为探针、实验或承诺——因为代码是充裕的,客户信任不是。她最后改写了游戏名称:过去一年是速度游戏,明年是野心游戏,衡量标准是你每月跑多少个大型实验。
AI 进入生产阶段之后, 智能、算力、芯片 会走向哪里?
庄明浩全程听完 AICC2026 后做的单口整理,三章一条主线:AI 进入生产阶段,比的是谁能让每个任务跑完。需求侧引 IDC 报告,2026 到 2030 年全球 Token 消耗复合增长率 4822.6%,由任务执行次数、单任务消耗与多智能体协同放大系数三个乘数相乘驱动,2030 年算力供需缺口达 3809 亿美元。第三章的两个细节尤其值得记:清华存算一体芯片用 28 纳米成熟制程把算力从 150 提到 600 TOPS,智源 FlagOS 让一个模型一天内适配 12 款芯片。 适合谁:同时关注 Agent 落地、算力与国产芯片生态的读者
这是「屠龙之术」一期单口带 PPT 的播客,主播庄明浩全程参加第七届 AICC2026 人工智能计算大会后做的侧记,内容分三章。第一章「从 Chat 到 Agent,需求侧的结构性跃迁」:IDC 与浪潮信息联合发布《2026 年中国人工智能计算力发展评估报告》,引用 Agent=Model+Harness 已成业界共识;预计到 2031 年 AI 累计创造 22.5 万亿美元经济价值、2030 年全球活跃 Agent 达 22.16 亿;2026 至 2030 年全球 token 消耗复合增长率 4822.6%,由任务执行次数、单任务 token 消耗、多智能体协同放大系数三个乘数相乘驱动,2030 年算力供需缺口达 3809 亿美金,物理限制成为常态。第二章「智能本身的重新定义」:同济大学郑庆华院士主张跳出单纯堆数据与算力,借鉴人脑机制走向机器记忆智能,实现有限性、时效性、开放性的平衡;工信部电子五所蒋沛航提出从单一模型评价转向全链路可靠 AI 评测体系,当天联合二十多家单位发布该体系。第三章「算力与芯片」:浪潮信息刘军提出能力型与容量型双轨智算并发布 SD200、HC2000 等产品;清华吴华强介绍存算一体芯片以成熟制程实现性能跃迁并推动中国芯换道超车;智源林咏华介绍 FlagOS 开源生态实现一模型一天内适配 12 款芯片。
89.当 AI 进入组织,那些「从没人说过的真相」|与网易阮良聊 AI 原生组织与企业 Agent 实战
网易内部的一组数字,是本期最锋利的证据:程序员用 AI coding 个人效率提升 300% 到 500%,同类软件功能从需求到上线却只从 20 天缩短到 17 天。阮良的解释是木桶短板,企业任务是长链条多人协作,个人闭环再快也顶不动整体。他给出三道坎,观念认知、个人短程任务落地、流程与组织改造,并交出一个可复制样本:取消周会,会前按模板填信息进知识库,AI 扫描整合成可追问的报告,决策改开专项会。 适合谁:推动 AI 原生组织改造与企业 Agent 落地的管理者
本期是主持人卫诗婕在杭州对网易集团副总裁、网易智企 CEO 阮良的深度访谈。阮良 2006 年从浙大计算机毕业后加入网易,历经互联网、移动互联网、AI 三次技术浪潮,此次重新拾起代码,深度使用 AI 并在企业内部推广。访谈围绕 AI 进入组织后的一线反共识观察展开:网易内部统计发现,个人用 AI coding 效率提升 300%-500%,但软件交付流程仅从 20 天缩短到 17 天,原因在于个人使用 AI 多是短程闭环,而企业任务由多人协作完成、链条更长,木桶短板效应决定了提效上限。阮良提出企业落地 AI 要跨过三道坎:观念认知、个人短程任务落地、流程与组织改造。他分享了取消周会、由 AI 同步信息的组织变革案例,讨论 SaaS 未死的逻辑(SaaS 本质是 Service,沉淀核心知识的产品反而更强)、蒸馏销冠技能训练普通销售、老板 AI 作为刚需、AI 价值量化公式(质量 × 节省时间 × 单位时间经济价值)、Token 消耗作为人才信号、以及 AI 替代任务而非替代完整的人等观点。
Replit CEO Amjad Masad on What Young People Should Learn in the AI Era
Amjad Masad 给年轻人的定位很直接:年轻人在社会中的效用是质疑根深蒂固的信念,去做异端,而今天的大学正好相反,用一份早已失效的人生剧本换走独立头脑。他理想中的学校不规定你学什么,忘我做项目时逃课不受惩罚,疯狂想法起飞时学校主动送上算力与实验室。他也点名早期融资的问题,想法尚未成形就给百万美元条款,是被嫉妒驱动的过早优化。文中他从象棋好奇心一路讲到 Replit 的 autoresearch 方向。 适合谁:关心 AI 时代教育路径、青年职业选择与好奇心复利的读者
在这期围绕一所全新硅谷学院展开的 a16z 对话中,Replit CEO Amjad Masad 用一个命题重新框定教育:年轻人在社会中的效用是质疑根深蒂固的信念——去做异端——而今天的大学恰恰相反,用一份早已失效的人生剧本(工作、结婚、买房)换走有独立头脑的人。他借 Arthur C. Clarke 的《城市与群星》指出,被压抑的破局者思维才是文明层面真正的损失。他理想中的大学不规定你学什么:像 Steve Jobs 在 Reed 学院旁听书法课那样随意游荡,忘我做项目时不受考勤惩罚,没有分数与考试,当一个古怪想法起飞时得到更多算力和实验室资源,而不是被开除。他相信 AI 已把定制化的项目式学习从看似不可能变成显而易见的默认选项:每个学生都能构建自己热爱的东西、把编程语言当作工具来学,需要的只是自由与信心。在融资上,他拒绝结构化的四年大学与即刻到账的支票之间的虚假二选一,主张用临时性资助支撑无压力的探索年份,并称想法成形前的百万美元条款是掠夺性的——如同被嫉妒驱动的过早优化。他把自己晚年开始迷上象棋归功于好奇心的复利:为弄清 LLM 为何下不好棋而训练模型,进而发现 vibe research(autoresearch),催生让任何人都能做机器学习研究的 Replit 新方向;同时他把智能体视为组织内的粘合剂,指向 holacracy 失败之后的「自动驾驶公司」。对话最后落在品格与人才上:尊重过去但毫无歉意地改变它,在奇点临近、后果不可预测的时代用亚里士多德的德性伦理取代后果主义功利主义,并看重那些在某个领域钻得极深、能教你东西的年轻人。