EP146 · 阿里开源复盘、专用执行模型、Switchyard · 08-12 早报
本期导语
一个开源项目如何在两个月内获得 20k star,阿里团队给出的答案落在开发、评审、发版与社区响应的具体流程上。本期另外两篇适合对照着读:NVIDIA 提供专用执行小模型,LangChain 则用真实任务测算何时值得路由到前沿模型,并明确成本、准确率与延迟之间的取舍。
本期内容
50 条连续五天登上 GitHub Trending 首页的思考
据阿里技术团队原文,open-code-review 在两个月内获得 20k star,并连续 5 天登上 GitHub Trending。更值得借鉴的是,团队用 All in Code 让 Agent 参与开发、评审和发版,同时以 200 个 PR 的评测集与人工决策守住核心链路;README 也从千行压到两百行,把上手路径缩至五分钟。
NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、精准的专用任务执行
Nemotron 3.5 Lightning 不是替代前沿模型,而是面向常驻智能体执行层的 30B MoE:每次仅激活 3B 参数,处理工具调用、结果校验等高频任务。NVIDIA 还开放权重、数据和训练配方,为专用小模型的本地部署与成本评估提供了可复现起点与路径。
您的智能体有多少次调用实际上需要前沿模型?
LangChain 在 145 个多步任务上测试 Switchyard:30B 模型承担 93% 的调用,路由方案比全用 Claude Opus 4.8 便宜 74%,准确率低约 6 个百分点。文章还将判别器成本和模型价差写进计算公式,给出五次运行的波动,并提醒约 700 毫秒的判别延迟不适合短任务;是否划算仍要用自己的工作负载验证。
E248|一个“催发货”AI 要跑通 260 步,和阿里瓴羊朋新宇聊聊中国式 FDE
阿里巴巴副总裁朋新宇深度拆解中国式 FDE 的务实路径:不讲个人英雄主义、不迷信 SOTA 模型,而是以“多快好省”为标准,为企业打造可量化的业务增长 Agent。
Gemini 应用月活用户突破 10 亿
Sundar Pichai 宣布 Google 的 Gemini 应用如今月活用户超过 10 亿,使其成为有史以来增长最快的 Google 产品,也是第 14 款达到 1B-user 里程碑的 Google 产品。
考虑使用 ACE?我们可以用更少的 Token 实现同样的效果
本文对比了 ACE 与 ALTK-Evolve 智能体记忆系统,证明了选择性指南检索在显著降低 Token 成本的同时,能够达到与全量剧本注入相当甚至更高的准确率。
AI 评测还在看准确率?数据科学早就用因果推断做归因分析了
本文针对传统 AI 评测仅关注准确率、忽略因果性的局限,引入因果推断与博弈论方法,提出可落地的归因分析框架,帮助精准量化 LLM 及 Agent 系统中各组件对结果的真实贡献,定位优化瓶颈。
100万美元Token不限量实验:团队更累、AI成本超人、组织0→1是效率突破点
宝玉团队在硅谷AI大厂进行的100万美元Token不限量实验发现,人员负担加重、AI使用成本高于人力,只有组织从0到1开始使用AI时才能看到显著效率提升,而现有以人为中心的架构成为瓶颈。
华为 AI 芯片来时的路
本文通过整理《昇腾崛起》一书的 100 条细节,详尽记录了华为昇腾 AI 芯片从 2016 年战略觉醒到 2026 年破局突围的完整研发与生存历程。
智能体循环中的 TDD:形式主义还是实际价值?
评估 AI 智能体循环中的 TDD,发现在小型实验中并不比非 TDD 有明显优势。