AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP146 · 阿里开源复盘、专用执行模型、Switchyard · 08-12 早报

一个开源项目如何在两个月内获得 20k star,阿里团队给出的答案落在开发、评审、发版与社区响应的具体流程上。本期另外两篇适合对照着读:NVIDIA 提供专用执行小模型,LangChain 则用真实任务测算何时值得路由到前沿模型,并明确成本、准确率与延迟之间的取舍。

50

连续五天登上 GitHub Trending 首页的思考

据阿里技术团队原文,open-code-review 在两个月内获得 20k star,并连续 5 天登上 GitHub Trending。更值得借鉴的是,团队用 All in Code 让 Agent 参与开发、评审和发版,同时以 200 个 PR 的评测集与人工决策守住核心链路;README 也从千行压到两百行,把上手路径缩至五分钟。

文章阿里技术作者:阿里技术
查看原文 连续五天登上 GitHub Trending 首页的思考(在新窗口打开)

NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、精准的专用任务执行

Nemotron 3.5 Lightning 不是替代前沿模型,而是面向常驻智能体执行层的 30B MoE:每次仅激活 3B 参数,处理工具调用、结果校验等高频任务。NVIDIA 还开放权重、数据和训练配方,为专用小模型的本地部署与成本评估提供了可复现起点与路径。

文章NVIDIA Technical Blog作者:Tanya Lenz
查看原文 NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents(在新窗口打开)

您的智能体有多少次调用实际上需要前沿模型?

LangChain 在 145 个多步任务上测试 Switchyard:30B 模型承担 93% 的调用,路由方案比全用 Claude Opus 4.8 便宜 74%,准确率低约 6 个百分点。文章还将判别器成本和模型价差写进计算公式,给出五次运行的波动,并提醒约 700 毫秒的判别延迟不适合短任务;是否划算仍要用自己的工作负载验证。

文章LangChain Blog作者:Srimanth Tangedipalli
查看原文 How many of your agent's calls actually need a frontier model?(在新窗口打开)

考虑使用 ACE?我们可以用更少的 Token 实现同样的效果

本文对比了 ACE 与 ALTK-Evolve 智能体记忆系统,证明了选择性指南检索在显著降低 Token 成本的同时,能够达到与全量剧本注入相当甚至更高的准确率。

文章Hugging Face - Blog作者:Vatche Isahagian, Jayaram Radhakrishnan, Vinod Muthusamy, Gaodan Fang, Punleuk Oum, G Thomas, Ashwath Vaithinathan Aravindan, Evelyn Duesterwald, Merve Unuvar
查看原文 Thinking of ACE? We Can Do It with Fewer Tokens(在新窗口打开)

AI 评测还在看准确率?数据科学早就用因果推断做归因分析了

本文针对传统 AI 评测仅关注准确率、忽略因果性的局限,引入因果推断与博弈论方法,提出可落地的归因分析框架,帮助精准量化 LLM 及 Agent 系统中各组件对结果的真实贡献,定位优化瓶颈。

文章大淘宝技术作者:大淘宝技术
查看原文 AI 评测还在看准确率?数据科学早就用因果推断做归因分析了(在新窗口打开)

100万美元Token不限量实验:团队更累、AI成本超人、组织0→1是效率突破点

宝玉团队在硅谷AI大厂进行的100万美元Token不限量实验发现,人员负担加重、AI使用成本高于人力,只有组织从0到1开始使用AI时才能看到显著效率提升,而现有以人为中心的架构成为瓶颈。

动态宝玉(@dotey)作者:宝玉
查看原文 100万美元Token不限量实验:团队更累、AI成本超人、组织0→1是效率突破点(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期