EP184 · 长任务成本、强化学习反馈、统一推荐
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
从 Opus 5.5 的长任务成本,到 MiMo 强化学习与美团统一推荐,判断模型如何进入真实流程。
本期内容
20 条Anthropic 发布 Claude Opus 5.5,长任务成本降四成
Anthropic 把 Opus 5.5 的重点放在更长、更可控的真实工作流:官方称其典型任务成本较 Opus 5 低 40%,并引入每次行动前的分类器、可审计沙箱和合并前代码审查。它同时承认预发布评估仍难覆盖真实部署,适合拿来审视高能力 Agent 的效率提升与治理边界如何并行落地。
Xiaomi MiMo-V2.6:扩展强化学习,迈向自我提升
小米把 MiMo-V2.6 的重点放在可验证复杂任务上的大规模 RL,而非只展示单项榜单:两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹,并公开了训练框架、任务环境和轻量 Harness。文章也保留与最强闭源模型仍有差距的判断;对开发者而言,更值得看的是把训练过程和复现资源一并开放的做法。
MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践
美团将外卖首页、拼好饭等长期独立建模的场景放进一个推荐基座:用异构 Tokenizer 和动态 Mask 处理不同特征与时序,以混合注意力控制长序列成本。文章称多个业务已全量,最显著业务订单增长超过 6%,推理成本降低 24%。这份实践的价值在于同时交代统一建模、训练稳定与训推优化如何相互配合,而非只报告线上结果。
腾讯 15 年资深后台工程师,转战大模型推理的抉择
本文分享了一位腾讯15年资深后台工程师在AI时代转型大模型推理工程的心路历程、技术路径及对未来趋势的深度思考。
高级评估: 如何在产品中发现并修复隐藏的 AI 失败
大多数 AI 团队会跳过错误发现并直接写入指标,但审查跟踪以找到值得测量的失败是最高效的步骤,编码代理可以自动化大部分工作,约 30 分钟。
Impeccable:用技能工程构建可靠智能体执行框架
Paul Bakaus 展示了 Impeccable 如何借助独立评审、反吸引子、任务路由、持久记忆、可执行上下文、Hooks、实时交互和模型专属构建,将设计提示转化为可靠的智能体 Harness。
提效约 70%!去哪儿网 AI Coding 驱动大型系统重构实践
去哪儿网分享如何通过构建 Harness(约束系统)与 Loop(反馈系统),将 15 万行代码的大型核心系统重构转化为可拆解、可验证的工程化 AI Coding 实践,实现交付效率提升 70% 及显著的性能优化。
千问办公押注的企业上下文,是 Agent 时代的组织语言
千问办公发布企业上下文(Enterprise Context)及相关产品,旨在通过构建结构化的组织知识体系、赋予 Agent 明确的组织身份与安全审计机制,将 AI 从通用办公工具升级为能深度嵌入企业业务流程的数字员工。
AI 进入生产阶段之后, 智能、算力、芯片 会走向哪里?
庄明浩以单口 PPT 形式整理 AICC2026 人工智能计算大会,从需求侧结构性跃迁、智能重新定义、算力芯片生态三层,论证 AI 进入生产阶段比的是「谁能让每个任务跑完」。
有效第三方评估的优先事项和原则
OpenAI承诺支持独立评估,提供训练、评估和部署的深度访问,并提出了四个评估优先事项。
面试官:“Agent 接了上百个工具,怎么选?”
面对 Agent 接入上百个工具的场景,应通过工具注册表、确定性权限过滤、粗分类与混合检索召回、LLM 精选的分层 Tool Routing 方案,替代把全部 Schema 塞进 Prompt 的做法。
Opus 5.5 上的任务成本分析 | Anthropic 的 Claude
Anthropic 重新设计了 Claude Projects,将其从静态文件夹演变为智能体工作流,其中协调器可管理多个并行的工作线程,以执行复杂、耗时的技术目标。
SGLang × Qwen × NVIDIA:NVFP4 KV Cache 突破长上下文与 Agentic 推理瓶颈
作者系统解读 SGLang 联合 Qwen、NVIDIA 将 NVFP4 格式落地 KV Cache 的博客,4-bit 下兼顾精度与性能,长上下文与 Agentic 场景收益随上下文放大。
从 AI 工具到经营智能体:快手分销增长 Agent 实践
快手技术专家祁慧分享分销增长 Agent 的完整实践:从 AIGC 邀约等单点工具,到托管产品形态,再到经营大脑 Multi-Agent 架构,核心是数据智能基建与业务智能体双轮驱动。
利用 AI Agent 暴力测试构建 Mole 的核心清理规则
作者通过 AI Agent 自动化安装卸载 300 多款 Mac 软件,通过实测填补了规则库缺失,论证了在软件生态非标准化现状下,通过工程实测积累数据是打造顶级清理工具的关键路径。
理解 Token,才能理解 AI 经济
腾讯研究院《Token 经济》导言提出,Token 是人类历史上第一个计量机器智力产出的单位,它让智力服务可计量、可定价、可治理,同时使传统经济学的多个前提假设失效,需要重新校准分析框架。
Jev 现已在 LangSmith Evals 中可用
Jev 是一种 System One 模型,它返回类型化答案而非生成文本,现已在 LangSmith Evals 中作为评判器可用,为评估开放式智能体行为提供了一种比 LLM-as-a-judge 更快、更便宜且更一致的替代方案。
Agent 版 Hugging Face 来了,openJiuwen 发布首个开源智能体资产平台
openJiuwen 发布开源智能体资产平台,通过将 Agent 能力解构为技能、连接器、插件、专家和专家团五类可流通资源,构建从创建到发布的生态闭环,旨在将一次性使用经验转化为可复用的能力资产。
边开飞机边换引擎:Harness 如何解决验证难题
本文分享了在大型登录系统改造中,通过 Makefile 固化构建、自建轻量化 K8s 管理平台「小 TKE」以及构建专用排障工具,将验证链路从依赖公共环境转向开发者自主可控独立环境的工程实践。
OpenAI 宣称 AI 攻克千禧年难题,27 位菲尔兹奖得主联名质疑
OpenAI 称内部模型解决纳维-斯托克斯方程并攻克超 100 个数学开放问题,引发 27 位菲尔兹奖得主联名公开信质疑,OpenAI 随后成立独立数学顾问组回应。