EP181 · Muse 工程交付、推理路由、MCP 上下文
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Muse 衔接工程交付,OpenAI 重构推理路由,领英用 MCP 管理组织知识,校准 AI 落地条件。
本期内容
20 条AI 写代码飞快,为何交付没有变快?小红书 Muse 的 Agentic 架构实践
AI前线整理的小红书 Muse 实践,把焦点从代码生成速度移到企业交付的连续性。分享拆开了 Agent Team、Harness、One Workspace 与结构化状态如何协同,也说明权限、验证和副作用日志要进入运行时控制。对正在接入 AI Coding 的复杂工程团队,它提供了从原型共创到生产落地的具体设计线索。
生产环境中的 LLM 推理路由:从引擎信号到策略
OpenAI 推理团队的分享把 LLM 路由落到一个容易忽视的工程取舍:距离最近的 GPU 未必带来最低端到端延迟。IRB 将全局优化的权重计算与本地快速决策分开,同时结合容量、健康度、网络开销和 KV 缓存;再用惩罚、受限重试与负载削减应对故障和过载。这为生产推理系统如何兼顾性能与稳定性给出清晰框架。
LinkedIn 的上下文工程:如何用 MCP 为 AI 智能体构建组织级上下文层
LinkedIn 工程师 Ajay Prakash 解释了为何仅给编码 Agent 接上工具仍不足以处理大型内部系统:隐性流程知识会散落在文档、讨论和个人经验里。团队借 MCP 交付可组合的 playbook,并按需检索工具与说明,以控制上下文负担;同时以代码审查、鉴权和弃用机制维护目录。它提示企业应把组织知识、质量与治理一起做成 Agent 的运行基础。
究竟有多少项目会真正建成?能源真的是 AI 最大瓶颈吗?——Positron AI 联合创始人访谈
Positron AI 联合创始人 Thomas 解释了生成式推理为何受内存而非 FLOPs 限制、缓存 token 与债务为何比能源短缺更关键,以及本地模型为何可能增加而不是减少前沿云端需求。
为何扩散模型将主导 AI 推理:Inception 联合创始人兼 CEO Stefano Ermon
Inception CEO Stefano Ermon 认为,扩散架构将凭借粗到细的并行生成,摆脱自回归模型受内存束缚的顺序瓶颈,并援引 Mercury、约 10 倍加速与低延迟部署作为依据。
AI 未能解出的最后一道 IMO 题:风车铺砖与动机化证明
Grant Sanderson 讲解 IMO 2025 第 6 题——赛场当日 AI 唯一未解的压轴题——如何用风车铺砖构造最优解,再借助边对应、方向区域与 Erdős–Szekeres 定理完成动机化下界证明,并主张数学更需要可理解的动机化讲解而非仅有形式证明。
AGI 最难一战,竟在医院!中国 AI 登上 Science,医生不怕失业还催着上线
阿里达摩院研发的 DAMO RADAR 模型登上 Science,通过“器官级细粒度对齐”的视觉-语言对比学习,实现了首个专家级通用腹部影像 AI,可一次性识别 18 种解剖结构的 146 种疾病,且模型与代码已全部开源。
Databricks CEO Ali Ghodsi:谈 AI 存在性风险、网络安全与企业本体
Databricks CEO Ali Ghodsi 认为近期 AI 存在性风险接近于零,将节奏控制公关与真正的安全工作区分开,提出递归自我改进的四项标准,并聚焦网络风险、企业本体、token 成本控制与智能体原生数据库。
Claude Code 重构 Projects:引入 Thread 多智能体并行架构与共享记忆
Anthropic 为 Claude Code 测试上线全新 Projects 功能,将单会话重构为「协调者+并行 Thread」的多智能体架构,支持任务自动拆解、云端后台持续执行及跨会话共享记忆。
AI 音乐的丰饶与失衡|AI 破晓
AI 降低音乐创作门槛带来供给爆发,但被听见成为新稀缺,产业面临同质化泛滥、收入稀释、版权边界模糊与信任赤字四重挑战,亟需建立标识、分类与授权等规则体系。
一家供应商,四种写法:确定性分段如何击败相似度分数
对一份合成的 11,531 行供应商列表进行实体解析实验表明,两个确定性规范化分段可免费消除 76% 的重复项,而剩余的模糊匹配残留在任何阈值下都无法安全自动合并,必须成为排序的人工审核队列。
WorkBuddy/CodeX 都这么强了,企业还要花钱自研智能体吗?
企业落地 Agent 应拆分为「搭运行底座」与「开发业务 Agent」两件事,通用 Agent 加 MCP/Skills 可先试跑,但内部工具封装、业务规则梳理、可观测与评测反馈这些工作省不掉,且通用 Agent 缺少完整执行日志是接入真实业务的主要障碍。
LLM 性能基准可靠吗?Google 工程师拆解生产级推理测试的陷阱与方法
Google 工程师 Ashok Chandrasekar 与 Jason Kramberger 揭示生产级 LLM 基准测试为何会被客户端瓶颈、采样差异和数据集错配误导,并介绍 Inference Perf 如何实现可观测、可复现的真实负载测试。
XCircle 小飞:只做管理那批人,要没工作了
XCircle 创始人小飞与徐文浩、任鑫围绕 AI 原生组织展开激辩:层级和部门能否直接干掉、管理者被 AI 替掉后谁来背锅、agent 参与生产后钱怎么分,最后落回「朝气蓬勃的一片混乱」这一当下判断。
陶哲轩启动“开放数学模型计划”:不依附大厂,为数学界打造自己的 AI
陶哲轩发起的 SAIR 基金启动开放数学计划,旨在通过开源权重模型和工具链,让数学家从 AI 使用者转变为科研工具的建设者。
Claude Fable 5.1:更聪明的模型为何可能更省钱
Anthropic 解释为何 Claude Fable 5.1 完成任务可比更弱模型更便宜:成本取决于模型、effort 与缓存,并给出开放式与例行工作的选型及组织管理员控制建议。
Google 发布 Android Bench 2.0:真实 Android 开发任务基准测试
Google 推出 Android Bench 2.0,用真实生产级应用和 30 个工程任务评测「模型 + Coding Agent」组合,最高通过率仅 28%,跨平台迁移与 XML→Compose 迁移任务几乎全军覆没。
AI 大神卡帕西 3 万字访谈:AI 是 “数字幽灵”,智能体好用还要 10 年 - 智东西
AI 专家 Andrej Karpathy 在深度访谈中指出,真正能替代实习生的智能体仍需十年迭代,并剖析了 AI 作为「数字幽灵」与生物智能的本质差异、强化学习的缺陷及模型坍缩等核心技术瓶颈。
敢把钱包交给 AI 吗?聊聊 Agent 交易爆发前夜的信任基建
本文记录了关于智能体(Agent)成为交易主体的圆桌讨论,深度探讨了从意图识别到支付执行的信任基建、安全机制及未来的 Agent 经济生态。
#729.OpenAI:多 Agent 让 RSI 更可行
OpenAI 研究员 Noam Brown 与 Dwarkesh 对谈,以一万个 Agent 88 小时攻克千禧年难题为例,讨论多 Agent 并行扩展测试时计算的机制、AI 组织的特殊性,以及 RSI 与对齐的真正难点——我们不知道指标是否测到了对齐。