BestBlogs.dev 第 108 期:智能的执行层
本期导语
「智能的执行层」是本期主题,也是这 20 篇内容共同追问的问题:智能怎样穿过真实环境,稳定地完成任务?Grok、DeepSeek 与 Gemini 同时推进能力、接口和价格,Harness、评测、缓存、路由与质量门禁则把模型组织成可以持续工作的执行系统。
以下是本周最值得关注的 10 个精彩亮点:
🧠 Grok 4.6、DeepSeek V4 Pro 与 Gemini 3.7 Flash 展示了执行模型的三种路径。Grok 强调长轨迹、自测与交互式项目;DeepSeek 原生支持 Responses API 和 Codex,并把思考强度分成 low、high、max;Gemini 在 FrontierCode 1.1 Main 上从 34.4% 提升到 43.6%,同时把输入价格降到每百万 Token 0.75 美元。模型竞争正在从单项能力扩展到接口、延迟、预算与持续交付。
🛡️ OpenAI Daybreak 把高风险能力与分级准入绑定。Blue 面向通用防御工作,Red 承载 GPT-5.6-Cyber 的零日漏洞发现和利用链验证。身份核验、硬件安全密钥、隔离环境、权限范围与动作审查一起进入产品合同。执行能力越强,授权就越不能只靠一句提示词。
💬 Claude Tag 与 WorkBuddy 把 Agent 带进日常工作现场。Claude Tag 会综合 Slack 频道上下文、记忆和长期指令,在回复、开线程、归并任务与保持沉默之间选择,官方称主动响应判断提高约 30%。WorkBuddy 则用 Ask、Craft、Plan 三种权限模式,把模型、Skills、本地目录、多任务和远程助理组织成渐进式办公入口。
🧩 Harness 正在成为模型与真实环境之间的操作层。DeepSeek Harness v0.1 把模型、工具、Skill、沙箱、存储和调度都做成插件;Codex Harness 通过延迟加载工具、异步子 Agent、沙箱、独立审查和上下文压缩支撑长程任务。Harrison Chase 给出的边界很实用:先用通用 Harness,只有当真实轨迹反复证明任务偏离训练分布时,再增加自建复杂度。
✅ 质量不再依赖人类逐行读完所有代码。Addy Osmani 主张把单元测试、属性测试、变异测试和架构规则变成持续门禁。Charity Majors 用「信任账户」解释同一件事:团队交付未逐行阅读的代码时,必须用确定性模拟、评测、可观察性和生产反馈补回信任。更快提交只是局部信号,客户价值、软件健康和返工成本才决定系统是否真的变好。
⚠️ 更多 Agent 不会自然产生更好的协作。Anthropic 的受控实验里,30 个 Agent 中有 18 个选择相同分支名,隐藏档案任务的群体准确率只有 17% 至 36%,目标冲突还会引发持续升级的地盘战。更强的执行能力可能让错误协调得更快。多 Agent 系统需要隔离、共享规则、申诉机制和人工介入,而不是把协作寄托在模型自觉上。
🔬 评测正在从结果打分变成可回放的改进循环。阿里安全团队用轨迹、确定性诊断、四层 gate 和失败黑名单改进 Skill,GLM 准确率从 77.8% 提升到 88.9%。美团两年实践则把结果评测、轨迹评测与「人人一致、人机一致」连接起来。两篇文章共同说明:先让失败过程可见,再决定应该修改模型、Prompt、工具还是工作流。
🌱 AI 原生开源正在重新分配维护工作。代码生成只是其中一环,阿里 AI Code Review 项目披露约 2 万月活、30% 以上采纳率和低于 5% 的误报率,开源后达到 2 万 Star。AI 可以处理 Issue 分类、测试、评审和发版等重复执行,核心团队仍要承担方向、合并、回归与社区关系。自动化扩大了维护杠杆,没有取消人的责任。
🔀 路由与缓存决定执行层能否负担得起。OpenRouter 从供应商差异、故障转移和安全层解释多模型选择为何是战略能力。阮一峰则用 DeepSeek V4 Flash 的定价说明缓存命中输入仅为未命中的 1/50。模型选谁、上下文怎