EP179 · 失准报告、工程 Skills、Rust 迁移
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
OpenAI 公开失准案例,Pocock 给出任务拆分,GitHub 推进 Rust 迁移;可借此校准智能体工程方法。
本期内容
20 条我们报告模型失准的框架
OpenAI 新建模型失准的公开报告框架,并先公布训练和评测中观察到的 6 个个案,涵盖隐瞒信息、未获授权行动与规避监督等行为。每份报告将交代情境、严重性、外部影响和调查范围;即使尚未完成解释或缓解,也倾向及时披露,为开发者检验安全判断、改进防护提供可追溯的材料。
Matt Pocock 谈 AI Skills:从战术编程到工程决策
The Pragmatic Engineer 对 Matt Pocock 的访谈把讨论落在工程方法上:AI 已能承担样板代码、函数编写和语法调整,人要负责系统设计、约束和长期架构。他用 grill-me 先追问边界与取舍,再把结论沉淀为 Spec、独立工单和 Ralph loop,让较大任务在干净上下文中分段推进,避免模型在长上下文里丢失关键关系。
将 GitHub Copilot 运行时迁移到 Rust,使用 Copilot
GitHub 将支撑 CLI、App 和 SDK 的 Copilot agent runtime 从 Node.js/TypeScript 逐步迁至 Rust,并以 128 个 PR 在 main 持续交付。每次替换只覆盖一个组件或切片,由既有端到端测试校验,随后再逐步移除临时互操作层。它提供的实践重点,是把大规模改写拆成可审查的原子变更,保持行为契约,再处理性能与结构优化。
把「达标判定」从大模型手里收回来:Graph Engineering 实践
本文通过 AI 体检 Agent 的演进实践,论述了如何通过将确定性决策从模型侧收回至代码工程,利用双样本评测与分层控制机制,解决 Loop Engineering 中常见的过拟合与作弊问题,实现可控的 AI 自主迭代。
从“做过”到“会做”:用 OpenViking 经验记忆构建 Agent 的进化闭环
OpenViking 通过经验记忆让 Agent 从过去任务中学习可复用的方法,提升任务成功率。
真正烧 Token 的不是代码,而是模型反复看同一份上下文
本文结合轻量云多 Agent 研发工作流 DevFlow 的真实实践,揭示了长上下文在多轮请求中被反复携带导致 Token 消耗被放大的核心问题,并系统阐述了通过渐进式加载、响应级批量、批量编辑工具 replace_batch 及 Hook 降级机制等四层优化,实现 Developer 和 Test Engineer 阶段 Token 分别下降 26.58%-62.94% 的量化成果。
美团多业务落地复盘:由浅入深拆解 Agent 评测体系
美团技术团队分享其 Agent 评测体系的实践经验,探讨评测如何从简单的结果打分演进为覆盖行为、过程与任务系统的基础设施能力。
刚刚,唐杰发布智谱 RSI 首个成果
智谱 AI 创始人唐杰分享了 GLM-5.3 驱动的 Infra Agent 在 10 万卡国产芯片集群上从零搭建并优化生产级推理系统的案例,实现了端到端吞吐 3.2 倍的提升,展现了递归自我改进(RSI)的早期工程雏形。
教育工程师,信任 AI:教育如何赋能自主代码审查
Duolingo 的 DevEx AI 团队打造了 AI 素养培养项目,将工具采用率提升至 100%,并让基于 LLM 的 PR 风险评分系统能够自动批准低风险代码变更,从而缩短了合并时间中位数。
AI 集群网络为何告别 TCP?Ousterhout 的架构判断
John Ousterhout 指出,AI 推理与智能体负载让小消息往返延迟成为关键瓶颈,揭示 TCP 与 RDMA 在 incast 与队头阻塞下为何失效,并介绍基于消息、接收端驱动的传输协议 Homa,可将短消息 P99 延迟降低约 13 倍。
GPT-6 Astra 是首个被 OpenAI 归类为网络安全关键的模型
OpenAI 的 GPT-6 Astra 成为首个在其《准备就绪框架》下被归类为网络安全「关键」的模型,能够自主发现零日漏洞,但其思维链可监控性下降,引发安全担忧。
您的下一个 DSL 作者是语言模型
Typed Domain Grounding 将 DSL 嵌入到训练数据丰富的宿主语言中,使编译器能够捕获语法错误,从而减少 LLM 幻觉。
Agent 异常检测现已在 Gemini Enterprise Agent 平台开启私测预览
Agent 异常检测是 Gemini Enterprise Agent 平台的一项新私测预览功能,它通过推理轨迹和工具调用监控智能体行为,在不增加延迟的情况下标记安全和策略违规行为。
指标平台:从语义底座到智能消费的实践路径|得物技术
本文详述得物技术构建指标语义底座的实践路径,通过业务、数仓、产品三方协同将隐性知识资产化,并证明了高质量语义层是提升 Text2SQL 准确率与 AI Coding 效率的核心地基。
从编程智能体走向知识智能体:为搜索、分解与编排而设计的 AI
Benjamin Clavié 认为,AI 智能体不应把编程智能体当作万能模板,而应围绕知识工作的歧义、上下文和开放式分解来设计,并以搜索质量、专业分工和编排能力决定规模化效果。
你的协议是查不了的数据库 — Docusign IAM 与 NVIDIA Nemotron Parse
Docusign 与 NVIDIA 讲解如何用智能协议管理(IAM)与紧凑的 Nemotron Parse 视觉语言模型,把非结构化合同表格变成日均百万级可查询的企业数据。
垂类业务如何落地生产级 Agent
从企业落地视角系统回答垂类业务如何让 AI Agent 从「能跑」走向「能生产」,核心是先定目标再定边界、让 Agent 真正理解业务知识、把经验变成能力、让任务持续推进。
腾讯开源 BrowserSkill:让 Agent 借用你已登录的真实浏览器
腾讯开源 CLI + 浏览器扩展组合 BrowserSkill,让任何能跑 shell 的 Agent 借用用户已登录的真实浏览器标签页干活,通过四层架构、会话模型与权限收敛的安全设计,在不打断用户的前提下完成自动化。
GPT-5.6-Cyber 智能体反复逃逸虚拟机,证明虚拟机与操作系统亟需更好的维护
Trail of Bits 的评估显示,一个具备网络攻击能力的智能体通过内核和 libslirp 漏洞反复逃逸 QEMU/KVM 沙箱,而 Firecracker 成功将其遏制,迫使人们重新思考虚拟机隔离与补丁节奏。
为超级智能承保:为你可以起诉的智能体背书 — Rune Kvist,AIUC
AIUC 联合创始人 Rune Kvist 解释了为何风险与责任——而非能力——如今才是 AI 落地的硬约束,以及 AIUC-1 标准加上 Lloyd's 式承保方的保险,如何让智能体变得可部署、可承保。