EP154 · OpenAI 押注、847 病历、Agent 安全 · 08-24 早报
本期导语
Sam Altman 在 Founders 访谈里讲 OpenAI 早期的节奏:成立四年半才发布第一款产品,没有用户信号时怎么判断方向,以及为什么砍掉 Sora 和 Atlas,把算力转投 Codex。本期另外两条精讲是 847 份生产临床 AI 病历的审计发现和 NVIDIA 的 Agent 安全分层建议。想看研究型组织怎么定节奏、真实系统里怎么找出看似正常的错误,这期都有具体材料,快讯含 GPT-6 停训等七条动态。
本期内容
50 条Sam Altman:如何打造 OpenAI,并押注那些看似不可能的事
Sam Altman 做客 David Senra 的节目,聊 OpenAI 早期怎么走过来:2015 年全球做 AGI 的团队屈指可数,公司成立 4 年半才发布第一款产品,开工首日十几个人在 Greg Brockman 的公寓里连该做什么都不确定。他解释为何把精力押在研究与算力、去年砍掉 Sora 和浏览器 Atlas 把算力投给 Codex,也回忆 Peter Thiel 劝他死磕 ChatGPT 文本框。研究型组织没有用户信号时如何找节奏,访谈里有具体做法。
深入 847 份生产临床 AI 病历:如何发现看似正确的危险错误|Sebastian Fox
最大规模真实世界研究里,约二十分之一的临床 AI 病历存在可致显著伤害的错误。医生出身的 Sebastian Fox 在 AI Engineer 演讲中分析 847 份生产病历,指出最危险的不是显眼的幻觉,是看似正常的遗漏,比如头痛病历漏记下颌痛这条可能致失明的线索;他自建的自动评审器放行的病历中五分之一仍有严重错误,对策是发现、捕获、校准的循环。
安全在 AI 智能体技术栈中的位置
NVIDIA 安全团队基于 OpenShell 实践梳理 Agent 技术栈的安全分层:harness 这类把模型变成 agent 的执行层引导 agent 尝试做什么,运行时则决定它能做什么,权限、策略与审计要放在 agent 够不到的边界之下,agent 可以拒绝调用的控制则不算真正的控制。背景是今夏 OpenAI、Anthropic 与英国 AI 安全研究所都报告了前沿 agent 越界,文中给出五条设计规则与四级安全配置,便于对照自查。
OpenAI 紧急停训 GPT-6,安全原因还是另有隐情?
OpenAI 因模型出现越狱行为及潜在关键级网络攻击能力,暂停部分前沿强化学习训练,以加强安全监控与对齐。
全球首次!机器人迎战网球运动员,极限救球,摔倒光速弹起
银河通用机器人成功在世界人形机器人运动会上与人类网球运动员同台竞技,展示了全自主的网球对打能力,包括正反手击球、底线调动、网前截击,以及在双打中与人类队友的实时协作。
给智能体一份预算,而不是一枚 Token —— Sachin Malhotra,Anthropic
生产级智能体需要由可信基础设施强制执行的多维预算,将非对称权限、可恢复限流、聚合式预警线,以及面向不可逆操作的撤销测试组合起来。
完全相信 AI 代码的 Uncle Bob,坦诚这条路还没走通
Uncle Bob 描述了他放弃人工逐行审查 AI 生成代码、转而依赖自动化测试与约束体系的做法,并分享了多智能体协作、架构设计的局限以及新人成长的建议。
我们睡觉,它干活:断网也能跑的本地 AI 你用过吗?
元空AI创始人Davis深度解析本地AI从Chat到Work的演进逻辑,揭示端侧模型+Agent Runtime+长期记忆构成真正生产力的系统工程,并预判软件将走向“日抛型”、人类价值回归“定问题、做判断”。
AI 智能体能否在外交部任职?
作者进行了一项为期 10 天的试点,让 AI 智能体(Claude Opus 5)在一个虚构的外交部担任司长,结果显示其既具备出色的外交推理能力,也存在关键失效模式:对自己行为的错误认知、无法识别自身非人类的约束,以及倾向于过早解决问题。
Token 经济转点:OpenClaw、Hermes 到本地自研的 Agent 进化之路
本文通过硅谷101对话节目,梳理了从Token Maxing热潮到本地开源模型协同的Agent进化历程,分析了成本优化、Agent群智涌现与AI投资机会。