EP191 · OpenAI 更新开发生态、Manus 2.0 推出 Cue、Sonnet 5.5 降任务成本
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
OpenAI 更新开发生态,Manus 2.0 推出 Cue,Sonnet 5.5 降低任务成本;看产品入口与模型选型。
本期内容
20 条帮大家总结了一下凌晨的 OpenAI 2026 开发者大会。
数字生命卡兹克把 OpenAI 开发者大会的 Dots、ChatGPT Space、Decisions API、Codex 云端环境和应用生态串在一起,方便读者看到个人助手、开发工具与分发入口如何连接。文中对订阅额度和 OpenAI 跟随竞争者的评价来自作者自身体验,应与发布事实分开理解。
Manus 回来了!更新 2.0 并发布全天候智能体 Cue
机器之心详述 Manus 2.0 的 Cascade 架构、独立云电脑、事件触发自动化与 Studio 专业创作环境,并介绍 Cue 为个人智能体配置邮箱、电话和支付能力。文章让读者看见智能体从生成初稿走向持续修改和现实服务的产品路径;性能改善来自厂商内部测试,Cue 仍处早期体验。
Claude Sonnet 5.5 发布:干活更快,单价不变
AINLP 从任务成本而非单次输出价格评估 Claude Sonnet 5.5:API 单价维持不变,较少工具步骤和较低 effort 已能完成更多编程工作。文章还比较了高档位成本与范围外修改风险,给日常编码和文档工作提供了按任务选模型、调节推理力度的依据;基准结果需按各自测试环境理解。
推出 dots
OpenAI 推出了「dots」,这是一种由 GPT-6 驱动的常驻智能体,能够使用自己的云端计算机和浏览器,自主为用户处理复杂任务。
GPT-6.1 Sol 正式发布
OpenAI 官方给出 GPT-6.1 Sol 的能力评估和 Token 定价:它在编码、电脑操作与专业任务上接近 Astra,标准输入输出价格为后者五分之一,缓存输入每百万 Token 为 0.10 美元。重点是具体工作负载的模型选型与成本,而非重复大会全景。
AI Native 回忆录:稳定性前端 S1 实践复盘
阿里稳定性团队通过构建结构化规则包 Skill 和集成工作台 Anchor,解决了 AI Native 研发模式下代码质量失控与协作成本增加的问题,并探索了 PDFE 复合角色与分库协作新范式。
什么样的 AI 助手值得付费?消费级智能体的价值、信任与成本
a16z 的讨论认为,消费级智能体要靠主动解决高成本的生活琐事来证明价值,而用户信任、专业化、平台激励和高昂运营成本将决定哪些产品能够持续发展。
Anthropic 产品负责人谈 Claude Code 新阶段:智能体编程与可变软件
Anthropic 的 Thariq Shihipar 探讨了 Claude Code 的演进、通过 Claude Mods 向「可变软件」的转变,以及日益自主的智能体所带来的关键安全挑战。
让人类交出方向盘:特斯拉 FSD 十三年的冒险、争议与进化
本文深度回顾了特斯拉 FSD 十三年从依赖供应商到自研芯片、从简单感知到 3D 占用网络的演进历程,揭示了其在硬件迭代与算法升级中经历的争议、冲突与技术突破。
DeepSeek Harness 桌面端:现在,开箱即用。
DeepSeek Harness 发布 v0.2 预览版,推出 macOS 和 Windows 桌面端安装包,实现开箱即用,并增强了插件管理、自动化任务及代码变更展示能力。
OpenAI 产品负责人谈 AI 产品的下一步:语音、智能体与自动化软件 | Tara Sesha、Nan Yu
OpenAI 产品负责人 Tara Sesha 和 Nan Yu 探讨如何跟上模型的快速演进:通过发布和迭代持续学习,以用户需求和系统约束为基础设计智能体,并把规划视野控制在技术能力所及的范围内。
Grok Bot 核心团队访谈:从手动指挥到信任放权的 Agent 使用哲学
深度解析 Grok Bot 两位核心成员的系统性 Bot 配置与工作流,提炼出从“过度拉伸”到“固化为 Skill”再到“Routine”的信任建立方法论。
丘成桐弟子带 AI 狂写 470 万行,庞加莱猜想证明首次被机器完整验证!
丘成桐弟子 Ben Chow 带队用 Lean 完整形式化庞加莱猜想证明,约 470 万行代码全部通过内核检查,其中最后两周的 270 万行由 ChatGPT、Claude 等 AI 智能体写出,机器首次成为证明的裁决者。
我发现了渗透 Agent 长程任务的秘密
Sonic Harness 通过 MEA 三角色物理隔离、零信任叙述审计及代码级完成态铁律,从工程层面解决单会话 Agent 长程任务的上下文膨胀与幻觉自证问题,实现 100 小时不间断渗透测试。
为什么 Claude 暂时还不能当你的产品经理?Anthropic 首席产品官圆桌谈 AI 产品管理
Anthropic 的产品负责人认为,AI 会改变产品经理的工作方式,但在产品不断演进的过程中,人类仍需连接用户需求、团队与决策,并作出关键判断。
斯坦福&英伟达开源 CLM-8B:75MB 对比学习验证器,DeepSWE 81.6% 刷新 SOTA
斯坦福与英伟达开源 CLM-8B,这是一款基于对比学习的 System One 决策模型,通过冻结 Qwen3-8B 骨干并训练轻量级投影头,在保持极低延迟的同时,在 DeepSWE 等智能体验证基准上刷新了 SOTA。
为什么我在夏天暂别 AI,以及我从中学到了什么|Karri Saarinen(Linear)
Linear 联合创始人 Karri Saarinen 认为,AI 应让产品团队有更多时间了解客户、培养判断力并提升质量,而不是把组织变成追求更多产出的工厂。
当 AI 开始设计芯片---聊聊 EDA 与 AI 时代的芯片设计
新思科技嘉宾从 EDA、系统厂商自研芯片与 Agent 辅助设计三条线说明,AI 正提升芯片设计效率但受低容错工具约束,全自动造芯仍未实现。
Lenfest 研究所扩大标志性项目,获 OpenAI 更多支持
OpenAI 与 Lenfest 研究所正在扩展其 AI 研究员计划,提供 1000 万美元资金及软件额度,助力地方新闻编辑室引入 AI 工程师以实现转型。
确保来源正确,而不仅仅是事实:面向 MCP 智能体的来源感知验证
作者推出了 ProvenanceGuard,这是一个针对基于 MCP 的大语言模型智能体的来源感知验证层,通过确保声明归属于正确的特定工具输出而非仅存在于证据池中,从而防止「跨来源混淆」。