EP112 · GPT-Live、Grok 4.5、本地模型编程 · 07-09 早报
本期导语
语音模型、编码模型和本地小模型,今天的三条精讲都在回答同一个问题:AI 能不能更自然地进入真实工作流。GPT-Live 关注实时对话里的连续交互,Grok 4.5 关注长任务和工具使用,本地模型实验则提醒我们,落地效果仍取决于任务边界、Harness 和人工审查。
本期内容
43 条OpenAI 发布全双工语音模型 GPT-Live
OpenAI 的 GPT-Live 把语音交互从轮流说话推进到全双工架构:模型可以边听边说、在需要时保持沉默或打断,同时把搜索、推理和更复杂的任务交给后台前沿模型处理。它不只是一次语音体验更新,也是在把实时对话和更长程的 Agent 工作流接起来。
Cursor 发布面向长任务的 Grok 4.5
Cursor 与 SpaceXAI 发布 Grok 4.5,重点不只是模型进入 Cursor,而是训练目标从纯软件工程扩展到数据科学、金融、法律等更宽的知识工作。文章还披露了用分布式 Agent 系统构造困难环境、通过强化学习训练长任务能力的路线,适合观察 AI coding 工具如何走向通用电脑工作。
本地模型用于编程的经验
这篇发布在 Martin Fowler 站点的文章作者是 Birgitta Böckeler。她用本地小模型做 Agentic coding 实验,按内存、速度、工具调用、功能正确性、上下文延续和代码质量建立可行性漏斗。结论很克制:本地模型还远不能替代大模型,但在小而明确、文件范围清楚的任务上已经能进入真实工作流。
Claude Cowork 在网页和移动端上线: anywhere 都可传递工作 | Anthropic 的 Claude
Claude Cowork 现已上线网页和移动端,允许用户在一台设备开始任务,随后在另一设备继续,支持后台执行和无缝切换。
如果 Agent 的 Harness 比模型本身更重要会怎样?
Aditya Bhargava 认为,智能体性能与其说取决于模型选择,不如说取决于具备工具、安全边界、推理循环、子智能体和优化能力的高质量 Harness。
超越固定 Harness:走向运行时自适应的 AI 工程
Rajiv Chandegra 认为,AI 工程必须从预先固定的 Harness 走向自适应多智能体系统,让结构在运行过程中涌现、稳定并持续变化。
在任何云上运行 AI 工作负载,在 Hugging Face 上存储:使用 SkyPilot 的零出口存储
本文介绍了 Hugging Face Storage 与 SkyPilot 的集成,使 AI 工作负载能够在任何云上运行,同时从 Hugging Face Hub 读取模型和数据集且无出口费用。
C4N 网络与存储优化型虚拟机
Google Cloud 的 C4N 虚拟机为高要求工作负载提供高达 400 Gbps 的网络和 25 GiB/s 的存储性能。
Meta 推出智能体图像模型 Muse Image 和视频模型 Muse Video
Meta 推出 Muse Image,这是一个具备智能体能力的图像生成模型,能够使用工具、自我优化以及测试时计算扩展,同时预览了 Muse Video(一款支持原生音频的视频生成模型),现已可在 Meta AI、Instagram Stories 和 WhatsApp 中使用。
构建让人保持判断力的 AI 系统,而不是只会点批准的流程
Angel Ortmann Lee 认为,human-in-the-loop AI 只有在界面促使人独立核验证据,而不是机械批准模型输出时,才真正有效。