EP178 · 全双工语音、GKE Agent、Claude CRM · 09-17 早报
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
全双工语音分层、GKE Agent 沙箱隔离、Claude CRM 人工确认,提供系统边界的判断路径。
本期内容
20 条你的语音智能体还只是对讲机 — Neil Zeghidour,Gradium
Gradium 负责人从语音交互的演进解释全双工为何关键:现有语音模型多在听与说之间轮换,难以处理附和与重叠表达。团队主张让轻量语音界面负责自然对话,将推理和工具调用交给后台文本模型,借此平衡实时感、智能能力与部署成本。
Agent Substrate 现已在 GKE 上可用
Google 推出可运行于 GKE 的开源 Agent Substrate,把智能体执行环境与机器管理拆开:运行时以微型虚拟机或 gVisor 隔离代码,并通过网络网关约束访问。它会在空闲时保存沙箱状态、释放算力,再按需恢复;文章的重点是为大量长生命周期智能体兼顾安全、低延迟和资源利用。
Salesforce 接入 Claude:销售与客服工作流
Anthropic 与 Salesforce 发布测试版插件,让销售人员在既有权限内把账户、商机和销售管道带入 Claude。它可汇集 CRM、邮件和 Slack 的会前信息,生成跟进内容并提出记录更新;写入 Salesforce 前仍由销售人员确认,适合观察权限边界与人工审批如何落地。
阶跃发布语音大模型 StepAudio 3,拿下多个全球第一!
阶跃星辰发布 StepAudio 3 系列模型,包括实时交互、语音识别、文本转语音、音频生成和音乐创作,其中多款模型在 Artificial Analysis 榜单中位列全球第一,展现出在内容理解、实时交互和音频创作方面的领先能力。
从内存饥渴的 HNSW 到量化 SPANN:Pinterest Manas 平台的技术演进
Pinterest 的 Manas 搜索平台通过对 HNSW 和 IVF 索引应用标量量化与乘积量化、转向基于 SSD 的 SPANN 服务,并试点多向量后期交互检索,大幅削减了内存成本。
无问芯穹联合清华、上交正式开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA
无问芯穹开源具身端侧推理引擎 APXInf,凭借 Rust 运行时与 FP8 量化实现 Jetson Thor 26 ms 延迟、38.46 Hz 频率,兼顾性能、稳定与快速模型接入。
用 1393 个 Agent 重构 Hermes 代码库:削减 34.4% 的实践复盘
Nous Research 让开源 Agent Hermes 重构自身代码库,派出 1393 个子 Agent,将超百万行非测试 Python 代码削减 34.4%,并公开了编排、验证与故障恢复的完整机制。
1300 万天压到 0.25 秒!分子之心用 AI 把化学反应拍成电影,成果登 Science 子刊
分子之心自研反应性机器学习力场 QuantaMind 以接近 DFT 的精度和经典分子动力学的速度,在万原子级体系上完整模拟酶催化循环,将十万原子反应体系单步耗时从千万天量级压缩到 0.25 秒,成果登上 Science Advances。
Claude for Small Business:新工作流、集成与培训
Claude for Small Business 扩展了其服务,包括 43 个工作流和 27 个与热门商务工具的新集成,使小型企业主能够自动化后台任务并推动增长。此次更新还引入了一系列免费的现场研讨会和合作伙伴网络研讨会,帮助用户上手使用新功能。
语音智能体不只会说话:Charlie Guo 谈三种可混用模式与原生实时音频 | OpenAI
OpenAI 开发者体验负责人 Charlie Guo 指出语音智能体不必口头回复,梳理可混用的语音到语音、语音到动作与事件到语音三种模式,并说明原生实时音频与 GPT Realtime 2 如何解锁更丰富、更可及的产品。
使用 Claude 时,数据留存如何运作
Claude 说明了为何为安全监控保留 30 天滚动窗口,以及 Enterprise Frontier Safeguards 如何让符合条件的企业在自行掌控数据的前提下继续识别滥用行为。
Michael Noukhovitch - 博客
该博客文章指出了 LLM 强化学习中的马太效应——简单任务不断提升而困难任务停滞不前——并提出了一种自适应采样方法「永不放弃」,将计算资源重新分配给困难问题,表现优于标准 GRPO。
告别「只会相似度检索」:腾讯最新 T-Mem 让 AI 学会「联想回忆」
T‑Mem 在写入记忆时预先生成联想触发器,使长对话记忆在无相似度的场景下也能被召回,实验在 LoCoMo 与 LoCoMo‑Plus 上刷新 SOTA。
读完斯坦福 116 页 AI 实施手册,我最大的感受是:别再盯着模型了
斯坦福 116 页企业 AI 实施手册调研 51 个真实案例后指出,AI 落地最难的不是技术而是组织,77% 的难题来自变革管理、数据质量与流程重设计,职能部门才是最大阻力。
E251|推理芯片之战:聊聊 Groq、Cerebras 与 OpenAI 三大路径
两位 AI 芯片创业者拆解 Groq、Cerebras 与 OpenAI 三条推理芯片路径的技术取舍,指出推理时代核心矛盾从算力转向带宽性价比,SRAM 与系统级异构是主要解法,而静态编译调度与晶圆级良率成本是各自软肋。
实习生 1 天消耗 1 亿 Token 被约谈:如何衡量 Token 的 ROI
文章以实习生一天烧掉 1 亿 Token 却只改十几行代码为引子,指出 Input Token 才是成本黑洞、每行代码成本是伪指标,主张用单位有效任务成本衡量 AI Coding 效率,并给出个人与团队层面的落地方法。
最懂科学的开源基础大模型『书生-S2』发布:科学能力比肩顶尖闭源,通用性能居开源第一梯队
上海人工智能实验室发布多模态基础大模型「书生-S2」,通过创新 Memory Decoder 架构实现领域知识的可插拔扩展,在科学计算、长程数学推理与智能体能力上达到顶尖水平,并预告了首个隐空间语言模型 NCP-ArchPreview。
Meta 新研究:字节模型蒸馏后,天花板破了
Meta FAIR 和华盛顿大学的研究表明,将大模型蒸馏到字节级别(而非 Token)可以显著提高小模型的性能上限,其中 End-Of-Token 方法在预测准确率上比传统 Token 蒸馏高出 4 个百分点。
对话 xLean 薛轲翰:扫地机产品远没有到头,清洁机器人可以是 Family Agent 的起点
xLean 创始人薛轲翰分享其双形态洗地机器人 TR1 的产品逻辑:以高频刚需的家庭清洁为切入点,通过手持模式采集高密度示范数据实现清洁闭环,并以此为底座构建模块化扩展的 Family Agent 生态。
Codex GPT-6 Astra 额度掉得太快?我用一段提示词,把上下文消耗大幅降低了!
作者发现 Codex GPT-6 Astra 额度快速消耗主要由于上下文累积,通过精简 AGENTS.md 并设置自动压缩与工具输出限制,显著降低了 token 用量。