AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP177 · 可验证安全、实时语音、上线排障 · 09-16 早报

黄仁勋把 AI 安全落到验证机制,Gemini 3.8 Live 展示实时协作,Plivo 的故障清单给出上线排障路径。

20

英伟达 CEO 黄仁勋谈 AI 安全、开放模型与赢得 AI 竞赛

黄仁勋把安全讨论拉回可验证的工程控制:他主张先追溯前沿实验室的具体事故、建立测试与独立评估,再决定监管如何介入;对递归自我改进,也强调产品发布前仍须经过验证与评测。对中文读者而言,值得借此区分风险叙事、治理机制与开放模型的产业选择,观察算力、应用和生态如何共同决定竞争力。

视频All-In Podcast作者:All-In Podcast
查看原文 Jensen Huang: The Doomer Hoax, Superintelligence is Here, and The Future of AI (ft. President Trump)(在新窗口打开)

Gemini 3.8 Live 发布:实时多模态与 Extended Thinking 双版本

Google DeepMind 发布的 Gemini 3.8 Live 将实时视觉理解、跨语言对话与后台工具调用放进同一语音交互链路;Extended Thinking 则在持续对话中处理更复杂的多步骤任务。文章同时给出开发者、企业与产品用户的上线入口,并以音频水印回应可识别性问题。它提供了观察语音智能体从演示走向工作流协作的一组具体能力边界。

文章Google DeepMind News作者:Tom Ouyang
查看原文 Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(在新窗口打开)

上线第一周就会撞上的 5 种语音智能体失败模式 — Venky B,Plivo

Plivo 基于长期语音 API 和真实生产呼叫经验,拆解语音智能体首周常见的延迟、转写、结构化采集、语音合成及轮次交互问题。最可迁移的经验是把自由文本改为带约束的字段和字段级评测,并在转写与合成之间加入可控的规范化层。对正在做语音产品的团队,这份清单可用来把 PoC 指标转成上线后的排障与验收项。

视频AI Engineer作者:AI Engineer
查看原文 5 Voice Agent Failure Modes You'll Hit in Week One — Venky B, Plivo(在新窗口打开)

Tobi Lütke:工作的未来、AI 智能体与人类判断力

Shopify CEO Tobi Lütke 向 Shane Parrish 讲述,像 River 这类带人格的智能体如何驱动 Shopify 大量工程工作,为何机器仍无法为艰难决策承担责任,以及品味、慢反馈直觉、修剪与长寿机构如何塑造他做产品与建公司的方式。

视频The Knowledge Project Podcast作者:The Knowledge Project Podcast
查看原文 Tobi Lütke: The Future of Work, AI Agents, and Human Judgment(在新窗口打开)

你的智能体出色完成了任务。它还能再来一次吗?

文章介绍了一套诊断与指南系统,用于衡量并将 LLM 智能体的平均准确率与单任务可靠性之间的一致性差距减半,同时不降低平均性能。

文章Hugging Face - Blog作者:Evelyn Duesterwald, Lilian Ngweta, Vatche Isahagian, Jayaram Radhakrishnan, Vinod Muthusamy, Gaodan Fang, Ashwath Vaithinathan Aravindan, Punleuk Oum, G Thomas, Merve Unuvar, Ayhan Sebin, Michał Ulewicz
查看原文 Your Agent Aced the Task. Will It Do It Again?(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期