AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP92 · Codex 回放、Claude Artifacts、A2A 协作 · 06-19 早报

Agent 学习方式正在从「写提示词」转向「看一遍就会」:OpenAI 让 Codex 通过一次录屏掌握完整工作流,Claude Code 把会话过程实时变成可分享的 Artifacts 页面,Google 的 A2A 协议则在满周岁之际,展示智能体之间如何安全地互相托付任务而不互相干扰。今天的精选还覆盖世界模型路线之争、CI/CD 渐进式交付,以及开源模型的智能体化评测。

42

OpenAI Codex Record & Replay:演示一次,即可复用浏览器工作流

OpenAI 为 Codex 上线 Record & Replay:用户只需演示一次完整操作(如在 YouTube Studio 填写元数据、上传缩略图、保存私密视频),Codex 就能把这次录制转化为可复用技能,在新任务里自主匹配素材、填写信息、核验结果。能力覆盖电脑操作、浏览器操作和已连接插件,未来还能扩展到整理 PR、安排日程等场景——把「写提示词」换成了「做一次示范」。

视频OpenAI作者:OpenAI
查看原文 Record & Replay in Codex(在新窗口打开)

Claude Code 现已支持 Artifacts 渲染功能

Claude Code 上线 Artifacts 功能:会话过程能被实时转化成可分享的可视化页面——PR 走查、系统说明、仪表盘、发布清单等,且随工作推进自动更新同一链接。基于会话上下文(代码库、连接器、对话本身)直接生成,无需额外搭建数据源。团队调试场景验证最多:工程师把故障排查过程发布成时间线、可疑提交和错误曲线,站会前已迭代两次,所有人对齐同一视图。目前 Beta 阶段面向 Team/Enterprise 组织开放。

文章Claude Blog作者:Claude Blog
查看原文 Claude Code now supports artifacts | Claude(在新窗口打开)

A2A 如何构建一个协作智能体的世界

Google 的智能体协作协议 A2A 满周岁:相比把智能体当 API 调用,A2A 让智能体之间发起真正的协作——保护内部「秘方」逻辑不外泄、避免单一智能体上下文被海量依赖污染、支持智能体反馈不完整请求并追问。文章以蛋白质结构预测工具 FoldRun 为例:开发者只需把任务交给 FoldRun 这个独立智能体节点,无需自建 GPU 流水线和模型生命周期管理。A2A 的 Python/Go SDK 已 1.0 GA,正拓展到电商支付、企业数据流和跨平台运维场景。

文章Google Developers Blog作者:Alan Blount, Frank Guan, Nick Losier
查看原文 How A2A is Building a World of Collaborative Agents(在新窗口打开)

哪条路线,才能通往「世界模型」的终局?|对话黄碧薇:Aether AI 创始人

黄碧薇教授深度拆解世界模型的技术现状,提出以因果 AI 为核心的第四条路线,分享了因果世界模型如何让机器人真正理解物理规律并实现举一反三,以及她从学者到创业者的心路历程。

播客十字路口Crossing作者:十字路口Crossing
查看原文 哪条路线,才能通往「世界模型」的终局?|对话黄碧薇:Aether AI 创始人(在新窗口打开)

超越流水线的 CI/CD:Robert Erez 谈渐进式交付、GitOps 与前滚恢复

Robert Erez 将 CI/CD 从流水线检查清单提升为一套务实的风险管理方法,其核心包括渐进式交付、实用主义 GitOps、前滚恢复以及规范的功能开关治理。

视频The Pragmatic Engineer作者:The Pragmatic Engineer
查看原文 CI/CD with Robert Erez(在新窗口打开)

MosaicLeaks:你的研究智能体还能保守秘密吗?

MosaicLeaks 引入了一个基准测试和一种隐私感知的强化学习方法(PA-DR),表明深度研究智能体会通过网页查询中的马赛克效应泄露隐私信息,并且仅针对任务性能进行训练会使泄露问题更加严重。

文章Hugging Face - Blog作者:Alexander Gurung, Rafael Pardinas
查看原文 MosaicLeaks: Can your research agent keep a secret?(在新窗口打开)

智能体化程度够了吗?用自有工具对开源模型进行基准测试

本文介绍了一种基准测试框架,它不仅衡量智能体是否成功完成任务,还衡量其付出的工作量,并以 `transformers` 库为例,展示了新的 CLI 和 Skill 能帮助大型开源模型,但会损害小型模型。

文章Hugging Face - Blog作者:Lysandre, Nathan Habib, Pedro Cuenca
查看原文 Is it agentic enough? Benchmarking open models on your own tooling(在新窗口打开)

TPU 上的 MoE 推理优化:SGLang-JAX 用 Pallas 内核砍延迟 53%

本文详细介绍了在 TPU v7x 上优化服务 Ling-2.6-1T MoE 模型的过程,重点是一种新颖的 Pallas 内核(Fused MoE V2),它将数据移动隐藏在计算之后,实现了 MoE 预填充延迟降低 53%,并在解码吞吐量上最高达到 H200 GPU 的 1.77 倍。

文章LMSYS Blog作者:Prayer, JamesBrianD, Haolin Fu, Haoguang Cai, Qinghan Chen
查看原文 Optimizing Ling-2.6-1T on TPU with SGLang-JAX: Hiding MoE Data Movement Behind Compute with One Pallas Kernel(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期