EP192 · Gemini Argon 推进长程任务、Anthropic 衡量机器人工作、Eleven v4 升级语音
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Gemini Argon 推进长程任务,Anthropic 衡量机器人工作,Eleven v4 升级语音:看懂落地取舍。
本期内容
20 条Gemini 4 Argon:前沿智能的新阶段
Gemini 4 Argon 将长程推理落到代码迁移、内存优化和安全防御,目前通过 Fairwind 向受信任的网络防御者逐步开放。Google 的内部案例提供了理解模型能力的新切口:连续实验、检查编译结果与人工审计,怎样共同支撑复杂工程任务,而非只看一次生成是否成功。
我们能预测机器人将从事的工作吗?
Anthropic 用任务、环境与成本三个层次衡量机器人的就业影响:当前机器人能覆盖许多体力任务,却往往需要受控场地,经济上划算的工作仍很少。研究结合任务数据库、Claude 评估和历史回测,帮助读者判断哪些岗位可能先发生变化,以及能力演示到实际部署还差什么。
Eleven v4:我们最具表现力的文本转语音 AI 模型
ElevenLabs 同时推出表达型 Eleven v4 与低延迟 Turbo,将语气、上下文、多说话人互动和跨语言声线一致性放进同一产品更新。原文说明自然语言导演指令、音频标签与声音克隆的使用方式,也分别交代推理延迟和首段可听语音的指标,便于创作者与语音智能体团队判断取舍。
高德本地生活分析 Agent AI Native实践全景(万字长文)
作者复盘了高德本地生活团队在 AI Native 研发转型中的实践,通过构建结构化规则、知识库和分析智能体,提升了 BI 经营诊断的效能。
小红书推荐系统的 Agentic 发布:跨昼夜任务 Harness 实践
小红书推荐系统将跨昼夜发布流程沉淀为近 20 万字 SKILL 后仍出现模型幻觉导致推全事故,转而构建长程任务 Harness,以任务持久化、模板约束、引擎推进和效果查证保障 Agent 可靠完成发布。
81.8 秒、15 个版本:一次纯 Codex 驱动的 AI-native 视频实践
京东技术团队分享了一套由 Codex 驱动的 AI-native 视频制作链路,通过将创意意图转化为可编辑的工程代码(HTML/GSAP/WebGL/Blender),实现了从产品资料到高质量成片的自动化生产与精准迭代。
从编程到个人助理:更强大的 AI,更透明的你
本文通过智谱 ZCode 等 AI 编程工具的静默上传事件,深度剖析了 AI 个人助理在提升效率的同时,如何通过不对等的用户协议和技术路径打破隐私屏障,使个体在科技巨头面前变得前所未有地透明。
SynthID Bio:合成生物学的水印方法
Google DeepMind 推出了 SynthID Bio,这是一系列通过在合成蛋白质序列和 3D 结构中嵌入不可见签名的水印方法,旨在增强生物安全性和科学完整性。
代码审查之死:数据揭示的真相 | Laurie Voss,Arize AI
Laurie Voss 认为,AI 生成代码的速度已让可信审查成为新的瓶颈;团队应把人的判断从逐行检查转向构建并监测可靠的审查系统。
400 多家组织的 AI 软件开发现状:Justin Reock 解读效能、质量与研发平台数据
DX 副 CTO Justin Reock 基于数百家组织和约 20 万名工程师的数据指出,AI 正在提升交付吞吐量,却也伴随 PR 变大、变更信心下降等质量与协作压力;组织应同时衡量使用情况、业务影响、成本和平台就绪度,并优先解决真正的交付瓶颈。
李飞飞创业公司被苏姿丰 550 亿收购!世界模型最大交易落地
AMD 以 82 亿美元全股票收购李飞飞创办的空间智能公司 World Labs,旨在通过整合世界模型技术构建端到端 AI 生态并应对 NVIDIA 的竞争。
DeepSeek 知乎独家发文,首次公开 V4.1 Agent 训练“大本营”DSec
DeepSeek 发布 DSec 技术报告,介绍如何通过弹性沙盒基础设施支撑 V4.1 的大规模 Agent 训练、评测及数据预处理。
HP 总裁谈 AI 智能体接手部分管理工作,以及如何用业务成效衡量企业 AI | Faisal Masud | E314
HP Digital Services 总裁 Faisal Masud 认为,企业 AI 必须带来可衡量的业务成效;他谈到智能体可能承担部分中层管理工作,并分享 HP 的客户优先软件理念、投资回报证据与按成效定价思路。
瓦解一场协同的模型蒸馏攻击
OpenAI 识别并瓦解了一场旨在通过对抗性蒸馏从其模型中提取保护推理能力的协同行动。
智能体三周重构 30 万行代码,从业者追问其证明了什么
CodeScene 利用 AI 智能体在三周内重构了 30 万行 C 代码,将代码健康度从 5.6 提升至 10,本文详述了这一案例研究。
看见即行动、性能超 Jev,上海 AI 实验室推出决策模型“书生·明决”,实现响应效率与质量双升级
上海人工智能实验室推出决策模型「书生·明决」,通过原生视觉感知与指令遵循的融合,在响应速度和决策质量上超越 Jev 等开源模型,并探索了快慢思考协同的调度机制。
AI 找出数学反例推翻论文,作者确认!453 篇手稿,AI 开始自己出题了
思特雅大学研究者曾仔健搭建的 AI Has Taste 系统,用多 Agent 分工把数学研究流程从选题、证明、找反例到提出新猜想全部自动化,已归档 453 份手稿,其中 6 篇为 AI 提出的新猜想,标志着 AI 从「答题」走向「出题」。
AI 时代漏洞发现与利用趋势
Google 威胁情报集团的数据显示,AI 正在使漏洞披露和利用率翻倍,并将发现方向转向高风险的远程代码执行(RCE)漏洞,迫使防御方从大规模修补转向基于威胁情报的分类处理和智能体化修复。
DeepSeek 加速向华为靠拢
DeepSeek 宣布开源面向华为昇腾的基础设施组件,涵盖 TileLang 算子语言、计算库及分布式通信库,实现与 NVIDIA 平台的深度适配。
在 TPU 上加速视频扩散模型的时空注意力
Google 研究人员通过在 TPU 上实现稀疏时空注意力,优化了视频扩散模型并实现了显著的生成速度提升。