EP188 · Parag 谈搜索补偿、Erina 用实验改进智能体、Roland 构建产品循环
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Parag 谈搜索补偿,Erina 用实验改进长程智能体,Roland 用循环迭代产品;三种视角帮助判断智能体如何落地。
本期内容
20 条Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口
前 Twitter CEO、Parallel 创始人 Parag Agrawal 判断,智能体频繁使用网络会重塑搜索成本。他解释如何让搜索先筛掉无关信息,节省模型推理开销,并提出按智能体获益向内容所有者付费。访谈还谈到持续监测网页变化的推送式搜索,可帮助读者理解开放网络的新商业模式。
长时程智能体需要实验,而不只是提示词 — Erina Karati
Erina Karati 以 Supercell 的多智能体游戏村庄说明,角色会在传递传闻时丢失来源,甚至把不确定说成确定。她提出用可控场景、运行轨迹和多维评分评估整段行为,只保留通过护栏的小幅策略改动。芒果促销案例已有改善,但她没有宣称系统获得普遍提升;这套方法可供长时程智能体借鉴。
「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化
Roland Gavrilescu 主张把运行、验证与反馈的循环视为智能体产品核心:将失败模式沉淀为评测,将重复行为沉淀为技能和提示词,再用可版本化的方案复用。招聘案例说明如何由人校准判断标准,并用实际用户反馈检验改动。他还强调衡量有价值的工作与成本;这些是方法主张,尚非通用效果的证明。
Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅
Claude Science 用既有 bootstrap 与 form-factor 方法计算出 N=4 超杨-米尔斯理论的九圈振幅,Lance Dixon 独立核验了结果。原文作者强调,Claude 在较少外部科学指导下完成复杂计算,但方法本身没有突破计算极限,宋何团队也同期取得相关结果。
一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio
Skydio 的 Suchet Bargoti 现场展示一名操作员同时操作三架无人机,并介绍支撑多机任务的自主技术栈:高可靠性目标、飞行数据反馈循环、地图式世界模型、遮挡下的目标跟踪,以及边缘与云端协作的视觉语言模型智能体。
Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本
Perplexity 以 Rust 编写的分布式键值存储 CobbleDB 取代核心搜索服务中的 DynamoDB;据其工程数据,批量读取延迟约降至原来的五分之一,整体存储费用至少降低 20%。
用反思击败强化学习:GEPA 与 Optimize Anything
Lakshya A. Agrawal 介绍了 GEPA 的反思式提示优化方法与 Optimize Anything,指出执行轨迹中的文本反馈能够改进提示词、智能体运行框架及其他可评分产物,而且所需样例远少于仅依赖奖励的优化方法。
自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta
Tejas Bhakta 介绍了如何由人类选定优化方向、提供准确的硬件与模型背景,再借助兼顾正确性和性能的基准测试,让智能体搜索 GPU kernel 的实现方案;他也提醒,过于狭窄的目标会诱发指标投机,而成功的 kernel 与裸机优化叠加后,据称可带来 3 倍提速。
机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略
Dyna Robotics 联合创始人 Jason Ma 介绍数据金字塔、推理模型与世界动作模型,以及通过奖励模型和人工参与的主动学习改进机器人策略。其微调后的 Dyna-1 在餐巾折叠的 24 小时试验中达到 99.4% 成功率;他还分别展示餐厅部署、经任务微调的萨克拉门托洗衣店毛巾折叠、CoRL 2025 陌生环境演示和红牛活动应用。
为 Agent 而生,千问 AI 平台发布全新服务方式
千问 AI 平台在云栖大会发布面向 Agent 的全新服务方式,通过 Qwen 共创计划与 AI Arena 引入真实场景反馈优化模型,并推出 Skills、CLI 及支付宝合作的安全支付机制,旨在让云服务更易被 Agent 理解、调用与管理。
亮出“中国最强 AI 芯片”还不够,平头哥又甩出一手开源
阿里平头哥在发布高性能 AI 芯片真武 V900 的同时,宣布扩大其类 CUDA 软件栈 T-Head SAIL 的开源范围,旨在通过降低迁移成本和赋能开发者自主优化,构建开放的国产算力生态。
我们如何打造能够自我改进的智能体|Zubin Aysola,Weights & Biases
Weights & Biases 工程师 Zubin Aysola 介绍 Arya 如何利用生产轨迹、忠实的离线仿真、可重复执行的任务和人工判断,持续研究并改进智能体的行为。
Claude Code 和 Codex 如何与人类研究员竞速:AI 研究基准的设计与局限
Prime Intellect 的 Elie Bakouch 介绍了 Codex、Claude Code 等智能体在机器学习速度挑战中的表现,并指出,只有采用受控且可复现的基准,才能区分刷新纪录与真正的新研究发现。
修复 PR 瓶颈:用检查、智能体审查与复盘给软件工厂装上刹车
Matt Pocock 提出,AI 驱动的软件工厂需要三道刹车——自动化检查、智能体审查与聚焦的人工审查,再加上能把编码标准不断复利的 retro 技能,才能把 PR 瓶颈压下去,而不是变成 slop cannon。
能为你运行实验的 AI 研究智能体:Arya 如何持续改进
Tim Sweeney 演示了研究智能体 Arya 如何探索模型实验,并介绍团队如何把生产轨迹、人工复核和任务评测结合起来,形成有章可循的智能体改进闭环。
在 Claude Code 中构建验证闭环:把手工检查变成可度量技能
这段 Claude Code 短片演示内置 verify 技能如何把浏览器与性能类手工检查变成可度量循环,让智能体自行确认 UI 改动、发现布局偏移并修复,减少来回沟通。
登顶 Hugging Face,网易有道开源实时语音全家桶
网易有道开源实时语音模型 R2T2 和 T3PO 登顶 Hugging Face,标志着中国 AI 影响力从通用大模型向细分技术栈渗透,并揭示了 Voice Agent 赛道中组件化与可控性的商业价值。
谷歌 TPU 跑 Kimi 比英伟达 GPU 快 57%!用的还是 DeepSeek 推理框架
初创公司 Inferact 通过为谷歌 TPU v7 开发 megakernel 推理内核,结合 DeepSeek DSpark 框架,使 Kimi K3 的推理速度比英伟达 GB200 快 57%,且代码已开源。
Apple Reference Image 在传感器端对照片签名,将来源信任从 C2PA 转移
Apple 为 iPhone 18 Pro 引入「Reference Image」,将图像来源信任从 C2PA 编辑链转移至传感器,并通过 Private Cloud Compute 验证真实的传感器捕捉。
笔记本跑 7000 亿参数 GLM!无 GPU 也行? SSD 当显存用火爆 GitHub
开源项目 Colibrì 利用 MoE 架构特性,通过 SSD-RAM-VRAM 分层内存调度技术,让普通笔记本在无 GPU 或低显存条件下运行 GLM-5.2、Kimi K3 等千亿至万亿参数大模型。