EP167 · 蚂蚁 Harness、Uber 成本、长程导航 · 09-06 早报
本期导语
沿蚂蚁数科 Harness 验收、Uber 成本治理与 UrbanGround 长程导航,判断工程落地边界。
本期内容
20 条AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践
蚂蚁数科魏长征用一个 40 多万行 Rust 新项目和一个超过 60 万行 C++ 存量项目说明,AI Coding 会放大需求模糊、事实冲突与验证不足。团队以唯一事实源、分层文档、CI 门禁和多视角 Review 建立 Harness;存量项目改造后,代码缺陷率从 20% 以上降至个位数。这把近期 AI 原生工程讨论推进到可验证、可验收的交付闭环。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
Uber 已有超过 70% 的代码合并请求由智能体生成,每天执行超过 30000 次技能调用;从 2 月到 8 月,周请求量增长 9.4 倍,AI 总支出自 4 月以来相对稳定。文章把成本拆到模型路由、上下文、工具加载和请求轮次,并用真实任务基准寻找质量与成本的平衡,为近期编码 Agent 实践补上规模化运营方法。
走两步,就忘了路|UrbanGround:上交、NUS 等团队把大模型放进「真实三维香港」
UrbanGround 用香港真实三维数据构建连续城市沙盒,在 810 个任务上测试 10 个多模态模型。短程导航最高成功率为 75.0%,长程仅为 0% 到 3.8%;封路和行人还会暴露动态调整问题。这项研究让读者区分识别地标与持续完成行动,也为近期物理 AI 讨论补充了更接近真实环境的评测坐标。
如何自建数据中心:为什么每家创业公司都该认真对待算力
Speechify 创始人 Cliff Whitesman 解释了 AI 公司为何可能需要自有 GPU 集群,并将算力经济学、产品切入点、智能体原生工程、语音交互和生物研究串联为一套打造复利型 AI 公司的战略。
从 S3 到 GPU 一步到位:重新思考 ML 训练的数据加载
Vortex 是一个 Linux Foundation 的列式文件格式,通过使用可组合的数组编码、用于投影/过滤裁剪的区域图布局,以及 GPU 原生解压缩,实现直接从 S3 到 GPU 的流式传输,从而绕过传统 PyTorch 管道中的 CPU 和 NVMe 瓶颈。
The Batch: 979 | LLM 清理智能体的“垃圾”
研究人员提出Self-GC方法,利用LLM选择性压缩智能体上下文,通过保留、折叠或剪枝操作在降低成本的同时减少关键信息丢失。
前沿推理抵达边缘:如何在 NVIDIA Jetson 上部署和优化模型
本指南探讨了在 NVIDIA Jetson 上部署先进推理模型,重点介绍如何利用 NVFP4 量化和投机解码来显著提升性能,同时保持模型保真度。
科技爱好者周刊(第 411 期):OpenClaw 2.0 是一个缩影
本期周刊深入探讨了 OpenClaw 2.0 的开发模式,揭示了 AI 时代软件生态的快速迭代与潜在风险,并分析了技术堆栈迁移的趋势。同时,分享了地月激光通信、韩国免费 AI 服务等科技动态,以及多个开源工具和资源。
AI 电话代理的工作原理:背后的架构分析
本文深入探讨了 AI 电话代理的多层架构,详细介绍了电话基础设施、语音识别、语言模型以及业务系统集成是如何协同工作,以处理客户来电并自动化预约等任务。
Lex Fridman 对话 DHH:Omarchy,才是真正属于 Agent 时代的操作系统
DHH 在访谈中把 Omarchy 称为 Agent 原生操作系统,并说明 Quattro 版本过去三个月几乎全速使用 Agent、最近两个月达到 100%。更值得关注的是,用户可以借助 Agent 改写界面与流程;这把软件可塑性与升级、权限、回退等维护问题放到一起。