EP186 · Every 实验室、Elastic 原子验证、同行反馈
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Dan Shipper 建实验室,Elastic 核查声明,Thoughtworks 谈同行反馈:看清 AI 协作边界。
本期内容
20 条在移动的 AI 前沿上做产品:Dan Shipper 的实验室机制
Every CEO Dan Shipper 把 AI 模型快速迭代带来的产品难题拆成探索与执行两种节奏:一两人的实验室团队先并行试验、内部自用,再把有持续使用和成本可行性的少数成果交给主线产品。这给产品负责人一个可操作的机制,而不只是保持敏捷的口号。
使用原子声明验证减少 LLM 幻觉
Elastic 在合并知识库文章时把生成与验证拆为两步:先生成连贯的合并稿,再将原文拆为可独立核对的原子声明,逐条标出已覆盖、被有意取代或遗漏。人工审查因此从重读整篇转为裁决缺口与冲突;这是控制 LLM 幻觉与信息丢失的可复用实践。
健康的反馈机制
这篇由 Thoughtworks 作者撰写的同行反馈指南主要讨论人际协作,但明确指出:即使团队越来越常与 AI Agent 结对,人与人之间互相学习的反馈仍不可替代。文章还以让 AI 代写沟通为例,区分个人偏好与团队规范,为 AI 进入团队后的协作边界提供判断框架。
如何为 AI 驱动的代码现代化项目做好准备 | Claude by Anthropic
Anthropic 的现场工程师将 AI 代码现代化拆为目标、正确性证书、上线策略、环境与审批准备、Agent 工作流和小范围验证六步,提醒团队把瓶颈从写代码转向可审计的验收与推广。
百万级仿真资产,正在重构机器人训练场:阿里巴巴 RoboFlywheel 首发
阿里巴巴发布 RoboFlywheel 开放式仿真基础设施,提供超百万级刚体、铰链与柔性资产,支持机器人交互与闭环训练。
拆解京东海博 AI-Native 落地保障:海博团队 AI 知识库能力建设
京东海博团队通过构建三层结构化 AI 知识库(项目、角色、Skill 层)并采用 OKF 规范,将业务知识从个人记忆转化为可被 AI 消费的组织资产,显著提升了研发分析效率与测试用例覆盖率。
用 Skills 将视觉语言模型变成智能体工具
Merve Noyan 主张开发者不应再把视觉语言模型直接当作线上端点,而是通过 Skills 工具包把精选的 Apache 2.0 视觉模型交给编码智能体调用,并用 VLM 标注加双评审的流水线,以约 3-4 美元的成本训练出 RF-DETR 这类专用模型。
在 MaxText 中复现 OLMo 3 7B 预训练:TPU 大规模训练案例研究
Google 研究人员使用 MaxText 在 TPU 上成功复现了 OLMo 3 7B 的预训练和中训阶段,证明了该框架与原 PyTorch 实现的对等性,并提供了关于大规模训练可靠性和性能优化的详细案例研究。
Hy Image3.5 preview 发布,为专业创作提供高性价比模型
腾讯混元发布图像生成模型 Hy Image3.5 preview,综合能力较上代提升约 30%,2K 出图定价 0.15 元/张,并已接入元宝、ima、WorkRally 等多款产品。
Replit CEO Amjad Masad 谈 AI 时代的年轻人应该学什么
Replit CEO Amjad Masad 认为,年轻人在社会中的效用就是质疑根深蒂固的信念、去做异端;他主张大学应当包容支线任务与由 AI 驱动的项目式学习而非分数,指出想法成形前的 VC 支票是掠夺性的过早优化,并讲述自己对象棋的好奇如何引出训练 LLM 下棋、开启 Replit 的 autoresearch 方向与「自动驾驶公司」愿景。
推理芯片之战:聊聊 Groq、Cerebras 与 OpenAI 三大路径与 Bill Dally 的设计哲学
182: 对话梁琛奇:抖音、猫箱、创业,「他们都搞生产力,我想用 AI 创造开心」
前字节产品负责人、动念引线创始人梁琛奇复盘抖音社交与猫箱的产品经验,提出娱乐比工具更慢受推理成本、模态与用户习惯三重前置条件制约,并押注 AI 时代的「涌现式创作」与新娱乐体验。
电信开源 TeleOCR:1.2B 参数文档解析模型,登顶 OmniDocBench v1.6 榜单
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,该模型在 OmniDocBench v1.6 榜单登顶并夺得 ICDAR-2026 科学图解析挑战赛冠军,实现了数字与拍摄文档的统一结构化解析。
从 VLM/VLA 到具身智能体 — Armen Aghajanyan,Perceptron AI
Perceptron AI 联合创始人 Armen Aghajanyan 主张放弃 VLM、VLA 与世界模型之间的分野,转向统一的具身基础模型:用 data-sparse MoE 路由解决视频监督稀疏与上下文膨胀,并以可用 10 倍廉价视频预训练数据替换遥操作数据的新 scaling law 作为最大研究突破。
为 AI 智能体构建文档上下文层 — Jerry Liu,LlamaIndex
Jerry Liu 回顾 RAG 从朴素流水线演进为智能体框架加上下文层的历程,剖析 PDF 与 Office 文档难以机器解析的技术根源,并介绍 LlamaIndex 的混合解析方案、ParseBench 企业文档基准与面向智能体循环的高速开源解析器 LightParse。
使用 LFM2.5-VL-DSpark 加速视觉语言模型
Liquid AI 发布了 LFM2.5-VL-DSpark,这是一个为 LFM2.5-VL-3B 视觉语言模型设计的实验性草稿模型,利用投机采样技术在极低内存开销下实现了高达 3.13 倍的解码速度提升。
Meta 复盘 Muse:Agent 怎么才能像「一个人」长期存在?
本文深度复盘了 Meta 的 Personal Agent 产品 Muse,探讨其在长对话交互、主动能力边界、安全架构(Sentinel 机制)以及个人超级智能的「分寸感」训练方面的设计决策。
把项目整包外包给 AI 蜂群:WorkSwarm Code 空间与集群模式实测
通过实测验证 openJiuwen 的 WorkSwarm Code 集群模式,展示了 AI Agent 团队如何从单句需求出发,自主完成技术选型、分工协作并交付可运行的完整项目成品。
如何使用 NVIDIA Warp 和 MjWarp 加速机器人仿真与学习工作流
NVIDIA 的指南展示了如何将 MuJoCo SO-101 抓取放置场景迁移到 MJWarp,从单个 CPU 世界扩展到 2,048 个并行 GPU 环境,同时保持仿真一致性。
5 分钟完成机器人纳管、10 秒启动跨集群任务,清华大学联合无问芯穹开源具身智能云原生平台 RLark
清华大学联合无问芯穹开源具身智能云原生平台 RLark,通过自研运行时和跨集群网络技术,实现机器人设备的统一纳管与跨地域任务的高效协同。