EP168 · OpenAI 心智、Portal 路由、a16z 业务循环 · 09-07 早报
本期导语
OpenAI 论异类心智,Spotify Portal 降耗,a16z 以业务循环重构组织,提供安全、成本与责任判断。
本期内容
20 条OpenAI 首席科学家:我们正在创造异类心智
基于 OpenAI 的内部结果,作者预期机器智能的快速进展可能延续至递归自我改进,同时承认当前实验室尚未充分解决对齐与监控。他区分目标对齐与价值对齐,并指出思维链监控正因工具交互、自我操控和非语言推理而减弱。文章的关键价值,是把继续扩展能力与建立共同安全门槛放进同一项决策。
Spotify Portal 为 Claude Code 节省约九成上下文用量
Spotify 工程师用 Portal 的 Gemini 2.5 Flash 模式,承接 Claude Code 的大文件读取与样板生成;Java 单体仓库测试中,大批量读取平均节省约 90% token。作者强调编辑、调试和架构判断不能委派。这套方法让模型路由可复用,也提醒团队权衡延迟和任务风险。
企业为何正演变为一系列循环 | Anish Acharya(a16z)
a16z 合伙人 Anish Acharya 将 AI 原生公司描述为层层嵌套的业务循环:智能体处理实验、交付与反馈,人类在循环抵达局部最优后选择下一座山。他进一步按收益上限配置模型,确定性强的窄任务重视性价比,高潜力工作可使用前沿模型。对管理者而言,这套框架把自动化讨论推进到组织重构与决策责任。
研究加速:OpenAI 内部视角
OpenAI 发布内部指标,显示截至 2026 年 8 月编程智能体已融入日常研究流程——中位数研究员每天在智能体推理上花费超 600 美元,智能体工作日出现在人类工作日的 3:1,委托任务组合转向更复杂的工作——同时坦诚讲述安全事件如何临时重塑计算资源分配与训练时间表。
TikTok SRE 技术负责人:AI Agents 说到底就是分布式系统
TikTok SRE Salman Munaf 将 AI Agent 定位为概率性分布式协调器,系统阐述为何超时是「未知」而非失败、记忆应视作可失效缓存、以及模型能力无法替代权限约束、事务补偿和可观测性等分布式系统机制。
对话 Axiom:AI 如何打破有界素数间隔纪录并重塑数学研究范式
AI for Math 公司 Axiom 通过 AI 驱动的搜索与验证,将有界素数间隔纪录推进至 212,展示了人机协作重塑数学研究的新范式。
StarVLA 仅用 16 卡训练,20% 数据超越 GR00T N1.6
StarVLA 发布 VLAct,通过保护 VLM 先验、多 Action Head 联合监督和部分统一 Action Space 的 continued pre-training 策略,用 16 卡+开源数据训练出可迁移的 VLM 底座,仅用 20% 的 GR-1 下游数据即超越 NVIDIA GR00T N1.6 全量基线,在 RoboTwin 2.0 达到 92.5% 成功率。
LLM-as-a-Verifier:无需训练的智能体反馈框架
LLM-as-a-Verifier 是一个通用细粒度评分框架,通过在 LLM 评分 token 上的 logprob 期望值来评估和选择智能体轨迹,在无需任何额外训练的情况下于编程、机器人与医疗基准测试中取得 SOTA 成绩。
从发现异常到验证结果,产品经理该把什么交给 Agent?
友盟+冯成蹊通过三个客户案例,阐述 AI Agent 如何把数据决策接入业务闭环:Agent 负责持续执行,但产品经理必须保留定义问题、判断证据、验收价值的三种判断。
OKF Agent Memory:Git 原生的智能体持久记忆层
一个高性能的 Git 原生持久化记忆层,专为 AI 智能体设计,实现了 Google OKF v0.2,可在无需外部数据库的情况下减少 80% Token 膨胀。