EP133 · 创业新杠杆、GPT‑5.6 效率、Skill Harness · 07-30 早报
本期导语
当 coding agent 能把过去数月的实现压缩到很短的周期,创业者真正要重新选择的是问题规模。本期从 Sam Altman 的逆共识判断出发,继续拆解 GPT‑5.6 在推理与 harness 上的效率增量,再落到 Skill 如何成为智能体产品的功能与治理单元,给出一条从机会判断到工程落地的阅读路径。
本期内容
48 条Sam Altman:为什么现在可能是创办公司的最佳时机
在 YC Startup School 2026 的完整访谈中,Sam Altman 把 AI 带来的创业机会落到三个条件:技术版图快速变化、成本下降、迭代周期缩短。更值得参考的是他的判断方法:寻找刚出现而多数人尚未更新认知的能力,用持续数据建立逆共识,再把智能体节省的时间投入更大、更难的问题。
GPT-5.6 如何将前沿智能与前沿效率融合
OpenAI 将 GPT‑5.6 的效率拆到模型训练、推理栈与 agentic harness 三层:生产内核优化让端到端服务成本下降 20%,改进的推测解码让 token 生成效率提升超过 15%。文章还解释了路由、缓存、上下文控制与避免重复工作的复利效应,适合用来理解智能与成本如何共同推进。
技能即新功能:构建以技能为中心的智能体 Harness
这场完整演讲把智能体产品中的 prompt、tool 与 skill 分别定义为谁、能连接什么、如何完成任务,并给出最小 harness:skill registry、system prompt 与文件读取。讲者进一步指出,模型升级必须重跑 eval;技能超过十个后要引入检索,达到数百个时则需要层级、元数据、所有权与生命周期治理。
相关性 ≠ 因果性:因果推断在 AI 评测归因中的方法与实践
本文深入探讨了如何利用因果推断与博弈论方法,通过组件级归因、扰动实验及因果 A/B 测试,精准定位复杂 AI Agent 系统(如 LLM、工具调用、规划能力等)的性能瓶颈。
生产环境中 MCP 的安全防护:超越网关的纵深防御
本文认为,生产环境中的 MCP 安全需要四个独立的控制层——安全执行、管理平面隔离、出站信任边界和语义完整性——而不是依赖单一的网关。
Morgan Stanley Alpha Lab:从自动化量化研究到自我改进的研究环境
Morgan Stanley 的 Alpha Lab 展示了一套智能体量化研究工具链,如何通过严格的环境、评测与研究流程量规,从自主实验走向自我改进。
当所有人都在给 AI 造缰绳,马厩正在消失
本文深入探讨了 AI 时代下「执行」能力的贬值与「承担」责任的稀缺,指出技术颠覆往往发生在被优化的维度之外,呼吁从业者在追求工程效率的同时,警惕被降维打击的风险,并寻找人机协作中不可替代的价值。
微软面向 AKS 上 AI 智能体的三层 LLM 路由架构
微软在 AKS 上推出三层参考架构,通过语义路由、策略管理与 GPU 感知的负载均衡,优化 AI 智能体流量调度。
使用工具变量进行产品实验:在 Python 中消除 LLM 路由决策的混杂效应
本教程展示了如何使用工具变量(速率限制回退)和两阶段最小二乘法在 Python 中恢复无偏的因果估计,评估高级 LLM 路由对任务完成率的影响,纠正标准 OLS 产生的混杂偏误。
SimilarWeb 如何使用 LangSmith 评估智能体报告
本文介绍了 SimilarWeb 如何使用 LangSmith 评估长篇幅的智能体研究报告,重点阐述了基于评分标准的 LLM 评判、忠实性检查,以及校准评估标准的关键重要性。