EP145 · OpenClaw 实战、人本 AI、多模型网关 · 08-11 早报
本期导语
把智能体放进真实世界,难点很快从模型能力转向权限、验证与维护。OpenClaw 的爆红复盘提供一线工程经验;李飞飞提醒我们用能动性与尊严衡量 AI 的价值;OpenRouter 则把多模型选择落到质量、成本和数据边界的动态权衡。三篇适合分别从系统实践、人本尺度和技术采购读起。
本期内容
47 条Peter Steinberger 谈当数百万人让智能体自由运行后会发生什么
OpenClaw 爆红后,Peter Steinberger 面对的已不只是模型能力,而是开放项目在安全、依赖、配置和维护上的连锁压力。他坦率复盘从一小时原型到大规模协作的代价,并给出务实判断:真正可靠的智能体,需要循环执行、验证结果、明确权限,也需要团队敢于对功能扩张说不。
从计算机视觉到以人为本的 AI:如何用 AI 增进智能、丰富人类生活
从 ImageNet 到空间智能,李飞飞把技术史与人的处境放在同一条线上:AI 的跃迁离不开大规模数据,但人类的记忆、动机与情感并未被互联网完整捕捉。她由此主张,教育、医疗与创作中的 AI 应扩展人的能动性与尊严;稀缺手术数据的例子也说明,协作常比贸然替代更可靠。
OpenRouter、开放模型与 LLM 网关市场:多模型选择为何成为战略能力
OpenRouter 联合创始人 Alex Atallah 从真实路由数据出发,解释为何多模型并非选项堆叠:模型、推理服务商和价格持续变化,企业需要在质量、成本、可用性与数据边界之间动态切换。他还拆解了开放模型最适合的分工——让低成本模型承担可验证任务,把未知问题留给更强的编排模型。
随着网络防御窗口收窄,扩大 Daybreak 项目
OpenAI 推出 GPT-5.6-Cyber 以及扩展后的 Daybreak 项目,为可信安全防御者提供先进、低拒绝率的 AI 能力,用于漏洞研究和网络防御。
让知识蒸馏成本足够低,可实现规模化运行
高效知识蒸馏通过缓存 top-K logits 并使用分块 KL 损失降低显存占用,从而在普通硬件上实现 LLM 压缩。
Claude 研究版在里曼 ζ 函数上取得进展
一个未发布的 Claude 研究版将里曼 ζ 函数满足里曼猜想的零点比例的下界从 41.6% 提升至 67.2%。
我用 DeepSeek 网页版拿下 KDD Cup 冠军!
Kaggle 全球第一选手复盘其使用 DeepSeek 网页版独立承担代码实现,最终夺得 KDD Cup 2026 工业赛道冠军的实战经验与 QueryFormer 方案。
Agent 评测漫谈 —— 由浅入深讲解 Agent 评测
本文由美团图灵评测团队基于两年业务实践,系统讲解 Agent 评测的定义、核心方法论与演进趋势,提出观测驱动、人人一致人机一致、数据飞轮等关键实践认知。
如何对抗标题党:Meta、LinkedIn 与 YouTube 案例研究
本文分析了 Meta、LinkedIn 与 YouTube 如何从基于参与度的检索系统转向基于语义的检索系统,以对抗标题党并提升内容相关性。
构建 AI 原生财务部门教会我的事
OpenAI 首席财务官 Sarah Friar 分享了构建 AI 原生财务部门的五个实用经验,涵盖 AI 访问、工作流重新设计、构建者文化、问责制和 ROI 衡量。