EP169 · Anthropic 改造工程 / Stripe 构建 Kai / 腾讯研究院解析任务经济 · 09-08 早报
本期导语
Anthropic 改造工程、Stripe 构建 Kai、腾讯研究院解析任务经济:理解智能体的交付、治理与定价。
本期内容
20 条Anthropic 如何构建产品,以及工程工作将如何改变|Thariq Shihipar
Anthropic 工程师 Thariq 把 Claude 当作思考伙伴,团队允许投入时间试验自动化,并将知识工作转成可执行流程。他解释了模型越强,权限控制与成果呈现为何越重要,也分享用设计参考和专业判断改善输出的方法。读者能借此重新划分亲自完成、交给模型和建设系统的工作。
Stripe 如何打造企业大脑 Kai
Stripe 用 Kai 将组织上下文、数据工具和共享技能接入员工日常工作。工程经理 Sherrod 展示了以项目配置模型与权限、优先检索可信指标层的做法,并说明如何把一次有效对话沉淀成可复用技能。这套实践让企业智能体的建设重点落在数据基础、治理和持续迭代。
从流量逻辑到任务逻辑,AI Agent 正在终结互联网的免费午餐
腾讯研究院从成本结构解释 Agent 商业模式为何转向任务交付:推理、工具调用与校验持续消耗资源,单价下降也可能被更复杂的任务抵消。文章进一步讨论广告触点缩短、软件按价值收费与平台分工,帮助读者把增长判断落到单次任务成本、付费意愿和可保留的利润。
自我改进的 Harness、个人本地 AI 与 YC 的工作智能体
YC Harness Club 认为,智能体的表现越来越取决于能够协调工具、记忆、子智能体、权限与执行经验学习的自我改进 Harness。
长期记忆与实时语音交互正式接通!颜水成团队发布无延迟“流式双脑”记忆框架
南洋理工大学、新加坡国立大学等团队联合提出VoiceMem流式双脑记忆框架,通过信息左脑与情感右脑并行检索、流式预检索机制,解决实时语音Agent长期记忆的延迟难题,实现近零额外延迟且准确率显著优于现有基线。
为何大多数多智能体系统即使评估通过仍会失败
本文解释了为何多智能体系统即使在输出层评估通过时仍会静默失败,并提出一种中间状态评估架构,使用轻量本地看门狗模型在每次智能体间交接前对其合理性进行打分。
Tom Krcha 演示 GPT-6 Astra 如何扩展设计原型
Tom Krcha 展示 GPT-6 Astra 如何把设计方向转化为可调整的原型:从参数化标志、活动网站到基于 Shader 的照片滤镜实验室,帮助设计师探索方案并传达可交付的体验愿景。
我为什么停掉了投入半年的 AI 社交产品
作者以个人借助AI开发AI社交小程序为例,经过半年试错,发现纯线上社交的核心难题是双向意愿而非效率,最终因商业模式难以成立而暂停项目,并指出AI降低了验证成本但未降低商业难度。
Fusion Check:无需数据,预测微调模型合并后的行为保真度
融合检查是一个零数据法则,可在合并前预测两个微调 LLM 是否兼容,已在 13 对上验证,LOOCV 相关性为 0.81,并以 MIT 许可开源。
机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型
据发布方,芝诺机器人发布的 Zeno-1 是全球首个专为去中心化多机器人协作设计的具身智能基础模型,通过四阶段训练让多台机器人无需中央控制即可自主协作完成长程任务。