AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP114 · 代理长程验证、工程训练车间、产品判断力 · 07-11 早报

当编码代理能独立跑上数小时,团队该把信任放在哪里?Cognition 的答案是工程师试用与真实约束,快手则展示了用可运行仓库训练和验证长程任务的路径。另一篇访谈把视线转向产品判断与推荐透明度,适合分别从工程、训练和产品三个角度展开阅读。

42

Cognition 用真实工程验证 Claude Fable 5 的长程编程能力

Cognition 用自建 Frontier Code 与工程师日常试用判断模型,而非只看通用基准。其团队称 Claude Fable 5 能在杂乱日志中定位根因、说明未知项,并可连续工作约八小时仍推进任务。文章提供的价值不在分数,而在考察长程编码代理是否值得托付的具体标准:能否守住约束、验证结果并在不确定时停下。

文章Claude Blog作者:Claude Blog
查看原文 Working at the frontier: How Cognition trusts Claude Fable 5 to work through the night | Claude by Anthropic(在新窗口打开)

KAT-Coder-V2.5 正式发布:从“写代码”到“做工程”,Agentic 能力全面提升

快手把代码智能体的训练重点从单文件补全转向可运行的真实仓库:AutoBuilder 在隔离环境中生成配置、验证测试并迭代修复,使环境构建成功率提升至57.2%,覆盖12种语言和超过10万个仓库。再结合多框架训练、分层奖励与失败轨迹回收,文章给出了一套针对长程工程任务的训练管线及其指标。

文章快手技术
查看原文 KAT-Coder-V2.5 正式发布:从“写代码”到“做工程”,Agentic 能力全面提升(在新窗口打开)

AI 时代品味、人类真实感与判断力的崛起

Adam Mosseri 在访谈中把 AI 工具普及后的产品工作拆成两个问题:执行成本下降时,团队仍需用有争议、可被反驳的策略判断决定做什么;推荐系统则可借助 LLM 把难以解释的向量偏好转成用户可理解、可调整的兴趣概念。对产品和内容团队而言,这是一份关于人类品味、身份标识与推荐透明度的观察。

视频Lenny's Podcast作者:Lenny's Podcast
查看原文 Adam Mosseri: AI is a tailwind for authenticity(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期