AI 精选周刊公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 精选周刊
Ginolujiaxian

BestBlogs.dev 第 112 期:可托付的智能

大家好!欢迎阅读 BestBlogs.dev 第 112 期 AI 精选文章推荐。

当模型会写代码、调用工具、操作电脑,也能连续工作数小时之后,我们面对的已经不只是能力问题,而是一个更难的问题:你愿意把什么交给它?一次令人惊艳的回答可以证明模型聪明,真正的托付却要求它理解目标、穿过真实系统、交付可以核验的结果,并在不确定时知道停下来。

本周 20 篇内容恰好构成了一张从能力到托付的路线图。DeepSeek 与 MiniCPM 继续提高单位成本下的智能供给,OpenAI 和 Anthropic 把 Agent 运行框架、沙箱、记忆与多智能体编排做成基础设施,Shopify、蚂蚁数科、阿里和天猫则把这些能力放进真实工程与组织。另一组文章把视角拉得更远:如果 AI 是我们尚未充分理解的异类心智,如果每个任务都带来真实成本,如果最终目标和后果仍由人承担,那么信任就不能来自拟人感或品牌承诺,只能来自一次次可见、可验证、可撤回的交付。

这就是本期主题「可托付的智能」。所谓可托付,不是让 Agent 永不犯错,而是让结果能够独立检查,让权限与风险相匹配,让失败可以被发现和恢复,让成本与任务价值相称。能力决定系统能走多远,这些机制决定我们敢让它走多远。

以下是本周最值得关注的 10 个精彩亮点:

🧠 智能供给正在变得更密、更便宜。 DeepSeek V4.1 Flash 以 552B MoE 架构运行,输入仅激活 8B、输出激活 16B,官方称 HBM 与 SSD 的 KV Cache 需求分别降至上一代的 1/4 和 1/8。MiniCPM5-2B 则把工具调用、深度搜索和代码生成推进到 2B 端侧模型。更便宜的智能扩大了可委托任务的范围,也让任务选择和模型路由变得更重要。

🎨 创作模型开始把控制权还给使用者。 每周已有超过 30 亿张图片通过 ChatGPT Images 与 GPT-Image API 生成,Images 2.5 官方称延迟最高降低 50%,并加入 Sketch、图片评论与多轮精修。真正适合创作流程的能力,不只是一次生成更漂亮,而是主体能否保持、意见能否准确落到局部、修改能否连续推进。可托付首先意味着结果可控。

🛡️ 越像同事的系统,越不能假装我们已经理解它。 OpenAI 首席科学家 Jakub Pachocki 把推理模型描述为被「培育」而非被完整设计出来的异类心智,并提醒思维链监控可能随能力提升而变得不可靠。他对递归自我改进的判断仍是前沿实验室的一家之言,却指出了重要边界:能力增长不能自动兑换成信任,扩展速度必须受安全证据约束。

🧩 Agent 的产品边界正在下沉为运行时。 OpenAI 的 Agents API 进入 public beta,把模型、工具、环境、上下文压缩与子智能体编排放进一次 API 调用;腾讯技术工程则解释 Harness 如何从上下文、行动循环、记忆一路长出会话恢复、沙箱和权限。模型负责推理,运行时负责让推理在真实世界里持续、受控、可恢复。

托付不是一次授权,而是逐步赢得的。 Claude Managed Agents 的实践先把期望结果写成 rubric,再用独立上下文核验正确性与来源,不确定时宁可不展示。Grok Bot 团队同样从小而可检查的任务建立信任,让用户看见进展并在合适时刻介入。一个像同事的 Agent,不该要求用户盯住每一步,也不能把最后 10% 的返工留给用户。

💻 AI 编程的竞争正在从生成代码转向设计工作系统。 Anthropic 工程师 Thariq Shihipar 强调目标、上下文、Skill、artifact 与验证循环;Codex 负责人 Tibo Sottiaux 则从 Rust、编译期保证、代码审查和模块化架构解释高速交付的边界。工具越强,团队越需要清楚哪些工作可以放手,哪些检查必须确定,哪些长

20
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期