EP144 · GLM-5.3 安全、循环工程、知识底座 · 08-15 早报
本期导语
同一套 Agent 工作流,只有把能力、停止条件和组织知识同时说清楚,才可能从演示走向生产。本期从 GLM-5.3 的编程与安全能力出发,继续看如何设计可验证的循环,以及存量团队怎样用知识底座重做协同;其余内容补充开放模型、浏览器自动化和评测陷阱。
本期内容
50 条GLM-5.3:前沿编程能力与涌现的网络安全能力
GLM-5.3 在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章既给出终端、软件工程和漏洞评测的分层结果,也说明完整权重将在安全加固后开放,读者可据此区分模型的防御潜力、攻击边界与厂商自测口径。
实用循环工程
Addy Osmani 把长时 Agent 工作拆成两种原语:goal 用可测量的完成条件推进有界任务,loop 按时间重复检查外部状态。更关键的经验是让独立 Agent 验证产出,并把审美、架构与安全判断留给人;这为并行代理从演示走向日常工程提供了可复用边界。
重构协同:关于 AI Native 团队的思考
大淘宝技术把 AI 提效停滞归因于协同仍由人串联,而不只是编码速度不够。作者设想以知识底座、分工 Agent 和人形成业务闭环:Agent 执行与传递,人负责目标、判断和例外。对存量团队而言,真正难点是把隐性规则外化,并让知识持续贴近代码、配置与数据等权威来源。
开放模型现状:2026 年夏季观察
Hugging Face 的半年期生态报告显示,中国实验室在顶尖开放模型发布上占据主导地位,Qwen 以 151K 个衍生模型成为社区基础模型;报告还首次单列可识别的 Agent 流量,并披露不同编程工具在其中的份额。
网页自动化的暗黑技法:让智能体像人一样使用网站
一场聚焦浏览器智能体工程实践的演讲:用 CLI 工作流和 Chrome DevTools Protocol 驱动网页,再以分级闭环让 AI 只处理感知与推理。
计算机使用智能体评测:别让可重放轨迹伪装成能力
这场研究分享指出,确定性的计算机使用基准可能奖励可重放的操作轨迹而非具备适应力的智能体,并提出通过环境变体、可验证性与更稳健的不确定性估计来修正评测。
dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步
REDtech 开源 280B 参数的多模态模型 dots3-note Preview,并提出 TEMPO 方法提升长程强化学习,同时发布 VibeSearchBench 与 VibeLifeBench 两套真实生活评测基准。
34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统
本文深度解析开源项目 DeepTutor,揭示其作为 Agent 学习操作系统的核心架构:统一 Agent Loop、RAG、Skills、外部 Agent 与三层长期记忆,实现学习任务的连续性与知识的可复用性,并详细介绍其功能模块、扩展能力与适用场景。
守护前沿:JetBrains 如何评估并部署 Claude Fable 5
JetBrains 首席技术官 Vladislav Tankov 分享公司如何评估并部署 Claude Fable 5,强调其在真实编码任务中的卓越准确性、效率和推理能力,同时考虑安全性和数据保留。
分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR?
本文深度探讨离散扩散语言模型(dLLM)的发展现状、技术特性与局限性,分析其与自回归模型(AR)的差异、并行生成的理论边界,并展望其在未来模型生态中的定位与潜在应用场景。