EP143 · Harness 插件、Sol 超速、多智能体风险 · 08-14 早报
本期导语
把 Agent 能力做成可替换插件之后,开发者仍要面对速度、评测和协作风险。本期先看 DeepSeek Harness 如何拆分模型、工具与运行轨迹,再把 GPT-5.6 Sol 的低延迟推理和 Anthropic 的多智能体实验放在一起观察:前者扩大实时任务空间,后者提醒规模化协作不会自然变得可靠。Gemini 3.7 Flash、论文复现与 Agent 评测闭环,则补上模型更新和工程实践的观察面。
本期内容
50 条DeepSeek Harness 开发者预览版:一切皆插件
DeepSeek Harness v0.1 以 MIT 协议开源,模型、工具、技能、会话、沙箱等能力均由 Cordis 插件组合,轨迹写入仅追加日志。这让开发者能看清各类能力如何独立替换,也提醒他们早期接口仍会快速变化。VentureBeat 同日提到的 V4-Pro 上线与 API 涨价属于模型和商业背景,不等同于 Harness 能力。
使用 OpenAI 加速 GPT-5.6 Sol 超速模式
Cerebras 与 OpenAI 向有限客户开放 GPT-5.6 Sol Ultrafast,宣称每秒输出 750 个 token 且不牺牲质量。文章解释晶圆级引擎如何以片上 SRAM 缓解数据搬运瓶颈,并用 HLE 对比高难任务耗时,为判断低延迟能否改变事故排查、安全响应等实时场景和 Agent 工作流提供依据。
多智能体系统的模式与问题
Anthropic Frontier Red Team 把多智能体风险拆成可观察实验:智能体会因相同上下文趋同、在共享代码中冲突,也会轻信不可靠同伴或围绕矛盾目标升级对抗。研究的启发是,单体模型变强并不会自动带来良好协作;设计者还需建立声誉、仲裁与人工介入等面向 Agent 的社会机制。
Google 正式发布 Gemini 3.7 Flash:面向编码与智能体的高效模型
Google DeepMind 发布了 Flash 模型系列的最新迭代版本 Gemini 3.7 Flash,在编程、智能体工作流、 Web 开发和知识工作方面实现了显著的性能提升,且每 token 价格仅为之前的 3.6 Flash 模型的一半。
Agent 越改越乱之后,我用评测和轨迹把它拉回来了
作者把 Agent skill 迭代变成一套可重复的自进化流程,用评测结果与操作轨迹生成 patch,经四层 gate 验证与黑名单回滚,把安全审计 Agent 准确率从 77.8% 稳定提升到 88.9%。
我们从复现 2,226 篇 ICML 论文中学到的经验
本文详细介绍了一场社区黑客松,利用 AI 代理复现了 2,226 篇 ICML 2026 论文,发现 51% 的论文至少有一条独立验证的主张,而 23% 的论文包含伪造的主张,并主张人类监督仍是有效论文评审的关键。
Claude Tag 更新:现在更能理解对话氛围与现场语境
Anthropic 升级了 Claude Tag,使其在决定是否主动响应时能够利用完整频道上下文,并声称响应决策能力提升约 30%,且新增的上下文用量不收费。
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书 dots 团队开源了 20 亿参数的连续自回归语音合成模型 dots.tts,通过跳过离散 Token 直接在连续隐空间生成,实现了高保真、低延迟及强大的编辑能力。
6 支快手工程团队,让 AI 落地真实业务
本文分享快手6支工程团队将AI落地真实业务的实践路径,涵盖产研协作、电商经营、业务现场、反作弊、全栈交付与生产质量管控等场景,解决AI个人提效难以转化为组织效率的共性痛点。
为什么托管智能体是智能体构建领域的下一个重大趋势
本文认为,托管智能体——在托管基础设施上运行并采用 AGENTS.md 和 MCP 等标准的智能体框架——将解锁下一波可用于生产的 AI 智能体开发。