EP110 · 混元 Hy3、Claude J-space、AI 自我验证 · 07-07 早报
本期导语
模型能力正在往两个方向落地:一边是 Hy3 这类模型进入办公、开发和游戏场景,一边是 Anthropic 继续拆 Claude 的内部工作区。硅谷101关于 AI 自我验证的讨论,则把自动化从口号拉回到验证、品味和防跑偏这些更具体的问题上。
本期内容
31 条腾讯混元 Hy3 发布:Agent 能力和产品体验跃升
腾讯混元 Hy3 从 preview 走到正式版,重点不是榜单宣传,而是 Agent 与真实生产力任务的稳定性:270 位专家盲测、幻觉率下降、多轮承接改善,以及 Apache 2.0 开源和更低 API 价格,给国产模型落地一个可核查样本,也适合观察模型如何进入办公、开发和游戏场景。
Claude 心智中心的 J-space:Anthropic 如何观察隐藏推理与安全信号
Anthropic 用 Jacobian 找到 Claude 可被语言描述的内部活动集合 J-space:它像工作区,暴露未说出口的中间步骤与联想。关掉它后模型仍能流畅回答简单问题,却会在需推理匹配语言的任务上失效;监控它也可能帮助发现隐藏操纵和假数据等安全信号。
E242|最快半年 AI 跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地
硅谷101这期把 AI 自我进化从概念拉回工程问题:嘉宾认为最快半年可跑通一次闭环,但持续递归提升的关键是自我验证,避免递归漂移。Apodex 的发现模型、多个子 Agent 互验、科学品味训练,都是理解下一阶段模型竞争的好入口。
您的 Worker 现在可以拥有前置缓存
Cloudflare 推出了 Workers Cache,这是一个分层缓存,位于 Worker 入口点之前,使服务器渲染的应用程序能够在命中时提供缓存的响应而无需调用 Worker,从而降低延迟和 CPU 成本。
自动训练研究框架:让智能体接手大模型优化
本文介绍一套 Agent 驱动的 LLM 微调自动化框架 AutoResearch-LLM,通过三阶段流水线(场景诊断→方案设计→自动化实验)将调参经验沉淀为 SKILL.md,并在 1688 电商任务上落地验证,提供了从理论到工程的可复用方法论。
为什么 Agent 时代,大家都在做 CLI?
本文深入分析 AI Agent 时代 CLI 复兴的结构性原因,阐释其与 MCP、SKILL 的分层关系,并提出 AI 友好的产品设计原则。
AI 写代码越来越快,质量谁来守?网盘主端 FE 的 AICR 准入实践
百度网盘主端FE团队分享了如何在CI/CD流水线中嵌入多Agent AI代码审查准入系统,以应对AI生成代码占比超55%后的质量保障挑战,并给出模型选型、误报治理与耗时控制的实战经验。
Builders Unscripted:Derya Unutmaz 谈 Codex、生物学与个性化医疗的数字孪生
Derya Unutmaz 解释了 Codex 和前沿推理模型如何让生物医学研究者快速原型化流式细胞术工具、免疫模拟器、CRISPR 设计应用,并通向个性化医疗中的数字孪生愿景。
戛纳金狮首届 AI Craft 落定:可灵给出全球顶级商业广告交付答卷
本文报道可灵AI在戛纳国际创意节拿下首届AI Craft奖项,通过获奖案例与商业化数据,论证AI视频生成已跨越从工具到工艺的临界点。
AI 季报 26Q2:从 coding 到 RSI,强者愈强的未来?
文章通过访谈MoE Capital合伙人,深度复盘2026年Q2 AI行业关键进展,聚焦前沿智能推进(OpenAI/Anthropic竞争、RSI、物理AI)与智能扩散趋势(企业模型选择、交互创新)。