AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP110 · 混元 Hy3、Claude J-space、AI 自我验证 · 07-07 早报

模型能力正在往两个方向落地:一边是 Hy3 这类模型进入办公、开发和游戏场景,一边是 Anthropic 继续拆 Claude 的内部工作区。硅谷101关于 AI 自我验证的讨论,则把自动化从口号拉回到验证、品味和防跑偏这些更具体的问题上。

31

腾讯混元 Hy3 发布:Agent 能力和产品体验跃升

腾讯混元 Hy3 从 preview 走到正式版,重点不是榜单宣传,而是 Agent 与真实生产力任务的稳定性:270 位专家盲测、幻觉率下降、多轮承接改善,以及 Apache 2.0 开源和更低 API 价格,给国产模型落地一个可核查样本,也适合观察模型如何进入办公、开发和游戏场景。

文章腾讯混元作者:腾讯混元
查看原文 腾讯混元 Hy3 发布:Agent 能力和产品体验跃升(在新窗口打开)

Claude 心智中心的 J-space:Anthropic 如何观察隐藏推理与安全信号

Anthropic 用 Jacobian 找到 Claude 可被语言描述的内部活动集合 J-space:它像工作区,暴露未说出口的中间步骤与联想。关掉它后模型仍能流畅回答简单问题,却会在需推理匹配语言的任务上失效;监控它也可能帮助发现隐藏操纵和假数据等安全信号。

视频Anthropic作者:Anthropic
查看原文 What’s at the center of Claude’s mind?(在新窗口打开)

E242|最快半年 AI 跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地

硅谷101这期把 AI 自我进化从概念拉回工程问题:嘉宾认为最快半年可跑通一次闭环,但持续递归提升的关键是自我验证,避免递归漂移。Apodex 的发现模型、多个子 Agent 互验、科学品味训练,都是理解下一阶段模型竞争的好入口。

播客硅谷101作者:硅谷101
查看原文 E242|最快半年 AI 跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地(在新窗口打开)

自动训练研究框架:让智能体接手大模型优化

本文介绍一套 Agent 驱动的 LLM 微调自动化框架 AutoResearch-LLM,通过三阶段流水线(场景诊断→方案设计→自动化实验)将调参经验沉淀为 SKILL.md,并在 1688 电商任务上落地验证,提供了从理论到工程的可复用方法论。

文章阿里云开发者作者:阿里云开发者
查看原文 AutoResearch-LLM:让 Agent 接手 LLM 训练优化(在新窗口打开)

Builders Unscripted:Derya Unutmaz 谈 Codex、生物学与个性化医疗的数字孪生

Derya Unutmaz 解释了 Codex 和前沿推理模型如何让生物医学研究者快速原型化流式细胞术工具、免疫模拟器、CRISPR 设计应用,并通向个性化医疗中的数字孪生愿景。

视频OpenAI作者:OpenAI
查看原文 Builders Unscripted: Ep. 5 - Derya Unutmaz(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期