EP136 · H3 全模态、Astra 数学、长时程智能体 · 08-02 早报
本期导语
一款模型同时处理文本、图像、视频和声音之后,真正需要追问的是能力如何验证、成本如何承担。MiniMax H3 给出通用生成架构,Astra 把 AI 推进到可形式核查的数学问题,长时程智能体研究则揭示上下文、奖励和算力之间的现实约束。本期还从可防御数据、GPU 利用率和诈骗治理补上产品与商业视角。
本期内容
50 条MiniMax H3:打破任务和模态边界的开放模型
MiniMax H3 将文本、图像、视频和声音统一进同一套理解与生成流程,可输出原生双声道的 15 秒 2K 视频。原文进一步拆解了全模态表征、高压缩 VAE、异构训练与上下文再生成,并坦陈画面精细度和模型规模仍需提升,适合用来理解通用视频模型如何在能力、成本与开放生态之间取舍。
OpenAI Astra 模型在数学与理论计算机科学领域取得 10 项重大突破
Greg Brockman 披露,OpenAI 的 Astra 内部版本在数学与理论计算机科学的 10 个问题上给出新结果,涉及 von Neumann 代数与球堆积,并附验证证书和推演材料。值得关注的不只是约 2000 美元的成本口径,更是这些证明能否经受独立复核,以及 AI 参与理论研究时透明度应达到什么标准。
迈向长时程 AI:智能体的训练、记忆与评测难题
Ross Taylor 与 Chengxi Taylor 从 Galactica 和早期推理强化学习讲到长时程智能体的现实瓶颈:上下文压缩会放大梯度方差、稀疏奖励与信用分配问题,流水线训练又在 GPU 利用率和离策略偏差间取舍。Kelly benchmark 中前沿模型全部亏损的案例,也提醒我们不能只用短周期编程任务判断智能体的长期能力。
149. 亲历中美 neo labs 资本狂潮,和清华刘子鸣聊:AI for AI、机制可解释性和 Max Tegmark
深度对话清华助理教授刘子鸣,亲述中美 neo labs 资本狂潮的体感,并系统阐述其以「AI 物理学」为基础的、非典型 AI for AI 研究路径。
开源崛起、降价 80%,大模型真的还能赚到钱吗?
本文分析大模型 API 价格下降 80%的背后逻辑,结合摩根士丹利报告与国内创业团队的盈利模型对比,探讨开源模型与闭源模型的竞争策略,以及大模型商业化的盈利变量与未来趋势。
你真的信 WorkBuddy 有 2000 万月活?
主播庄明浩以数据控的视角,批判性地拆解了广为流传的 WorkBuddy 2000 万月活数据,并以此切入,深度分析了中国 AI Agent 市场的真实用户规模与商业化困境。
“榨”出硅的极限:怎么让 GPU 不“闲着”?
本文结合专家访谈与行业数据,系统拆解 AI Infra 的四层架构,解释 GPU 利用率低下的原因,并剖析 KV Cache 复用、连续批处理、PD 分离、投机采样等关键技术如何把算力效率榨到极限。
联合设计 AI 模型注意力机制以实现快速交互式长上下文推理
本文探讨了针对优化 AI 模型注意力机制的联合设计原则,以提升长上下文场景下的推理速度和交互性,基于群组大小、头维度和序列长度分析提出了四条实用指南。
围绕可防御数据打造 AI 公司的方法
Jun Park 说明,构建人类行为模拟系统的 AI 公司,需要依靠具有代表性的行为数据、因果实验,以及与真实世界结果持续校验,才能形成持久优势。
打击犯罪诈骗行动
OpenAI 利用 ChatGPT 破坏了一个涉及投资、恋爱、赌博和冒充的诈骗集团。