EP170 · Images 2.5、Grok Bot、Claude 智能体 · 09-09 早报
本期导语
ChatGPT Images 2.5 升级,Grok Bot、Claude Managed Agents 给出取舍坐标。
本期内容
20 条OpenAI 推出新一代图像模型 ChatGPT Images 2.5
OpenAI 称,ChatGPT 与 API 每周生成超过 30 亿张图片。Images 2.5 提升参考图保真、局部编辑和多轮一致性,延迟最多降低 50%;新增 Sketch,API 推出 Flare 与 Sunburst,为创作者和开发者提供速度与精细度不同的选择。这次更新同时覆盖消费端创作流程与开发者接入路径,也让速度和可控性成为模型选型的直接依据。
Roman Ugarte:一个月打造 Grok Bot,如何让智能体成为可信赖的知识工作同事
Grok Bot 产品负责人 Roman Ugarte 复盘小团队约一个月做出内部可用原型:先从知识工作任务出发,持续削减功能,把产品设计成可委托工作的同事,而非通用聊天框。可信任来自真实系统上下文、清晰权限、可介入的进度与短反馈闭环;判断智能体价值,应看用户能否反复交付完整任务。
创始人如何基于 Claude Managed Agents 构建产品
三家团队把 Claude Managed Agents 用于会议准备、销售情报与产品分析:用结果 rubric 和独立上下文核验输出,以账户、用户和组织级记忆支撑跨账户工作,并用沙箱约束代码与外部动作。案例给出的取舍很清楚:基础设施若不决定产品质量可先托管,把精力留给用户价值、评估闭环与成本归因。
OpenAI 公布 Navier–Stokes 千年难题研究进展
OpenAI 宣布,其内部多智能体系统已提供解析证明和 Lean 形式化,解决了 Navier–Stokes 存在性与光滑性千年难题。
利用 Claude 平台降低成本并提升性能 | Claude by Anthropic
本文介绍了三个实用修复方案——最大化提示词缓存命中率、消除升级模型时的反模式以及校准努力程度——在不牺牲性能的前提下降低 Claude 平台成本,并引入了 Claude Code 工具(如 prompt-audit、cost-optimize 和 hillclimb)来自动化这些改进。
AlphaGenome Atlas:90 亿个人类 DNA 变异的分子预测
Google DeepMind 推出了 AlphaGenome Atlas,一个免费平台,包含对人类基因组中所有 90 亿个可能的单核苷酸变异的分子预测,以及一个 AVI 分数,帮助研究人员优先考虑具有影响力的遗传变化。
天猫技术大型 AI 项目的研发协同实践
天猫技术团队以新品 MDI 项目为例,分享大型 AI 项目研发协同从超级个体到全员赋能的四阶段实践,涵盖结构化知识库、站点地图分工、上下文缝补、技术哨兵机及 NekoCollar 平台等关键方法。
面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力
面壁智能联合 OpenBMB 开源 MiniCPM5-2B,以 2B 参数在 AA 榜单全球 4B 以下开源基座模型中综合排名第一,并同步开源数据、训练框架与强化学习策略,初步具备端侧通用 Agent 能力。
字节跳动质量保障团队|让 QA 真正用起来:测试用例生成 Agent 落地,我们做对了什么
字节跳动质量保障团队分享了 NL2Test Agent 的落地经验,强调通过场景选择、工程设计和容错机制,让测试用例生成工具真正被 QA 使用。
Milvus HNSW 量化索引选型指南:从 SQ、PQ、PRQ 到 Refine 实测
本文基于 Cohere 1M 数据集实测对比 Milvus 中 HNSW、HNSW_SQ、HNSW_PQ 和 HNSW_PRQ 四种索引,给出 SQ8 作为均衡起点、refinement 恢复召回率等选型建议。