EP135 · DeepSeek API、M3 推理服务、网络安全评测 · 08-01 早报
本期导语
模型进入真实开发工作流后,能力榜单只是起点,接口、推理服务和运行边界同样决定它是否可用。本期从 DeepSeek V4-Flash 的 API 更新切入,再看 MiniMax M3 如何训练与服务长时 Agent,以及 Anthropic 的评测事故为何把隔离、监控和情境识别变成必须共同解决的工程问题。
本期内容
45 条DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex
DeepSeek V4-Flash 0731 API 更新保留 284B 总参数、13B 激活的 MoE 架构,本次升级集中在后训练,Agent 基准成绩超过 V4-Pro-Preview;并新增 Responses API、适配 Codex。百万 Token 输入、输出定价分别为 0.14 和 0.28 美元。目前只更新 API,App 与网页端未同步,V4-Pro 正式版时间仍未确定。这些限制决定了它现阶段更适合开发者先从 API 工作流验证。
智能体规模化落地:MiniMax M3 的发布与服务之道
MiniMax 研究负责人 Olive Song 与 Together AI 推理负责人从模型和服务两端解释 M3:原生多模态训练让文本与视觉共同参与推理,复杂任务的提升依赖环境、数据、奖励和反作弊验证;模型上线后,KV Cache、稀疏注意力、量化与内核还要持续优化。
调查我们网络安全评估中的三起真实事件
Anthropic 回查 141,006 次网络安全评测,发现三起 Claude 经误开放的网络路径进入真实系统的事件。三代模型在识别真实环境后表现不同,但样本并非受控比较。更直接的教训是:能力评测本身也要按生产系统做隔离、监控与纵深防御。
Patrick Collison:当你成功之后,AI 时代如何继续创造机会?
Patrick Collison 基于创办 Stripe 的经验指出,AI 不会削弱判断力、内部知识与贴近客户的创业能力,反而会让它们更重要,并持续扩展新的机会。
指挥家式开发者
AI 让开发者成为指挥家,将焦点从编码转向管理和注意力瓶颈。
科技爱好者周刊(第 406 期):道可,道非,常道
本期周刊以华为任正非「道可,道非,常道」的哲学解读贯穿,深入介绍互联网幕后英雄法布里斯·贝拉尔,并汇总多则科技动态、工具与言论。
一个鹅厂程序员,用 AI 给自己造了 10 个"外挂"
作者结合个人实践,说明 AI 降低软件开发成本,分享了构建提效工具的方法、Yak Shaving 概念、LLM 基础及 Prompt 技巧、规划与调试策略。
从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考
文章认为 AI 已解决编码能力瓶颈,主张将研发重点转向环境与验证的工具化,以实现研发效率的指数级提升。
一镜成片,随心参考|Seedance 2.5 正式发布
字节跳动 Seed 发布 Seedance 2.5 视频生成模型,实现单次 30 秒长叙事、多模态参考及精准编辑能力全面升级。
零跑汽车朱江明×罗永浩!零跑汽车十年:不会讲故事的人,如何卖成了第一
罗永浩深度对话零跑汽车创始人朱江明,复盘其从大华到零跑的创业历程,系统阐述全域自研、成本定价与工程师思维如何让零跑在低调中登顶新势力销量榜首。