EP138 · Qwen3.8-Max、推理工程、办公智能体 · 08-04 早报
本期导语
一个模型能否持续完成复杂工作,既取决于能力,也取决于推理系统和它进入组织后的产品路径。本期从 Qwen3.8-Max 的长程任务案例出发,拆解 Baseten 的生产推理取舍,再对照腾讯、阿里、字节围绕办公智能体的组织重排;后者的内部信息以晚点报道为边界。
本期内容
50 条Qwen3.8-Max:编程与办公,全面跃升
Qwen3.8-Max 把能力重点放在长程自主工作:官方给出从编程、科研复现到办公任务的完整案例,并说明训练环境、奖励与数据均衡怎样共同扩展。读者可据此区分模型发布中的规格升级、实测轨迹与仍待第三方验证的效果声明。
推理工程大师课:Baseten 如何把模型高效送上生产环境
Baseten 的 Philip Kiely 与 Ali Taha 从一个超长请求进入系统讲起,逐层拆开缓存感知路由、预填充与解码分离、推测解码、量化和并行策略。它把推理成本、延迟与可靠性还原成可操作的系统取舍,也提醒读者优化收益依赖流量和模型。
腾讯、阿里、字节的 AI 办公大战:赛马与变阵内幕
晚点通过腾讯 WorkBuddy、阿里千问办公与字节豆包、飞书的组织调整,呈现大厂如何把竞争重心转向办公智能体。文章的价值在于产品、销售和组织线索的交叉,但内部数据与变动主要来自匿名采访,相关结论应保留来源边界。
OpenAI 推出 GPT-Live:重构语音栈实现持续交互
OpenAI 推出 GPT-Live,采用全新架构,使模型能够在不被打断的情况下同时听和说。
开放通用智能,MiniMax H3 正式开源
本文宣布 MiniMax H3 全新通用视频生成模型开源,详细介绍模型架构、多模态输入支持、H3-Context-IR 预处理系统、H3-Base 与 H3-Regenerate-2K 模块的技术细节,并提供部署指南与使用案例。
你的智能体需要计算机,而不是容器——介绍 @cloudflare/computer
本文介绍了 @cloudflare/computer,一种通过专用计算资源而非容器部署 AI 智能体的新方法,强调性能、可扩展性和开发者体验。
Orchard: 可扩展智能体 AI 的开源框架
微软推出 Orchard ,这是一个开源的 Kubernetes 原生框架,其可重用的环境服务和三个智能体训练配方使得小型开放权重模型能够在软件工程、网页导航和个人助理任务中接近前沿性能。
腾讯把 Agent 记忆系统开源了,TencentDB Agent Memory 实测!
本文对腾讯开源的 TencentDB Agent Memory 进行了全链路实测与源码级机制拆解,覆盖时效性、提炼质量、检索命中、更新演化四层测试,并深度解析其四层记忆金字塔、三路检索注入、冲突仲裁与降级容错设计。
SQLite 严重 CVE,还是 LLM 垃圾内容? | JFrog
这篇文章揭露了一批由 LLM 生成的 SQLite CVE:它们引用不存在的代码、无法触发漏洞利用,且后来被降级,暴露出自动化 CVE 摄入流程的系统性缺陷。
对话昉擎科技梁军:AI 芯片创业不应该想成为下一个英伟达
晚点对话前华为麒麟架构师、寒武纪前 CTO 梁军,深度解析其新创公司昉擎科技的分离式架构与 4D Memory 技术路线,以及他对国产 AI 芯片竞争格局、英伟达 LPX 方向和智能本质的非常规判断。