EP182 · Step 5 长任务、Bun 迁移治理、直播字幕链路
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
从 Step 5 的长任务取舍,到 Bun 的 AI 迁移治理与快手实时字幕链路,读者可据此审视模型、工程和延迟的取舍。
本期内容
20 条阶跃发布旗舰模型 Step 5 Preview:向前一步,智能效率的新一代「帕累托前沿」
阶跃星辰公布的 Step 5 Preview 采用 600B 稀疏 MoE、27B 激活参数并支持 100 万 Token 上下文,瞄准长上下文与多轮工具调用。文章以连续超过 3 小时的设备调试、GPU 内核优化和后训练实验说明任务链路;权重将于 10 月 15 日释放,适合关注开源模型与长任务成本取舍的读者。
Bun 四个月内将 53.5 万行 Zig 重写为 Rust,消除大量内存泄漏
InfoQ 梳理 Bun 团队以 AI 辅助完成 Zig 到 Rust 迁移的过程:约 50 个动态工作流、四个工作区分片和 64 个并行实例,依托超过百万条断言推进。PORTING.md 与 LIFETIMES.tsv 把映射和生命周期显式化,实施与对抗式审查分工;19 个语义回归也提醒团队,测试与审查仍需覆盖长期可维护性。
Live Captioning Engineering:业界首个直播电商 AI 实时字幕系统的端到端实践
快手电商直播技术团队把实时字幕的交付拆为语音识别、PTS 对齐、级联分发与端侧渲染:主播发声到字幕具备展示条件约 400~500 毫秒,CER 从 7.81% 降至 3.51%,支撑千万级持续并发。文章尤其解释流式修订为何需要 sentenceId、revision 和播放器时间线,对建设高并发实时 AI 系统有直接参考价值。
Jev 能成为更好的智能体评估器吗?
LangChain 对 TypeSafe AI 的「系统一」决策模型 Jev 进行了评估,发现其在智能体测试中比传统的 LLM-as-judge 评估器更快、更便宜且更一致。
YC 2026 Startup 复盘:硬件、数据的都在挣钱,应用团队开始自己训模型了
YC 合伙人基于近 12 到 18 个月批次数据复盘 AI 创业生态:硬科技占比翻倍、端到端交付产品的公司更快赚钱、给大模型卖数据与 RL 环境成为隐形大生意,掌握业务数据的应用公司开始自训专用模型,单人创始人与三四十岁资深创业者同时变多。
推理工程的新进展:Philip Kiely 解读 TurboQuant、Still 与 DFlash
Philip Kiely 介绍 Inference Engineering 的首份公开增补,比较本地与数据中心推理的优化原则,并解析 TurboQuant、Still、DFlash 及持续重训带来的新取舍与性能机会。
从 MVP 到万亿参数工作负载:CoreWeave 的推理平台纵向演进
Sitanshu Gupta 介绍了 CoreWeave 如何用统一的推理平台覆盖 serverless 与 dedicated 消费模式,并通过负载分类、KV cache 感知路由、卸载、可选的 prefill–decode 解聚,以及 NVFP4 和投机解码等手段,持续提升从 MVP 到万亿参数服务的性价比。
WebCraftBench:给 AI 生成的网页来一场「实测大考」
腾讯混元联合清华、北大提出 WebCraftBench,把软件测试方法引入 AI 网页生成评测,通过插桩、覆盖率引导探索与多维评分,在 197 组人类偏好对比中达到 85.3% 一致率。
ZCode 被曝登录后会打包上传完整 Git 历史 · AIHOT
一项逆向工程调查发现,智谱的 ZCode 桌面应用会在用户登录后悄悄打包整个工作区(包括完整的 .git 历史)并上传至阿里云 OSS,加密密钥由服务器持有,用户无法通过任何 UI 设置关闭。
#730.Matt Pocock:AI 时代软件基本功更重要
Matt Pocock 从发声教练自学转行成为 TypeScript 教育者,如今转向 AI Agent 工作流,主张 AI 吃掉了战术性编程、人类应把控战略,用软件工程经典概念(示踪弹开发、垂直切片、深度模块、通用语言)作为引导词与 Agent 沟通,并以 Grill Me、Wayfinder 等 skill 管理上下文与复杂项目。
到底什么是 Context?万字长文谈 Pi Agent context 管理
本文以 Pi Agent 为例,系统拆解了 Agent 中 Context 的构成、动态增长、预算控制与压缩重建机制,指出 Context 是 Harness 组装、随执行动态演进的信息环境,而 Compaction 本质是 Context 表示的降维与重建。
一个生产级 AI 客服,到底是怎么做出来的?
作者复盘两年 AI 客服实践,指出生产级 AI 客服需经历知识整理、意图识别、检索兜底、SOP 接管、放权、成本核算与可观测七层能力,且综合成本可能仍高于人工。
单个机柜到底能跑多少个 Agent?答案不在 GPU 身上
英特尔基于实际工作量公式,指出数据中心优化应聚焦调度有效性、资源平衡度和计算卸载效益,以提升单机柜Agent交付量,而非仅关注理论算力参数。
刚刚,阶跃 Step 5 Preview 发布!一举杀进全球开源前三
阶跃星辰发布 Step 5 Preview,以 600B 稀疏 MoE 架构在 AA 智能指数夺得全球开源前三,并通过实测编程、长程 Agent、深度研究及金融尽调四大场景,验证其高性价比与生产级长任务执行力。
谷歌终于支棱起来了?Gemini 4 Pro 疑空降 Arena 榜单,13 项跑分碾压 GPT-6 和 Fable
Gemini 4 Pro 在 Arena 盲测中以约五分之一的 Token 价格,在 13 项全能测试中全面碾压 GPT-6 Astra 和 Claude Fable 5.1,尤其在长程 Agent 任务和复杂推理方面展现出显著优势,标志着谷歌在 AI 旗舰模型竞争中重新占据领先地位。
当 Agent 会自动上传你的代码库,开源为什么更重要了
作者从 Grok Build 上传整个代码库、Claude Code 嵌入隐蔽标记等事件切入,指出 Agent 时代数据主权问题已从「输入去哪」升级为「积累归谁」,并以网易有道开源办公 Agent LobsterAI 为例,论证开源是用户保留控制权的可行路径。
谷歌 AI 首次「越狱」:自己破解密码入侵三家公司
Gemini 在夺旗演练中因环境配置失误意外访问三家真实企业系统,本文借此梳理 AI 安全的三类风险,并系统介绍 AWS 在 AI for Security 与 Security for AI 两条路径上的产品与真实案例。
《网络安全人才实战能力报告-AI 赋能篇》正式发布,当 AI 进入业务深水区安全如何跟上
报告分析了 AI 时代网络安全人才的分布、实战能力、培养和评价,指出随着 AI 应用快速落地,专职安全力量不足,人才需具备模型、接口、权限和业务复合能力,并强调 AI 提效不替代专业判断,高校应加强实训体系建设。
把「因果思维链」焊进世界模型,它凭什么登顶?
Aether AI 发布因果世界模型 CausalWM,通过引入「因果思维链 (Causal CoT)」显式建模物理运动与几何变化,在 TriWorldBench 和 PAI-Bench 等具身智能基准测试中登顶,实现了从单纯预测未来画面到理解物理演化过程的跨越。
FlashNorm:用权重折叠与 CUDA 流并行加速 RMSNorm,并修复让模型倒着说话的竞态故障
Filip Makraduli 介绍 FlashNorm 如何通过权重折叠、延迟 RMSNorm 除法和取消冗余预归一化降低 Transformer 推理开销,并复盘 CUDA 流竞态如何让模型生成结果落后一拍、最终被修复。