EP185 · GPT-6 缓存、Gemini 语音、Grok 4.7
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
GPT-6 缓存降重复成本,Gemini 3.8 TTS 设计声音,Grok 4.7 强化长任务:看清各自适用场景。
本期内容
20 条GPT-6 的改进提示缓存
OpenAI 针对持续运行的 GPT-6 Agent 改进提示缓存:共享前缀在 30 分钟窗口内可复用,缓存输入最高享 90% 折扣。新仪表盘与诊断工具能定位工具定义或输入变化造成的未命中,显式断点让开发者选择稳定上下文。做多轮任务的团队可据此检查延迟和成本,而非只看模型单次调用价格。
Google 发布 Gemini 3.8 文本转语音模型
Google DeepMind 新发布 Gemini 3.8 Flash 与 Flash-Lite TTS:前者支持自然语言设计声音、逐行指导表演,后者面向大批量生成。原文还说明声音复刻需授权验证,并为生成音频加入水印。语音 Agent 和内容团队可比较创造性控制、规模化成本与声音权利保障,区分这次语音生成更新和此前的实时语音对话模型。
xAI 发布 Grok 4.7:编程与知识工作模型升级
xAI 发布 Grok 4.7,强调更长时程任务、更强的自我检查,以及对 Grok Bot 运行框架的原生适配。官方给出编程、终端和专业知识工作等多项基准,也公布 API 定价与接入渠道;这些性能数字属于厂商测试。读者可从任务类型、成本和验证方式三个维度判断它是否适合自己的 Agent 工作流。
错误码排查从 3~8 小时到分钟级,Agent 怎么做到的?
腾讯团队用单 Agent 挂载知识库、代码图谱、可观测平台与代码托管四类能力,构建错误码治理 Agent,将排查从 3~8 小时压缩到分钟级,action_type 与人工标注一致率从 66% 提升到 88%、硬冲突率降至 0%。
网易阮良谈 AI 原生组织与企业 Agent 实战
网易集团副总裁阮良基于网易内部实践,揭示 AI 落地企业的核心矛盾:个人效率提升 300%-500%,但软件交付周期仅从 20 天缩短到 17 天,症结在于流程与组织未变,并提出 AI 原生组织的三层改造路径与决策中枢方法论。
从数据摄取到智能体:AI 团队如何基于文档智能构建应用 —— Reducto,Adit Abraham
Reducto 联合创始人 Adit Abraham 基于数十亿页文档的处理经验,讲解非结构化数据为何仍是智能体落地的瓶颈:用小视觉模型加 VLM 分解解析、以 token 级 agentic OCR 精准修正错误、为推理与检索准备不同的表格表示,并通过智能体 harness 与逐阶段评估同时提升精度与召回。
《AI Native 研发范式实践手册》重磅发布
阿里以 AIDC 数字投手、千问用增 Agent、万有无界平台三个案例,梳理大型企业如何建设运行环境、身份权限、效能度量与组织协作体系,推动智能体从写代码走向规模化交付。
AI 自迭代的小游戏 Agent:2 周上线 6 款小游戏,3 天迭代 12 款小游戏
大淘宝技术把数据感知、运营 Agent、生产 Agent 与人工审核连成小游戏迭代闭环;团队称两周上线 6 款游戏、3 天完成 12 款存量游戏的迭代,展示单点 AI 工具如何进入完整业务流程。
AI 写得快 ≠ 真正提效:一文讲清 Harness“记忆”和“验证闭环”
腾讯云开发者以单个 Coding Agent 的工程实践拆解记忆与验证闭环:两级索引知识库、Hook 强制读取、会话复盘和上线核验,说明如何让任务持续可靠完成。
《纽约客》观察良渚:中国 Vibe Coding 聚落与 AI 热潮
《纽约客》记者走访杭州良渚的 AI 创业者,从 FateTell、YouMind 等产品及开发者聚会观察低成本独立开发的机会,也记录创办人对流量、盈利与地方扶持的不同判断。
EuroSys 2027|快手联合北航提出 TB 级推荐模型 Checkpoint 系统 AdaptCP
AdaptCP 是一个高性能自适应检查点系统,专为工业级推荐模型训练设计,通过冷热感知的混合策略、Save-on-Update 机制和并行 I/O 引擎,显著提升训练吞吐和故障恢复效率。
Modal 超越 Kubernetes:如何在数秒内扩展 100 万个并发沙箱
Modal 的工程师重建了他们的沙箱基础设施,以支持数百万个并发沙箱和每秒数万个沙箱创建,采用了一种水平可扩展的架构,不再进行全局协调,让调度看起来更像负载均衡。
把 RSI 讲明白的科普级综述
这篇综述用「持久改进—自主闭环—递归增益—稳健可控」四层框架,梳理从 1981 年 EURISKO 到 2026 年 AIDE² 的五次边界推进,结论是有界自我改进闭环已经出现并产生净正收益,但递归自我加速(点火)尚无充分公开证据。
jina-ocr-v1:在低成本 GPU 上更快解析文档
Jina AI 发布了 jina-ocr-v1,一个总参数 3.4B 但激活仅 570M 的紧凑型文档解析模型,通过 MoE 架构与 FastMTP 技术在低成本 GPU 上实现了极高的吞吐速度。
TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案
TWIST 是一种新型的混淆机制,用于保护大模型的隐私,通过联合模型与 Token 空间的协同变换,实现更强的数据隐私保护能力。
面向智能体的 API:在 MCP 时代重新思考 API 项目
摩根士丹利工程师讲述他们如何围绕 MCP 和开源的 CALM 架构即代码框架重建 API 项目,并加入治理控制与护栏,在生产环境中部署了 110 个 API。
导演、剪辑、编剧都在贬值,而升值的是另一种人
一场关于 AI 内容行业的圆桌讨论指出,制作环节因可被培训和模型迭代覆盖而持续贬值,价值正向上游故事 IP 和下游「被看见」的分配权迁移,而真正稀缺的是懂内容表达的人。
Agents 成新一代造王者,开发者正在快速失去技术决定权
RedMonk 创始人 Stephen O'Grady 指出,Agent 正取代开发者成为技术选型的决策者,行业权力结构从「开发者造王」转向「Agent 造王」,开发者可能沦为「国王的顾问」。
知识不是文件,也不是向量 | KDC 系列 02
本文区分 Representation、Knowledge 与 RAG 的职责,提出知识对象、来源证据、成熟度、版本与适用边界等工程要求,说明认知成果如何被验证、引用和持续更新。
Claude 发现一种具有类 CRISPR 重复序列的新型酶系统
Anthropic 新成立的生命科学实验室报告称,Claude 智能体在 21 小时内筛选了超过 200,000 条序列,自主发现了一种名为 ART 的新型酶系统——一种与类 CRISPR DNA 重复阵列配对的逆转录酶。