EP164 · Gemini 模型更新、Claude 电商架构与 GitHub 成本实践 · 09-03 早报
本期导语
Gemini 更新模型,Claude 分享电商架构,GitHub 优化成本:理解能力选择与工程落地。
本期内容
20 条Google 发布 Gemini 3.8 Flash 系列:升级编码与漏洞修复
Google 发布 Gemini 3.8 Flash 与 Cyber,面向长周期编程和自主任务提升推理能力,Cyber 侧重漏洞发现与补丁生成。Flash 沿用上一代单价,但更多推理可能增加 token 消耗,Cyber 限受信防御者使用。企业可结合披露的基准和使用案例,按任务效果、实际成本和接入条件判断是否试用。
Anthropic 电商智能体构建指南:架构、成本与生产实践
Anthropic 从已上线的电商项目总结单智能体配合技能的架构,解释如何保持购物会话的共享上下文,并让工具复用现有业务系统。指南进一步覆盖缓存、记忆、交易审批和评测,附可运行的参考实现,方便团队判断哪些能力交给模型、哪些约束由系统执行。
GitHub 如何在保证任务质量的同时提高 AI 编程的成本效率
GitHub 披露 Copilot 的成本优化实验:保留有用上下文、压缩重复输出、精简提示词,并合并后台任务通知。团队通过离线评测与线上实验追踪任务质量,发现部分压缩会引发重复读取。文章提供了从完整任务衡量成本、验证优化效果的具体方法。
【AI新闻】Claude Fable/Mythos 5.1:新SOTA模型,75%缓存价格削减但70%更多输出令牌
Latent.Space 梳理 Claude Fable/Mythos 5.1 更新:缓存读取单价下降 75%,其引用的 Artificial Analysis 测试显示输出用量约增至 1.7 倍、单任务成本增加约 20%。这组结果提示团队把模型能力、缓存占比和完成任务的总用量一起比较。
大淘宝 AI 驱动研发体系的实践和思考
本文总结了团队在 AI 驱动研发体系的实践探索,从 AI 辅助编程发展到完整的 AI 驱动研发体系。文章指出业务AI研发的真正瓶颈是上下文而非模型能力,提出'本地优先:Agent + 文件夹 + Git'理念,通过 Price360-KB 项目 Harness 将业务知识、源代码、项目规则和验证证据组织在同一工作空间。实践表明迭代过程本身就是知识飞轮,项目无需完美知识库即可启动,在真实产品迭代中持续完善。文章阐述了项目 Harness 的三层结构设计、机器可读的迭代协议以及人负责决策而 Agent 负责执行完整的工作模式。随着模型和通用 Agent 能力提升,项目 Harness 将收缩,但业务知识治理和质量责任不会消失,未来技术人员将更接近 FDE 角色,需深入理解业务、设计项目规则并对端到端交付结果负责。
Claude Code 团队如何用 Claude Code 重塑软件开发流程
Claude Code 团队说明,目标导向的智能体、可组合的基础能力、扇出式工作流与验证产物,正如何把软件开发从逐步监督工具调用转向更高层次的编排。
对话兰小欢:置身 AI 事内,不要拿旧理论硬套新现实|AI 透镜研究系列
兰小欢以经济学视角剖析AI时代:组织因承担风险而存续,权力在信息被打平后向关键卡位集中,就业从生产转向验证,Token难以作为稳定分析单元,AGI应是超越公司控制的公共品。
Google AI Agents 挑战赛作品背后的 4 个工程模式
本文提炼出 Google for Startups AI Agents Challenge 获奖作品中的四大关键工程模式:双向 MCP 工具暴露、事件驱动并发、一致的回退验证,以及分层路由以降低推理成本。
1.5 TB 压到 214 GB,Hy4 preview 轻量版来了
腾讯混元通过 Sherry 稀疏三值量化和 MIX-STQ1_0 混合精度策略,将 Hy4 preview 模型从 1.5 TB 压缩至 214 GB,同时保持了在长文理解、检索和数学等任务上的高精度,并实现了跨异构设备的联合推理。
AI Agent 应用精细化评测:评测体系设计与工程实践
本文介绍了基于商品中心 Agent 架构的精细化评测体系,通过拆解感知、规划、记忆、工具四大模块,构建覆盖质量、成本、性能的多元化指标,并结合端到端与模块级评测、自动化数据集生成、LLM-as-Judge 等方法,实现了对 Agent 能力的全面、可执行、可解释的评估。