AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP164 · Gemini 模型更新、Claude 电商架构与 GitHub 成本实践 · 09-03 早报

Gemini 更新模型,Claude 分享电商架构,GitHub 优化成本:理解能力选择与工程落地。

20

Google 发布 Gemini 3.8 Flash 系列:升级编码与漏洞修复

Google 发布 Gemini 3.8 Flash 与 Cyber,面向长周期编程和自主任务提升推理能力,Cyber 侧重漏洞发现与补丁生成。Flash 沿用上一代单价,但更多推理可能增加 token 消耗,Cyber 限受信防御者使用。企业可结合披露的基准和使用案例,按任务效果、实际成本和接入条件判断是否试用。

文章Google DeepMind News作者:Tulsee Doshi
查看原文 Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(在新窗口打开)

Anthropic 电商智能体构建指南:架构、成本与生产实践

Anthropic 从已上线的电商项目总结单智能体配合技能的架构,解释如何保持购物会话的共享上下文,并让工具复用现有业务系统。指南进一步覆盖缓存、记忆、交易审批和评测,附可运行的参考实现,方便团队判断哪些能力交给模型、哪些约束由系统执行。

文章Claude Blog作者:Claude Blog
查看原文 A guide to the anatomy of effective commerce agents | Claude by Anthropic(在新窗口打开)

GitHub 如何在保证任务质量的同时提高 AI 编程的成本效率

GitHub 披露 Copilot 的成本优化实验:保留有用上下文、压缩重复输出、精简提示词,并合并后台任务通知。团队通过离线评测与线上实验追踪任务质量,发现部分压缩会引发重复读取。文章提供了从完整任务衡量成本、验证优化效果的具体方法。

文章The GitHub Blog作者:Erik Kristensen
查看原文 How we make AI coding more cost efficient without sacrificing task quality(在新窗口打开)

【AI新闻】Claude Fable/Mythos 5.1:新SOTA模型,75%缓存价格削减但70%更多输出令牌

Latent.Space 梳理 Claude Fable/Mythos 5.1 更新:缓存读取单价下降 75%,其引用的 Artificial Analysis 测试显示输出用量约增至 1.7 倍、单任务成本增加约 20%。这组结果提示团队把模型能力、缓存占比和完成任务的总用量一起比较。

文章Latent.Space作者:Latent.Space
查看原文 [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens(在新窗口打开)

大淘宝 AI 驱动研发体系的实践和思考

本文总结了团队在 AI 驱动研发体系的实践探索,从 AI 辅助编程发展到完整的 AI 驱动研发体系。文章指出业务AI研发的真正瓶颈是上下文而非模型能力,提出'本地优先:Agent + 文件夹 + Git'理念,通过 Price360-KB 项目 Harness 将业务知识、源代码、项目规则和验证证据组织在同一工作空间。实践表明迭代过程本身就是知识飞轮,项目无需完美知识库即可启动,在真实产品迭代中持续完善。文章阐述了项目 Harness 的三层结构设计、机器可读的迭代协议以及人负责决策而 Agent 负责执行完整的工作模式。随着模型和通用 Agent 能力提升,项目 Harness 将收缩,但业务知识治理和质量责任不会消失,未来技术人员将更接近 FDE 角色,需深入理解业务、设计项目规则并对端到端交付结果负责。

文章大淘宝技术
查看原文 AI 驱动研发体系的实践和思考(在新窗口打开)

对话兰小欢:置身 AI 事内,不要拿旧理论硬套新现实|AI 透镜研究系列

兰小欢以经济学视角剖析AI时代:组织因承担风险而存续,权力在信息被打平后向关键卡位集中,就业从生产转向验证,Token难以作为稳定分析单元,AGI应是超越公司控制的公共品。

文章腾讯研究院
查看原文 对话兰小欢:置身 AI 事内,不要拿旧理论硬套新现实|AI 透镜研究系列(在新窗口打开)

AI Agent 应用精细化评测:评测体系设计与工程实践

本文介绍了基于商品中心 Agent 架构的精细化评测体系,通过拆解感知、规划、记忆、工具四大模块,构建覆盖质量、成本、性能的多元化指标,并结合端到端与模块级评测、自动化数据集生成、LLM-as-Judge 等方法,实现了对 Agent 能力的全面、可执行、可解释的评估。

文章阿里技术
查看原文 AI Agent 应用精细化评测:评测体系设计与工程实践(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期