EP111 · GEO 仪表盘 / AI 工程化 / 模型工作空间 · 07-08 早报
本期导语
今天的早报先从一个很现实的问题开始:AI 搜索时代,很多看起来精确的仪表盘其实未必能指导业务。接着看两篇来自阿里和腾讯的工程实践:当 AI Agent 参与真实研发,团队真正需要补上的不是更多提示词,而是门禁、验证、反馈和可审计的交付流程。
本期内容
27 条称量烟雾:为什么GEO仪表盘基本无用 — Better Than Good.
GEO 仪表盘正在成为 AI 搜索时代的新焦虑入口,但文章用多项研究和行业案例指出:品牌在 ChatGPT、Claude 等回答里的排名高度随机,很多指标既没有真实查询量,也缺少业务转化验证。它更适合作为今天的第一条,因为它提醒团队把注意力从昂贵仪表盘转回可验证的基础工作。
从「不敢发」到「天天发」:AI Agent 时代的 CI/CD 生存指南
阿里技术这篇把 AI Agent 写代码后的发布信任问题讲得很具体:数十万行 Go 代码、数百个命令、上百个真实 API 冒烟用例和近三千行 CI 配置,如何支撑最近 30 天几乎每个工作日发版。它的价值不在理念,而在把分层门禁、动态冒烟、CI 历史反馈和灰度 telemetry 变成可审计流程。
从 Vibe Coding 到 Harness—— 一套大仓 AI 工程化实战
腾讯技术工程这篇从另一个角度补上 AI 工程化全链路:在 30 多个微服务、10 多个前端微应用的大仓里,AI 不能只会写代码,还要读 PRD、对齐方案、跑沙箱接口测试、补门禁脚本并交付 MR。它和阿里 CI/CD 一起构成今天更聚焦的主线:AI 研发不是模型能力秀,而是工程纪律。
sqlite-utils 4.0 发布,引入数据库模式迁移功能
Simon Willison 发布 sqlite-utils 4.0,引入数据库迁移、嵌套事务、复合外键等新特性及破坏性变更,并在 AI 的辅助下显著提升了版本质量。
语言模型中的全局工作空间
Anthropic 研究人员提出证据表明,Claude 已经发展出一小套内部神经模式("J 空间"),其功能类似于全局工作空间,能够实现可报告、可控且灵活的内部推理,这与自动处理截然不同。
Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环
本文基于阿里云诊断系统的生产实践,详细阐述了如何构建从日志扫描到预发部署的全自主 Loop 闭环,使 ERROR 总量下降 96%、同类问题修复时间从 48 分钟降至 15 分钟、人工介入次数降为零。
EdgeBench:衡量真实世界环境学习,发现新 Scaling Law
字节跳动 Seed 发布超长程评测集 EdgeBench,发现 Agent 在真实环境中的学习表现遵循高精度 log-sigmoid 曲线,且学习速度每三个月翻一倍。
使用最终 Token 偏好优化减少灾难循环 — Blog
Liquid AI 推出 Antidoom,这是一种利用最终 Token 偏好优化(FTPO)的有针对性的方法,用于消除推理模型中的退化重复循环(灾难循环),在早期的 LFM2.5-2.6B 检查点上将循环率从 10.2% 降低到 1.4%,在 Qwen3.5-4B 上从 22.9% 降低到 1%,同时改进了评估分数。
走进 Zipline 的自治系统:从无人机配送到自动化物流基础设施
这是一场深入拆解 Zipline 自动化物流基础设施的访谈,展示客户需求、安全工程、监管协作、垂直整合与硬件经济模型如何共同把无人机配送变成一套完整运营系统。
施耐德电气如何使用 LangSmith 构建 LLMOps 基础
本文详细介绍了施耐德电气如何使用 LangSmith 构建企业级 LLMOps 基础,涵盖可观测性、评估、部署以及从大规模部署 60 多个 AI 产品中得出的关键经验。