AI 每日早报公开专栏
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

AI 每日早报
Ginolujiaxian

EP111 · GEO 仪表盘 / AI 工程化 / 模型工作空间 · 07-08 早报

今天的早报先从一个很现实的问题开始:AI 搜索时代,很多看起来精确的仪表盘其实未必能指导业务。接着看两篇来自阿里和腾讯的工程实践:当 AI Agent 参与真实研发,团队真正需要补上的不是更多提示词,而是门禁、验证、反馈和可审计的交付流程。

27

称量烟雾:为什么GEO仪表盘基本无用 — Better Than Good.

GEO 仪表盘正在成为 AI 搜索时代的新焦虑入口,但文章用多项研究和行业案例指出:品牌在 ChatGPT、Claude 等回答里的排名高度随机,很多指标既没有真实查询量,也缺少业务转化验证。它更适合作为今天的第一条,因为它提醒团队把注意力从昂贵仪表盘转回可验证的基础工作。

文章Hacker News作者:Iain Harper
查看原文 Weighing smoke: why GEO dashboards are mostly useless — Better Than Good.(在新窗口打开)

从「不敢发」到「天天发」:AI Agent 时代的 CI/CD 生存指南

阿里技术这篇把 AI Agent 写代码后的发布信任问题讲得很具体:数十万行 Go 代码、数百个命令、上百个真实 API 冒烟用例和近三千行 CI 配置,如何支撑最近 30 天几乎每个工作日发版。它的价值不在理念,而在把分层门禁、动态冒烟、CI 历史反馈和灰度 telemetry 变成可审计流程。

文章阿里技术作者:阿里技术
查看原文 从「不敢发」到「天天发」:AI Agent 时代的 CI/CD 生存指南(在新窗口打开)

从 Vibe Coding 到 Harness—— 一套大仓 AI 工程化实战

腾讯技术工程这篇从另一个角度补上 AI 工程化全链路:在 30 多个微服务、10 多个前端微应用的大仓里,AI 不能只会写代码,还要读 PRD、对齐方案、跑沙箱接口测试、补门禁脚本并交付 MR。它和阿里 CI/CD 一起构成今天更聚焦的主线:AI 研发不是模型能力秀,而是工程纪律。

文章腾讯技术工程作者:腾讯技术工程
查看原文 从 Vibe Coding 到 Harness—— 一套大仓 AI 工程化实战(在新窗口打开)

语言模型中的全局工作空间

Anthropic 研究人员提出证据表明,Claude 已经发展出一小套内部神经模式("J 空间"),其功能类似于全局工作空间,能够实现可报告、可控且灵活的内部推理,这与自动处理截然不同。

文章Anthropic Research作者:Anthropic Research
查看原文 A global workspace in language models(在新窗口打开)

Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环

本文基于阿里云诊断系统的生产实践,详细阐述了如何构建从日志扫描到预发部署的全自主 Loop 闭环,使 ERROR 总量下降 96%、同类问题修复时间从 48 分钟降至 15 分钟、人工介入次数降为零。

文章阿里云开发者作者:阿里云开发者
查看原文 Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环(在新窗口打开)

使用最终 Token 偏好优化减少灾难循环 — Blog

Liquid AI 推出 Antidoom,这是一种利用最终 Token 偏好优化(FTPO)的有针对性的方法,用于消除推理模型中的退化重复循环(灾难循环),在早期的 LFM2.5-2.6B 检查点上将循环率从 10.2% 降低到 1.4%,在 Qwen3.5-4B 上从 22.9% 降低到 1%,同时改进了评估分数。

文章Hacker News作者:Liquid AI
查看原文 Reducing Doom Loops with Final Token Preference Optimization — Blog(在新窗口打开)
登录后订阅

登录后会回到本专栏。公开期次现在即可阅读。

查看往期