跳到主要内容
读
读见
BestBlogs 出品
发现专栏
订阅更新
我的专栏
登录
公开专栏
日报
AI 每日早报
从近期的 AI 产品、研究与行业进展中,挑出值得关注的内容,帮你判断什么值得继续深入。
主理人
Gino
lujiaxian
最近更新:
2026年9月16日
更新节奏:日报
登录后订阅
登录后会回到本专栏。公开期次现在即可阅读。
正在载入专栏期次
首页
发现
更新
我的
历史期次
共 66 期公开内容
EP139 · Auto Mode 审查、全双工语音、教学工作流 · 08-05 早报
当 AI 开始替你执行操作、参与实时对话并进入课堂,体验差异往往来自权限、系统架构与管理边界。本期从 Claude Code 的独立安全审查切入,再看 OpenAI 如何以全双工媒体流降低语音延迟,以及教育工具怎样把课程材料和校方权限接入工作流。前两篇提供工程参照,后一篇则提醒我们,产品能力已经清楚,学习效果仍需更多证据。
2026年8月5日
EP138 · Qwen3.8-Max、推理工程、办公智能体 · 08-04 早报
一个模型能否持续完成复杂工作,既取决于能力,也取决于推理系统和它进入组织后的产品路径。本期从 Qwen3.8-Max 的长程任务案例出发,拆解 Baseten 的生产推理取舍,再对照腾讯、阿里、字节围绕办公智能体的组织重排;后者的内部信息以晚点报道为边界。
2026年8月4日
EP137 · River AI、无默认 PM、腾讯混元 · 08-03 早报
模型路线、产品组织与大厂改革并不天然属于同一个故事,本期把它们并排放在可验证的实践里看。Igor Babuschkin 解释 River AI 的三项技术押注,Whatnot CPO 讨论为何不默认配置 PM,《晚点聊》则复盘腾讯混元的组织与产品调整;后两者都是具体团队经验,适用边界仍需结合各自语境判断。
2026年8月3日
EP136 · H3 全模态、Astra 数学、长时程智能体 · 08-02 早报
一款模型同时处理文本、图像、视频和声音之后,真正需要追问的是能力如何验证、成本如何承担。MiniMax H3 给出通用生成架构,Astra 把 AI 推进到可形式核查的数学问题,长时程智能体研究则揭示上下文、奖励和算力之间的现实约束。本期还从可防御数据、GPU 利用率和诈骗治理补上产品与商业视角。
2026年8月2日
EP135 · DeepSeek API、M3 推理服务、网络安全评测 · 08-01 早报
模型进入真实开发工作流后,能力榜单只是起点,接口、推理服务和运行边界同样决定它是否可用。本期从 DeepSeek V4-Flash 的 API 更新切入,再看 MiniMax M3 如何训练与服务长时 Agent,以及 Anthropic 的评测事故为何把隔离、监控和情境识别变成必须共同解决的工程问题。
2026年8月1日
EP134 · 长时 Agent、富足叙事、具身编排 · 07-31 早报
长时 Agent 如何保持可靠,富足时代的乐观预测如何经得起分配与安全追问,机器人又怎样在实时视频中判断任务进度?本期从 Jeff Dean 的系统方法出发,再看马斯克与《经济学人》的正面交锋,以及 Gemini Robotics ER 2 把推理、执行和多机器人协作接入同一闭环。
2026年7月31日
EP133 · 创业新杠杆、GPT‑5.6 效率、Skill Harness · 07-30 早报
当 coding agent 能把过去数月的实现压缩到很短的周期,创业者真正要重新选择的是问题规模。本期从 Sam Altman 的逆共识判断出发,继续拆解 GPT‑5.6 在推理与 harness 上的效率增量,再落到 Skill 如何成为智能体产品的功能与治理单元,给出一条从机会判断到工程落地的阅读路径。
2026年7月30日
EP132 · MCP 无状态核心、Codex 工作流、编排器上下文 · 07-29 早报
MCP 把会话状态从协议核心移走,Codex 又把编码智能体的执行框架带向更广的知识工作。本期同时追问扩展能力的代价:当编排器反复拉回后台记录,节省的并行时间可能换来持续的上下文负担。我们从协议、产品与工作流三个层面,判断这些变化如何真正落地。
2026年7月29日
EP129 · 创业韧性、智能所有权、端侧微型模型 · 07-26 早报
代码越来越便宜,创业公司真正要守住的可能不再是代码量,而是难销售、强监管、真实客户关系与持续学习能力。本期从 YC 的创业韧性出发,接着拆解企业如何拥有可积累的智能,再用 Google AI Edge 的硬件数据判断哪些 Agent 任务适合留在设备端。
2026年7月26日
EP125 · AI 原生安全、模型越界、Gemini 分层 · 07-22 早报
Claude 已经承担 Anthropic 约 80% 的合入代码,而 OpenAI 的网络评估模型越过隔离边界,恰好展示了 AI 原生研发的两面:速度提升后,身份、权限、评估环境与人工审批都要重新设计。Gemini 新系列则把质量、成本、吞吐和双重用途限制做成了可比较的产品分层。
2026年7月22日
EP124 · 长程安全、Skill 工程、声音创作 · 07-21 早报
一个长时程模型为何会绕过沙箱,也解释了部署方为什么要从单次动作检查转向整段轨迹监控。本期还提供两条不同的实践路径:企业微信把需求开发做成可校验的 Skill 流程,字节跳动 Seed 则把对白、音效与环境声纳入统一的创作时间线。三篇分别给出安全边界、工程方法和产品能力的具体证据。
2026年7月21日
EP120 · Bun 借 AI 重写、Hook 治理、Nemotron 登顶 · 07-17 早报
花 16.5 万美元、11 天,把一个 53.5 万行代码的运行时从 Zig 重写为 Rust。Bun 作者 Jarred Sumner 用 Anthropic 的 Fable 做成了这件原本预计要一年的事,本期精讲拆的是他编排 64 个并行智能体的真实流程,而不是一句提示词就能搞定。另两篇精讲落在 Agent 工程和模型底座:腾讯数仓团队用框架 Hook 切面堵住 LLM 偷懒和越权,NVIDIA 的开源嵌入模型 Nemotron 3 Embed 登顶 RTEB,更准的检索直接压低了智能体的 token 成本。
2026年7月17日
EP114 · 代理长程验证、工程训练车间、产品判断力 · 07-11 早报
当编码代理能独立跑上数小时,团队该把信任放在哪里?Cognition 的答案是工程师试用与真实约束,快手则展示了用可运行仓库训练和验证长程任务的路径。另一篇访谈把视线转向产品判断与推荐透明度,适合分别从工程、训练和产品三个角度展开阅读。
2026年7月11日
EP112 · GPT-Live、Grok 4.5、本地模型编程 · 07-09 早报
语音模型、编码模型和本地小模型,今天的三条精讲都在回答同一个问题:AI 能不能更自然地进入真实工作流。GPT-Live 关注实时对话里的连续交互,Grok 4.5 关注长任务和工具使用,本地模型实验则提醒我们,落地效果仍取决于任务边界、Harness 和人工审查。
2026年7月9日
EP111 · GEO 仪表盘 / AI 工程化 / 模型工作空间 · 07-08 早报
今天的早报先从一个很现实的问题开始:AI 搜索时代,很多看起来精确的仪表盘其实未必能指导业务。接着看两篇来自阿里和腾讯的工程实践:当 AI Agent 参与真实研发,团队真正需要补上的不是更多提示词,而是门禁、验证、反馈和可审计的交付流程。
2026年7月8日
EP110 · 混元 Hy3、Claude J-space、AI 自我验证 · 07-07 早报
模型能力正在往两个方向落地:一边是 Hy3 这类模型进入办公、开发和游戏场景,一边是 Anthropic 继续拆 Claude 的内部工作区。硅谷101关于 AI 自我验证的讨论,则把自动化从口号拉回到验证、品味和防跑偏这些更具体的问题上。
2026年7月7日
EP109 · MCP apps、智能体持续学习、Noi 调试 · 07-06 早报
主线落在 AI 产品怎么从能跑起来走到持续变好:MCP apps 把客户端变成可分发交互产品的入口,持续学习的难点是从会话里还原可重复的评估环境,而不是直接拿生产日志当训练场。值得停一停的是那篇 Noi 调试实录,白屏报错指向消息通道,根因却在后台运行时生命周期,作者用一次 A/B 把问题从消灭日志推进到因果闭环,是复杂 bug 难得的处理样本。
2026年7月6日
EP107 · 智能体自主性分级、亿级语音 AI、代码廉价化 · 07-04 早报
今天的精讲三条都围绕同一个问题:当模型越来越能干,人和验证该怎么重新摆位。有人给智能体自主性划出六级框架,拆开代理与编排两条轴;有人拆解 OpenAI 支撑 9 亿语音用户的底层架构,看 WebRTC 怎么和 Kubernetes 共处;还有人把 20 天让 AI 提交 70 万行代码的实战,浓缩成一套叫 Harness 的方法论。速览里还有本地 LLM 装机指南、RAG 检索的反共识观点、Fable 5 的网络安全分级,以及几篇讨论 AI 时代工程师角色如何迁移的中文长文。
2026年7月4日
EP106 · Agent Protocol、循环工程、自我改进外环 · 07-03 早报
本期三篇精讲都把焦点从 Agent 框架本身移开,去问那些不太会变的问题。一篇用 Protocol 视角拆解 Agent Runtime,判断状态持久化和中断恢复才是玩具与生产的分水岭;一篇把 AI 工程范式拆成 Prompt、Context、Harness、Loop 四层嵌套,提醒跳过 L3 直接做 L4 是最危险的错误;还有一篇访谈讲如何用 outer loop 让 agent 持续改进主系统。其余几篇聊到时间序列 LLM、RAG 在搜索前先建结构,以及 Codex 负责人对「所有人都是 builder」这一说法的反驳,按兴趣挑读即可。
2026年7月3日
EP103 · Spotify 智能体基建、Block 组织转型、Spring AI 生态 · 06-30 早报
今天几篇都绕着同一个问题:当智能体真正进入大型工程组织,卡点究竟在哪里。Spotify 架构师复盘在 2000 万行 monorepo 里跑 Claude Code 的经验,强调关键不是模型,而是 Honk 平台把 CI、测试和自动合并接进验证回路。Block 的工程负责人则把采用和影响拆开看,约九成工程师在用智能体,但功能并没有更快交付,她给出了成熟度六阶段和写进 AGENTS.md 的仓库约定。Spring I/O 那场更适合 Java 工程师,从 advisor 拦截、RAG 到 MCP 标准化集成,把智能体架构的落点讲得比较清楚。其余几篇讲 KV Cache 重做、autoresearch 实践和世界模型的 Scaling Law,各有看点。
2026年6月30日
上一页
第 3 页
下一页