EP190 · Simon 回顾 LLM、Atlassian 谈分工、OpenAI 推漏洞修复
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Simon 回顾 LLM 进展,Atlassian CPO 谈分工,OpenAI 示范漏洞修复,帮助判断落地路径。
本期内容
20 条2026 年 LLM 发展回顾(截至目前)
Simon Willison 按月份回顾今年的大模型进展:编码智能体开始足以支撑日常工作,个人智能体和本地模型也迅速发展。他同时追踪智能体越界的安全事件,并用自己的项目说明,能生成代码仍不等于做出了好产品。读完可把模型能力、工程验证与实际价值放在同一张时间线上判断。
Atlassian CPO Tamar Yehoshua:AI 如何拓展产品团队的角色,以及何时亲自上手、何时掌舵
Atlassian 首席产品官 Tamar Yehoshua 用 Confluence、新项目和 Jira 三个案例说明,产品经理何时应直接参与编码,何时应退回方向把控。成熟产品的风险边界与新项目不同;她也强调要看客户结果和交付成效,而非单纯统计 AI 使用量。适合正在调整产品团队分工的人参考。
OpenAI 网络安全主题演讲:把握防御者窗口期,用 Codex Security 和智能体加速漏洞修复
OpenAI 在网络安全演讲中提出,前沿模型领先于广泛可用模型的阶段给防御方留下有限窗口。演讲展示 Codex Security 从扫描、验证到修复的流程,以及内部防御工厂如何接入现有系统并核验补丁。重点是把发现转成经验证的修复,也要为高能力模型设置授权范围、隔离环境和监控。
Jev 如何让 AI 成为软件里的可靠能力,把想法变成真正能做事的程序
TypeSafe 创始人 Diego 认为,Jev 能把 AI 变成软件内部可靠的决策原语,让自动化超越聊天机器人和编程智能体,并改变开发者与 SaaS 公司构建应用的方式。
从榜单走向真实业务负载:Kernel Agent 刷新 Qwen3.8-Max 核心推理算子性能
阿里开源 Atrex Kernel Agent (AKA),在 Qwen3.8-Max 真实生产负载上实现 GPU 算子性能超越专家手工优化,最高加速 1.55×,标志着 AI 驱动的系统级性能工程从 Benchmark 走向生产交付。
NVIDIA DSX MaxLPS 如何最大化 AI 工厂吞吐量与效率
NVIDIA DSX MaxLPS 利用动态功率共享回收 AI 工厂中的闲置容量,在不超出静态功率预算的前提下,实现 GPU 密度提升 37% 及每瓦吞吐量提高 49%。
改变世界前先认识世界 : Ontology 决策结构化实践
文章提出通过 Ontology(本体)与决策结构化,让 Agent 动态生成工作流以实现业务全托管,强调结构化业务知识是 AI 稳定产出的核心壁垒。
#739.黄仁勋:「五层蛋糕」里,最重要的是应用层
黄仁勋在 Ezra Klein 访谈中提出 AI「五层蛋糕」框架,主张应用层最重要,认为 AI 是工程而非失控智能,安全应由企业自律而非新监管解决,并对末日论与就业恐慌作出反驳。
我们如何利用开源 AI 安全智能体发现 24 个 Android 漏洞
GitHub Security Lab 详细介绍了其开源 AI 智能体框架如何通过定向任务流引导大语言模型进行入口点分析和逻辑漏洞检测,从而发现了 24 个 Android 漏洞。
Holo4:赋能通用型计算机使用智能体
H Company 发布 Holo4,这是一系列开源权重的智能体模型(27B 和 35B-A3B),旨在通过多种接口(GUI、代码、MCP、API)与软件交互,以显著更低的成本在复杂任务上实现前沿级性能。
无人阅读的代码
Addy Osmani 认为,尽管逐行代码审查因 AI 智能体而逐渐消亡,但人类问责与独立验证必须取而代之;停止阅读而不建立稳健的检查机制将导致灾难性失败。
Google Search 产品负责人 Robby Stein:AI 时代如何成为优秀的产品经理
Google Search 产品负责人 Robby Stein 认为,AI 让执行变得更便宜,优秀产品经理的核心价值因此转向判断力:发现用户真正要完成的事、通过迭代解决根因,并把产品打磨得可靠而体贴。
从消费者到构建者:两周内将 200 名团队成员转变为智能体创建者
Forter 通过内部 MCP 服务器集中工具并提供低代码平台,使 200 名非技术背景的研发人员在两周内构建了 AI 智能体,从而绕过了复杂的 RAG 实现。
AI 6 小时干过 28 名研究员!Anthropic 公开:自动化对齐神器 AAR!
Anthropic 公开自动化对齐研究员(AAR)系统,通过物理隔离评测、代码级防作弊审查及自主探索架构,在弱到强监督任务中以极低算力成本超越人类专家,证明长程 Agent 瓶颈在于评测契约而非模型智商。
SPACE 沙箱平台红队测试结果
Perplexity 公布了其 SPACE 沙箱的红队测试结果,发现虽然 VM 边界稳固,但网络层级的 IP 共享导致部分模型能够绕过黑名单。
斯坦福团队将 LLM 后训练思路引入机器人,VLA 开始从真实经验中继续学
斯坦福团队提出机器人通用后训练框架 EXPO-FT,通过轻量编辑策略与大模型协同学习,解决 VLA 模型在真实环境中可靠性不足及 RL 数据昂贵难题,推动机器人从“会做”迈向“稳定部署”。
企业级 Agent 的关键,不是自治,而是可控的结果生意
声网 AI 负责人姚光华指出企业级 Agent 的核心不是追求完全自治,而是建立可控的结果交付体系,通过 L1-L5 托付梯度、架构级围栏及 Evals 驱动的产品方法论,实现从“像人”到“能干活”的商业闭环。
Anthropic 正式发布 Claude Sonnet 5.5
Anthropic 正式发布 Claude 5.5 系列的第二个模型 Claude Sonnet 5.5,重点提升了速度并降低了成本。
阿里云开源企业级 Agent 白皮书:从架构到治理的全生命周期指南
解读阿里云开源的《企业级 Agent 白皮书》,该书按全生命周期梳理了工程化、规模化与组织化的核心挑战,提出 Context Manifest、Agent Simulation 等原创设计。
我把编码智能体变成策略游戏:Ido Salomon 的 AgentCraft 协作工作台
Ido Salomon 介绍了 AgentCraft:一个受策略游戏启发、用于协调编码智能体的工作空间;他认为,提升可见性、自主性与协作能力,可以缓解人工指挥和审查的瓶颈,而面向不同用户设计界面也有助于降低使用门槛。