EP173 · 开放模型成本、Agent 记忆、B 端实践 · 09-12 早报
本期导语
从开放模型的成本测量,到 HL-Mem 的记忆治理,再到京东 B 端协作,判断 AI 落地如何分配模型、证据与人机责任。
本期内容
20 条The Pulse:科技公司转向开放 AI 模型
The Pragmatic Engineer 汇集 Uber、Pinterest 与 AT&T 的一线实践:通过开放权重模型、模型路由和持续基准测试,Uber 将单次 AI 请求成本降 34%、单次会话成本降 52%。文章的价值在于把模型选型从偏好之争落到真实任务、质量与成本的持续测量,也提醒团队为复杂任务保留前沿模型。
让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍
来自淘天直播 AIGC 团队的 HL-Mem 实践,将长期记忆设计为可治理的认知系统:不可变 Event 保存证据,Claim 可被新信息修正,并以有效时间和记录时间解释历史。它还把去重、来源准入、衰减和显式遗忘放进默认链路,为需要中文检索和本地部署的 Agent 提供了一套具体取舍。
AI 使用心得:B 端产品工作中的方法、边界与实践
京东技术的 B 端实战将 34 个人日的需求工作压缩至 15 个人日,并把经验归纳为背景输入、AI 反问、Skill 初稿和人工复核的循环。文中用支付、收银和接口对接案例说明:AI 擅长整理、暴露遗漏与生成可讨论版本;流程边界、异常规则和最终责任仍须由人确认。
AI 研究者讨论递归自我改进究竟有多近
Dwarkesh Patel、Beren Millidge、John Schulman 与 Charlie O’Neill 讨论扩展、强化学习和研究自动化能否带来递归自我改进,并拆解可能阻断它的泛化、评估和现实学习瓶颈。
Google 发布多智能体最佳实践
Google Research、DeepMind 与 MIT 联合研究用 260 个受控配置证明,多智能体效果取决于任务结构是否适合分工,而非模型强弱,并给出三条可查询判据与智能体数量最优值约束。
快速扩展在线存储以服务超过 10 亿 ChatGPT 用户
OpenAI 工程团队解释了他们如何将基于 Python 的在线存储平台 Habitat 从一个简单的客户端库,扩展为一个处理每秒超过 70M 次请求、存储超过 500PB 数据,并为超过 10 亿周活跃 ChatGPT 用户提供服务的分布式系统。
衡量 AI 在情报定位与常规武器领域的能力
Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。
推出面向金融服务的 ChatGPT
OpenAI 推出面向金融服务的 ChatGPT,集成内置金融数据、公司专属模板与 GPT-6 Astra 推理能力,为金融机构自动化研究、财务建模和客户交付物。
如何构建自评估 AI 系统:用于 LLM 应用的自动化测试和评估管道
本文介绍了如何构建一个三层评估管道——确定性检查、LLM-as-judge 评分和定期人工审查——来可靠地测试和监控 LLM 应用,包括回归测试和统计显著性分析。
2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍
基于 AI Agent 的智能诊断系统通过配置驱动的并发取数、规则+LLM 双通道标签、分层决策 Trace 与 SSE 实时推送,将工单处理时间从 2-3 分钟压缩到 20-40 秒,实现 3-9× 提效。