EP151 · 搜索语义表征、Token 分工、数据评测产品 · 08-21 早报
本期导语
美团搜索三期实践给出一条很实在的表征工程路径:难负样本、简化 Prompt、覆盖率与统计特征,哪个环节都不能省。另一边,硅谷 101 讨论本地开源模型和云端前沿模型如何按任务分工,YC Paper Club 则把数据、环境和评测当作持续维护的产品。三篇分别适合排序工程、Agent 成本和评测体系的读者进入。
本期内容
50 条美团搜索 3.0:LLM 语义表征在排序模型的探索与应用
美团搜索团队用三期线上实践,把 LLM 语义表征从单点相似度特征推进到 Query、POI、Deal 联合建模,再迁移到下挂精排。最有复用价值的是工程判断:难负样本决定判别力,Embedding Prompt 应做减法,跨场景复用先查覆盖率,语义信号仍要与统计特征协同。
E249|Token 经济转点:OpenClaw、Hermes 到本地自研的 Agent 进化之路
黄东旭以重度 Agent 用户和数据库创业者的实践,复盘从最强模型、多智能体互审,到本地开源模型与云端前沿模型分工的变化;张宏江则把成本下降与用量增长放进产业周期。节目真正有用的提醒是:Token 效率不是少调用,而是让模型能力、任务难度、数据与 Harness 各就其位。
深入数据:YC Paper Club 探讨 AI 的数据、评测与智能体环境
YC Paper Club 把数据问题拆成四个可操作层面:从误报和漏报反查缺失信息,用弱监督放大专家判断,以更真实的任务和验证智能体评估代码,再通过实测选择多语训练配比。共同结论是,数据集、环境和评测 Harness 都要像产品一样持续维护;这比继续追逐已饱和基准更接近生产改进。
具身智能展会最热的一年,肉眼难见机器人的进化?
本文深度复盘 2026 世界机器人大会,揭示人形机器人出货量激增背后的「泛化能力不足、数据稀缺、商业化路径分化」三大核心瓶颈,指出行业正处于从「演示阶段」向「通用落地」跨越的关键阵痛期。
微调模型正在变成技术债:50 倍 ROI 背后的脆弱系统|Lease End
Lease End 的数据科学家复盘了一个盈利的微调意图分类系统如何变得脆弱昂贵,以及技能、工具与上下文为何能带来更快修复和更低总成本。
给 Agent 做“CT”:大规模 Agent 的可观测与质量保障体系
火山引擎技术负责人钱世俊在 QCon 2026 分享如何构建统一观测基座,实现大规模 Agent 的白盒化透视、根因定界与观测-评测-优化的工程化闭环。
OpenAI 推出 AI Futures 研究项目
OpenAI 的 AI Futures 博客通过历史视角探讨如何平衡 AI 力量与个人能动性。
MiniMax Design:从操作像素,到操作语义和表达意图
MiniMax 发布 MiniMax Design,一款基于自研多模态视频模型 H3 的 Agent 驱动创作工具,将多模态生成能力组织进从分镜到成片的完整商业内容生产流程。
解锁智能体自主性:面向 AI 原生系统的安全运行时|Docker
Docker 认为,智能体自主性的关键不再是模型智力,而是以 microVM 沙箱、即时收敛权限和意图校验构成可移植的安全运行时。
Claude Code 面向初创公司的实战指南
本指南基于对十几家快速增长的初创公司的访谈,提炼出五条规则,涵盖如何用 Claude Code 实现全员交付、自动化繁琐工作、验证输出、为变化而构建,以及从原型走向生产。