EP193 · Claude 拓展科研方法|DHH 宣布告别手写代码|Tessl 核算软件工厂成本
登录后会回到当前阅读位置,不会自动订阅。公开期次现在即可阅读。
本期导语
Claude 辅助科研、DHH 告别手写代码、Tessl 核算成本:理解 AI 协作的验证与收益。
本期内容
20 条Claude 时代的科学
Schwartz 借助 Claude 构建 BootLoops,把物理学计算方法迁移到生态学和遗传学。模型能找到技术上成立的跨领域联系,领域专家则帮助把结果推进为有科学意义的问题。读者可据此理解如何选择适合 AI 的任务,把精确计算、工具积累与人的研究判断组织成协作流程。
每日脉动:RoR 作者再次引发‘手写代码终结论’辩论
DHH 宣布 37signals 将手写代码变为例外,并开始开发原生移动应用、迁移部分后端到 Rust。Gergely Orosz 把这一转向与工程师负担、软件质量问题放在一起讨论,提出建设验证系统和生成确定性工具的方向。读者可从中重新判断代码生成普及后,工程责任与能力应落在哪里。
600 美元的 PR:软件工厂的投资回报究竟来自哪里
修改与审查智能体反复往返,让 Tessl 一次 PR 花掉约 600 美元。研究负责人 Rob 从这次经历谈任务边界、验证和反馈,并用队列形式化建模与审查实验说明收益来自整套流程。把重试、基础设施和人工注意力计入成本,才能看清软件工厂值得优先改进的环节。
如何在 Harness 中构建模型路由器
LangChain 在 Open SWE 智能体 Harness 内构建了模型路由器,对每项任务进行分类并选择最低成本的合适模型,将编码线程的中位数成本降低了 64%,且质量变化可忽略不计。
Airbnb CEO Brian Chesky:AI 如何改变旅行产品,以及优秀人才为何更有优势
Airbnb CEO Brian Chesky 解释了 AI 搜索、服务市场和更快的产品交付,并认为当人人都能用上相同工具时,判断力与品味会变得更重要。
Introducing Olmo-core 3: 为大规模 MoE 设计的开放、可扩展训练基础设施
Olmo-core 3 提供开放的大规模 MoE 训练基础设施。团队在初步的八块 B300 配置中测得吞吐量较前代提升 2.7 倍,并公开技术报告,记录专家路由、通信与内存管理的取舍;这是系统基准结果,不是已经训练好的万亿参数模型。
Cohere 发布 Embed 5:新一代嵌入模型的检索与多语言表现
Cohere 发布了 Embed 5,这是一个包含 Pro 和 Fast 版本的全新嵌入模型系列,专为搜索和智能体工作流设计,并在金融基准测试中表现卓越。
NVIDIA 推出 DOCA 智能体技能,加快 BlueField 应用开发
NVIDIA 推出了 DOCA Agent Skills,这是一个标准化框架,旨在为 AI 智能体提供领域知识和架构约束,从而加速在 BlueField DPU 上的应用开发。
构建 Gateway API 数据平面:Envoy Gateway 与 Airlock 的幕后设计
两位 Gateway API 实现者结合 Envoy Gateway 和 Airlock Microgateway,解释代理部署、集群映射、xDS 更新和扩展机制各自的取舍。
为什么真正的智能远不止是优化 | Aeon 随笔
文章指出,将智能定义为优化复兴了休谟关于理性是情感奴隶的观点,而康德提出的理性即自主这一更丰富的内涵,才是将人与工具区分开来的关键。
Braşov 还是 Brașov?15 个大模型写对我的城市名,直到你先写错
一项基于 Kaggle 的基准测试通过代码点评分法对 15 个大模型进行评估,结果显示它们能正确书写罗马尼亚语 ș/ț,但会如实复制输入中的遗留 cedilla 字符 ș/ţ,而单一的系统提示规则可将准确率从 64% 提升至 96%。
When Every AI Agent Action Is Authorized—and the Overall Decision Is Still Wrong
Exploring the governance challenges of AI agents like Meta's Muse, highlighting how individually authorized actions can still lead to outcomes that drift from user intent.
使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆
本指南详细介绍了如何在 Amazon EKS 上使用 NVIDIA NeMo Agent Toolkit,将 Amazon S3 Vectors 实现为多智能体 AI 系统的持久记忆层。
利用 Docling 将混乱文档转换为结构化数据
本文介绍了由 IBM Research 开发的开源工具包 Docling,它可以将 PDF 和图像等复杂文档转换为适用于 AI 和 RAG 流水线的结构化表示形式。
GitHub - mourad-baazi/hotpath
Hotpath is a tool that records AI agent executions and compiles them into deterministic workflows to reduce cost and latency by only using LLMs for judgment.
Microsoft AI 模型已上线 Vercel AI Gateway
Vercel 与 Microsoft AI (MAI) 达成合作,将其先进的语音生成和实时转录模型引入其 AI Gateway。
AI 乌托邦与罕见病诊断:Joel Borgen、Daniel McKinnon 对谈
节目从 OpenAI 的产品与安全争议,谈到 Joel Borgen 的 AI 辅助小说,再进入 Daniel McKinnon 用基因组分析重新审视罕见病漏诊的实践。
在 AWS 上为 Claude Platform 实现多环境访问 | Amazon Web Services
本指南提供了在 AWS 上为 Claude Platform 建立多账户架构的逐步实现方案,通过不同的访问模式隔离生产和开发环境。
AI 如何释放而非取代我的创造力|Kelly A. Boesch
艺术家 Kelly A. Boesch 讲述她如何借助 AI,把个人创作的图像变成动画短片和原创歌曲,同时让自己的审美、歌词与情感意图始终居于创作核心。
推理拍卖:为什么争抢 GPU 优先权破坏 KV 缓存局部性
伯克利大学、TTIC 和 Google Research 的一篇论文表明,对大模型推理的无约束优先级拍卖破坏 KV 缓存局部性,使延迟上升多达 12 倍,因此作者提出了一种带有 VCG 支付的基数树约束拍卖,在保持缓存命中率的同时,获取约 80% 的福利收益。