正在刊行早报 · Morning Brief
2026-10-02所有内容
随机比特 · Random Bits

LangChain 九成任务不用最强模型,成本中位数降了 64%

2026-10-02AI Engineering / Systemsrbits.uk
LangChain 九成任务不用最强模型,成本中位数降了 64%

LangChain 在 973 个编程任务会话中测试模型路由:九成分配给较便宜的模型,每个会话的成本中位数从 2.61 美元降到 0.94 美元,代码合并率没有显著变化。这个实验提醒团队:每次都用最强模型,可能只是花得更多。

🚀 模型能力与训练突破

• Gemini 4 Argon 扩大输出上限 —— Google 将输出上限从 6.4 万扩至 100 万 token,支持更长的连续推理与任务执行。目前先向受信任的网络防御团队开放,普通开发者仍需等待。官方说明

• Context Language Models:让模型自己整理上下文 —— 论文把上下文变成模型可编辑的文件,让它决定保留什么。作者在 12 小时 EdgeBench 任务中报告得分提高 5%、计算量减少 59%;长期任务值得测试“记什么”,不只扩窗口。论文摘要

• Olmo-core 3 开放 MoE 训练基础设施 —— Ai2 在八张 B300 的初步测试中,将 470 亿参数 MoE 的训练吞吐提升至旧实现约 2.7 倍。关键改动是让专家权重留在 GPU 上,减少反复搬运;这是训练框架升级,并非新模型发布。工程说明

🛠️ 开发工具与成本控制

• LangChain 公布模型路由实测 —— 路由组成本中位数降低 64%,代码合并率未出现统计显著差异;全部使用便宜模型的另一组测试,却因质量问题提前停止。省钱要按任务分配模型,不能统一降档。实验全文

• OpenRig 组织持久的编程 Agent 团队 —— 项目用角色、固定地址和任务归属组织 Claude Code、Codex 与 Pi,并提供状态快照与恢复。对多 Agent 协作而言,谁负责、交接什么,比多开几个终端更关键;本期关注来自热榜,非当日首发。项目文档

• Photo Scrubber:照片隐私处理留在本地 —— Simon Willison 用 GPT-6 Astra 构建实验工具,通过浏览器中的 WebAssembly 与人脸检测模型模糊陌生人的面部。小工具的价值很具体,但自动检测仍需人工检查漏检。作者说明

🚨 自主执行与企业落地

• OpenShell 在运行环境中限制 Agent 权限 —— NVIDIA 项目通过沙箱和运行时检查约束文件、系统调用与网络访问,真实凭据只注入发往获准端点的请求。权限边界由系统执行,比只让模型“遵守规则”更可控;热榜升温不代表今日发布。项目文档

• Dots 全天待命,主动研究采用只读工具 —— OpenAI 的助手可跨项目持续工作,但后台主动研究不能发消息、修改应用内容或控制电脑。这里值得关注的是权限分层:主动发现问题,与获准采取行动,是两种能力。官方说明

• Barclays 扩大 Claude 合作 —— 银行预计年底让 50% 的开发者采用 Claude Code;这是部署目标,尚非完成比例。合作公告还披露邮件处理平台每日处理约 12 万封邮件,具体业务流程比“全员拥抱 AI”更值得跟踪。合作公告

📚 延伸阅读

• LangChain:How to Build a Model Router in the Harness
https://www.langchain.com/blog/how-to-build-a-model-router-in-the-harness

• Rulin Shao 等:Context Language Models
https://arxiv.org/abs/2609.37725

• Ai2:Introducing Olmo-core 3
https://huggingface.co/blog/allenai/olmocore3

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。