正在刊行长文 · Essay
2026-07-30所有内容
随机比特 · Random Bits

谁能让一美元干更多活,谁才算赢。

2026-07-30AI Engineering / Systemsrbits.uk
谁能让一美元干更多活,谁才算赢。

过去看模型发布会,很像看学霸晒成绩单:代码多少分、数学多少分、又领先对手几个百分点。

GPT-5.6 这次却把试卷翻了过来,开始做一道财务题:

一美元,到底能买到多少真正完成的工作?

OpenAI 把它称为「Useful Intelligence per Dollar」。这里比较的不是 Token 单价,而是一次任务成功交付的总成本:调用了多少次模型、消耗多少 Token、花了多久,以及最后需不需要人类返工。

GPT-5.6 的效率设计大致分成三层。

第一层是模型分工。Sol、Terra、Luna 分别覆盖高难任务、日常工作和高频低成本场景。不是所有问题都派最强模型上场,而是让不同价格的「员工」做适合自己的活。

第二层是推理预算。简单任务少想一点,困难任务再开 max;跨轮任务则复用之前的推理状态,避免每次都从头读题。智能不再只有「开」和「关」,而是像云服务器一样按需分配。

第三层是 Agent 工作流。模型可以用程序处理工具返回的大量中间数据,只把真正有用的部分送回上下文,从而减少无意义的往返。最难的任务才启动多 Agent 并行,用更多计算换更高成功率和更短等待时间。

这背后真正重要的变化是:

模型的竞争单位,正在从「回答一次」变成「完成一件事」。

便宜模型如果连续失败三次,还要人类擦屁股,并不便宜。昂贵模型如果一次完成、无需返工,反而可能更省钱。

所以,以后评估模型,别只看榜单,也别只看每百万 Token 的价格。拿一百个真实任务跑一遍,记录成功率、总费用、耗时和人工返工量。

跑分决定模型能不能上牌桌,每美元有效智能,才决定谁最后买单。

参考资料:

OpenAI:《A scorecard for the AI age》
https://openai.com/index/a-scorecard-for-the-ai-age/

OpenAI:《GPT-5.6: Frontier intelligence that scales with your ambition》
https://openai.com/index/gpt-5-6/

OpenAI:《Model guidance》
https://developers.openai.com/api/docs/guides/latest-model

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。