过去看模型发布会,很像看学霸晒成绩单:代码多少分、数学多少分、又领先对手几个百分点。
GPT-5.6 这次却把试卷翻了过来,开始做一道财务题:
一美元,到底能买到多少真正完成的工作?
OpenAI 把它称为「Useful Intelligence per Dollar」。这里比较的不是 Token 单价,而是一次任务成功交付的总成本:调用了多少次模型、消耗多少 Token、花了多久,以及最后需不需要人类返工。
GPT-5.6 的效率设计大致分成三层。
第一层是模型分工。Sol、Terra、Luna 分别覆盖高难任务、日常工作和高频低成本场景。不是所有问题都派最强模型上场,而是让不同价格的「员工」做适合自己的活。
第二层是推理预算。简单任务少想一点,困难任务再开 max;跨轮任务则复用之前的推理状态,避免每次都从头读题。智能不再只有「开」和「关」,而是像云服务器一样按需分配。
第三层是 Agent 工作流。模型可以用程序处理工具返回的大量中间数据,只把真正有用的部分送回上下文,从而减少无意义的往返。最难的任务才启动多 Agent 并行,用更多计算换更高成功率和更短等待时间。
这背后真正重要的变化是:
模型的竞争单位,正在从「回答一次」变成「完成一件事」。
便宜模型如果连续失败三次,还要人类擦屁股,并不便宜。昂贵模型如果一次完成、无需返工,反而可能更省钱。
所以,以后评估模型,别只看榜单,也别只看每百万 Token 的价格。拿一百个真实任务跑一遍,记录成功率、总费用、耗时和人工返工量。
跑分决定模型能不能上牌桌,每美元有效智能,才决定谁最后买单。
参考资料:
OpenAI:《A scorecard for the AI age》
https://openai.com/index/a-scorecard-for-the-ai-age/
OpenAI:《GPT-5.6: Frontier intelligence that scales with your ambition》
https://openai.com/index/gpt-5-6/
OpenAI:《Model guidance》
https://developers.openai.com/api/docs/guides/latest-model
