有些公司的 AI 转型,像健身房年卡。
买的时候热血沸腾,PPT 上肌肉线条清晰;三个月后真正在动的,可能只有付款记录。
7 月 19 日,Simon Willison 转发了 Nik Suresh 的一篇文章,里面有个很刺眼的场景:Nik 说,他见过一位高管刚做完一份全公司围绕 AI 的技术战略,随后承认自己从来没用过 ChatGPT,也没用过任何 AI 工具。那家公司年收入超过 20 亿美元。
这类案例是匿名转述,不能当成行业统计。但它足够像很多会议室里的空气:所有人都在说 AI,真正上手的人反而最安静。
更荒诞的是另一个例子。有公司把 token 消耗做成排行榜,工程师为了保住位置,让 AI 去把一份 Go 仓库改写成 Zig,输出能不能用不重要,账单看起来很努力。
这就像公司要求员工每天走一万步,结果大家把手机绑到电风扇上。步数很感人,人没动。

AI 转型最怕演出来
企业想用 AI 很正常,麻烦出在另一件事:组织太急着证明“我们已经在用 AI”。
一旦“使用多少 AI”变成政治正确,指标就会开始变形。购买 Copilot 许可证可以叫转型,上线没人用的内部聊天机器人可以叫创新,token 排行榜可以叫 adoption。最后大家都很忙,只有业务结果没被叫到会议室。
合格的 AI 项目应该先问一个笨问题:它到底完成了什么工作。
OpenAI CFO Sarah Friar 7 月 17 日发了一篇文章,提出企业衡量 AI 投入的四个问题:AI 完成了多少有用工作;每个成功任务实际花多少钱;结果有多可靠;投入扩大后,每一美元是否换来更多工作。
这组问题有价值,因为它把讨论从“买了什么工具”拉回“交付了什么结果”。
一个客服机器人接了很多电话,却没有解决问题,只是把用户温柔地送进虚空,最后得到的是自动失联。一个 coding agent 生成很多 PR,却大部分不能合并,最后得到的是代码烟花。
真指标要防刷
企业要避免 AI 表演化,可以先看四件事。
第一,任务有没有“完成”的定义。合同审完、工单解决、代码过测试,这些才算工作结果。
第二,成本算不算失败和返工。便宜模型跑十次、人审三轮,不一定比贵模型一次成功更省钱。
第三,可靠性有没有分层。哪些结果可直接使用,哪些需要修正,哪些必须升级给人处理,这比单一准确率更接近真实工作。
第四,指标能不能被刷。token、调用次数、使用时长,都是很容易被电风扇带着跑的数字。真正该看的,是成功任务和业务结果。

AI 当然会改变工作。但越是重要的投入,越不能只靠口号推动。
团队如果真的想用 AI,第一步可以很小:挑一个具体流程,定义完成标准,算清成功任务成本,再看它能不能稳定复用。
AI 转型最怕的是演得太像真的。演久了,账单会当真,业务不会。
