正在刊行长文 · Essay
2026-09-04所有内容
随机比特 · Random Bits

让 AI 像原始人一样说话:这个看似搞笑的 Skill,凭什么砍掉了 65% 的 Token 账单?

2026-09-04AI Engineering / Systemsrbits.uk
让 AI 像原始人一样说话:这个看似搞笑的 Skill,凭什么砍掉了 65% 的 Token 账单?

在终端里用 Coding Agent 排查一个空指针报错,明明只需要修改一行可选链,模型却往往先吐出两句热情洋溢的开场白:“当然可以!非常乐意为您解决这个问题。我仔细检查了代码库,发现在用户鉴权模块中存在一个逻辑漏洞……”,接着在终端里大段重写整段函数,最后还不忘附上三句贴心的安全提示。

看着光标在命令行里慢吞吞地一行行吐字,开发者除了等待别无他法。到了月底查看 API 账单,不少团队更是困惑:明明每天只提交了有限的代码变更,为何消耗的预算会如此惊人?

大模型最昂贵的从来不是思考过程,而是那些毫无信息增量的礼貌客套与长篇客服腔。

被忽视的输出端三重代价

大模型在出厂阶段经过大量的强化学习与安全对齐,被深度植入了过度礼貌的交际习惯。这种设定在网页端充当通用问答助手时表现得温和友好,但一旦被部署进高频、长周期的软件开发流水线,这些多余的废话就会演变为沉重的系统性负债。

这种负债体现在物理与财务的三重约束上。首先是极为悬殊的定价结构。在当前主流商业模型的计费规则中,输出 Token 的单价普遍是输入 Token 的三到五倍。模型每说一句客套的废话,消耗的成本都在以高倍率成倍放大。

其次是不可逾越的生成延迟。大语言模型的输入阶段可以通过并行矩阵运算实现快速预填充,哪怕传入数万字的项目背景也能在几百毫秒内解析完成;然而输出阶段属于自回归计算,必须逐字串行生成。每一句没有技术实质的客套开场与礼貌收尾,都会让终端前等待的工程师多耗费数秒的串行等待时间。

更严重的问题在于多轮交互中的上下文污染。在长会话工作流中,前序轮次输出的所有文本都会作为历史记录自动滚入后续调用的输入端。这意味着第一轮生成的客套话,在后续数十轮交互中会被反复计费并占用宝贵的上下文窗口。注意力资源被大量无意义的虚词稀释,最终导致模型遗忘最初立下的关键架构约定。

输出 Token 在成本、延迟与注意力维度的三重代价

用原始人语体消灭过度礼貌

开源社区近期引发热议的项目 caveman,用一种近乎极客幽默的方式击中了这个工程痛点。该方案通过为编码智能体注入一套极致精炼的角色约束,强制模型模仿电报体甚至原始人语调进行技术沟通。

系统要求模型彻底剥离所有的问候语、抱歉词以及转折连词。面对相同的空指针修复请求,模型不再输出任何社交客套,而是直接收敛为高密度的核心事实。例如仅输出报错位置、修复方案与执行测试结果,用四个最核心的技术锚点代替原本长达数百词的漫长对话。

这种看似极端的语体改造在工程评测中展现出了惊人的效率收益。在十组针对复杂代码库的标准测试与重构任务中,由于模型无需再分心生成冗长的自然语言包装,任务完成的逻辑准确率与单项测试通过率丝毫没有下降。

实测数据显示,极简约束让单轮交互中的输出 Token 从平均四百余个暴降至一百四十余个,综合降幅高达百分之六十五。不仅直接砍掉了近三分之二的最高单价计算开销,更让模型的注意力紧紧聚焦在变量、行号与逻辑断言等高信息密度的要素上。

客服腔废话与极简结构化输出的信息密度对比

工业级研发的输出压缩规范

幽默的原始人语体揭示了一个严肃的工程原则:在自动化研发流水线中,智能体的沟通必须从自然语言漫谈走向确定性的结构化收敛。团队无需生搬硬套幽默的词汇规则,而应在工程层面建立严谨的输出压缩标准。

一套成熟的智能体输出契约应当强制规范四个基本要素。第一是原子动作,清晰标明是新增、修改还是删除;第二是绝对路径,精确指示变动发生的文件;第三是变更锚点,精确到具体的代码行号与方法签名;第四是工程原因,用一句话阐明变动背后的物理动机。除了这四项必要信息与必要的代码补丁之外,严禁模型生成任何总结性寒暄。

通过在团队统一的智能体配置文件中植入此类输出压缩规范,工程师不仅能够显著压降每月的模型调用账单,更能让终端交互恢复干脆利落的响应速度。更关键的是,整洁精炼的会话历史保护了上下文窗口的纯净度,让长周期、高难度的系统级重构不再受困于早期的注意力稀释。

大模型的智能水平体现在对复杂逻辑的推导深度,而非堆砌文字的篇幅长度。把 AI 当作需要情感抚慰的客服,往往只会得到平庸而昂贵的代码;将其约束为沉默高效的工程工具,才是工业级研发落地应有的姿态。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。