正在刊行长文 · Essay
2026-08-05所有内容
随机比特 · Random Bits

便宜 Coding Agent 的关键,不是模型便宜,是上下文别乱动

2026-08-05AI Engineering / Systemsrbits.uk
便宜 Coding Agent 的关键,不是模型便宜,是上下文别乱动

Reasonix 项目方自述的一个公开单日样本里,同一批输入在缓存后约 1.38 美元;如果没有缓存,约 61.06 美元。差距不在模型名称,而在同一份上下文是否反复冷启动。

在终端里让编程代理继续改一个小函数,操作上像是接着上一轮做,计费系统未必如此处理。第一轮打开仓库时,项目说明、系统提示、工具说明、历史文件和测试输出都要送进模型。若后续回合不能复用这些内容,系统会在第二轮、第三轮反复发送同一份任务背景。

prefix cache,即前缀缓存,解决的正是这个问题。同一份任务背景,不应在每一轮重复计费。

终端 Agent 的 prefix cache 成本结构

缓存命中依赖稳定的上下文前缀

DeepSeek 的上下文缓存默认开启,但后续请求必须完整匹配已经保存的缓存前缀,才能按缓存计算。DeepSeek 文档给出命中规则,Reasonix 样本给出成本量级。两者合在一起,指向同一个工程要求。客户端必须稳定组织上下文。

编程代理的风险在于,每轮都会重新拼接工具说明、历史消息和临时状态。工具结果顺序变化,工具说明重新生成,临时推理写回下一轮,都会让开头漂移。界面上仍是同一个会话,缓存层看到的可能已经是新输入。

此前把低成本模型接入多代理 worker 时,问题也先出在交付过程。任务跑偏,等待变长,需要更强模型打断和纠偏。单次调用便宜,不等于单位合格结果便宜。

Reasonix 的做法是拆开上下文。固定材料在会话开始后不改,历史记录只追加,临时草稿和推理过程不发给上游,也不污染下一轮开头。

长会话编程代理的成本开关,在于客户端能否稳定复用同一份上下文。

选型应先核查上下文复用

该样本当天约 4.35 亿输入 token 命中缓存,缓存命中率为 99.82%。

当天怎么计费 大约花费
大部分上下文复用了缓存 1.38 美元
每轮都当作新输入计算 61.06 美元

这只是一组项目方样本,不能当作通用评测,也不能证明某个代理一定更强。它只说明一个更窄的问题。模型单价之外,客户端怎样组织上下文,会直接改变账单。

选择或自建终端编程代理时,可以先打开一段长会话日志,看三项证据。每轮是否记录缓存命中,固定材料是否有稳定序列化或 hash,大型测试日志是否先摘要再进入上下文。

这三项能回答同一个问题。同一份背景是在复用,还是每轮冷启动。先看这些记录,再比较模型单价。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。