正在刊行长文 · Essay
2026-09-01所有内容
随机比特 · Random Bits

AI 月趋势:长任务交付的胜负手,正从模型跑分转向状态机

2026-09-01AI Engineering / Systemsrbits.uk
AI 月趋势:长任务交付的胜负手,正从模型跑分转向状态机

2026 年 8 月下旬,我把一套跨越需求分析、代码修改、配置迁移与多平台分发的自动化 Agent 管线,从主力旗舰模型整体切换到了当周最火爆的低价模型路线。

从单价上看,输入每百万 Token 只要一毛多钱,相比此前下降了超过 80%,榜单上的单步编程测试分数甚至追平了几个月前的顶级基准。

然而,在接下来的真实批处理任务中,整个系统经历了一场意料之外的成本失控:任务总是在执行到第 12 步左右突发中断。由于旧架构缺乏细粒度的状态检查点,系统在捕获异常后,选择将几十 KB 的报错堆栈直接回填到对话历史中“让大模型再试一次”。随后,参数缺失、字段漂移、下游 SDK 自动重试与并发分支连环触发,原本便宜的单次调用被放大了 3.4 倍的总账单,甚至险些对已经完成扣费的外部接口触发二次重复调用。

那一刻的工程反差极其尖锐:单步生成的“聪明”正在以惊人的速度降价,但在长达数十步的连续工程链路上,系统交付的“确定性”却变得前所未有的昂贵。

过去这一个月的 AI 行业,表面上是各大模型厂商在极低价格、超大上下文和更高跑分上的极限内卷;但若深入到真实的工程落地现场,就会发现真正的系统瓶颈已经彻底转移:决定一项复杂工程任务能否交付的,不再是模型在单次 Prompt 里的峰值智力,而是系统在长程运行中的状态可恢复性与契约确定性。

这就是 2026 年 8 月份复盘最核心的技术判断。

行业纵览:单步智能的极限降价与长程链路的概率衰减

如果把 2026 年 8 月的模型发布连起来看,会发现单步智能的供给已经进入了工业化过剩阶段。

8 月 26 日,智谱正式公开了此前在 OpenRouter 匿名霸榜的 GLM-5.3-Flash。这款 320B 总参数、18B 激活的混合专家模型(MoE),不仅支持 100 万 Token 的全模态上下文,并以 MIT 协议开源权重,其 API 定价更直接压低至输入每百万 Token $0.15、输出每百万 Token $0.50,官方公布日均承载算力突破 100 万亿 Token。

紧接着,DeepSeek 在 8 月 13 日正式推出 DeepSeek-V4-Pro-0813 商用版本,不仅具备 100 万上下文与 87.9 的 Terminal-Bench 2.1 表现,更以开源形式推出了配套的 DeepSeek Harness v0.1,标志着模型厂商从单纯交付权重文件,转向直接下沉交付外围交互工作壳;OpenAI 亦在 8 月 26 日正式从 ChatGPT 下线 o3 选项并下调 API 定价,全面推动用户向 GPT-5.5 与 o3-pro 迁移。

在主流基准测试中,SWE-bench Verified 的头部分数已被刷新至 96%,Terminal-Bench 2.1 也逼近 90%。这意味着,对于任意一个单点函数编写、局部 Bug 修复或单轮命令调用,现代模型几乎拥有了接近人类高级工程师的即时表现。

但许多研发团队很快发现了一个反直觉的工程现实:单步得分 95% 的大模型,在 20 步的长程工程任务中,端到端成功率往往不足 36%。

其背后的数学逻辑非常朴素。假设一个复合长任务由 20 个具备顺序依赖的子步骤构成(包括依赖检查、语法重构、环境搭建、数据迁移、测试校验和外部发布)。即便模型在每个单步的独立成功率高达 95%,整条链路在无外界干预下的总成功率仅为 (0.95^{20} \approx 35.8%);如果换成单步成功率 88% 的轻量低价模型,20 步之后的端到端存活率将直接暴跌至 (7.8%)。

在单步调用场景下,失败只是一次对话报错;但在长程自动化系统中,单步失败如果缺乏隔离与拦截,就会产生三种致命的连锁破坏:

单步智能无法对抗概率的连乘衰减。当单步推理变得极其廉价时,真正卡住生产力落地的,是长程链路的“下限保护能力”。

现场实测:崩溃恢复与低价模型的隐形契约成本

为了彻底厘清长任务崩溃与恢复的底层机理,我在隔离测试环境下设计了一组受控对照实验。

实验模拟了一个包含五个典型阶段的长程工程流水线(信息探索、内容草拟、外部写操作、合规审核、最终归档),并在流水线的第 3 步之后与第 4 步执行中,刻意注入了两次真实的进程级硬崩溃。

模式指标 Naive 对话累加模式 Checkpoint 状态机模式 工程差异对比
状态载体 全量 Message 历史追加 磁盘结构化不可变回执 状态与对话彻底解耦
崩溃恢复逻辑 模型重读全文自主瞎猜 提前终止守卫零开销跳过 毫秒级断点自愈
外部写操作次数 3 次(重复执行 2 次) 1 次(精确幂等执行) 彻底消除重复副作用
上下文 Token 消耗 33,070 Tokens 1,750 Tokens 降低 94.7% 消耗
LLM 唤醒次数 10 次 5 次 减少 50% 调用次数
确定性断言通过率 失败(状态与回执漂移) 25 / 25 全部通过 工业级确定性保障

第一组对照采用目前行业常见的 Naive 对话累加模式:系统没有独立的状态机,完全依赖将历史对话一路追加并在重启后重新读取上下文,让大模型自主推断“当前进行到了哪一步”。

结果极其惨烈:由于历史对话中充斥着前序阶段的思考过程与崩溃日志,大模型在两次重启后产生了严重的上下文理解漂移,不仅先后唤醒了 10 次大模型推理,累积消耗了 33,070 个上下文 Token,更在第三阶段将已完成扣费的外部操作重复执行了 2 次(总计调用 3 次)。如果这是真实的生产支付或发布环境,已经引发了灾难性的重复操作。

第二组对照采用 Checkpoint 状态机模式:系统将业务状态彻底从对话历史中剥离,采用无状态的纯函数调用,并在每个关键阶段落地不可变的动作回执(Action Receipt)与原子状态检查点(Checkpoint)。

在相同的两次硬崩溃注入下,系统在重启瞬间直接读取磁盘上的结构化回执,利用提前终止原则(Early Termination)在毫秒级自动跳过前序已完成的步骤。最终,系统仅唤醒 5 次模型调用,消耗的上下文 Token 恒定在 1,750 个(相比前者下降 94.7%),外部写操作精准执行 1 次且 0 次重复,25 项确定性断言全部一次性通过。

与此同时,我们在 8 月底针对低价模型(如 GLM-5.3-Flash 与轻量 Mini 路线)的实测也揭示了另一个关键事实:廉价模型的真正成本,不在于单价,而在于“契约稳定性”。

低价模型在执行单一问答时表现优异,但在需要严苛遵循 JSON Schema、工具调用参数契约或复杂文本渲染状态(如 Draft.js 树状结构注入)时,会出现约 18% 的契约格式微漂移(例如遗漏非核心字段、在 JSON 外部包裹多余 Markdown 标记、字段大小写变异)。

在缺乏前置契约拦截的系统中,这种微小漂移不会立刻报错,而是会顺着链路流向下游工具,导致下游解析崩溃,进而触发 3 层以上的重试机制。最终计算下来,原本单价便宜 80% 的模型,由于长链条上的契约违约与重试损耗,综合交付成本反而比直接使用高确定性的旗舰模型高出数倍。

这证明了一个冷酷的工程结论:在长程任务中,没有经过契约门禁保护的低价模型,不是成本优化,而是隐形负债。

架构演进:支撑长程交付的四层确定性底座

如何把一个脆弱的、依赖概率的 Prompt 长链条,改造成一个工业级可靠的长程交付系统?

综合 8 月份的学术前沿(如 arXiv:2608.12476 提出的受控持久化记忆 GPM,以及 arXiv:2608.12761 提出的因果状态层 Matrix)与一线工程实战,长程 Agent 架构必须建立四层确定性底座:

第一层底座:状态与对话解耦的不可变回执账本(Receipt Ledger)。 绝不能将大模型的 message history 当作系统的持久化状态。对话只是临时的通信管道,随时可能被压缩、被遗忘或被污染。所有产生外部影响的操作,必须在落地时生成一份与模型解耦的、机器可读的不可变回执,记录全局唯一的幂等键、时间戳、状态哈希与下游系统返回凭据。只要回执账本存在,外部世界的真实事实就不会被篡改。

第二层底座:具备提前终止能力的 Checkpoint 状态机。 长任务必须被切分为离散的阶段与明确的状态转移守卫。每个阶段在启动前先执行提前终止检查:读取回执账本,若发现当前阶段已被满足,则立刻跳过模型调用与重复执行。这不仅消除了重启时的重复副作用,更将每次恢复的上下文开销压缩至当前单步,赋予系统极速自愈能力。

第三层底座:契约门控路由(Test-Gated Routing)。 在模型调度上,让低价模型充当试探者,但在其输出接入真实系统调用前,必须通过一层毫秒级的轻量 Schema 校验与逻辑断言。一旦检测到契约漂移,控制面立刻执行熔断并将任务升级至高阶确定性模型,严禁在已被污染的错误上下文内原地盲目重试,彻底封死重试风暴。

第四层底座:物理级别的失败域隔离(Failure Domain Isolation)。 多 Agent 协同的本质不是通过 Prompt 让一个模型分饰多角,而是构建相互隔离的物理失败域。正如 8 月份 MCP 2026-07-28 规范推行无状态核心(Stateless Core)以及 Claude Code 推出子会话独立分叉(Subagent Forking)所体现的,每个子 Agent 必须拥有独立进程、独立文件作用域与独立上下文,杜绝脏状态横向蔓延。

决策指引:面向长程任务的工程路线调整

基于上述证据与技术演进,对于正在推进 AI 落地的团队与管理者,接下来的技术路线应当做出三个坚决的调整:

第一,停止为 1% 的单步跑分差异而频繁重构系统,把工程预算优先投入到状态机、回执与断点恢复能力的建设上。 裸模型的单步提升已经边际递减。决定最终交付质量的是外围系统的状态持久化设计。如果底层仍然使用全量累加对话做状态管理,接入再新的模型也依然会在长任务中频繁崩溃。

第二,将团队的成本与效能考核指标,从“Token 单价与调用次数”转向“长程任务交付率与单位交付总成本”。 单纯追求低 Token 单价是局部的虚假繁荣。真正决定 ROI 的分母是最终成功交付且无需人工返工的任务数。将循环放大系数、重试次数、契约违约率与人工接管率纳入核心监控看板,才能看清真实的系统总成本。

第三,坚决执行“控制面去智化”,用确定性代码与不可变规则约束非确定性模型。 Agent 系统的控制面越是试图让大模型通过自我反思来管理流程,系统越容易陷入混沌。大模型只负责在受控沙箱内产出候选决策,而路由、拦截、状态转移、重试限制与权限边界,必须全部交由确定性的状态机代码严格执行。

2026 年 8 月的技术演进给出了一个清晰的信号:

单步生成的智能已经走下神坛,变成了廉价而充沛的日用电力。

而真正拉开工程团队差距的,是谁能用严密的契约、状态机与失败域,在这座充满随机性的电力之上,建造出永不坍塌的确定性高楼。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。