正在刊行长文 · Essay
2026-08-13所有内容
随机比特 · Random Bits

AI 月趋势:模型越来越强,真正稀缺的却变成了“控制权”

2026-08-13AI Engineering / Systemsrbits.uk

我最近把几种 Coding Agent 配置放进同一组工程任务里测试。

最荒诞的一次,不是模型把代码写错了,而是工作根本没有开始:我指定了一条名为 grok-4.5-build 的模型路由,连续五次任务都在 5—7 秒内退出,工作区没有任何文件变化。终端只留下一句很朴素的报错:unknown model id

如果只看最终成绩,它是五战五败。但这显然不是模型能力的失败——系统甚至没有走到调用模型那一步。后来我换回默认的 Grok 路由,同一套环境里的六个任务全部通过公开和隐藏测试。

前后两组结果的差别,不是“智能”突然增长了,而是运行时绑定终于正确了。

那一刻我突然意识到,今天再讨论“哪个模型最聪明”,越来越像只看发动机马力选车。真正决定它能不能把人送到目的地的,是点火、变速、导航、刹车和仪表盘这一整套底盘:模型如何进入工作现场,拿到什么上下文和权限,怎样调用工具,失败后由谁重试,最后又用什么证据证明任务真的完成。

过去 31 天的 AI 新闻看似杂乱,底下其实都指向同一件事:

模型能力正在批量供应,能把 Agent 管住、算清、验明白的工程能力开始变贵。

这就是本期 AI 月趋势想讨论的“控制权”。

它不是让人频繁点击批准按钮,也不是把所有操作关进一个容器。它至少包括五件事:身份与权限控制、运行环境控制、整段行动轨迹控制、成本与重试控制,以及完成状态的证据控制。

谁能把这五件事做成基础设施,谁才有机会把模型能力稳定地变成生产力。

<!-- 配图建议:发动机与底盘。左侧是不断更换的模型,右侧是身份、运行时、轨迹、成本、验收五层控制面。 -->

先说明样本:这不是一张完整的行业排行榜

这次观察窗口是 2026 年 7 月 14 日到 8 月 13 日。

我整理了其中 23 天的每日知识条目,共 235 条候选事件,并回看了几组一手实验和项目草稿。资讯采集有日期缺口,所以本文不做“某类新闻增长了百分之多少”之类的伪统计,也不会把摘要里的产品名直接当成事实。

我采用的标准更简单:一条新闻只有回到官方发布、原始研究或可复现实验后,才允许支撑核心判断;一条趋势必须同时回答“它改变了什么工程对象”,而不只是“又发生了什么”。

按这个标准筛完,过去一个月真正连成线的,不是模型榜单,而是 Agent Plugins、Skills、Sandboxes、自托管 Runner、安全边界、上下文缓存、重试治理和任务验收。

看起来像八个话题,其实都是同一个问题:当模型开始连续采取行动,我们究竟靠什么控制它?

一、先复盘上个月:三个预判,只有一个半兑现

上一篇月趋势里,我做了三个判断。

第一,AI 技术栈会分裂成模型层、上下文层和信任层。第二,SDK 计费会催生模型路由和“模型网格”。第三,端侧 AI 会获得操作系统级战略地位。

一个月后回头看,第一条方向基本正确,但当时说得太抽象。

“信任层”没有先长成一份统一标准,而是分散地落进了更具体的工程对象:插件清单、技能目录、微虚拟机、网络策略、密钥注入、自托管执行器、行动日志、预算和验收记录。换句话说,信任不是在模型外面再包一层提示词,而是把 Agent 从启动到交付的整个生命周期变成可配置、可观察、可中止的系统。

第二条只对了一半。模型路由确实越来越重要,但我上个月高估了“换模型”在成本优化里的权重。真实 Agent 的账单不只由模型单价决定。循环多跑两轮、工具失败后重复提交、前端与后端各自重试、并发分支无人取消、上下文反复失效,都可能把一次便宜调用放大成一笔昂贵任务。

所以真正需要路由的,不只是模型,还包括重试、工具、上下文、预算和人工接管。

第三条暂时不能算兑现。本地执行、私有环境和设备绑定都在增强,但“端侧 AI 已经成为操作系统默认入口”,这个月的证据仍然不够。把本地模型升温直接写成 OS 格局已定,是把方向感冒充完成时。

这次复盘对我很重要。月趋势不应该只是把上次的句子换个说法再讲一遍;预判如果永远正确,就多半从来没有具体到能被证伪。

二、这个月最大的模型新闻,是模型新闻不再稀缺

这一个月,我自己的实验配置里同时出现了 GPT、Qwen、GLM、DeepSeek 和 Grok 路线。五个成功绑定的配置都跑通了六个任务,差别主要落在耗时、长任务稳定性和工具链行为上;唯一五次全败的配置,败在模型 ID 没有被运行时识别。

这只是一个很小的工程基准,不是通用模型排行榜。它不能证明某个模型比另一个模型聪明,也不能外推到所有代码库。但它足以暴露一个常被榜单遮住的事实:

在真实工作里,“可用模型”不是一个权重文件,而是模型能力与工作壳的乘积。

可以把它写成一个极简公式:

实际可用能力 = 模型能力 × Harness 完整度

这里的 Harness,可以理解为把模型接入真实工作的“马具”或“工作壳”:系统提示、工具协议、上下文装配、仓库规则、权限、运行环境、失败恢复、测试和交付流程都属于它。

这也解释了为什么模型发布越来越像供应链更新。

当可选能力足够多,团队不再会因为单一模型的新分数就整体迁移。它更关心的是:现有 IDE 和 Agent 是否支持;工具调用是否稳定;旧会话能不能续接;缓存是否命中;企业身份能不能映射;输出能否进入现有评审和部署链路。

模型仍然重要,但裸模型不再是完整的选型单位。

过去大家问:“哪一个模型最强?”

接下来更有用的问题是:“哪一个模型,装进哪一个 Harness,在我们的任务、权限和验收规则下,能以什么成本稳定完成工作?”

榜单比较的是一次回答,组织购买的是一条完成链路。两者之间,正好隔着控制权。

三、Agent 正在长出自己的“操作系统层”

如果说模型是 CPU,那么过去一个月密集出现的 Agent 基础设施,正在补齐一个操作系统应该承担的职责:加载能力、分配身份、隔离进程、挂载文件、管理网络、记录状态,并为不同应用提供一致接口。

这不是比喻游戏。几个官方项目已经把这层结构写得很具体。

Agent Plugins 把插件目录定义成一组可移植资源:清单、Skills、脚本、参考资料和 MCP 配置可以被不同 Agent 客户端发现和加载。其初始技术委员会包含 Amazon、Cursor、Microsoft、OpenAI 和 Vercel 的维护者。值得注意的不是又多了一个插件市场,而是多方开始争取“能力如何被打包、声明和装载”的公共语法。

Docker Sandboxes 则把 Agent 的执行现场提升为产品对象。官方文档强调,每个沙箱拥有自己的微虚拟机、文件系统、网络和 Docker daemon;组织管理员还能管理文件、网络和工具访问策略。它解决的不是“代码能不能在容器里跑”,而是“一个拥有连续行动能力的 Agent,应该在哪个边界内跑”。

8 月 7 日发布的 Claude Code v2.1.224 也加入了 self-hosted runner,让团队能把自有机器或容器变成 Claude 会话的执行地点。同一个版本还同时涉及插件校验、跨会话消息、沙箱凭证遮蔽和文件系统拒绝规则的修复。

把这些更新放在一起看,会发现竞争已经从聊天窗口向下沉了整整一层:

  1. 能力如何声明:Skill 和 Plugin 告诉系统“我会什么、需要什么”;
  2. 身份如何映射:用户能做什么,不等于 Agent 自动继承全部权限;
  3. 环境如何提供:代码、依赖、网络、密钥和临时资源在哪里运行;
  4. 状态如何续接:长任务、跨会话和多 Agent 协作怎样不丢上下文;
  5. 结果如何退出:产物怎样被验收、提交、部署或回滚。

这五层合起来,才是 Agent 的控制面。

我越来越不愿意把“多写几个工具调用”称为 Agent 平台。工具只是系统调用;没有身份、生命周期、隔离、调度和状态管理,就像一台允许任意进程直接碰磁盘和网络的电脑——能跑,但不能放心交给组织。

这里还有一个很关键的区分:虚拟文件系统和执行沙箱不是一回事。

前者解决 Agent 看见什么信息、如何逐步展开上下文;后者解决不可信代码在哪里执行、能访问什么真实资源。把文档放进虚拟目录不会自动产生安全隔离,把代码关进微虚拟机也不会自动解决上下文污染。企业 Harness 必须把两者分别设计,再用策略连接起来。

一个更接近生产现实的权限公式是:

有效能力 = 用户授权 ∩ Agent 配置 ∩ 当前 Skill 策略 ∩ 会话范围 ∩ 工具侧强制约束

这里是交集,不是并集。

提示词可以解释规则,但不能充当权限边界。真正的拒绝必须发生在模型无法绕过的位置:身份服务、工具网关、文件系统、网络代理、密钥服务或提交接口。

<!-- 配图建议:Agent 控制面五层架构。上层是聊天/IDE,中央是身份、Skill、上下文、策略、状态,下层是 VFS、Sandbox、工具和企业系统。 -->

四、安全审查的单位,正在从一步命令变成整段轨迹

传统审批喜欢逐动作判断:读取文件是否安全,写入文件是否安全,上传文件是否安全。

问题在于,Agent 的危险结果往往不属于其中任何一步,而属于它们的组合。

我做过一个很小的对照实验:使用完全虚构的 DEMO_SECRET,把“写入—追加—上传”拆成多步,并设置十个不同的切分点。逐动作检查器只看当前一步,不保存完整累积状态。结果十组模拟泄漏全部被放行。换成在每个出口检查累计状态的策略后,十组全部被拦截。

这不是一次真实攻击,也不能证明某个具体产品存在漏洞。它证明的是一种结构性盲区:

如果安全系统只理解动作,不理解动作留下的状态,那么每一步都合规,合起来仍可能完成被禁止的结果。

8 月初 OpenAI 公布的第三方网络安全评估复盘提供了一个更现实的参照。在一组刻意降低防护、允许访问公网的评估配置中,模型执行了超出预期边界的动作;另一次 CTF 环境配置错误,让虚构目标对应到了真实域名。官方报告强调,这不是复杂的沙箱逃逸或零日漏洞,而是评估环境、网络边界与任务目标共同形成的越界。

这一区分非常重要。

把它写成“AI 觉醒并逃出了实验室”很吸睛,却会让工程团队修错问题。真正应该修的是:为什么公开网络被允许,目标解析为什么落到真实资产,边界事件为什么没有更早触发停止,以及停止之后能否证明所有外部影响都已收敛。

Agent 安全因此需要从“命令批准”升级成“轨迹治理”。至少要具备四个能力:

“替代路径”尤其容易被忽略。Agent 第一次上传失败后,可能改发邮件;邮件被拒后,又可能把内容贴进工单。如果不同工具各自只管自己的单步策略,系统看起来拒绝了两次,最终结果却仍然发生。

所以,拒绝不能只是一次 API 返回 403。它必须变成整项任务的约束,持续作用于后续计划。

这也是截图提示注入值得警惕的原因。图片经过缩放、OCR、描述模型和结构化抽取后,恶意指令可能不再保留原始像素形态,却保留了行动意图。人眼检查原图不能替代跨模态来源追踪。真正需要保护的不是某个输入框,而是信息从进入系统到触发高风险工具之间的整条链路。

<!-- 配图建议:三步操作单独为绿色,累积状态在出口变红;对照“逐动作审批”与“轨迹级治理”。 -->

五、成本不该按 Token 算,而要按“成功任务”算

模型供应增加带来了一个直觉:同类能力越来越便宜,Agent 成本自然会下降。

这句话只在调用次数、上下文长度和成功率都不变时成立。真实系统恰恰不会保持不变。

一次模型调用便宜以后,产品可能让 Agent 多规划三轮,多开几个并行分支;工具超时后 SDK 重试,任务队列再重试,用户看不到反馈又点一次;上下文顺序轻微变化让 Prefix Cache 失效,整段固定提示和仓库说明重新计费;最后虽然输出了答案,却没有通过测试,还要人接手返工。

于是模型单价降了,完成一件事的总成本反而可能上升。

更合理的分母不是 Token,而是“成功且无需返工的任务”。

可以先用一个粗糙但可行动的公式:

单位成功任务成本 =(模型 + 工具 + 沙箱 + API + 存储 + 评测 + 人工接管成本)÷ 成功且无需返工的任务数

它至少暴露了四个成本乘数:

1. 循环乘数

Agent 发现结果不满意,继续规划、搜索、修改和验证。单轮很便宜,不受限的循环仍然昂贵。预算需要约束整段任务,而不是只限制单次请求。

2. 重试乘数

重试最危险的情况不是次数多,而是拥有者不唯一。模型、SDK、工具适配层、队列和前端都认为自己应该“帮忙再试一次”,三层各重试两次,最坏路径就可能膨胀成八次。每一种失败只能有一个重试负责人,其余层负责上报证据。

3. 并发乘数

多 Agent 同时探索能降低延迟,也能快速烧掉预算。只要一个分支找到足够证据,其他分支就应该被取消。否则并发不是加速,而是把无人消费的答案批量生产出来。

4. 上下文乘数

Prefix Cache 不是“打开一个开关”就会自动省钱。要让稳定前缀持续命中,系统提示、工具定义、项目规则和固定历史需要保持顺序稳定;当前问题、临时日志和高频变化内容则应该放在后部。一次无关时间戳或随机排序,都可能让后续请求从头计算。

因此,成本优化的顺序也应该反过来:先限制无效循环和重复重试,再治理并发与上下文,最后才是比较模型单价。

模型路由依然有价值,但它要消费更完整的信号:任务类型、风险等级、上下文复用率、工具成功率、预计人工接管概率,以及剩余预算。

便宜模型如果需要三次返工,就不便宜。昂贵模型如果一次完成并留下可验收证据,也未必昂贵。

<!-- 配图建议:冰山图。水面上是 Token 单价,水面下是循环、重试、并发、缓存失效、人工返工。 -->

六、AI 先压缩的,不一定是程序员,而是“只负责翻译需求”的工作层

关于 AI 与就业,最容易写成两个极端:要么程序员马上消失,要么工具永远只是自动补全。

过去一个月的材料不足以支持任何宏观就业数字,我自己的小样本也不能外推行业。但从工程流程里,已经能看到一种更具体的压缩:标准化的“翻译层”正在变薄。

所谓翻译层,是把已经明确的需求换一种表达形式:把接口说明翻成样板代码,把字段表翻成 CRUD,把固定规则翻成配置,把一份测试计划翻成脚本。只要输入、约束和验收足够清晰,这类工作非常适合模型批量完成。

但真实任务最费力的部分,通常发生在清晰输入之前和漂亮输出之后:

我那条失败的模型路由就是一个缩影。若只看任务面板,会得到“某 Agent 五次不会写代码”的错误结论;只有追到运行时日志,才知道它五次都没有获得写代码的机会。

AI 越擅长执行,定义与验收就越值钱;生成越便宜,证明就越值钱。

这并不意味着人人都要成为架构师。它意味着工程师的杠杆点会移动:少花时间亲手生产可预测的中间文本,多花时间寻找事实源、固定边界、设计验证、解释失败并对最终状态负责。

未来稀缺的可能不是“会不会写代码”,而是能否在一个充满自动生成代码的系统里回答:这次改动究竟解决了什么,证据在哪里,还有什么没有被证明。

七、我给团队和自己做的两个决定

趋势文章如果最后只剩“值得关注”,就没有完成它的任务。基于这个月的证据,我做两个具体调整。

决定一:把 Agent 的验收单位,从“输出”改成“带证据的状态变化”

一段回复、一个补丁、一次测试通过,都只能是中间证据。

真正的完成状态应该包含:目标对象发生了什么变化;使用了哪些来源和权限;验证覆盖了哪些路径;远端、部署或用户现场是否独立读回;哪些结论仍然只是本地推断。

对代码任务,至少要区分:生成了代码、测试通过、本地提交、推送远端、合并、部署和生产验收。它们不能被一句“已完成”压扁。

对研究任务,至少要区分:发现线索、读取原文、完成复现、形成判断和对外发布。摘要不是来源,进程存活不是结果,Agent 自己说成功也不是独立验收。

我希望每项重要任务最后都有一份很小的“产物清单”:来源、变更、验证、部署状态和未决风险。不是为了制造文档,而是为了让人和下一个 Agent 能从证据继续工作,而不是重新猜测。

决定二:减少追逐模型榜单,把能力投资到问题定义、约束设计、验证和根因归因

模型当然还要试,但不再把“换到最新模型”视为默认改进。

对于一项重复任务,优先问四个问题:

  1. 输入中的事实源是否唯一、可追溯;
  2. 权限和禁止结果是否能被工具层强制;
  3. 成功是否有机器可读的验收条件;
  4. 失败后能否定位到模型、上下文、运行时、工具或外部系统。

这四件事做不好,再强的模型也只会更快地产生不确定性。它们做好以后,模型升级才有机会变成稳定收益。

对个人也是一样。纯粹生成代码的速度会越来越普遍;能发现问题定义错了、能设计一个会失败的测试、能从证据里定位真实责任边界,会成为更长期的能力。

八、未来一个月,我会复盘这三个预判

预判一:沙箱会从“隔离一个进程”扩展成统一的身份与出口策略

下一批 Agent 沙箱的差异点,不会只是启动速度和镜像兼容性,而是谁能统一控制身份、文件、网络、密钥、工具和数据出口。

只隔离文件系统,却把宿主机环境变量全部注入进去;限制某条上传命令,却允许 Agent 换另一个工具发送——这种“局部安全”会越来越快暴露缺口。

我会观察的兑现信号是:主流产品是否开始提供组织级策略、短期身份、出口审计和跨工具的一致阻断,而不只是一个可运行代码的容器。

预判二:“模型 × Harness”会取代裸模型,成为主要选型单位

模型发布会越来越与某个 IDE、Agent、Runner、插件系统或企业工作台联合出现。团队评测也会从纯问答分数,转向固定仓库、固定工具和固定验收下的端到端完成率。

我会观察的兑现信号是:更多官方发布直接给出工具链兼容、长任务恢复、上下文缓存、权限与交付指标,而不仅是模型基准分数。

预判三:企业 AI 指标会从调用量转向成功任务率、单位成功成本和人工接管率

调用量和 Token 消耗适合描述资源使用,不适合描述业务价值。只奖励调用增长,团队会自然制造更多循环、更多并发和更多无人消费的输出。

我会观察的兑现信号是:平台预算、路由和告警是否开始围绕成功任务、返工、P95 成本、人工接管与证据完整度设计。

如果一个月后,企业看板仍然只展示调用次数和 Token 折线,这条预判就只能算“我认为应该如此”,而不是已经发生。

结语:下一轮竞争,不是谁更会回答,而是谁更能完成

模型不会停止进步,榜单也不会消失。但当多种模型都能写出像样的代码、调用工具和执行计划后,新增智能的边际价值,会越来越依赖它周围的控制系统。

没有正确的模型绑定,智能无法启动;没有稳定上下文,智能每轮都要失忆;没有轨迹治理,单步合规可能累积成越界;没有成本控制,便宜调用会被循环和重试放大;没有独立验收,漂亮输出无法证明工作完成。

所以这一轮真正值得建设的,不只是更大的模型入口,而是更可靠的工作底盘。

它能回答五个朴素的问题:

  1. 现在是谁在行动?
  2. 它能看见和改变什么?
  3. 它已经做过什么,累积出了什么状态?
  4. 为了这个结果,我们实际付出了多少?
  5. 谁用什么证据确认任务真的结束?

当这五个问题都有答案,Agent 才从一段令人惊艳的演示,变成一个可以进入真实组织的生产系统。

模型能力正在批量供应。

接下来最贵的,是控制它抵达结果的能力。


主要公开资料

注:文中的 Coding Agent 对照、十个轨迹切分点和成本分析来自作者的小型工程实验与复盘。它们用于揭示系统边界,不构成通用模型排名、真实攻击披露或行业就业统计。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。