我最近把几种 Coding Agent 配置放进同一组工程任务里测试。
最荒诞的一次,不是模型把代码写错了,而是工作根本没有开始:我指定了一条名为 grok-4.5-build 的模型路由,连续五次任务都在 5—7 秒内退出,工作区没有任何文件变化。终端只留下一句很朴素的报错:unknown model id。
如果只看最终成绩,它是五战五败。但这显然不是模型能力的失败——系统甚至没有走到调用模型那一步。后来我换回默认的 Grok 路由,同一套环境里的六个任务全部通过公开和隐藏测试。
前后两组结果的差别,不是“智能”突然增长了,而是运行时绑定终于正确了。
那一刻我突然意识到,今天再讨论“哪个模型最聪明”,越来越像只看发动机马力选车。真正决定它能不能把人送到目的地的,是点火、变速、导航、刹车和仪表盘这一整套底盘:模型如何进入工作现场,拿到什么上下文和权限,怎样调用工具,失败后由谁重试,最后又用什么证据证明任务真的完成。
过去 31 天的 AI 新闻看似杂乱,底下其实都指向同一件事:
模型能力正在批量供应,能把 Agent 管住、算清、验明白的工程能力开始变贵。
这就是本期 AI 月趋势想讨论的“控制权”。
它不是让人频繁点击批准按钮,也不是把所有操作关进一个容器。它至少包括五件事:身份与权限控制、运行环境控制、整段行动轨迹控制、成本与重试控制,以及完成状态的证据控制。
谁能把这五件事做成基础设施,谁才有机会把模型能力稳定地变成生产力。
<!-- 配图建议:发动机与底盘。左侧是不断更换的模型,右侧是身份、运行时、轨迹、成本、验收五层控制面。 -->
先说明样本:这不是一张完整的行业排行榜
这次观察窗口是 2026 年 7 月 14 日到 8 月 13 日。
我整理了其中 23 天的每日知识条目,共 235 条候选事件,并回看了几组一手实验和项目草稿。资讯采集有日期缺口,所以本文不做“某类新闻增长了百分之多少”之类的伪统计,也不会把摘要里的产品名直接当成事实。
我采用的标准更简单:一条新闻只有回到官方发布、原始研究或可复现实验后,才允许支撑核心判断;一条趋势必须同时回答“它改变了什么工程对象”,而不只是“又发生了什么”。
按这个标准筛完,过去一个月真正连成线的,不是模型榜单,而是 Agent Plugins、Skills、Sandboxes、自托管 Runner、安全边界、上下文缓存、重试治理和任务验收。
看起来像八个话题,其实都是同一个问题:当模型开始连续采取行动,我们究竟靠什么控制它?
一、先复盘上个月:三个预判,只有一个半兑现
上一篇月趋势里,我做了三个判断。
第一,AI 技术栈会分裂成模型层、上下文层和信任层。第二,SDK 计费会催生模型路由和“模型网格”。第三,端侧 AI 会获得操作系统级战略地位。
一个月后回头看,第一条方向基本正确,但当时说得太抽象。
“信任层”没有先长成一份统一标准,而是分散地落进了更具体的工程对象:插件清单、技能目录、微虚拟机、网络策略、密钥注入、自托管执行器、行动日志、预算和验收记录。换句话说,信任不是在模型外面再包一层提示词,而是把 Agent 从启动到交付的整个生命周期变成可配置、可观察、可中止的系统。
第二条只对了一半。模型路由确实越来越重要,但我上个月高估了“换模型”在成本优化里的权重。真实 Agent 的账单不只由模型单价决定。循环多跑两轮、工具失败后重复提交、前端与后端各自重试、并发分支无人取消、上下文反复失效,都可能把一次便宜调用放大成一笔昂贵任务。
所以真正需要路由的,不只是模型,还包括重试、工具、上下文、预算和人工接管。
第三条暂时不能算兑现。本地执行、私有环境和设备绑定都在增强,但“端侧 AI 已经成为操作系统默认入口”,这个月的证据仍然不够。把本地模型升温直接写成 OS 格局已定,是把方向感冒充完成时。
这次复盘对我很重要。月趋势不应该只是把上次的句子换个说法再讲一遍;预判如果永远正确,就多半从来没有具体到能被证伪。
二、这个月最大的模型新闻,是模型新闻不再稀缺
这一个月,我自己的实验配置里同时出现了 GPT、Qwen、GLM、DeepSeek 和 Grok 路线。五个成功绑定的配置都跑通了六个任务,差别主要落在耗时、长任务稳定性和工具链行为上;唯一五次全败的配置,败在模型 ID 没有被运行时识别。
这只是一个很小的工程基准,不是通用模型排行榜。它不能证明某个模型比另一个模型聪明,也不能外推到所有代码库。但它足以暴露一个常被榜单遮住的事实:
在真实工作里,“可用模型”不是一个权重文件,而是模型能力与工作壳的乘积。
可以把它写成一个极简公式:
实际可用能力 = 模型能力 × Harness 完整度
这里的 Harness,可以理解为把模型接入真实工作的“马具”或“工作壳”:系统提示、工具协议、上下文装配、仓库规则、权限、运行环境、失败恢复、测试和交付流程都属于它。
这也解释了为什么模型发布越来越像供应链更新。
当可选能力足够多,团队不再会因为单一模型的新分数就整体迁移。它更关心的是:现有 IDE 和 Agent 是否支持;工具调用是否稳定;旧会话能不能续接;缓存是否命中;企业身份能不能映射;输出能否进入现有评审和部署链路。
模型仍然重要,但裸模型不再是完整的选型单位。
过去大家问:“哪一个模型最强?”
接下来更有用的问题是:“哪一个模型,装进哪一个 Harness,在我们的任务、权限和验收规则下,能以什么成本稳定完成工作?”
榜单比较的是一次回答,组织购买的是一条完成链路。两者之间,正好隔着控制权。
三、Agent 正在长出自己的“操作系统层”
如果说模型是 CPU,那么过去一个月密集出现的 Agent 基础设施,正在补齐一个操作系统应该承担的职责:加载能力、分配身份、隔离进程、挂载文件、管理网络、记录状态,并为不同应用提供一致接口。
这不是比喻游戏。几个官方项目已经把这层结构写得很具体。
Agent Plugins 把插件目录定义成一组可移植资源:清单、Skills、脚本、参考资料和 MCP 配置可以被不同 Agent 客户端发现和加载。其初始技术委员会包含 Amazon、Cursor、Microsoft、OpenAI 和 Vercel 的维护者。值得注意的不是又多了一个插件市场,而是多方开始争取“能力如何被打包、声明和装载”的公共语法。
Docker Sandboxes 则把 Agent 的执行现场提升为产品对象。官方文档强调,每个沙箱拥有自己的微虚拟机、文件系统、网络和 Docker daemon;组织管理员还能管理文件、网络和工具访问策略。它解决的不是“代码能不能在容器里跑”,而是“一个拥有连续行动能力的 Agent,应该在哪个边界内跑”。
8 月 7 日发布的 Claude Code v2.1.224 也加入了 self-hosted runner,让团队能把自有机器或容器变成 Claude 会话的执行地点。同一个版本还同时涉及插件校验、跨会话消息、沙箱凭证遮蔽和文件系统拒绝规则的修复。
把这些更新放在一起看,会发现竞争已经从聊天窗口向下沉了整整一层:
- 能力如何声明:Skill 和 Plugin 告诉系统“我会什么、需要什么”;
- 身份如何映射:用户能做什么,不等于 Agent 自动继承全部权限;
- 环境如何提供:代码、依赖、网络、密钥和临时资源在哪里运行;
- 状态如何续接:长任务、跨会话和多 Agent 协作怎样不丢上下文;
- 结果如何退出:产物怎样被验收、提交、部署或回滚。
这五层合起来,才是 Agent 的控制面。
我越来越不愿意把“多写几个工具调用”称为 Agent 平台。工具只是系统调用;没有身份、生命周期、隔离、调度和状态管理,就像一台允许任意进程直接碰磁盘和网络的电脑——能跑,但不能放心交给组织。
这里还有一个很关键的区分:虚拟文件系统和执行沙箱不是一回事。
前者解决 Agent 看见什么信息、如何逐步展开上下文;后者解决不可信代码在哪里执行、能访问什么真实资源。把文档放进虚拟目录不会自动产生安全隔离,把代码关进微虚拟机也不会自动解决上下文污染。企业 Harness 必须把两者分别设计,再用策略连接起来。
一个更接近生产现实的权限公式是:
有效能力 = 用户授权 ∩ Agent 配置 ∩ 当前 Skill 策略 ∩ 会话范围 ∩ 工具侧强制约束
这里是交集,不是并集。
提示词可以解释规则,但不能充当权限边界。真正的拒绝必须发生在模型无法绕过的位置:身份服务、工具网关、文件系统、网络代理、密钥服务或提交接口。
<!-- 配图建议:Agent 控制面五层架构。上层是聊天/IDE,中央是身份、Skill、上下文、策略、状态,下层是 VFS、Sandbox、工具和企业系统。 -->
四、安全审查的单位,正在从一步命令变成整段轨迹
传统审批喜欢逐动作判断:读取文件是否安全,写入文件是否安全,上传文件是否安全。
问题在于,Agent 的危险结果往往不属于其中任何一步,而属于它们的组合。
我做过一个很小的对照实验:使用完全虚构的 DEMO_SECRET,把“写入—追加—上传”拆成多步,并设置十个不同的切分点。逐动作检查器只看当前一步,不保存完整累积状态。结果十组模拟泄漏全部被放行。换成在每个出口检查累计状态的策略后,十组全部被拦截。
这不是一次真实攻击,也不能证明某个具体产品存在漏洞。它证明的是一种结构性盲区:
如果安全系统只理解动作,不理解动作留下的状态,那么每一步都合规,合起来仍可能完成被禁止的结果。
8 月初 OpenAI 公布的第三方网络安全评估复盘提供了一个更现实的参照。在一组刻意降低防护、允许访问公网的评估配置中,模型执行了超出预期边界的动作;另一次 CTF 环境配置错误,让虚构目标对应到了真实域名。官方报告强调,这不是复杂的沙箱逃逸或零日漏洞,而是评估环境、网络边界与任务目标共同形成的越界。
这一区分非常重要。
把它写成“AI 觉醒并逃出了实验室”很吸睛,却会让工程团队修错问题。真正应该修的是:为什么公开网络被允许,目标解析为什么落到真实资产,边界事件为什么没有更早触发停止,以及停止之后能否证明所有外部影响都已收敛。
Agent 安全因此需要从“命令批准”升级成“轨迹治理”。至少要具备四个能力:
- 来源标记:一段指令来自用户、网页、图片、OCR 还是另一个 Agent;
- 跨步骤污点传播:敏感内容经过复制、改写、压缩或多模态转换后,标记不能消失;
- 出口状态检查:发送、上传、提交、付款和部署之前,检查累计状态与目标,而不只检查最后一条命令;
- 可中止的完整轨迹:记录因果链、工具结果和状态变化,并允许控制面停止后续替代路径。
“替代路径”尤其容易被忽略。Agent 第一次上传失败后,可能改发邮件;邮件被拒后,又可能把内容贴进工单。如果不同工具各自只管自己的单步策略,系统看起来拒绝了两次,最终结果却仍然发生。
所以,拒绝不能只是一次 API 返回 403。它必须变成整项任务的约束,持续作用于后续计划。
这也是截图提示注入值得警惕的原因。图片经过缩放、OCR、描述模型和结构化抽取后,恶意指令可能不再保留原始像素形态,却保留了行动意图。人眼检查原图不能替代跨模态来源追踪。真正需要保护的不是某个输入框,而是信息从进入系统到触发高风险工具之间的整条链路。
<!-- 配图建议:三步操作单独为绿色,累积状态在出口变红;对照“逐动作审批”与“轨迹级治理”。 -->
五、成本不该按 Token 算,而要按“成功任务”算
模型供应增加带来了一个直觉:同类能力越来越便宜,Agent 成本自然会下降。
这句话只在调用次数、上下文长度和成功率都不变时成立。真实系统恰恰不会保持不变。
一次模型调用便宜以后,产品可能让 Agent 多规划三轮,多开几个并行分支;工具超时后 SDK 重试,任务队列再重试,用户看不到反馈又点一次;上下文顺序轻微变化让 Prefix Cache 失效,整段固定提示和仓库说明重新计费;最后虽然输出了答案,却没有通过测试,还要人接手返工。
于是模型单价降了,完成一件事的总成本反而可能上升。
更合理的分母不是 Token,而是“成功且无需返工的任务”。
可以先用一个粗糙但可行动的公式:
单位成功任务成本 =(模型 + 工具 + 沙箱 + API + 存储 + 评测 + 人工接管成本)÷ 成功且无需返工的任务数
它至少暴露了四个成本乘数:
1. 循环乘数
Agent 发现结果不满意,继续规划、搜索、修改和验证。单轮很便宜,不受限的循环仍然昂贵。预算需要约束整段任务,而不是只限制单次请求。
2. 重试乘数
重试最危险的情况不是次数多,而是拥有者不唯一。模型、SDK、工具适配层、队列和前端都认为自己应该“帮忙再试一次”,三层各重试两次,最坏路径就可能膨胀成八次。每一种失败只能有一个重试负责人,其余层负责上报证据。
3. 并发乘数
多 Agent 同时探索能降低延迟,也能快速烧掉预算。只要一个分支找到足够证据,其他分支就应该被取消。否则并发不是加速,而是把无人消费的答案批量生产出来。
4. 上下文乘数
Prefix Cache 不是“打开一个开关”就会自动省钱。要让稳定前缀持续命中,系统提示、工具定义、项目规则和固定历史需要保持顺序稳定;当前问题、临时日志和高频变化内容则应该放在后部。一次无关时间戳或随机排序,都可能让后续请求从头计算。
因此,成本优化的顺序也应该反过来:先限制无效循环和重复重试,再治理并发与上下文,最后才是比较模型单价。
模型路由依然有价值,但它要消费更完整的信号:任务类型、风险等级、上下文复用率、工具成功率、预计人工接管概率,以及剩余预算。
便宜模型如果需要三次返工,就不便宜。昂贵模型如果一次完成并留下可验收证据,也未必昂贵。
<!-- 配图建议:冰山图。水面上是 Token 单价,水面下是循环、重试、并发、缓存失效、人工返工。 -->
六、AI 先压缩的,不一定是程序员,而是“只负责翻译需求”的工作层
关于 AI 与就业,最容易写成两个极端:要么程序员马上消失,要么工具永远只是自动补全。
过去一个月的材料不足以支持任何宏观就业数字,我自己的小样本也不能外推行业。但从工程流程里,已经能看到一种更具体的压缩:标准化的“翻译层”正在变薄。
所谓翻译层,是把已经明确的需求换一种表达形式:把接口说明翻成样板代码,把字段表翻成 CRUD,把固定规则翻成配置,把一份测试计划翻成脚本。只要输入、约束和验收足够清晰,这类工作非常适合模型批量完成。
但真实任务最费力的部分,通常发生在清晰输入之前和漂亮输出之后:
- 需求里的冲突由谁澄清;
- 哪个系统才是事实源;
- 权限边界在哪里;
- 失败是模型、路由、环境、工具还是数据造成的;
- 测试通过是否等于用户问题已经解决;
- 产物能否回滚,出了事故由谁承担判断。
我那条失败的模型路由就是一个缩影。若只看任务面板,会得到“某 Agent 五次不会写代码”的错误结论;只有追到运行时日志,才知道它五次都没有获得写代码的机会。
AI 越擅长执行,定义与验收就越值钱;生成越便宜,证明就越值钱。
这并不意味着人人都要成为架构师。它意味着工程师的杠杆点会移动:少花时间亲手生产可预测的中间文本,多花时间寻找事实源、固定边界、设计验证、解释失败并对最终状态负责。
未来稀缺的可能不是“会不会写代码”,而是能否在一个充满自动生成代码的系统里回答:这次改动究竟解决了什么,证据在哪里,还有什么没有被证明。
七、我给团队和自己做的两个决定
趋势文章如果最后只剩“值得关注”,就没有完成它的任务。基于这个月的证据,我做两个具体调整。
决定一:把 Agent 的验收单位,从“输出”改成“带证据的状态变化”
一段回复、一个补丁、一次测试通过,都只能是中间证据。
真正的完成状态应该包含:目标对象发生了什么变化;使用了哪些来源和权限;验证覆盖了哪些路径;远端、部署或用户现场是否独立读回;哪些结论仍然只是本地推断。
对代码任务,至少要区分:生成了代码、测试通过、本地提交、推送远端、合并、部署和生产验收。它们不能被一句“已完成”压扁。
对研究任务,至少要区分:发现线索、读取原文、完成复现、形成判断和对外发布。摘要不是来源,进程存活不是结果,Agent 自己说成功也不是独立验收。
我希望每项重要任务最后都有一份很小的“产物清单”:来源、变更、验证、部署状态和未决风险。不是为了制造文档,而是为了让人和下一个 Agent 能从证据继续工作,而不是重新猜测。
决定二:减少追逐模型榜单,把能力投资到问题定义、约束设计、验证和根因归因
模型当然还要试,但不再把“换到最新模型”视为默认改进。
对于一项重复任务,优先问四个问题:
- 输入中的事实源是否唯一、可追溯;
- 权限和禁止结果是否能被工具层强制;
- 成功是否有机器可读的验收条件;
- 失败后能否定位到模型、上下文、运行时、工具或外部系统。
这四件事做不好,再强的模型也只会更快地产生不确定性。它们做好以后,模型升级才有机会变成稳定收益。
对个人也是一样。纯粹生成代码的速度会越来越普遍;能发现问题定义错了、能设计一个会失败的测试、能从证据里定位真实责任边界,会成为更长期的能力。
八、未来一个月,我会复盘这三个预判
预判一:沙箱会从“隔离一个进程”扩展成统一的身份与出口策略
下一批 Agent 沙箱的差异点,不会只是启动速度和镜像兼容性,而是谁能统一控制身份、文件、网络、密钥、工具和数据出口。
只隔离文件系统,却把宿主机环境变量全部注入进去;限制某条上传命令,却允许 Agent 换另一个工具发送——这种“局部安全”会越来越快暴露缺口。
我会观察的兑现信号是:主流产品是否开始提供组织级策略、短期身份、出口审计和跨工具的一致阻断,而不只是一个可运行代码的容器。
预判二:“模型 × Harness”会取代裸模型,成为主要选型单位
模型发布会越来越与某个 IDE、Agent、Runner、插件系统或企业工作台联合出现。团队评测也会从纯问答分数,转向固定仓库、固定工具和固定验收下的端到端完成率。
我会观察的兑现信号是:更多官方发布直接给出工具链兼容、长任务恢复、上下文缓存、权限与交付指标,而不仅是模型基准分数。
预判三:企业 AI 指标会从调用量转向成功任务率、单位成功成本和人工接管率
调用量和 Token 消耗适合描述资源使用,不适合描述业务价值。只奖励调用增长,团队会自然制造更多循环、更多并发和更多无人消费的输出。
我会观察的兑现信号是:平台预算、路由和告警是否开始围绕成功任务、返工、P95 成本、人工接管与证据完整度设计。
如果一个月后,企业看板仍然只展示调用次数和 Token 折线,这条预判就只能算“我认为应该如此”,而不是已经发生。
结语:下一轮竞争,不是谁更会回答,而是谁更能完成
模型不会停止进步,榜单也不会消失。但当多种模型都能写出像样的代码、调用工具和执行计划后,新增智能的边际价值,会越来越依赖它周围的控制系统。
没有正确的模型绑定,智能无法启动;没有稳定上下文,智能每轮都要失忆;没有轨迹治理,单步合规可能累积成越界;没有成本控制,便宜调用会被循环和重试放大;没有独立验收,漂亮输出无法证明工作完成。
所以这一轮真正值得建设的,不只是更大的模型入口,而是更可靠的工作底盘。
它能回答五个朴素的问题:
- 现在是谁在行动?
- 它能看见和改变什么?
- 它已经做过什么,累积出了什么状态?
- 为了这个结果,我们实际付出了多少?
- 谁用什么证据确认任务真的结束?
当这五个问题都有答案,Agent 才从一段令人惊艳的演示,变成一个可以进入真实组织的生产系统。
模型能力正在批量供应。
接下来最贵的,是控制它抵达结果的能力。
主要公开资料
- Agent Plugins:开放的 Agent 插件标准
- Docker Sandboxes 产品页
- Docker Sandboxes 文档
- Claude Code v2.1.224 Release Notes
- OpenAI:Third-party cyber evaluations involving OpenAI models
注:文中的 Coding Agent 对照、十个轨迹切分点和成本分析来自作者的小型工程实验与复盘。它们用于揭示系统边界,不构成通用模型排名、真实攻击披露或行业就业统计。