早上打开工作台,十几个后台任务已经各自拉好了分支。代码行数不再紧缺,编译通过的消息不断弹出,审查队列却堵死了。你点开一个 PR,发现它缺了测试数据;点开另一个,改动触碰了关键计费逻辑,却没有附带监控指标。
当雇佣一个执行者的边际成本趋近于零,研发流程的瓶颈立刻发生漂移:产出代码不再稀缺,工程师的同步注意力才是整个系统里最昂贵的资源。 团队如果还在单纯比拼谁家模型基准分更高,很快就会发现代码堆积如山,但没有几个能直接上线。
算力装进底盘,代码才算落地
模型能力就像一台马力不断攀升的发动机,但发动机自己不会跑,它需要底盘接入真实的生产环境。
The Pragmatic Engineer 在 2026 年 8 月 25 日报道了金融科技公司 Ramp 的内部开发实践:其内部 coding agent Inspect 在 2026 年 7 月累计运行了超过 100 万次 session,目前 Ramp 约 75% 的已合并 PR 均由 Inspect 发起,其远程沙箱环境启动时间压缩在 5 秒以内。
Ramp 在今年 1 月的官方技术文中披露,Inspect 运行在 Modal 的隔离虚拟机内,直接打通了 GitHub、Sentry、Datadog、LaunchDarkly、Braintrust、Buildkite 与 Slack。它的核心价值不是依赖某种独占模型,而是让程序在独立沙箱里拥有等同于人类员工的系统权限与上下文。能查日志、能看告警、能改开关,改动才具备交付的可能性。
交付三闭环:环境、验证与注意力

把一个任务从“写完”推到“上线”,中间隔着三个必须闭合的工程层次:Agent 先在数秒内获得干净、可复现的隔离环境和内部上下文;再用测试、遥测、功能开关乃至 Chromium 截图与 live preview 证明改动正确;最后把常规检查留在后台,只在异常分支、风险等级跃迁或不可逆操作时,向人推送经过压缩的高信噪比上下文。
Latent Space 在 2026 年 8 月 22 日的文章《The Evolution of the Agent Harness》中分析指出,随着模型逐渐内化推理、工具调用与多主体编排,外部外壳(Harness)的核心职责正在转向权限、身份、信任与可读性,其实质演变成了“人类注意力界面(human attention interface)”,用于界定自主决策与人工审批的边界。
下一代工具链的差距,不在于多接几个 API,而在于能否把复杂的验证过程消化在后台,只把确定性的风险暴露给人类。
别只看它写得快,看它如何证明自己做对了
如果一个工具每次推进都需要人去确认“这样改行不行”,它就相当于几十个不断敲你办公室门的实习生。
团队在评估或搭建下一代 coding agent 时,决策重心应当从模型榜单移开。比起追问它写特定逻辑的能力,更该在架构评审中提出两个具体的工程问题:它能调动哪些系统去自证结果正确,以及它究竟会在什么触发条件下,递出需要你打断思路的那张审批单。
资料
- Why Ramp built Inspect, an AI coding agent — The Pragmatic Engineer (2026-08-25): https://newsletter.pragmaticengineer.com/p/why-ramp-built-inspect
- Why We Built Our Background Agent — Ramp Builders Blog: https://engineering.ramp.com/post/why-we-built-our-background-agent
- The Evolution of the Agent Harness — Latent Space (2026-08-22): https://www.latent.space/p/attention-interface
