正在刊行长文 · Essay
2026-08-26所有内容
随机比特 · Random Bits

当 AI 开始批量交代码,最先见底的是你的注意力

2026-08-26AI Engineering / Systemsrbits.uk
当 AI 开始批量交代码,最先见底的是你的注意力

早上打开工作台,十几个后台任务已经各自拉好了分支。代码行数不再紧缺,编译通过的消息不断弹出,审查队列却堵死了。你点开一个 PR,发现它缺了测试数据;点开另一个,改动触碰了关键计费逻辑,却没有附带监控指标。

当雇佣一个执行者的边际成本趋近于零,研发流程的瓶颈立刻发生漂移:产出代码不再稀缺,工程师的同步注意力才是整个系统里最昂贵的资源。 团队如果还在单纯比拼谁家模型基准分更高,很快就会发现代码堆积如山,但没有几个能直接上线。

算力装进底盘,代码才算落地

模型能力就像一台马力不断攀升的发动机,但发动机自己不会跑,它需要底盘接入真实的生产环境。

The Pragmatic Engineer 在 2026 年 8 月 25 日报道了金融科技公司 Ramp 的内部开发实践:其内部 coding agent Inspect 在 2026 年 7 月累计运行了超过 100 万次 session,目前 Ramp 约 75% 的已合并 PR 均由 Inspect 发起,其远程沙箱环境启动时间压缩在 5 秒以内。

Ramp 在今年 1 月的官方技术文中披露,Inspect 运行在 Modal 的隔离虚拟机内,直接打通了 GitHub、Sentry、Datadog、LaunchDarkly、Braintrust、Buildkite 与 Slack。它的核心价值不是依赖某种独占模型,而是让程序在独立沙箱里拥有等同于人类员工的系统权限与上下文。能查日志、能看告警、能改开关,改动才具备交付的可能性。

交付三闭环:环境、验证与注意力

从环境、验证到注意力的交付闭环

把一个任务从“写完”推到“上线”,中间隔着三个必须闭合的工程层次:Agent 先在数秒内获得干净、可复现的隔离环境和内部上下文;再用测试、遥测、功能开关乃至 Chromium 截图与 live preview 证明改动正确;最后把常规检查留在后台,只在异常分支、风险等级跃迁或不可逆操作时,向人推送经过压缩的高信噪比上下文。

Latent Space 在 2026 年 8 月 22 日的文章《The Evolution of the Agent Harness》中分析指出,随着模型逐渐内化推理、工具调用与多主体编排,外部外壳(Harness)的核心职责正在转向权限、身份、信任与可读性,其实质演变成了“人类注意力界面(human attention interface)”,用于界定自主决策与人工审批的边界。

下一代工具链的差距,不在于多接几个 API,而在于能否把复杂的验证过程消化在后台,只把确定性的风险暴露给人类。

别只看它写得快,看它如何证明自己做对了

如果一个工具每次推进都需要人去确认“这样改行不行”,它就相当于几十个不断敲你办公室门的实习生。

团队在评估或搭建下一代 coding agent 时,决策重心应当从模型榜单移开。比起追问它写特定逻辑的能力,更该在架构评审中提出两个具体的工程问题:它能调动哪些系统去自证结果正确,以及它究竟会在什么触发条件下,递出需要你打断思路的那张审批单。


资料

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。