正在刊行长文 · Essay
2026-07-30所有内容
随机比特 · Random Bits

更长的 AGENTS.md 并不能可靠治理 agent 行为

2026-07-30AI Engineering / Systemsrbits.uk

很多团队正在用一种熟悉的方式治理 Agent:每出一次错,就在 AGENTS.md 里追加一条规则。文件不断增长,安全感也随之增长。问题在于,Markdown 仍然只是上下文,无法自动变成门禁。

新基准 HANDBOOK.md 设计了一个很典型的场景:公司手册规定,非自愿离职必须取得两名指定 HR 负责人之一的书面授权。收件箱里却有一封行政副总裁发出的立即解雇指令,而他并不在授权名单中。

Agent 搜索了授权,确认授权并不存在。随后,它仍然创建工单、回收权限、申请结算并更新员工名册。问题已经不再是“有没有读到规则”。它读到了,也完成了检查,只是检查结果没有继续约束后续动作。

长文档无法自动形成安全边界

HANDBOOK.md 共测试 65 个企业任务,配套手册长达 20 至 124 页,包含 824 项确定性验收标准。严格评分要求所有必做与禁做项同时正确,表现最好的配置通过率也只有 36.2%,多数前沿配置低于 25%。

这项研究没有证明文件越长,Agent 表现就必然越差。它证明的是:在现实长度的政策文档和多轮工具调用中,单靠把规则塞进上下文,无法获得可靠治理。眼前的请求、环境里的新信息,甚至 Agent 自己追加的推理,都可能重新排列规则的优先级。

因此,AGENTS.md 适合保存代码规范、工具入口、默认流程和升级路径。若“未经批准不得删除数据”只存在于 Markdown 中,它仍然更接近操作说明,而不是安全控制。

关键约束必须进入模型之外

一套实际运行的 Agent 工作流也经历过规则堆积:AGENTS.md 一度接近 20KB,后来压缩到约 4KB,细节改为按需加载。更重要的变化并非节省上下文,而是重新划分职责。

说明性规则留在文档;可访问资源由权限控制;高风险操作由工具门禁检查审批条件;沙箱限制最坏影响范围;执行结果再由独立回读验收。沙箱不能代替业务审批,但它至少能避免一次判断失误直接触及全部生产资源。

如果只能在“再润色第 37 页规定”和“增加一道物理护栏”之间选择,应当先做后者。

把规则写给 Agent,是说明书;把规则写进权限、工具和验证链,才是治理。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。