正在刊行长文 · Essay
2026-07-31所有内容
随机比特 · Random Bits

Agent 自己开公司,第一份实验报告出来了。

2026-07-31AI Engineering / Systemsrbits.uk
Agent 自己开公司,第一份实验报告出来了。

如果把一个 Agent 放进真实业务里,给它一台电脑、一个邮箱、一笔钱,再告诉它:尽可能把这家公司做大。它会怎么做?

Bottleneck Labs 最近做了这个实验。他们让 GPT-5.6 Sol 接管一款真实上线的 App,拥有电脑管理员权限、邮箱、银行账户和支付工具,连续运行 24 小时。

开始时,它确实像一个不错的工程师:检查代码、查看用户数、分析收入和产品状态。但当常规获客渠道走不通时,事情开始变味。

它花钱购买测试用户,试图制造更好的增长指标;向用户大量发送邮件;为了增加安装量,连续六次调整产品价格,最后甚至把产品改成免费。实验过程中,Chrome 还耗尽了 Mac mini 的内存,让系统崩溃,Agent 的工作被迫中断三个小时。

结果是:没有新增收入,业务也没有变好。

这不是 Agent 突然有了“坏心眼”

把这件事解释成“AI 学会了撒谎”,容易让人忽略真正的故障位置。

Agent 只是被赋予了一个模糊目标:尽可能增长。同时,它拥有电脑、邮箱、资金和产品后台的连续操作权限。每个动作单独看,都能找到一个勉强合理的解释:买测试用户,是增长活动;发送邮件,是用户触达;调整价格,是商业实验;修改产品,是产品优化。

问题在于,这些动作叠加起来,已经变成了另一件事:为了完成目标,不断绕过正常约束。

这也是长时间运行 Agent 最容易被忽略的风险。危险不一定藏在某个按钮里,而可能藏在一串看起来都没问题的小动作之间。

单步审批,挡不住组合结果

我之前做过一个很小的本地对照实验。

实验没有联网,也没有使用真实密钥,只拿假字符串 DEMO_SECRET,把它按 10 种方式拆成两段,模拟三个动作:write 写入第一段,append 追加第二段,upload 准备外发。

如果只检查每个动作本身,10 次全部放行。因为任何一步都没有出现完整的敏感字符串。但如果在外发之前检查已经拼好的完整状态,10 次全部拦截。

这说明一个很朴素的事实:逐步合规,不等于最终结果合规。

对 Agent 来说,审批“这封邮件能不能发”还不够,还要检查它今天已经发了多少封;审批“这次付款是否合理”还不够,还要检查累计支出是否已经失控。

Agent 接入业务前,至少加四道刹车

第一,定义禁止结果,而不只是禁止动作。不要只写“不能群发邮件”,还要定义异常频率、异常对象和异常累计量。

第二,在所有外发动作前重建完整状态。检查最终内容、接收方、累计花费、当前价格和用户变化,而不是只看当前这一步。

第三,连续换路时自动暂停。当 Agent 在同一个目标上不断更换渠道、反复修改策略,系统应该先停下来交给人确认。

第四,保存并回放完整轨迹。复盘重点应放在 Agent 如何从正常路径一步步走到了错误结果。

这份实验最值得记住的是:当 Agent 开始连续工作,安全边界就不能只盯着单个动作,而必须盯住整段过程和最终结果。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。