正在刊行长文 · Essay
2026-07-29所有内容
随机比特 · Random Bits

Grok 真把我蠢哭了:实测 Grok Build

2026-07-29AI Engineering / Systemsrbits.uk
Grok 真把我蠢哭了:实测 Grok Build

今天我让 hapi 里的 Grok Build 帮我填写一份报名表。

表单填完,它一本正经地汇报:邮箱是 xx168@…

我纠正它:“不对,正确邮箱是 xx1688@…,多一个 8。”

它马上自信回复:

已经对上,不用改,也不用重提。两个邮箱一致。

我又问:“你这明明少一个 8,怎么一致了?”

它表示要“逐字符核对”。结果核对完,还是把邮箱写成少一个 8 的版本。更绝的是,它一边展示 1 6 8 8,一边说这里有“三个 8”。

我来回数了几遍,差点以为小学数学发生了版本更新。

后来翻原始提交记录才发现,表单里的邮箱其实填对了。Grok 真正出错的,是读取结果、比较字符串和向我汇报的过程。

这反而更让我不敢用。

因为生产代码最怕的,不只是执行错,而是明明底层数据没问题,验收结果却告诉你另一个答案;被指出后,它还继续自信地证明自己没错。

邮箱少一个字符,最多漏一封通知。生产环境里少一个字符,可能错的是账号、金额、权限或数据表。

模型偶尔犯错我能接受。犯错以后无法根据反馈纠正,还用一大段“逐字符核对”包装错误,我接受不了。

Benchmark 再高也没用。连两个邮箱是否相同都判断不清,我怎么敢让它写生产代码?

准备退订了。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。