正在刊行长文 · Essay
2026-08-23所有内容
随机比特 · Random Bits

三个 AI 都说这篇能发,读者却一眼看出它没干货

2026-08-23AI Engineering / Systemsrbits.uk
三个 AI 都说这篇能发,读者却一眼看出它没干货

我把那篇 Homebrew 6 文章送进自动写作与审核链路,参与写作、审核和放行的三个 AI 一路显示通过。结构完整,表达流畅,段落之间也有清楚的转折。可用户读完后只留下了一句判断——“流畅的零干货评论文”。

我回头对照原稿,才看见这个判断指向的问题:读者看完仍不知道下一步该做什么。原稿谈安全、信任与版本变化,却没有一行可执行命令,没有一份核对清单,也没有说明哪些环境会真正受到影响。自动流程识别出了“像一篇文章”,却没有识别出“能不能帮读者完成一次判断”。

三个 AI 绿灯与一位读者红灯的对比

共享偏好会制造虚假共识

我最初也把多个自动环节同时通过,当成了交叉验证。但这些环节未必真正独立。它们可能共享同一套审美,偏爱结构完整、措辞流畅、论证看似周全的文本,也容易把这些表面特征当成读者价值。

回看 Homebrew 6 的失败,我发现裁判检查了文章是否顺畅,却没有继续检查三个更具体的问题。它没有核对文章能否给出可以运行的命令、说明操作步骤,以及让读者得到可执行的结果。一篇评论可以凭借完整感反复获得绿灯,真正决定收藏与转发的内容却始终缺席。

多个裁判的一致,不等于多份独立证据;如果它们共享评价偏好,一致性只会放大共同盲点。

这也不意味着 AI 初审没有价值。格式错误、明显事实冲突、结构断裂和前后矛盾,仍适合交给自动流程高频筛查。问题只出在把“通过初审”误当成“已经有用”。前者检查稿件是否基本成立,后者必须落到读者能否据此行动。

人工拒绝应成为校准样本

那次差评之后,我停止修饰句子,直接补回三类真实交付,包括三条自查命令、信任机制的解释,以及受影响场景的对照。修订版获得收藏价值的原因很直接。每一项价值都能在正文中被逐项指出,语言润色反而成了次要工作。

这类“自动通过、人工拒绝”的样本,比普通通过样本更值得保存。通过只能证明现有标准再次得到了满足,拒绝却暴露了标准没有定义的部分。它应当直接成为下一轮评价规则的校准材料。

从 AI 初审到失败样本回灌的校准回路

失败样本应回灌为下一轮门禁

我现在只保留一条校准回路。先保留 AI 初审,再把人工拒绝的稿件单独入库;将拒绝原因标成具体失败类型;把该类型转成下一轮必须验证的门禁,并用旧失败样本持续回放。

关键在于标签必须可检查。“没有干货”过于宽泛,无法直接执行;“缺少命令、操作步骤与可执行结果”才可以变成门禁。此后再遇到技术文章,审核不只评价是否流畅,还要逐项指认这些内容位于哪里。无法指认,就不能以结构完整为由放行。

例如,旧门禁只问“结构是否完整”。回灌后还要追问可执行动作在哪里、适用对象是谁、执行后能得到什么结果。门禁检查的是正文证据,而不是“完整”“专业”之类的形容词。

我没有因此取消 AI 初审。这次失败只证明一个有限结论。共享偏好的自动审核可能漏掉尚未定义的读者价值。人工专门提供机器最缺少的拒绝样本,再由自动流程吸收。每一次真实拒绝,都应被转化为下一轮更具体的门禁;这样,失败才不会只留下差评,而会改变系统此后的判断。

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。