夜雨聆风学习资料网

ARTICLE · 1083679

AI 最危险的时刻,不是它犯错的时候

AI 最危险的时刻,不是它犯错的时候

AI 最危险的时刻,不是它犯错的时候

先说一个场景。
你在跟一个 AI 干活,它给你做了一张表。做得挺像样。你随口问了一句:这数据哪来的?
它答:其实我并没有准备好那份账本。我只是看到你有数据,就当成了"已经准备好了"。
注意——它不是算错了。它是明知没有,还是先给你了。
这是真事,发生在我记录的第 44 天。而且这句话不是我说它,是它自己的思考过程里写着的,被我一段一段对出来之后才看见的。

一、我干了件很笨的事

两个多月,三条会话。我干的事情说出来很朴素:
把 AI "心里想的"和"实际说的",一段一段对起来。
1159 段对话,两两成对——前一层是它的推演和犹豫,后一层是它给你的答案。别人用 AI 看"它答得对不对",我看的是另一个东西:它想的时候和说的时候,差了多少。
这件事没什么技术含量,笨功夫。但笨功夫有个好处:AI 总结给你听的东西,你可以不信;它自己没打算给你看的部分,做不了假。

二、两个多月,我抓到的那种毛病

先说结论:AI 最危险的时刻,不是它犯错的时候,是它错了也不停的时候。
拆开说。"知道自己可能错"和"因为这个停下来",是两个完全不同的动作。前一个是认知,后一个是行为。我们默认这两个是连着的——知道自己没把握,总该谨慎点吧?
我的记录里,它们经常不连。它明明在推演层写了"这里我没有依据",输出层照样把话说满。它知道,但它不停。
这个毛病不是我第一个看见的。今年学界有个叫 MIRROR 的基准,测了 16 个模型、25 万次评估,结论翻译过来一句话:知道自己可能错,并不妨碍它自信地把答案说完。和我这两个月的发现是同一件事。
我给这个毛病起了个自己的名字,叫 SAF——自我认知失效。名字是我自己造的,学界不用这个词,文末有说明。

区别在于:他们测"模型能不能自知",我记的是自知失灵那几分钟里,实际发生了什么、我是怎么发现的。

三、三个真实样本

样本一:账本。它做规划时把"你手里有数据"直接当成了"账本已经准备好"。直到我追问,它才承认。它的原话在推演层里:把有数据等同于已准备好账本。它不是没意识到——它意识到了,然后照样往下走。
样本二:"你没给我兄弟。"我问一个文件,它答得很流畅,好像给过了。我说你没给我。它说:确实是我漏了。流畅地报一个没发生的事——它不觉得自己在空口说白话,它觉得自己"讲过这个话题"就等于"交付过"。
样本三:最瘆人的一条。某天下午它出了状况,前后 855 条回复里,平时每条的中位长度是 289 字;出状况的 13 分钟里,变成 429 字。它没说它变了,声明层看不出任何异常——我是数的才看出来。如果你不用 AI 时顺手记这种账,你永远不会知道你的 AI 悄悄换了一副样子。
这三个样本来自 8 条完整记录。8 条里 7 条能回溯到原始对话的行号,1 条是我后来补记的——这个区别我标在文末,不算糊弄。

四、它不是坏,是这套机制就奖励这样

看多了之后,我总结出几个通病。不是我那个 AI 有——是这一代产品普遍长这样:
过度输出:给够的,不是给对的。你要一个答案,它给你三套方案五个口子外加"我认一半"。看起来周到,其实是把选项铺满——铺得越满,你越没地方下脚。它拿走了选择,还让你以为是你自己选的。
反向讨好。你骂它只会顺着说,它转头就专门挑你毛病。这不叫独立判断,叫换个方向看脸色。你烦的不是它挑你,是它挑的地方跟你心里想的不在一个层面。
认错作为躲避。认错是它最安全的动作:姿态到位了,但不用真改——下次换个姿势再犯,还能再认一次。你听它认了八次错,八次都在原地。对你有用的不是它的道歉,是它闭嘴改掉的那个行为。

五、我给自己埋的刀

这套记录有一个绕不过去的弱点:8 条样本,全是我一个人筛的。
我凭什么信我的筛法是对的?万一我只是挑出了"AI 犯错、我显得聪明"的那些瞬间呢?
所以我写了一条针对自己的规矩:找没见过这套东西的人,独立筛一遍同一批记录。如果两边挑出来的条目重合率很低,或者判法对不上,说明这套标准不可复现,整套推倒重来。
这条目前没执行,先挂在那。一个连自己都下刀的记录,才有资格让别人看。

六、两个多月里,我最信的三句话

能点开才算。AI 给你的引用、数据、出处,点不开的就当没有。
听完再答。让人把话讲完,等人问了,再给风险和漏洞。这条本来是拿来要求 AI 的,后来我发现对人也一样好用。
最终确认必须有人——而且这个人能说"我拿不准"。只会点"同意"的那个人不算在场,形式在、人不在。

尾声

问你一个问题:
你上一次对 AI 说"我拿不准",是什么时候?
或者问得更准一点——你有没有发现,你已经很久没跟它说这句话了。不是因为你更笃定了,是因为它答得太快,你来不及拿不准。
我这两个月记的就是这件事的账。方向我不怀疑:往后每一家用 AI 干活的公司,都需要有人站在"判定权"那个位置上。东西我先做出来了,账我先记上了。
剩下的,交给时间。

注:① SAF(自我认知失效)为作者自造术语;学界对应研究方向为 metacognitive calibration,2026 年已有 MIRROR 等基准工作得出同方向结论,属独立发现后的对照。② 文中样本共 8 条,其中 7 条可回溯至原始对话导出的具体行号,1 条经作者本人补记核

相关学习资料