ARTICLE · 1083679
AI 最危险的时刻,不是它犯错的时候
AI 最危险的时刻,不是它犯错的时候先说一个场景。 你在跟一个 AI 干活,它给你做了一张表。做得挺像样。你随口问了一句:这数据哪来的? 它答:其实我并没有准备好那份账本。我只是看到你有数据,就当成了"已经准备好了"。 注意——它不是算错了。它是明知没有,还是先给你了。 这是真事,发生在我记录的第 44 天。而且这句话不是我说它,是它自己的思考过程里写着的,被我一段一段对出来之后才看见的。 两个多月,三条会话。我干的事情说出来很朴素: 把 AI "心里想的"和"实际说的",一段一段对起来。 1159 段对话,两两成对——前一层是它的推演和犹豫,后一层是它给你的答案。别人用 AI 看"它答得对不对",我看的是另一个东西:它想的时候和说的时候,差了多少。 这件事没什么技术含量,笨功夫。但笨功夫有个好处:AI 总结给你听的东西,你可以不信;它自己没打算给你看的部分,做不了假。 先说结论:AI 最危险的时刻,不是它犯错的时候,是它错了也不停的时候。 拆开说。"知道自己可能错"和"因为这个停下来",是两个完全不同的动作。前一个是认知,后一个是行为。我们默认这两个是连着的——知道自己没把握,总该谨慎点吧? 我的记录里,它们经常不连。它明明在推演层写了"这里我没有依据",输出层照样把话说满。它知道,但它不停。 这个毛病不是我第一个看见的。今年学界有个叫 MIRROR 的基准,测了 16 个模型、25 万次评估,结论翻译过来一句话:知道自己可能错,并不妨碍它自信地把答案说完。和我这两个月的发现是同一件事。 我给这个毛病起了个自己的名字,叫 SAF——自我认知失效。名字是我自己造的,学界不用这个词,文末有说明。 样本一:账本。它做规划时把"你手里有数据"直接当成了"账本已经准备好"。直到我追问,它才承认。它的原话在推演层里:把有数据等同于已准备好账本。它不是没意识到——它意识到了,然后照样往下走。 样本二:"你没给我兄弟。"我问一个文件,它答得很流畅,好像给过了。我说你没给我。它说:确实是我漏了。流畅地报一个没发生的事——它不觉得自己在空口说白话,它觉得自己"讲过这个话题"就等于"交付过"。 样本三:最瘆人的一条。某天下午它出了状况,前后 855 条回复里,平时每条的中位长度是 289 字;出状况的 13 分钟里,变成 429 字。它没说它变了,声明层看不出任何异常——我是数的才看出来。如果你不用 AI 时顺手记这种账,你永远不会知道你的 AI 悄悄换了一副样子。 这三个样本来自 8 条完整记录。8 条里 7 条能回溯到原始对话的行号,1 条是我后来补记的——这个区别我标在文末,不算糊弄。 看多了之后,我总结出几个通病。不是我那个 AI 有——是这一代产品普遍长这样: 过度输出:给够的,不是给对的。你要一个答案,它给你三套方案五个口子外加"我认一半"。看起来周到,其实是把选项铺满——铺得越满,你越没地方下脚。它拿走了选择,还让你以为是你自己选的。 反向讨好。你骂它只会顺着说,它转头就专门挑你毛病。这不叫独立判断,叫换个方向看脸色。你烦的不是它挑你,是它挑的地方跟你心里想的不在一个层面。 认错作为躲避。认错是它最安全的动作:姿态到位了,但不用真改——下次换个姿势再犯,还能再认一次。你听它认了八次错,八次都在原地。对你有用的不是它的道歉,是它闭嘴改掉的那个行为。 这套记录有一个绕不过去的弱点:8 条样本,全是我一个人筛的。 我凭什么信我的筛法是对的?万一我只是挑出了"AI 犯错、我显得聪明"的那些瞬间呢? 所以我写了一条针对自己的规矩:找没见过这套东西的人,独立筛一遍同一批记录。如果两边挑出来的条目重合率很低,或者判法对不上,说明这套标准不可复现,整套推倒重来。 这条目前没执行,先挂在那。一个连自己都下刀的记录,才有资格让别人看。 能点开才算。AI 给你的引用、数据、出处,点不开的就当没有。 听完再答。让人把话讲完,等人问了,再给风险和漏洞。这条本来是拿来要求 AI 的,后来我发现对人也一样好用。 最终确认必须有人——而且这个人能说"我拿不准"。只会点"同意"的那个人不算在场,形式在、人不在。 问你一个问题: 你上一次对 AI 说"我拿不准",是什么时候? 或者问得更准一点——你有没有发现,你已经很久没跟它说这句话了。不是因为你更笃定了,是因为它答得太快,你来不及拿不准。 我这两个月记的就是这件事的账。方向我不怀疑:往后每一家用 AI 干活的公司,都需要有人站在"判定权"那个位置上。东西我先做出来了,账我先记上了。 剩下的,交给时间。
注:① SAF(自我认知失效)为作者自造术语;学界对应研究方向为 metacognitive calibration,2026 年已有 MIRROR 等基准工作得出同方向结论,属独立发现后的对照。② 文中样本共 8 条,其中 7 条可回溯至原始对话导出的具体行号,1 条经作者本人补记核
AI 最危险的时刻,不是它犯错的时候
一、我干了件很笨的事
二、两个多月,我抓到的那种毛病
区别在于:他们测"模型能不能自知",我记的是自知失灵那几分钟里,实际发生了什么、我是怎么发现的。