
AI 最怕「如果」:大模型的反事实困境,暴露了一个更深的问题
你问 AI「如果二战德国赢了会怎样」,它能聊得头头是道。但那些话,有几分是真的在「推理」,有几分只是在「拼凑听起来合理的句子」?这个问题的答案,比你想象的更令人不安。
先做一个小实验。打开任意一个大模型,问它:「如果牛顿没有发现万有引力,物理学会晚多少年?」它会给你一个相当自信的答案,也许还带着几个具体的年份和人名。读起来逻辑严密,细节充分。但问题是——这个答案是怎么来的?
它不是在「推理」,它是在「补全」
大模型的底层机制是预测下一个词。训练时,它吃进去的是海量真实文本——新闻、论文、小说、论坛帖子。这些文本有一个共同特征:它们都是已经发生过的事情。历史是已知的,规律是已知的,因果链是已知的。模型在这种数据上训练得越久,对「真实世界的模式」就越熟悉。
但「如果……会怎样」这类问题,天然就在已知世界之外。它要求你切断现实的因果链,在一个从未存在过的分支里往前走。没有人写过「如果牛顿没出生,1780年的物理学教科书」,因为那本书不存在。模型没见过这条路,自然也不知道这条路通向哪里。
「
模型学会的是「什么听起来像真的」,而不是「什么在逻辑上必然成立」
」
它能做的,是找到训练数据里和你的问题「最相似的模式」,然后按照那个模式继续生成。这不是推理,这是高维度的模式匹配。结果看起来像分析,实际上更像即兴创作——只不过即兴创作的素材是几千亿个真实句子,所以听起来格外可信。
为什么反事实问题特别容易出问题
1反事实问题没有「标准答案」可以验证,模型的错误无法被训练数据纠正
2这类问题的措辞往往和真实问题高度相似,模型容易把真实世界的结论直接套用
3人类读者对「反事实推理」的期待本身就模糊,很难分辨哪里出了问题
第二点尤其值得展开。「如果苏联没有解体,冷战会持续多久」——这个问题里,「冷战」「苏联」「持续时间」都是模型见过无数次的词汇,相关的历史分析也大量存在于训练数据中。模型会自然地被这些熟悉的词汇「拉回」到真实历史的轨道上,然后用真实历史的逻辑来回答一个根本不在真实历史里的问题。这不是模型在撒谎,而是它的「引力」太强——它太擅长说真实世界的话,以至于在虚构世界里也用同一套语法说话。
这背后是一个更根本的能力缺口
人类做反事实推理,依赖的是「因果模型」。我们脑子里有一套对世界运作方式的理解:A导致B,B导致C。当我们问「如果A不发生」,我们会在这套模型里做手术——切掉A,看整个系统怎么重新运转。这是一种主动的、结构性的思维操作。
3
诺贝尔经济学奖得主朱迪亚·珀尔把因果推理分为三个层次:关联、干预、反事实。大模型擅长第一层,挣扎于第三层。
大模型缺乏这样的内部因果模型。它学到的是词和词之间的统计关系,不是变量和变量之间的因果结构。所以当你做「手术」——切掉某个前提——它没有一套结构可以重新运算,它只能在语言层面继续生成「听起来像反事实推理」的句子。形式对了,内核是空的。
●这就是为什么大模型在「描述事实」时可靠,在「推断反事实」时飘忽——前者是记忆的变体,后者需要真正的因果推理能力。
但这不是说 AI 没用,而是要用对地方
反事实推理的困难,不应该让你得出「AI 一无是处」的结论。恰恰相反,理解这个限制,才能更有效地使用它。用大模型做反事实分析,有一个相对靠谱的策略:把大问题拆成可验证的小步骤。不要问「如果互联网没有出现,世界会怎样」,而是问「互联网的出现具体改变了哪些经济结构」——后者有真实数据支撑,模型给出的答案质量会高得多。然后你自己来做那个「切掉互联网」的思想实验。
换句话说,让 AI 做它擅长的事:调取事实、梳理已知逻辑、整理相关案例。把「如果」这个部分,留给人类。这不是在贬低 AI,而是在承认一个现实:因果推理是人类认知里非常古老、非常核心的能力,它不是靠读更多文本就能习得的。
有意思的是,这个问题其实折射出一个更大的争论:语言能力和思维能力,到底是不是同一件事?大模型的存在,让很多人开始重新审视这个问题。它能说出听起来很「有思想」的话,但背后是否真的有「思想」在运作——这个问题,连研究者之间都没有共识。也许反事实推理的困境,只是这个更深问题的一个小小的切口。
✦ 小结
大模型在反事实问题上容易「编造」,根本原因不是它不诚实,而是它的底层机制是模式匹配而非因果推理。它太擅长说「真实世界的话」,以至于在虚构的假设世界里也用同一套语法——形式上像推理,内核上是拼凑。用好 AI 的关键,是把「事实调取」和「因果判断」分开,让各自做擅长的事。
夜雨聆风