AI 为什么也会"不懂装懂"?—— 聊聊大模型的幻觉问题
你有没有遇到过这种情况:问 ChatGPT 一个问题,它回答得头头是道,引经据典,甚至还能给你编出参考文献。你正想夸它靠谱,结果一查——那篇参考文献根本不存在,完全是它编的。
这就是大模型的"幻觉"问题。今天我们就来聊聊,AI 为什么也会"不懂装懂"。
什么是"幻觉"?
打个比方。你正在考试,遇到一道完全不会的题。你怎么办?硬着头皮编呗。根据自己学过的知识,东拼西凑,写出一段看起来像模像样的答案。
大模型的行为,跟这个一模一样。
大模型本质上是一个"超级猜词器"。它的工作原理是:你给它一段上文,它猜下一个字应该是什么。比如你说"今天天气真",它根据训练数据判断,下一个字大概率是"好"。就这么简单。
但它并不知道"今天天气真"这句话背后的含义是什么。它只是在做概率计算。所以当你问它一个它"没学过"的问题时,它不会说"我不知道",而是继续猜——猜出一个看起来合理、但实际上可能是错的答案。
这就是幻觉。
为什么大模型会产生幻觉?
原因主要有两个。
第一个原因:它没有真正的"记忆"。
大模型的知识来自训练数据。比如某个模型是 2024 年 6 月训练的,那 2024 年 7 月以后发生的事情,它一概不知。你问它"昨天发生了什么新闻",它根本不知道,但它不会承认,而是编一个"看起来像新闻"的东西给你。
第二个原因:它只有"语感",没有"判断力"。
大模型很擅长模仿人类的语言模式。它知道"参考文献"通常长什么样、"法律条文"通常怎么写。所以当你问它一个需要专业知识的问题,它可能会编出一段看起来非常专业的回答,甚至连格式都模仿得很到位。
但问题是——它不知道自己在编。
两个典型场景
场景一:知识过时。
你问:"2025 年诺贝尔物理学奖得主是谁?" 如果模型训练数据只到 2024 年,它要么说不知道,要么编一个看起来像诺贝尔奖得主的名字。你如果不核实,就被它骗了。
场景二:胡编乱造。
你问:"请介绍一本叫《深度学习与煎饼果子制作》的书。" 这本书根本不存在。但大模型会给你编出作者、出版社、内容简介,甚至还能写一段"读者评价"。
看出来了没?大模型就像一个特别会说话的朋友,你问什么它都能接上话,但接的对不对,它自己也不知道。
怎么解决?
既然大模型会"不懂装懂",那能不能让它"先查再答"呢?
就像考试的时候,如果是开卷考试,你可以翻书找答案,那答对的概率就大多了。
给 AI 配一本"参考书"——这就是接下来要聊的 RAG 技术。
简单说,RAG 的思路是:用户提问之后,先不急着让 AI 回答,而是先去一个知识库里搜索相关内容,找到相关的资料之后,再把这些资料一起交给 AI,让它"基于资料"来回答。
这样一来,AI 就不是"凭空编造"了,而是"有据可查"。如果知识库里没有相关内容,AI 也能坦率地说"我没找到相关信息",而不是硬编一个。
小结
今天我们聊了三个问题:
大模型会"幻觉"——它不会说"我不知道",而是编一个看起来合理的答案。 幻觉的原因是大模型没有真正的记忆,只有语感。 解决思路是给 AI 配一本"参考书",也就是 RAG 技术。
下一篇文章,我们就来详细聊聊:RAG 到底是什么?它怎么帮 AI 变得靠谱?
下一篇预告:RAG 是什么?给 AI 配一本"参考书"
夜雨聆风