大模型并不会真正把你的全部资料记进脑中。本文从文档切分、向量表示、相似度检索到答案生成,逐步拆解 RAG 的完整工作流程,并说明它能解决什么、有哪些局限,以及适合哪些知识应用场景。
把一份几十页的文档交给 AI,几秒后,它就能回答文档里的问题。
很多人以为,AI 在这几秒钟里“学会”了整份文档。其实,它通常没有接受新训练,也没有把资料永久记进大脑。真正发挥作用的,是 RAG。
RAG 的中文名叫“检索增强生成”。名字听起来复杂,原理却很像一次开卷考试:先找到与问题有关的资料,再根据资料组织答案。
一、文档先被切成小块
一本几百页的书,不可能每问一个问题就从头读到尾。因此,文档进入知识库后,通常会被拆成许多较小的文本块。
切得太大,检索时容易夹带无关内容;切得太小,又可能破坏上下文。例如一句“它的续航时间为 12 小时”,如果与前文的产品名称分开,就很难知道“它”指什么。
所以,切分不能只看字数,还要尽量保留语义完整性。
二、文字变成一串数字
为了比较两段文字是否相关,系统会通过嵌入模型,把文本块转换成一组叫作“向量”的数字。

含义相近的文本向量彼此靠近,含义不同的向量距离较远
可以把它想象成一张语义地图:讨论“手机电池”和“续航”的内容彼此靠近,讨论“相机镜头”的内容则在另一个区域。
需要注意的是,向量并不等于机器真正理解了文字。它只是把文本特征转换成一种便于计算和比较的形式。
三、问题也要进入地图
当你提出“这款设备能用多久”时,系统也会把这个问题转换成向量,然后去知识库中寻找距离较近的文本块。
这个过程叫作检索。
系统可能找到“满电状态下可连续使用 12 小时”,以及电池容量、充电时间等候选内容,再选出相关度最高的几段。
如果真正有用的段落没有被找到,大模型再聪明,也只能根据不完整的信息作答。
四、模型负责组织答案

文档切分、向量化、问题检索、相关片段与大模型生成答案
检索完成后,系统会把用户的问题和找到的资料一起交给大模型,并要求它依据这些内容回答。
这时,大模型的主要角色不是“回忆”,而是阅读、归纳和表达。
整个流程可以浓缩成四步:
文档切分; 文本向量化; 根据问题检索; 结合资料生成答案。
这就是 RAG 的基本工作方式。
五、RAG 改善了什么
RAG 最大的价值,是让大模型使用训练数据之外的知识。企业可以接入内部制度和产品手册,个人可以接入笔记、论文或书籍;资料更新后也不必重新训练整个模型。
如果系统展示资料来源,用户还可以回到原文核对。这种方式更适合专业、私有或经常变化的信息。
六、它仍然可能出错
RAG 能降低模型脱离资料随意回答的概率,但不能彻底消除错误。
原始资料可能不准确,文档切分可能破坏语境,检索也可能找错段落。即使找到了正确内容,大模型在归纳时仍可能误解或遗漏。
因此,可靠的 RAG 系统还要关注资料质量、切分方式、检索策略和引用核验。
结语
理解 RAG,可以先记住一个简单比喻:它不是给 AI 植入一段永久记忆,而是给 AI 准备了一座可以随时查阅的图书馆。
资料是否可靠、书架是否整理得当、管理员能否找到正确页面,共同决定了最后的回答质量。
觉得有用?点个关注,持续获取优质内容。
夜雨聆风