乐于分享
好东西不私藏

RAG 第一步为什么经常失败?因为文档解析把结构弄丢了

RAG 第一步为什么经常失败?因为文档解析把结构弄丢了
上一期,我们把零散的课程资料整理成了范围清楚、版本明确、来源可追溯的证据库。
但完成资料整理后,还不能马上开始向量化和检索。
因为在原始文件和知识库之间,还有一个非常关键的环节:文档解析。
很多 RAG 项目并不是输在模型,也不是输在向量数据库,而是在文档刚进入系统时,就已经把最重要的信息弄丢了。
同一份课程课件,人打开时可以轻松看出:这是第几章;当前页的标题是什么;哪些内容属于正文;哪些内容属于表格;公式和变量解释是什么关系;实验步骤的先后顺序是什么;这段内容位于哪一页。
但经过一次简单的文本提取后,它可能会变成:
一串顺序混乱的句子;标题和正文混在一起;页码全部消失;表格被拆成零散数字;公式变成乱码;代码缩进全部丢失;图片页直接变成空白。
后面即使检索到了其中一句话,系统也很难判断:
它来自哪一份文件?属于哪一章?位于哪一页?前后还有哪些适用条件?用户该怎样回到原文核对?
所以,文档解析的目标不是“把文字复制出来”。
而是把原始文件转换成:可阅读、可检索、可引用、可追溯的结构化内容。

一、文本提取和文档解析,不是一回事

文本提取解决的问题是:文件里有哪些文字?
文档解析解决的问题是:这些文字原本属于什么结构?
例如,一页 PPT 中可能包含:页面标题;三个知识点;一张电路图;一段图注;页脚中的课程名称。
如果只是提取文字,系统可能得到:课程名称;页面标题;第一条知识点;页脚;第二条知识点;图中标注;第三条知识点。
虽然文字都被“读出来了”,顺序和结构却已经发生变化。
对人来说,这仍然勉强能看懂。
但对后续的切分、检索和引用来说,这些结构错误会被不断放大。
一个合格的文档解析过程,至少要同时满足三个目标。
第一个目标:内容可读
包括:文字顺序基本正确;重复页眉和页脚得到处理;乱码能够识别;缺失页面得到标记;段落不会无意义地拼接。
第二个目标:结构可用
包括:标题和正文能够区分;章节层级能够保留;编号列表保持原有顺序;表格行列关系不被打散;图片和图注能够建立联系;代码块和普通正文能够区分。
第三个目标:来源可追溯
每一个解析单元至少应该知道:来自哪份文件;属于哪门课程;对应哪个章节;位于哪一页或哪张幻灯片;使用的是哪个资料版本。
只满足“内容可读”,系统可能勉强可以回答。
只有同时满足结构可用和来源可追溯,系统才有机会稳定检索并生成准确引用。

二、PPT 解析:标题比字数更重要

课程 PPT 通常有一个特点:每一页文字不一定多,但标题提供了非常强的语义。
例如,一张幻灯片标题是:定时器中断配置流程
正文只有几条简短内容:配置时钟;设置预分频;设置自动重装值;开启中断;启动定时器。
如果解析时只保留正文,却丢掉标题,那么后续知识块中就只剩一串动作。
系统可能无法判断这些步骤属于:定时器配置;串口配置;外部中断配置;还是其他外设配置。
所以,PPT 解析时,建议以“幻灯片”为基本单位,至少保留:幻灯片编号;页面标题;正文文本;列表顺序;表格内容;图片说明;讲者备注;所属章节;原始文件名。
其中,讲者备注很容易被忽略。
有些教师会把补充说明、课堂重点和演讲提示写在备注中。
如果备注属于课程正式内容,就应该保留。
如果只是个人演示提示,则需要在进入知识库前判断是否应当使用。

三、只有图片的 PPT 页面怎么办?

很多课程 PPT 并不是纯文字。
它可能包含:电路原理图;流程图;程序结构图;实验接线图;公式截图;软件操作截图。
如果某一页主要是图片,普通文本提取可能只能得到标题,甚至一片空白。
这时不能直接认为:这一页没有知识内容。
需要先判断图片的作用。
第一类:装饰性图片
例如背景图片、人物照片、无关插图。
这类内容通常不需要进入知识库。
第二类:辅助理解的示意图
例如简单流程示意、结构关系图。
可以保留:图片标题;图注;所在页码;一段人工摘要。
第三类:承载关键知识的图片
例如:电路图;公式图;实验接线图;参数表;代码截图。
这类内容如果无法可靠自动识别,就应该显式标记,并进行人工补录或采用专门的图像解析方式。
最危险的做法不是“没有提取出来”。
而是系统认为已经提取完整,实际上漏掉了页面中最关键的内容。

四、PDF 解析前,先判断是哪一种 PDF

PDF 看起来都是同一种文件格式,但从解析角度看,至少可以分成三类。
第一类:文本型 PDF
这类 PDF 中的文字可以直接选中和复制。
通常可以直接提取字符,但仍然需要检查:双栏内容顺序;页眉页脚重复;换行位置;公式编码;特殊符号;文字框顺序。
例如一篇双栏讲义,正常阅读顺序应该是:左栏从上到下;再读右栏。
但有些解析工具会按照横向顺序提取,变成:左栏第一行;右栏第一行;左栏第二行;右栏第二行。
最后得到的文字看似完整,实际上已经无法正常阅读。
第二类:扫描型 PDF
这类 PDF 本质上是一张张图片。
文字无法直接选中,需要使用 OCR,也就是光学字符识别。
OCR 可以把图片中的文字转成文本,但结果不能直接当作可靠原文。
最容易识别错误的内容包括:数字;单位;公式;上下标;引脚名称;芯片型号;代码符号;英文字母和数字组合。
例如:数字 0 可能被识别成字母 O;数字 1 可能被识别成字母 l;μF 可能被识别成 uF;GPIO0 可能被识别成 GPI00。
普通句子中出现一个错字,也许影响不大。
但实验参数、芯片型号和公式出现一个字符错误,就可能直接改变答案。
第三类:混合型 PDF
有些 PDF 中,一部分页面包含可提取文字,另一部分页面是扫描图片。
这类文件不能只根据第一页判断。
更合理的做法是逐页检测:当前页是否存在文本层;字符数量是否异常;页面是否需要 OCR;OCR 结果是否需要人工抽查。
如果使用 OCR,还应该在元数据中明确标记:解析方法:OCR;OCR 工具;识别日期;置信度;人工抽查状态。

五、Word 和实验指导书:最重要的是步骤顺序

Word 文档和实验指导书通常比 PPT 更连续,但也更容易出现复杂结构。
例如:多级标题;编号列表;实验步骤;警告信息;参数表格;图题;脚注;修订记录;批注。
实验指导书中的步骤顺序尤其重要。
原文可能是:配置系统时钟;初始化 GPIO;配置定时器参数;开启中断;启动定时器。
如果解析后只剩五句普通文本,系统可能无法判断步骤的先后关系。
因此,Word 解析时应尽量保留:
标题 1、标题 2、标题 3 等层级;编号列表;项目符号;表格行列;图片编号;图题;步骤顺序;警告和注意事项。

六、修订、批注和隐藏文本不能默认进入知识库

Word 文档中可能存在:已删除但仍保留的修订内容;教师或同学留下的批注;尚未接受的修改意见;隐藏文字;内部审核说明。
这些内容不一定属于正式文件正文。
如果解析工具把它们全部提取出来,知识库可能会同时包含:原始结论;修改建议;被删除的旧结论;审核人员的评论。
最终系统可能把“建议修改为某参数”当成正式实验参数。
因此,解析前要先确定:修订是否已经接受;批注是否属于正式内容;隐藏文字是否需要保留;旧内容是否应该进入当前版本。
知识库使用的不是“文件中所有能读取的文字”。
而是当前生效、经过确认的正式内容。

七、表格不能被拆成没有表头的数字

表格是课程资料中非常重要的一类内容。
常见表格包括:参数对照表;寄存器配置表;实验结果表;器件型号表;评分标准;考试章节范围表。
如果表格被简单转成连续文本,可能变成:模式 1 0 1 0 2 1 0 1 3 1 1 0。
系统无法知道:哪些是列名;哪些是数据;不同数字分别对应什么含义;单位是什么。
表格解析时,建议保留:表格名称;列名;行名;数据;单位;页码;上下文标题。
可以把表格转换成:
表名:定时器工作模式对照表
列名:工作模式、控制位 M1、控制位 M0、功能说明
第 1 行:模式 0、M1=0、M0=0、13 位定时器
第 2 行:模式 1、M1=0、M0=1、16 位定时器
这样即使后续切分,数据也不会脱离表头和单位。

八、公式要和变量解释放在一起

一个公式单独存在,通常不足以回答问题。
例如:T = (PSC + 1)×(ARR + 1)÷ f
如果系统只保留公式,却丢失变量说明,就无法判断:
T 表示什么;PSC 表示什么;ARR 表示什么;f 是哪个时钟频率;
这个公式适用于什么模式;单位是什么。
所以,公式解析时应尽量保留:原公式;公式名称;变量定义;单位;适用条件;对应章节;所在页码;配套解释。
如果复杂公式无法可靠自动提取,可以采用:记录公式所在页;保留原图;增加人工文字摘要;标记“需要查看原公式”。
不能因为解析困难,就直接把公式页面静默跳过。

九、代码块不能像普通段落一样清洗

代码对空格、缩进、括号和符号非常敏感。
例如 Python 中的缩进决定代码结构。
C 语言中,一个分号、括号或运算符错误,都可能改变代码含义。
所以,代码解析时应保留:代码语言;原始缩进;换行;函数名称;注释;代码所在章节;代码前后的功能说明。
不要为了清理文本,统一删除:空格;换行;特殊符号;注释;括号。
如果代码块和普通正文使用同一种清洗方式,很容易把一段可运行代码变成无法理解的文字。

十、建立统一的解析输出格式

无论原始文件是 PPT、PDF 还是 Word,最终都建议转换成统一的中间格式。
每一个解析单元至少可以包含这些字段:
document_id文件唯一编号。
source_file原始文件名称。
course所属课程。
section_title章节或小节标题。
page_or_slide页码或幻灯片编号。
content_type内容类型,例如:
正文;标题;表格;公式;代码;图注;OCR 文本。
raw_text原始提取文本。
clean_text清洗后的文本。
version资料版本。
reliability资料可靠性等级。
parse_method解析方法,例如:原生文本提取;OCR;人工补录;版面解析。
parse_warning解析风险或异常说明。
例如,一个解析单元可以记录为:
文件:单片机_课件_03定时器_20260901.pdf
章节:第三章 定时器
页码:第 18 页
内容类型:公式
原始内容:T = (PSC + 1)×(ARR + 1)÷ f
解析方式:PDF 原生文本提取
风险提示:公式中的上下标需要人工核对
可靠性:A 级

十一、程序没有报错,不代表解析成功

很多人判断解析是否成功的标准是:
程序运行结束,没有出现错误提示。
但“程序没有崩溃”只能说明代码执行完成。
不能说明:全部页面都被读取;文字顺序正确;表格结构完整;公式没有乱码;页码能够对应;图片中的内容没有丢失。
所以,解析完成后必须进行人工抽查。
建议至少抽查:文件开头;文件中间;文件结尾;表格页面;公式页面;图片页面;代码页面;扫描页面。重点检查:文字顺序是否正常;标题层级是否保留;页码是否准确;表格列名是否存在;公式符号是否完整;代码缩进是否保留;是否存在整页缺失;是否有重复内容。还可以使用简单规则辅助发现异常。
例如统计每页字符数量:某页字符数突然变成 0,可能是扫描页或解析失败;某页字符数异常多,可能是重复提取或阅读顺序混乱;连续多页内容完全相同,可能是页眉页脚被错误提取;大量出现乱码字符,可能是编码或公式解析问题。

十二、解析失败一定要显式记录

最危险的处理方式是:某一页解析失败,但系统没有报错,直接跳过。
用户以后询问这一页的内容时,系统可能会:找不到答案;从其他章节拼出一个相似答案;使用模型通用知识补充;给出错误的确定结论。
更安全的做法是为每个失败页面建立记录。
至少保存:文件名称;页码;失败类型;可能原因;当前处理方式;是否需要 OCR;是否需要人工补录;修复状态;修复日期;处理人员。
例如:
文件:单片机实验指导书.pdf
页码:第 26 页
失败类型:扫描图像,未提取到文本
页面内容:定时器实验接线图
当前处理:已保留页面图片
后续操作:需要人工补充图注和关键引脚说明
修复状态:待处理
显式失败并不可怕。
真正危险的是:错误内容或缺失内容悄悄进入知识库,系统却把它当成完整资料。

十三、不同文件类型应该重点检查什么?

PPT
必须保留:页号、标题、正文、备注。
重点检查:图片页、文字框顺序、重复页脚。
文本型 PDF
必须保留:页码、段落、标题。
重点检查:双栏顺序、公式乱码、换行错误。
扫描 PDF
必须保留:页码、OCR 文本、OCR 标记。
重点检查:数字、单位、公式、型号识别。
Word
必须保留:标题层级、编号、表格、图题。
重点检查:修订、批注、隐藏内容。
表格
必须保留:表名、列名、行数据、单位、上下文。
重点检查:表头丢失、数据错位。
代码
必须保留:缩进、换行、语言类型、函数说明。
重点检查:符号丢失、格式被清洗。

十四、文档解析最容易踩的五个坑

第一个坑:只保存一份合并后的纯文本。
纯文本没有文件、章节和页码,后续很难准确引用。
第二个坑:把 OCR 结果直接当作可靠原文。
OCR 对数字、公式、单位和代码的识别并不稳定。
第三个坑:静默跳过无法解析的页面。
系统会误以为资料完整,用户也无法知道覆盖范围。
第四个坑:看到重复文字就全部删除。
有些重复是页眉页脚,有些重复可能是正文中真正强调的内容,需要先判断。
第五个坑:把表格、公式和代码按普通段落处理。
不同结构需要不同解析和保存方式。

十五、开始切分前,先填写这份解析记录

文件 ID:
原始文件名:
文件类型:
解析工具:
解析方法:
总页数:
成功解析页数:
OCR 页面范围:
页码是否保留:
幻灯片编号是否保留:
标题层级是否保留:
列表顺序是否保留:
表格处理方式:
公式处理方式:
代码处理方式:
图片页处理方式:
抽查页码:
发现的问题:
失败页面:
人工补录内容:
解析版本:
解析日期:
处理人员:
如果这些信息没有记录,后面一旦更换解析工具或调整参数,就很难判断结果为什么发生变化。

30 秒自测

问题:一个 PDF 已经成功提取出全部文字,但页码、章节标题和表格列结构全部丢失。
它是否已经满足 RAG 的文档解析要求?
答案:没有。
它只能算完成了基础文本提取。
由于页码和章节标题已经丢失,后续无法稳定进行章节过滤和准确引用。
由于表格列结构已经丢失,系统也可能无法正确理解表格数据之间的关系。
合格的 RAG 文档解析,不只要读出文字,还要尽量保留内容结构和来源信息。

本篇核心速记

第一句:文档解析要保留内容、结构和来源,而不只是“读出文字”。
第二句:PPT、PDF、Word、扫描件、表格、公式和代码,需要采用不同的处理策略。
第三句:无法解析的内容要显式记录,不能静默进入或退出知识库。

下一篇预告

课程文件完成解析后,我们会得到大量带有章节、页码和来源的标准内容。
但这些内容还不能直接全部塞进向量数据库。
下一步需要决定:
一份课程资料应该怎样切成知识块?
为什么块太大,会带来大量无关内容?
为什么块太小,又会把定义、条件和步骤拆散?
下一篇,我们继续讲:
知识库“切分”到底怎么做?块太大、太小都可能答不准。
关注「狮言科技领域」,了解更多技术。