PDF 看起来都是同一种文件格式,但从解析角度看,至少可以分成三类。第一类:文本型 PDF这类 PDF 中的文字可以直接选中和复制。通常可以直接提取字符,但仍然需要检查:双栏内容顺序;页眉页脚重复;换行位置;公式编码;特殊符号;文字框顺序。例如一篇双栏讲义,正常阅读顺序应该是:左栏从上到下;再读右栏。但有些解析工具会按照横向顺序提取,变成:左栏第一行;右栏第一行;左栏第二行;右栏第二行。最后得到的文字看似完整,实际上已经无法正常阅读。第二类:扫描型 PDF这类 PDF 本质上是一张张图片。文字无法直接选中,需要使用 OCR,也就是光学字符识别。OCR 可以把图片中的文字转成文本,但结果不能直接当作可靠原文。最容易识别错误的内容包括:数字;单位;公式;上下标;引脚名称;芯片型号;代码符号;英文字母和数字组合。例如:数字 0 可能被识别成字母 O;数字 1 可能被识别成字母 l;μF 可能被识别成 uF;GPIO0 可能被识别成 GPI00。普通句子中出现一个错字,也许影响不大。但实验参数、芯片型号和公式出现一个字符错误,就可能直接改变答案。第三类:混合型 PDF有些 PDF 中,一部分页面包含可提取文字,另一部分页面是扫描图片。这类文件不能只根据第一页判断。更合理的做法是逐页检测:当前页是否存在文本层;字符数量是否异常;页面是否需要 OCR;OCR 结果是否需要人工抽查。如果使用 OCR,还应该在元数据中明确标记:解析方法:OCR;OCR 工具;识别日期;置信度;人工抽查状态。
五、Word 和实验指导书:最重要的是步骤顺序
Word 文档和实验指导书通常比 PPT 更连续,但也更容易出现复杂结构。例如:多级标题;编号列表;实验步骤;警告信息;参数表格;图题;脚注;修订记录;批注。实验指导书中的步骤顺序尤其重要。原文可能是:配置系统时钟;初始化 GPIO;配置定时器参数;开启中断;启动定时器。如果解析后只剩五句普通文本,系统可能无法判断步骤的先后关系。因此,Word 解析时应尽量保留:标题 1、标题 2、标题 3 等层级;编号列表;项目符号;表格行列;图片编号;图题;步骤顺序;警告和注意事项。
六、修订、批注和隐藏文本不能默认进入知识库
Word 文档中可能存在:已删除但仍保留的修订内容;教师或同学留下的批注;尚未接受的修改意见;隐藏文字;内部审核说明。这些内容不一定属于正式文件正文。如果解析工具把它们全部提取出来,知识库可能会同时包含:原始结论;修改建议;被删除的旧结论;审核人员的评论。最终系统可能把“建议修改为某参数”当成正式实验参数。因此,解析前要先确定:修订是否已经接受;批注是否属于正式内容;隐藏文字是否需要保留;旧内容是否应该进入当前版本。知识库使用的不是“文件中所有能读取的文字”。而是当前生效、经过确认的正式内容。