乐于分享
好东西不私藏

实战 03:pdf文件解析(一)技术分析

实战 03:pdf文件解析(一)技术分析

PDF(Portable Document Format)是一种广泛用于文档交换的文件格式,由Adobe Systems开发。它具有跨平台性、固定布局和易于打印等特点。因此,现实中大部分的专业文档都是以 PDF 格式存储,低精度的 PDF 解析会显著影响专业知识问答的效果。

一、技术路线

Word 和 Markdown 存储的是语义结构——标题、段落、表格的层级关系。PDF 存储的是页面描述语言——在坐标 (x, y) 处用某某字体渲染一串字符,在这画条线,在那放张图。
这意味着解析 PDF 时,你面对的不是一棵 DOM 树,而是一堆无组织的绘制指令。从“视觉呈现”反推“语义结构”,才是问题本质。

1.1 三类 PDF,三种难度

| 类别 | 特征 | 难度 | 场景 ||------|------|------|------|| 原生文本 PDF | Word/WPS 直接导出,嵌入文本层 + 字体信息 | ★☆☆ | 普通办公文档 || 排版复杂的文本 PDF | 多栏、表格、公式、页眉页脚混排 | ★★★ | 学术论文、合同、财报 || 扫描件 PDF | 每页就是一张图片,零文本层 | ★★★★★ | 老档案、传真件、书籍扫描 |
真实场景往往是混合态的:一份 PDF 前 3 页是电子版合同正文,后面附带的是扫描的签字页和证照复印件。

1.2 五大经典难题

  1. 多栏布局:双栏论文的文字按栏序交错排列,直接读取会得到“第一栏第一行、第二栏第一行、第一栏第二行...”的错乱文本
  2. 表格混排:表格内单元格、跨页表格、无框线表格,文本顺序极易打乱
  3. 公式混排:行内公式和行间公式穿插在正文中,需要识别并转为 LaTeX 等结构化表示
  4. 页眉页脚干扰:“第 X 页 / 共 Y 页”和章节标题被当成正文内容混入
  5. 阅读顺序还原:把散布在页面各处的文字块按人类阅读习惯排成线性文本

1.3 两大技术范式:Pipeline vs End-to-End

未解决上述问题, PDF 解析框架大致分化为两条路线:
范式 A:Pipeline 流水线——分而治之
代表框架:MinerU、Docling、Marker、UniParser、PaddleOCR PP-StructureV3
核心理念:将 PDF 解析拆成多个独立子任务,每个子任务由专门的模型或规则处理,最后组装结果。
PDF 文件│├── 1. 文本提取层 ── 提取原生文本 + 坐标信息│├── 2. 版面分析层 ── 深度学习检测:标题、段落、表格、公式、图片区域│├── 3. 专项识别层 ── 表格 → 结构识别 / 公式 → LaTeX / 图片 → OCR│├── 4. 语义组装层 ── 阅读顺序排序、页眉页脚剔除、跨页合并│└── 5. 格式输出层 ── Markdown / JSON / HTML
优势:
  • 可控性高:每个环节可独立调试、升级、替换,出问题能精确定位
  • 幻觉风险低:文本来自 PDF 原生层或 OCR 转录,而非 LLM “想象”
  • 性能可预测:每个模型的计算量有上限,不会像 VLM 一样对复杂页面输出暴涨
  • 部署灵活:可以在 CPU 上只跑文本提取,GPU 上跑版面分析,按成本分配资源
劣势:
  • 环节间的误差传播:版面分析的漏检会导致后续识别完全丢失该区域
  • 工程复杂度高:多个模型的调度、版本管理、结果对齐都是工程负担
  • 对极端复杂排版(海报、报纸、不规则网格)的泛化能力有限
范式 B:End-to-End VLM——一步到位
代表框架:dots.ocr、SmolDocling、MonkeyOCR、olmOCR、Logics-Parsing
核心理念:将整个 PDF 页面作为图片输入一个 VLM(视觉语言模型),让模型直接输出结构化结果。
PDF 页面图片 → VLM (ViT + LLM) → Markdown / JSON
优势:
  • 端到端简化:没有多模型串接,工程链路短
  • 隐式联合建模:版面理解、文字识别、阅读顺序在模型内部统一处理,没有信息断层
  • 泛化能力强:对排版极端不规则的页面(海报、广告页、手写批注)有天然的鲁棒性
劣势:
  • 幻觉风险:VLM 可能“脑补”出原文没有的内容,对知识库场景这是致命的
  • 成本高:即使使用小型 VLM(如 dots.ocr 的 1.7B),单页推理也比 Pipeline 慢
  • 可控性差:输出格式不稳定,难以针对特定环节调优
  • 吞吐量低:dots.ocr 在 A100 上约 0.47 页/秒,而 Docling Pipeline 可达 9 页/秒
随着大模型的进一步升级,通过VLM直接读取PDF将会广泛应用,但需要平衡token消耗和解析时间。
第三条路:混合架构
2025 年下半年出现了融合两条路线的尝试:
MinerU 2.7 Hybrid 后端:文本型 PDF 直接用 pdfminer 提取(Pipeline 思路),扫描件走 VLM 识别,根据页面特征自动切换
Docling 双轨并行:StandardPdfPipeline(AI 模型级联)和 VlmPipeline(SmolDocling 256M)并存,用户按需选择
UniParser:在 Pipeline 框架内引入 VLM 作为“疑难杂症”的兜底方案——表格识别置信度 < 阈值时,裁剪该区域送入 VLM 二次解析
核心判断标准就一条:能走原生文本层就不走 OCR,能走 OCR 就不走 VLM。这是一个成本-准确率-可控性的三重优化问题。

二、核心环节深度拆解

2.1 版面分析

版面分析是 Pipeline 范式中最关键的一环——它决定了后续表格识别、公式识别、OCR 的“注意力”该放在页面哪里。
第一代:规则驱动(XY-Cut 算法)
经典做法是按投影轮廓递归切割:沿 y 轴找水平空白带切分行,沿 x 轴找垂直空白带切分列。
优点:零依赖,速度极快
缺点:遇到无规则空白、嵌套结构、图文混排就失效
第二代:目标检测驱动
代表模型:DocLayout-YOLO(MinerU 所用)、DocLayNet RT-DETR(Docling 所用)
将版面分析视为目标检测问题——检测标题、段落、表格、公式、图片等元素的位置和类别。
DocLayout-YOLO 的关键创新是GL-CRM(全局到局部可控感受野模块):传统 YOLO 在同一层用固定感受野处理所有目标,但版面元素尺度差异极大——标题可能是一行大字,表格可能是半页的网格。GL-CRM 让网络在不同区域动态调整感受野大小,兼顾大尺度表格和小尺度标题。
DocLayNet(Docling 的训练数据集)是人手工标注的约 8 万–15 万页文档,涵盖 13–17 种版面元素类别。有监督训练 + 大规模人工标注,是这一类方法的质量基石。
第三代:分组检测
代表模型:UniParser-LD
传统版面分析给每个元素独立画框。分组检测更进一步:识别关联元素对——图片 + 图注、表格 + 表题、公式 + 公式编号。这些“属于一起”的关系在检测阶段就被保留,后续组装阅读顺序时不会把它们拆散。
版面的结构化输出
检测完元素后,下一步是将它们组织为层级结构:
Page├── Section (第 3 章)│ ├── Heading ("3.1 实验方法")│ ├── Paragraph ("本文采用...")│ ├── Table (表 2: 实验结果)│ │ ├── Caption│ │ └── Cells│ └── Figure (图 5: 流程图)│ ├── Image│ └── Caption└── Footer ("— 第 12 页 —")
Docling 的做法是将这个层级结构作为核心数据模型(DoclingDocument),所有后续处理都在这个模型上操作。Marker 则用 StructureBuilder 将检测到的块按空间关系和语义规则组装成树。

2.2 表格识别

表格识别是所有框架公认的硬骨头,业界达成的共识是分两步:
第一步:表格结构识别——这个单元格占几行几列、有没有合并?
主流方法有三条路线:
| 路线 | 代表方案 | 思路 ||------|---------|------|| 视觉结构解析 | TableFormer(Docling) | 将表格图片输入 ViT 编码器 + Transformer 解码器,输出结构描述序列(OTSL 语言),描述每个单元格的边界和合并关系 || 端到端 VLM | dots.ocr, SmolDocling | 表格图片直接送入 VLM,一次输出带 HTML/Markdown 表格标签的完整内容 || 矢量路径 | PyMuPDF `find_tables()` | 从 PDF 内部线条和文本坐标推算表格结构,**零 GPU 开销**,对原生 PDF 表格效果极好 |
第二步:单元格内容识别——这个单元格里写的什么?
与第一步解耦,单独对每个单元格做文本提取或 OCR。这样做的好处是:即使结构识别正确但内容 OCR 有误,只需要修正单个单元格,不用重新跑整个表格。
跨页表格是一个特殊难题——同一个表格被 PDF 分页截断。MinerU 和 Docling 的做法是在后处理阶段检测页面边界处被切断的表格,通过表头重复、列宽一致的启发式规则进行合并。

2.3 公式识别

学术论文和技术文档中的公式需要从像素转换为 LaTeX 源码,才能在 Markdown 中正确渲染。
MinerU 的方案:专门训练了UniMERNet——一个编码器-解码器模型,将公式图片编码后由 Transformer 解码器生成 LaTeX 序列。这是一个标准的图像到序列(Image-to-Sequence)任务。
Marker 的方案:使用Texify模型,同样是专门的公式识别模型。
关键细节:公式分为行内公式(inline math,如 E=mc^2)和行间公式(display math,独立成行)。版面分析阶段就要区分两者——行内公式由公式检测器找出,行间公式通常作为独立的版面块被检测到。

2.4 阅读顺序

这是 PDF 解析的“最后一公里”,也是最容易被低估的难点。
基础方案:XY-Cut 排序
从左到右、从上到下排列所有检测到的元素块。对单栏文档基本够用,对多栏会失败。
进阶方案:布局感知排序
  • Docling 的做法:将页面元素构建为有向图,节点是各版面块,边的方向由空间位置和学习到的阅读模式决定。通过拓扑排序确定最终阅读顺序。
  • MinerU 的做法:使用LayoutReader模型,这是一个专门训练的深度学习模型,输入页面中所有检测框的位置和类别,输出它们的阅读顺序编号。思路是让模型从海量标注数据中学习“人类会怎么读这一页”。
高级方案:语义组保持
UniParser 的核心创新:在版面分析阶段就标记了元素之间的语义关联——图片和它的图注是一组、表格和它的表题是一组。在阅读顺序排序时,这些组不会被拆散,图注始终紧跟在它所属的图片之后。

相关学习资料