PDF(Portable Document Format)是一种广泛用于文档交换的文件格式,由Adobe Systems开发。它具有跨平台性、固定布局和易于打印等特点。因此,现实中大部分的专业文档都是以 PDF 格式存储,低精度的 PDF 解析会显著影响专业知识问答的效果。
一、技术路线
1.1 三类 PDF,三种难度
| 类别 | 特征 | 难度 | 场景 ||------|------|------|------|| 原生文本 PDF | Word/WPS 直接导出,嵌入文本层 + 字体信息 | ★☆☆ | 普通办公文档 || 排版复杂的文本 PDF | 多栏、表格、公式、页眉页脚混排 | ★★★ | 学术论文、合同、财报 || 扫描件 PDF | 每页就是一张图片,零文本层 | ★★★★★ | 老档案、传真件、书籍扫描 |
1.2 五大经典难题
多栏布局:双栏论文的文字按栏序交错排列,直接读取会得到“第一栏第一行、第二栏第一行、第一栏第二行...”的错乱文本 表格混排:表格内单元格、跨页表格、无框线表格,文本顺序极易打乱 公式混排:行内公式和行间公式穿插在正文中,需要识别并转为 LaTeX 等结构化表示 页眉页脚干扰:“第 X 页 / 共 Y 页”和章节标题被当成正文内容混入 阅读顺序还原:把散布在页面各处的文字块按人类阅读习惯排成线性文本
1.3 两大技术范式:Pipeline vs End-to-End
PDF 文件│├── 1. 文本提取层 ── 提取原生文本 + 坐标信息│├── 2. 版面分析层 ── 深度学习检测:标题、段落、表格、公式、图片区域│├── 3. 专项识别层 ── 表格 → 结构识别 / 公式 → LaTeX / 图片 → OCR│├── 4. 语义组装层 ── 阅读顺序排序、页眉页脚剔除、跨页合并│└── 5. 格式输出层 ── Markdown / JSON / HTML
可控性高:每个环节可独立调试、升级、替换,出问题能精确定位 幻觉风险低:文本来自 PDF 原生层或 OCR 转录,而非 LLM “想象” 性能可预测:每个模型的计算量有上限,不会像 VLM 一样对复杂页面输出暴涨 部署灵活:可以在 CPU 上只跑文本提取,GPU 上跑版面分析,按成本分配资源
环节间的误差传播:版面分析的漏检会导致后续识别完全丢失该区域 工程复杂度高:多个模型的调度、版本管理、结果对齐都是工程负担 对极端复杂排版(海报、报纸、不规则网格)的泛化能力有限
PDF 页面图片 → VLM (ViT + LLM) → Markdown / JSON端到端简化:没有多模型串接,工程链路短 隐式联合建模:版面理解、文字识别、阅读顺序在模型内部统一处理,没有信息断层 泛化能力强:对排版极端不规则的页面(海报、广告页、手写批注)有天然的鲁棒性
幻觉风险:VLM 可能“脑补”出原文没有的内容,对知识库场景这是致命的 成本高:即使使用小型 VLM(如 dots.ocr 的 1.7B),单页推理也比 Pipeline 慢 可控性差:输出格式不稳定,难以针对特定环节调优 吞吐量低:dots.ocr 在 A100 上约 0.47 页/秒,而 Docling Pipeline 可达 9 页/秒
二、核心环节深度拆解
2.1 版面分析
Page├── Section (第 3 章)│ ├── Heading ("3.1 实验方法")│ ├── Paragraph ("本文采用...")│ ├── Table (表 2: 实验结果)│ │ ├── Caption│ │ └── Cells│ └── Figure (图 5: 流程图)│ ├── Image│ └── Caption└── Footer ("— 第 12 页 —")
2.2 表格识别
| 路线 | 代表方案 | 思路 ||------|---------|------|| 视觉结构解析 | TableFormer(Docling) | 将表格图片输入 ViT 编码器 + Transformer 解码器,输出结构描述序列(OTSL 语言),描述每个单元格的边界和合并关系 || 端到端 VLM | dots.ocr, SmolDocling | 表格图片直接送入 VLM,一次输出带 HTML/Markdown 表格标签的完整内容 || 矢量路径 | PyMuPDF `find_tables()` | 从 PDF 内部线条和文本坐标推算表格结构,**零 GPU 开销**,对原生 PDF 表格效果极好 |
2.3 公式识别
2.4 阅读顺序
Docling 的做法:将页面元素构建为有向图,节点是各版面块,边的方向由空间位置和学习到的阅读模式决定。通过拓扑排序确定最终阅读顺序。 MinerU 的做法:使用LayoutReader模型,这是一个专门训练的深度学习模型,输入页面中所有检测框的位置和类别,输出它们的阅读顺序编号。思路是让模型从海量标注数据中学习“人类会怎么读这一页”。
夜雨聆风