文字大多还在,阅读顺序却乱了。这类问题常见于缺少可靠阅读顺序信息的双栏 PDF。Docling 能做的,就是把被双栏排版打散的阅读顺序重新接上,交给你一份能读、能整理的工作稿。

图 1|直接复制乱序。 同一页 PDF 的图注被夹进正文中,说明问题来自阅读顺序,而不是文字缺失。
●1. 先看版面:Docling 把版面元素组织起来
双栏 PDF 的解析中出现左右栏交错,主要问题是页面上的文本块没有按人眼阅读顺序重新组织,页面坐标和阅读顺序没有被保留。
Docling 是一套由 IBM Research 发起的开源文档解析工具,支持 PDF、DOCX、PPTX、XLSX、HTML 和图片等多种输入,可以把解析结果统一组织为结构化文档,再导出为 Markdown、HTML 或 JSON。对于 PDF,它处理的不只是字符提取,还包括页面布局、阅读顺序和表格结构。
这也是 Docling 适合处理双栏乱序的原因。它不是替你读懂论文,也不是一次性修好所有复杂元素,而是先识别标题、段落、图注等版面元素,尝试把它们组织成一份可检查的工作稿。先把语义连续性接回来,后续的摘要、检索和知识库整理才有可靠的文本基础。
●2. 安装与配置:先用 standard 建立基线
先用 pip install docling 完成基础安装。安装后既可以通过 Python API 调用,也可以直接使用 CLI 命令。
Python API 适合嵌入批处理或后续知识流;CLI 命令不需要另写脚本,输入文件、pipeline、OCR 开关、输出格式和目录都能在一条命令中明确记录。

图 2|Docling Quickstart。 官方页面给出安装命令 `pip install docling`,作为后续 CLI 配置的入口。
CLI 命令的 --pipeline 参数提供 legacy、standard、vlm 和 asr 四个选项:
●standard: 从 PDF 文字层起步,同时处理版面和表格;可以关闭 OCR,也不要求 GPU。
●vlm: 把页面作为图像交给视觉语言模型处理,会替代 standard 的版面解析和 OCR 路线;复杂页面可能更有优势,但模型和资源要求更高。
●legacy 与 asr: 前者用于兼容旧处理方式,后者用于音频转写。
对于双栏论文的版式问题,先用 standard 建立最低复杂度基线,并关闭 OCR,只观察现有文字能否按正确顺序重新连接:
docling convert paper.pdf --pipeline standard --no-ocr --to md --output ./docling-output
--no-ocr 不是为了省一步,而是避免重新识别已有文字,混淆“阅读顺序是否恢复”的判断。如果 standard 仍然无法理顺版面,可以考虑 --pipeline 改为 vlm 模式。
●3. 用一页验收:先看段落和图注顺序
双栏解析是否值得继续,不用先看全文输出量,先拿一页最典型的双栏页做小验收。验收对象不是 Markdown 长不长,而是页面上的内容关系有没有接回来。
还是开篇那个图注插入正文的样本。使用 Docling 解析后,图注独立成段。

图 3|同页输出对比。 Docling 先接回完整正文段落,再把 Figure 2 图注独立成段。
对于解析结果的验收,可以快速检查三处:
●标题与段落: 小标题后没有跳到另一栏的正文。
●栏间衔接: 左栏读完后,右栏承接的是下一段,而不是页面中间的句子。
●图注与脚注: 说明文字没有被插入正文,引用编号仍能找到对应位置。
如果读论文遇到的问题是正文、图注和页眉的结构乱序,Docling 值得作为第一个尝试的解析工具。今天就挑一页问题明显的论文,看标题、栏间和图注是否接得上;成立后再扩大到全文。
下一步问题|论文中的表格和公式,怎样少丢一点?
下一期继续看 MinerU:当阅读顺序已经理顺,真正难复用的往往是表格、公式和复杂版式。
夜雨聆风