3款PDF解析器横测:10篇论文谁更稳?
科研效率工具实测 · PDF 解析篇
Docling、MinerU 和 Marker,到底谁更适合把论文喂给 AI?
下载论文很容易,把论文真正变成 AI 能读的材料却没那么简单。
双栏排版会打乱阅读顺序,公式可能直接消失,跨行表格容易变形;等你想核对原文时,又发现 Markdown 里没有页码。看起来只是“PDF 转 Markdown”,实际是在同时处理版面、OCR、公式、表格和引用关系。
所以这次我没有继续整理功能列表,而是把同一批 10 份科研 PDF 交给Docling、MinerU 和 Marker:在同一台 MacBook Air 上逐篇运行,看它们分别在哪些地方赢,哪些地方会让人返工。
先给结论:没有总冠军。
想要更快、更干净的通用 Markdown:先试 Docling; 公式和复杂表格优先:更值得先试 MinerU; 想保留页码锚点、方便回到原文:Marker 最突出; 扫描件和复杂论文不要只看平均速度,它们会制造非常明显的长尾。
这也是本文最重要的判断:选 PDF 解析器,不能只问“识别准不准”,要先问你准备拿结果做什么。
先说清楚:三款工具在做什么?
普通 PDF 阅读器看到的是一张页面;RAG、知识库和 AI Agent 更希望得到结构化内容:标题是标题,段落顺序正确,公式能用 LaTeX 表达,表格仍是表格,图片和页码还能追溯。
三款工具的共同目标,都是把 PDF 还原成更适合机器处理的格式,但侧重点不同:
这里的“更好”都只指本次固定样本和配置,不代表所有版本、设备和文档类型的永久排名。
我怎么测的?
测试材料
样本不是随手挑一篇论文,而是 9 篇公开论文加 1 份可控扫描件:
Attention Is All You Need Deep Residual Learning for Image Recognition Robust Speech Recognition via Large-Scale Weak Supervision BERT GPT-4 Technical Report Docling Technical Report Nougat Table Transformer / PubTables-1M LayoutLMv3 将 Attention 前 3 页转成图片后重新生成的扫描版 PDF
前 9 篇各取前 6 页,扫描件取 3 页,共57 页。样本里同时有双栏正文、数学公式、普通表格、复杂表头、图片和扫描 OCR。
环境与公平性
设备:MacBook Air,Apple M2,24 GB 内存; 系统:macOS 26.6.2,arm64; Python:3.12.13; 版本:Docling 2.120.3、MinerU 3.4.5、Marker 2.0.0; 为降低设备后端差异,三者都按 CPU 路径运行; 每篇论文单独启动一次命令,累计墙钟时间;模型已下载,计时不含首次下载; Docling 使用默认转换能力,没有默认开启代价较高的公式增强;MinerU 开启公式与表格;Marker 使用 fast 模式。
这不是学术级准确率 Benchmark。我没有为 57 页制作逐字符人工真值,因此不把“出现了多少公式标记”冒充准确率。结果分为两部分:可以精确复核的运行时间与成功情况,以及对公式、表格、页码和阅读顺序的人工检查。
第一轮结果:Docling 快,但速度不是全部
三款工具逐篇处理 10 份 PDF 都成功。累计时间如下:
Docling 还支持把多文档放进同一条转换流程。本次批量运行 10 份样本耗时 89.8 秒,比逐篇启动的 121.4 秒更快。不过,为了避免“一个工具批量、另两个工具逐篇”的口径混用,正文主表仍采用逐篇累计数据。
Marker 的平均数尤其容易误导:它处理几份文本层完整的 PDF 只用了约 1~8 秒,但 Nougat 样本用了约 180 秒,扫描件用了约 146 秒。容易的页面很快,触发 OCR 或复杂回退后却会突然变慢,这比一个平均值更值得注意。
公式:MinerU 最积极,Docling 默认最克制
用 Attention 论文检查公式时,差异非常明显。
Docling 默认配置的正文和标题很干净,但没有把关键公式输出成可直接复用的 LaTeX。它并非没有公式能力,只是默认没有打开公式增强。我额外对 Attention 前 6 页启用公式增强,单篇耗时升到约 174 秒,其中日志显示公式增强本身占了约 139 秒。
这说明一个容易被忽略的事实:“支持公式”和“默认就以可接受成本输出公式”是两回事。
MinerU会积极输出 LaTeX,分式、根号、上下标都更容易进入后续知识库。代价是文本偶尔出现字符间距异常或 OCR 小错误,公式仍需要抽查,不能直接当作论文源文件。
Marker也能保留不少公式,而且简单页面输出很快;但在本次 Attention 样本里,部分公式被包进两列表格,复杂表达和表格结构有时互相干扰。
如果你的核心任务是“从数学论文里提取可检索、可复制的公式”,本次结果会让我先选 MinerU;如果公式只是辅助,而你更重视干净段落和速度,Docling 默认模式更省心。
表格:简单表格 Docling 更顺眼,复杂表头 MinerU 更能保结构
我重点查看了 Attention 和 Table Transformer 两组样本。
Docling 把不少规则网格直接整理成可读的 Markdown 表格,列宽和内容关系比较清楚,适合人继续编辑。
MinerU 更倾向输出 HTML 表格。对普通读者来说不如 Markdown 清爽,但 rowspan、colspan 能保留跨行、跨列结构;当论文出现多层表头时,这种表达更有价值。当然,个别单元格仍会有 OCR 错字。
Marker 的简单表格可以使用,但本次复杂表头出现过空列、错位和表头拆散。它不是不能解析表格,而是当“表格结构必须直接进入数据库”时,我不会只依赖一次自动转换。
所以表格也没有一句话答案:
给人读、继续改 Markdown:Docling 更舒服; 复杂合并单元格、后续程序处理:MinerU 更有优势; 真正重要的数据表:三者都要保留原页并安排人工校验。
页码追溯:Marker 赢得最明确
当论文进入 RAG,最危险的不是少一个换行,而是 AI 给出结论后,你无法快速回到证据所在页面。
本次 Marker 输出里保留了大量类似 page-x-y 的锚点,并能在内部引用中指向这些位置。对 10 份输出进行模式统计,共出现868 个页码锚点或锚点引用。同样的 Markdown 输出口径下,Docling 和 MinerU 没有提供这种显式页码锚点。
这个数字不是“准确率”,只说明 Marker 对页级追溯做得更主动。若你要搭建论文问答系统、证据审计或带出处的研究助手,这可能比多识别一个公式更重要。
MinerU 则提供了额外的布局 PDF、span PDF 和中间 JSON,调试版面识别很有帮助;只是最终 Markdown 本身没有 Marker 那样直观的页码锚点。
安装与稳定性:失败记录比成功截图更有用
三个工具都不是“pip 安装完就永远不出问题”。
Docling 在这台 Apple Silicon Mac 上安装和运行最顺,单文档与批量都完成。
MinerU 逐篇运行 10 份样本全部成功,但把整个目录一次性交给批处理时,在页面装配阶段约 72% 处退出。逐篇运行可以绕开问题,也更容易定位是哪一份文档出错。
Marker 2.0.0 在 macOS 上还需要 llama.cpp。没有 llama-server 时,10 份样本只有 4 份在 fast 模式下直接完成,其余在公式、OCR、表格或扫描件回退路径上失败;安装依赖后,10 份才全部通过。
此外还要检查许可。Marker 的代码采用 Apache 2.0,但其 README 对模型权重另有许可和商业使用说明。**代码开源不等于配套权重可以无条件用于所有商业场景。**真正上线前,应重新核对你所用版本的官方条款。
到底该怎么选?
如果你不想同时维护三套环境,可以按目标做第一轮筛选:
1. 论文转 Markdown,准备交给人读或交给大模型总结
先试Docling。输出干净、速度稳定,普通双栏论文的阅读顺序也较自然。遇到公式密集文档,再决定是否启用增强或切换工具。
2. 数学、物理、计算机论文,公式和复杂表格是核心资产
先试MinerU。它更愿意输出 LaTeX 和结构化 HTML 表格,但要接受更慢的速度,并对 OCR 与公式做抽查。
3. 要做可追溯的 RAG 或论文证据库
先试Marker,尤其关注页码锚点;同时准备好 macOS 依赖、长尾耗时和模型权重许可检查。
4. 真正重要的科研资料
不要押宝单一路径。更实用的方案是:
先用 Docling 做快速通用转换; 检测到公式密集页或复杂表格时,路由给 MinerU; 需要引用审计时,保留 Marker 页码锚点或自行写入页级元数据; 所有抽取块保留 document_id + page + bbox,让答案可以回到原 PDF。
这也是我做完测试后的最终建议:把解析器当成流水线里的不同工位,而不是互斥的信仰选择。
这次测试的边界
只有 10 份样本、57 页,不能覆盖中文古籍、专利、财报和手写文档; 使用 Apple M2 CPU,不能代表 NVIDIA GPU 或云端高配机器; 没有逐字符真值,因此没有给出虚假的综合准确率; 版本、默认模型和硬件后端变化,都可能改变结果; 速度包含每篇命令启动与模型加载,适合个人批处理视角,不等同于常驻服务吞吐量。
但它足以回答一个实际问题:科研 PDF 解析没有“闭眼选一个”的答案。你越在乎公式、复杂表格和证据追溯,就越应该把失败页面和中间产物留在流程里。
下一轮你更想看哪一种:**中文学位论文、专利 PDF、扫描版教材,还是把三款工具接进同一个本地 RAG?**欢迎留言,我会按需求继续做真实复现。
参考资料
Docling 官方仓库与文档 MinerU 官方仓库与快速开始 Marker 官方仓库与许可说明 Attention Is All You Need Table Transformer / PubTables-1M Docling Technical Report
夜雨聆风