乐于分享
好东西不私藏

PDF 转 Markdown 总翻车?这个 71.9k star 开源神器,让大模型真正"读懂"你的文档

PDF 转 Markdown 总翻车?这个 71.9k star 开源神器,让大模型真正"读懂"你的文档

你有没有过这种崩溃时刻:拿到一份几十页的 PDF 论文或行业报告,想把里面的内容喂给大模型做总结,结果复制粘贴出来——公式变成一堆乱码,表格错位成抽象画,双栏排版读起来前言不搭后语,扫描件更是干脆选不中文字。

说真的,PDF 这玩意儿对人类友好,对大模型却是个"刺头"。它本质上是排版指令,不是结构化文本。你直接把 PDF 丢给 ChatGPT、丢进 RAG 知识库,模型拿到的是一堆没有语义的字符流,再聪明也只能"瞎猜"。

这背后缺的,其实是一个靠谱的文档解析环节。今天聊的 MinerU,就是干这个的——而且干得相当漂亮。

它到底在解决什么问题

MinerU 是上海人工智能实验室 OpenDataLab 团队开源的一款高精度文档解析引擎,干的活儿一句话能说清:把复杂的文档,变成大模型能直接用的 Markdown 和 JSON

别小看这一步。一份真实的 PDF 里,藏着页眉页脚、脚注、页码、多栏排版、图片、表格、公式……如果一股脑提取,模型读到的是"前言 + 页码 + 正文 + 脚注"混在一起的大杂烩。MinerU 做的是把这些噪音剥离掉,按人类阅读顺序重排,再把结构还原出来:

○  去掉页眉、页脚、脚注、页码,保留语义连贯;

○  单栏、多栏、复杂版面都能按正确阅读顺序输出;

○  图片、图片说明、表格、表格标题和脚注,各归各位;

○  公式自动识别转成 LaTeX,表格自动转成 HTML。

它最初诞生于 InternLM 大模型预训练的过程——团队要处理海量科学文献,被公式和符号转换折磨得不行,索性自己造了个轮子。换句话说,这是个被真实大模型训练需求"逼"出来的工具,不是 PPT 工程。

三种引擎,精度拉满

文档解析这事儿,难点在于"既要快、又要准、还不能瞎编"。MinerU 的解法是双引擎 + 三后端,让你按需取舍。

它有 VLM(视觉大模型)和 OCR 两个引擎,搭配出三种推理后端,在文档解析基准 OmniDocBench v1.6 上的成绩是这样的:

○  pipeline 后端:快速稳定、无幻觉,纯 CPU 也能跑,准确率 86.47;

○  vlm-engine 后端:走高精度路线,支持 vLLM/LMDeploy,准确率 95.30;

○  hybrid-engine 后端:高精度 + 原生文本提取 + 低幻觉,准确率 95.39(high 档)。

翻译一下:如果你只是想本地、没显卡也能批量跑文档,用 pipeline,4GB 显存甚至纯 CPU 就能转起来;如果你追求极致精度、有张 8GB 以上的显卡,上 vlm 或 hybrid,准确率能冲到 95 分以上。

更妙的是 hybrid 后端最近新增了一个 effort 参数(medium/high),medium 模式在 macOS 上处理文本 PDF 速度能提升最高 220%,精度只掉 0.13 分。这种"精度换速度"的开关,对实际工程太友好了——不是所有人都需要顶配精度,很多时候够用就行。

不只是 PDF,化学论文都能啃

很多人以为 MinerU 只是个"PDF 转 Markdown"工具,其实它的输入范围比想象中大:

PDF、图片、DOCX、PPTX、XLSX、网页,它都能吃进去。Word 里的上下标、删除线,Excel 里的表格兼容性,PPT 的版式——这些在最近几个版本里都做了系统性增强。

输出也不止 Markdown 一种,还有 JSON、LaTeX,保留完整的排版层级,方便你直接接 RAG 知识库或喂给 Agent。

有个细节挺有意思:它专门做了化学论文解析,能识别分子结构、提取化学反应、做全局分子关联,还和 A4Chemistry 合作赋能化学科研。公式方面,长公式、多行公式、复杂嵌套结构都能转成 LaTeX/MathML。表格方面,连旋转、跨页、合并单元格这种"地狱级"场景都能还原成 CSV/HTML/Markdown。

也就是说,从普通报告到硬核学术论文,它都打算承包了。

上手其实很简单

开源工具最怕"装半天跑不起来",MinerU 这点做得克制。三行命令搞定安装:

pip install --upgrade pip pip install uv uv pip install -U "mineru[all]" 

用起来也是一行命令的事。有显卡就:

mineru -p 输入文件 -o 输出目录 

没显卡、想跑 CPU,加个参数指定后端:

mineru -p 输入文件 -o 输出目录 -b pipeline 

不想折腾环境,它还提供在线版(mineru.net)、桌面客户端、Gradio 网页界面,甚至 Docker 部署。对开发者,它给了 Python/Go/TypeScript 三种 SDK、REST API,还有 MCP Server,能直接接进 Cursor、Claude Desktop、Windsurf 这些 AI 编程工具。RAG 框架那边,LangChain、LlamaIndex、RAGFlow、Dify、FastGPT 都已打通。

凭什么拿下 71.9k star

开源文档解析工具不少,MinerU 能冲到 71.9k star、175 个 release,靠的是几个实打实的差异化:

一是迭代够狠。 光 2026 年 5 月中旬到 6 月中旬这一个月,就发了 10 个版本,平均两三天一个。最新的 3.4 版把 OCR 模型升级到 PP-OCRv6,精度提升约 11%,处理速度直接翻倍。这种节奏,说明背后有团队在持续投入,不是"发了就晾着"。

二是接地气。 它覆盖了 10 多种国产 AI 芯片——昇腾、寒武纪、燧原、摩尔线程、昆仑芯都支持。OCR 支持 109 种语言。国产芯片这块,多数同类商业工具根本不碰。

三是许可证松绑。 早期是 AGPLv3,对商业部署不太友好;后来迁移到基于 Apache 2.0 的「MinerU Open Source License」,采用门槛大幅降低,企业敢用了。

说到底,文档解析是大模型落地里那个"不起眼但卡脖子"的环节。你的 RAG 再强、Agent 再聪明,喂进去的如果是乱码,出来的也只能是幻觉。MinerU 把这一环做扎实了,还做开源了,难怪开发者愿意用脚投票。

如果你手里正有一堆 PDF、Word、扫描件要喂给大模型,与其跟格式死磕,不如花十分钟把 MinerU 跑起来试试。


参考资料/来源

official(官方)

○  MinerU GitHub 仓库:https://github.com/opendatalab/MinerU

○  MinerU 官网:https://mineru.net