你有没有过这种崩溃时刻:拿到一份几十页的 PDF 论文或行业报告,想把里面的内容喂给大模型做总结,结果复制粘贴出来——公式变成一堆乱码,表格错位成抽象画,双栏排版读起来前言不搭后语,扫描件更是干脆选不中文字。
说真的,PDF 这玩意儿对人类友好,对大模型却是个"刺头"。它本质上是排版指令,不是结构化文本。你直接把 PDF 丢给 ChatGPT、丢进 RAG 知识库,模型拿到的是一堆没有语义的字符流,再聪明也只能"瞎猜"。
这背后缺的,其实是一个靠谱的文档解析环节。今天聊的 MinerU,就是干这个的——而且干得相当漂亮。
它到底在解决什么问题
MinerU 是上海人工智能实验室 OpenDataLab 团队开源的一款高精度文档解析引擎,干的活儿一句话能说清:把复杂的文档,变成大模型能直接用的 Markdown 和 JSON。
别小看这一步。一份真实的 PDF 里,藏着页眉页脚、脚注、页码、多栏排版、图片、表格、公式……如果一股脑提取,模型读到的是"前言 + 页码 + 正文 + 脚注"混在一起的大杂烩。MinerU 做的是把这些噪音剥离掉,按人类阅读顺序重排,再把结构还原出来:
○ 去掉页眉、页脚、脚注、页码,保留语义连贯;
○ 单栏、多栏、复杂版面都能按正确阅读顺序输出;
○ 图片、图片说明、表格、表格标题和脚注,各归各位;
○ 公式自动识别转成 LaTeX,表格自动转成 HTML。
它最初诞生于 InternLM 大模型预训练的过程——团队要处理海量科学文献,被公式和符号转换折磨得不行,索性自己造了个轮子。换句话说,这是个被真实大模型训练需求"逼"出来的工具,不是 PPT 工程。
三种引擎,精度拉满
文档解析这事儿,难点在于"既要快、又要准、还不能瞎编"。MinerU 的解法是双引擎 + 三后端,让你按需取舍。
它有 VLM(视觉大模型)和 OCR 两个引擎,搭配出三种推理后端,在文档解析基准 OmniDocBench v1.6 上的成绩是这样的:
○ pipeline 后端:快速稳定、无幻觉,纯 CPU 也能跑,准确率 86.47;
○ vlm-engine 后端:走高精度路线,支持 vLLM/LMDeploy,准确率 95.30;
○ hybrid-engine 后端:高精度 + 原生文本提取 + 低幻觉,准确率 95.39(high 档)。
翻译一下:如果你只是想本地、没显卡也能批量跑文档,用 pipeline,4GB 显存甚至纯 CPU 就能转起来;如果你追求极致精度、有张 8GB 以上的显卡,上 vlm 或 hybrid,准确率能冲到 95 分以上。
更妙的是 hybrid 后端最近新增了一个 effort 参数(medium/high),medium 模式在 macOS 上处理文本 PDF 速度能提升最高 220%,精度只掉 0.13 分。这种"精度换速度"的开关,对实际工程太友好了——不是所有人都需要顶配精度,很多时候够用就行。
不只是 PDF,化学论文都能啃
很多人以为 MinerU 只是个"PDF 转 Markdown"工具,其实它的输入范围比想象中大:
PDF、图片、DOCX、PPTX、XLSX、网页,它都能吃进去。Word 里的上下标、删除线,Excel 里的表格兼容性,PPT 的版式——这些在最近几个版本里都做了系统性增强。
输出也不止 Markdown 一种,还有 JSON、LaTeX,保留完整的排版层级,方便你直接接 RAG 知识库或喂给 Agent。
有个细节挺有意思:它专门做了化学论文解析,能识别分子结构、提取化学反应、做全局分子关联,还和 A4Chemistry 合作赋能化学科研。公式方面,长公式、多行公式、复杂嵌套结构都能转成 LaTeX/MathML。表格方面,连旋转、跨页、合并单元格这种"地狱级"场景都能还原成 CSV/HTML/Markdown。
也就是说,从普通报告到硬核学术论文,它都打算承包了。
上手其实很简单
开源工具最怕"装半天跑不起来",MinerU 这点做得克制。三行命令搞定安装:
pip install --upgrade pip pip install uv uv pip install -U "mineru[all]" 用起来也是一行命令的事。有显卡就:
mineru -p 输入文件 -o 输出目录 没显卡、想跑 CPU,加个参数指定后端:
mineru -p 输入文件 -o 输出目录 -b pipeline 不想折腾环境,它还提供在线版(mineru.net)、桌面客户端、Gradio 网页界面,甚至 Docker 部署。对开发者,它给了 Python/Go/TypeScript 三种 SDK、REST API,还有 MCP Server,能直接接进 Cursor、Claude Desktop、Windsurf 这些 AI 编程工具。RAG 框架那边,LangChain、LlamaIndex、RAGFlow、Dify、FastGPT 都已打通。
凭什么拿下 71.9k star
开源文档解析工具不少,MinerU 能冲到 71.9k star、175 个 release,靠的是几个实打实的差异化:
一是迭代够狠。 光 2026 年 5 月中旬到 6 月中旬这一个月,就发了 10 个版本,平均两三天一个。最新的 3.4 版把 OCR 模型升级到 PP-OCRv6,精度提升约 11%,处理速度直接翻倍。这种节奏,说明背后有团队在持续投入,不是"发了就晾着"。
二是接地气。 它覆盖了 10 多种国产 AI 芯片——昇腾、寒武纪、燧原、摩尔线程、昆仑芯都支持。OCR 支持 109 种语言。国产芯片这块,多数同类商业工具根本不碰。
三是许可证松绑。 早期是 AGPLv3,对商业部署不太友好;后来迁移到基于 Apache 2.0 的「MinerU Open Source License」,采用门槛大幅降低,企业敢用了。
说到底,文档解析是大模型落地里那个"不起眼但卡脖子"的环节。你的 RAG 再强、Agent 再聪明,喂进去的如果是乱码,出来的也只能是幻觉。MinerU 把这一环做扎实了,还做开源了,难怪开发者愿意用脚投票。
如果你手里正有一堆 PDF、Word、扫描件要喂给大模型,与其跟格式死磕,不如花十分钟把 MinerU 跑起来试试。
参考资料/来源
official(官方)
○ MinerU GitHub 仓库:https://github.com/opendatalab/MinerU
○ MinerU 官网:https://mineru.net
夜雨聆风