乐于分享
好东西不私藏

PDF、Word 一键变 Markdown:开源解析引擎 MinerU

PDF、Word 一键变 Markdown:开源解析引擎 MinerU
做 RAG 或知识库的人,多半被第一关卡过:你想把公司几百页 PDF、一堆 Word 方案喂给模型,结果表格丢了、公式碎成乱码、页眉页脚混进正文,模型读到的顺序更是东拼西凑。问题往往不在模型,在于"喂进去的文档"没被解析干净。
MinerU 干的事,就是把这步做扎实。它是个开源文档解析引擎,把这些复杂格式转成结构化的 Markdown / JSON,让 LLM 能按人类阅读顺序读懂。仓库 2024 年开源,现在已经约 7.4 万 Star、6200 多 Fork,昨天都还在提交,是这类项目里少有的大体量且高活跃的一个。
它到底能解析什么
输入面很宽:PDF、图片、DOCX、PPTX、XLSX,甚至网页链接。输出不只是纯文本,而是:
  • 自动剥掉页眉、页脚、页码,按正确的阅读顺序排版,单栏双栏都认;
  • 保留标题、段落、列表层级;
  • 把图片、表格(转成 HTML)、公式(转成 LaTeX)单独抽出来。
打个比方:很多解析器像把整本书扔进碎纸机再拼接,顺序和图表都乱;MinerU 更像请了个细心的排版编辑,先把版面看清,再按"人怎么读"的顺序整理出来。
最值得说的一点:两套引擎
MinerU 给了三种后端,核心是两个思路:
  • pipeline(OCR 路线):快、稳、几乎不幻觉,纯 CPU 也能跑。适合量大、对速度敏感的批量活。实测在 OmniDocBench v1.6 上 E2E 约 86.2 分。
  • vlm / hybrid(视觉语言模型路线):精度更高,hybrid high 能到 95.39 分,对复杂版面、扫描件更稳;代价是要更多算力。
  • 中间还有个 medium 模式:省资源,但不带图片分析,需要图片理解得切到 high。
一行命令就能跑:
mineru -p <input_path> -o <output_path>      # GPU 环境
mineru -p <input_path> -o <output_path> -b pipeline   # 纯 CPU
不止命令行
它还自带 FastAPI 接口、Gradio 网页界面,能直接拖文件上去看效果。更顺手的是,它原生提供了 MCP 服务器,能接进 Claude Code 这类 Agent 工作流;也和 LangChain、LlamaIndex、Dify、FastGPT 打通。对想做"文档自动入库"的人,等于省掉自己写解析服务的功夫。
顺带一提,它背后是上海 AI Lab 的 OpenDataLab,最早是在 InternLM 大模型预训练里为了解决科学文献的符号转换问题长出来的,现在还支持昇腾、寒武纪等 10 多种国产 AI 芯片——这点对信创环境的人挺实在。
上手门槛
最常规是 uv 装 Python 包:
pip install uv
uv pip install -U "mineru[all]"
装完 mineru -p 文件 -o 输出目录 就能用。不想装环境,也有在线 Demo 可以先试。
对硬件:纯 CPU 能跑 pipeline;想上 GPU 精度或 vlm 路线,最好有块显卡(Volta 及以上或 Apple Silicon)。内存建议 32GB 起,磁盘留 20GB 以上。
要如实说的几点
  • 许可证有坑,做产品的人先看清楚。 它从 3.1.0 起把 AGPLv3 换成了自定的 "MinerU Open Source License"(基于 Apache 2.0),个人和非商业用基本没障碍,但商业使用有附加条件。要做商业化产品,先去读一遍许可证原文,别默认当成纯 Apache 免费。
  • Docker 不支持 macOS,只推荐 Linux 和带 WSL2 的 Windows。Mac 用户直接走 Python 包更省事。
  • Windows 只支持 Python 3.10–3.12,因为底层 ray 还没跟上 3.13,装错版本会踩坑。
  • 解析不是万能的。复杂版面、扫描页、手写内容仍可能翻车,建议在意质量前先跑在线 Demo 验一下。引擎分数(86.2 / 95.39)也只在官方声明的评测环境下成立,别直接当成你文档上的表现。
最后
如果你正被"文档进 RAG 就乱"这个问题烦,MinerU 值得当首选试一下。它把公式、表格、版面顺序这几件最头疼的事都接住了,还顺手给了 MCP 和国内芯片支持。先把协议看清,再决定怎么用,就稳了。
觉得有用就收藏,转给也在搭知识库、做 RAG 的同事。你做文档解析现在用的是什么,是自己写脚本还是已经有趁手的工具?评论区聊聊。
关注我,带你了解更多有用的AI工具。

把微信文章、YouTube 一键变成 NotebookLM 播客,这个技能能办

3.4 万 Star 的 AI agent 项目合集,到底能当什么用

终端也能接 AI?这个 macOS 工具把助手嵌进了命令行

自己生成的 AI 图带水印?这个工具一键清掉标和元数据