
自动剥掉页眉、页脚、页码,按正确的阅读顺序排版,单栏双栏都认;
保留标题、段落、列表层级;
把图片、表格(转成 HTML)、公式(转成 LaTeX)单独抽出来。
pipeline(OCR 路线):快、稳、几乎不幻觉,纯 CPU 也能跑。适合量大、对速度敏感的批量活。实测在 OmniDocBench v1.6 上 E2E 约 86.2 分。
vlm / hybrid(视觉语言模型路线):精度更高,hybrid high 能到 95.39 分,对复杂版面、扫描件更稳;代价是要更多算力。
中间还有个 medium 模式:省资源,但不带图片分析,需要图片理解得切到 high。
mineru -p <input_path> -o <output_path> # GPU 环境
mineru -p <input_path> -o <output_path> -b pipeline # 纯 CPUpip install uv
uv pip install -U "mineru[all]"许可证有坑,做产品的人先看清楚。 它从 3.1.0 起把 AGPLv3 换成了自定的 "MinerU Open Source License"(基于 Apache 2.0),个人和非商业用基本没障碍,但商业使用有附加条件。要做商业化产品,先去读一遍许可证原文,别默认当成纯 Apache 免费。
Docker 不支持 macOS,只推荐 Linux 和带 WSL2 的 Windows。Mac 用户直接走 Python 包更省事。
Windows 只支持 Python 3.10–3.12,因为底层 ray 还没跟上 3.13,装错版本会踩坑。
解析不是万能的。复杂版面、扫描页、手写内容仍可能翻车,建议在意质量前先跑在线 Demo 验一下。引擎分数(86.2 / 95.39)也只在官方声明的评测环境下成立,别直接当成你文档上的表现。




夜雨聆风