"
MinerU是一款文档解析工具
可将PDF文本、图像DOCX、PPTX文本等XLSX输入转换为 Markdown 和 JSON 等机器可读格式,以便进行后续的检索、提取和处理。
官方网址: https://mineru.net/
GitHub: https://github.com/opendatalab/MinerU
文档解析是 RAG 与 Agent 的第一道关卡。解析质量,直接决定检索与生成的质量上限。
MinerU 用 VLM + OCR 双引擎,把 PDF、扫描件、Office 文档变成大模型真正读得懂的 Markdown / JSON。
做 RAG 的人都知道一句话:垃圾进,垃圾出。知识库的质量上限,在文档进入向量库之前就已经决定了。扫描件识别错一个字、表格结构乱了、公式变成乱码——后面的检索、问答、Agent 调用,全都会跟着出错。
MinerU 是 OpenDataLab 开源的智能文档解析引擎,专注解决这件事:把 PDF、DOCX、PPTX、XLSX、图片、网页,解析成结构完整的 Markdown / JSON,让 LLM、RAG、Agent 工作流直接使用。
📌 本文看点
01
双引擎 · 109 语言
02
四大接入方式
03
私有化部署
CORE CAPABILITIES
它到底能解析什么
MinerU 的定位很明确:面向 LLM、RAG、Agent 工作流的高精度文档解析引擎。它做的不是"把 PDF 变成文字"这种粗活,而是保留结构、还原版式、按人类阅读顺序输出。
109
OCR 识别语言
6
格式全覆盖
2
VLM + OCR 双引擎
「把复杂文档变成 LLM-ready 的结构化数据,是 MinerU 存在的全部理由。」
格式全覆盖
原生支持 PDF、DOCX、PPTX、XLSX、图片与网页,无需先转格式再解析。
公式与表格保真
公式输出为 LaTeX,表格输出为 HTML,精确还原版面结构。
复杂版面不惧
扫描件、手写内容、多栏布局、跨页表格合并,都能处理。
阅读顺序输出
输出遵循人类阅读顺序,自动去除页眉页脚,不污染语义。
INTEGRATION
四种姿势接入
从不会写代码的普通用户,到重度开发者,MinerU 给每种人都留了一条路:MCP Server、RAG 框架集成、SDK/CLI、在线即用。
💡 接入 MCP 后,Cursor 这类编码工具可以直接在对话里把 PDF 交给 MinerU 解析,再基于结果写代码或搭知识库。
PRIVATE DEPLOYMENT
私有化部署,数据不出内网
对于涉密、合规要求高的企业,MinerU 支持完全离线的私有化部署。三种推理后端按需选择,兼顾速度、精度与资源占用。
| pipeline | |
| vlm-engine | |
| hybrid-engine |
国产 AI 芯片适配(10+ 家)
💡 长文档场景:滑动窗口机制显著降低峰值内存,几万页的文档不再需要手动拆分。
VERSION HISTORY
半年进化:3.0 → 3.4
从 2026 年 3 月的 3.0 到 6 月的 3.4,MinerU 走了四步关键的棋:
3.0.0 · 原生 DOCX 与长文档
原生解析 DOCX,不再"先转 PDF 再解析",端到端提速数十倍;pipeline 后端在 OmniDocBench v1.5 拿到 86.2 分。
3.1.0 · 开源协议放开
从 AGPLv3 换成基于 Apache 2.0 的 MinerU Open Source License,商用门槛大幅降低;VLM 升级,原生支持 PPTX / XLSX。
3.3.0 · 效率可调节
新增 effort 参数:medium 档准确率仅降 0.13 分,速度提升 35%~220%;VLM 升级到 2.5-Pro-2605。
3.4.0 · OCR 大升级
OCR 模型升级到 PP-OCRv6,OmniDocBench v1.6 准确率提升约 11%,OCR 处理速度提升约 100%。
THE END
写在最后
MinerU 开源、免费,采用更友好的MinerU Open Source License(基于 Apache 2.0),社区与商用都能放心接入。想立刻体验,打开 mineru.net 在线解析即可,无需部署;想深度集成,去 GitHub 上 opendatalab/MinerU 看文档。
文档解析做好了,RAG 就成功了一半。
小提示:如果只是偶尔解析几份 PDF,直接用它官方的在线版就够了;如果你在搭 RAG 知识库,或者想把文档解析能力接进 Cursor 这类工具,MCP Server 是最快的一条路。
夜雨聆风