MinerU:AI知识库建站的必备工具
你是否也被这些问题折磨过?
论文里的数学公式复制出来变成一堆乱码?扫描版 PDF 想提取表格却发现格式全乱?想给大模型喂点高质量语料,却卡在了"文档解析"这一步?
如果你也遇到过这些糟心事,今天要介绍的开源项目——MinerU,或许能帮你解决问题。
MinerU 是什么?
MinerU 是由上海人工智能实验室(OpenDataLab)开源的一款高性能文档解析工具,专门用来把复杂的 PDF、图片,甚至 DOCX、PPTX、XLSX 等 Office 文档,转换成结构化的 Markdown 和 JSON 格式 。
它的设计初衷很明确:为大语言模型(LLM)训练和检索增强生成(RAG)流程,提供高质量的结构化数据。也就是说,它不只是简单地"抽取文字",而是尽力还原文档原本的排版结构、语义信息,让机器也能"读懂"文档。
核心能力:不止于"能读",更要"读得准"
MinerU 支持多种复杂场景:
• 版面结构保留:自动识别标题、正文、图片、表格等元素,保持文档原有逻辑结构。 • 公式识别:内置 MFD/MFR(数学公式检测与识别)模型,能把论文中的数学公式转换为 LaTeX 格式,配合 pylatexenc完成渲染处理 。• 复杂表格重建:无论是有线表格还是无线表格,都能转换为结构化的 Markdown 或 OTSL 格式。 • 多语言支持:借助 fast-langdetect自动识别语言,并调用对应的 OCR 引擎处理 。• 多种输出格式:标准 Markdown、面向 NLP 优化的 Markdown,以及详细的内容列表(content list)任你选择。
架构设计:多后端灵活切换
MinerU 最大的亮点之一,是它的多后端架构,可以根据你的硬件条件和精度需求自由切换:
| Pipeline | pipeline | |
| VLM | vlm-auto-engine | vllm、lmdeploy、mlx 等多种推理引擎 |
| Hybrid | hybrid-auto-engine | |
| HTTP Client | *-http-client | |
| Office | docxpptx/xlsx |
整个调度流程由 do_parse 和 aio_do_parse 两个核心函数完成任务分发:从 CLI 入口出发,根据文件后缀和配置的后端类型,路由到不同的解析引擎(pipeline、vlm、hybrid 或 office),最终统一生成 middle_json 中间格式,再转换为 Markdown / JSON / 图片等最终产物。
怎么用起来?
MinerU 提供了非常丰富的接入方式,无论你是想快速试用还是深度集成,都有对应的入口:
1. 命令行工具:一行 mineru命令即可批量处理文档 。2. API 服务:基于 FastAPI 的 mineru-api,支持远程调用和异步任务管理 。3. 负载均衡路由: mineru-router帮你管理多个 worker 实例 。4. Web 可视化界面:基于 Gradio 的 mineru-gradio,拖拽文件就能看到解析效果 。5. Python SDK:直接调用 do_parse或aio_do_parse,嵌入自己的数据处理流程。6. 模型服务器:针对 VLM 后端提供了 mineru-vllm-server、mineru-lmdeploy-server、mineru-openai-server等专用服务 。7. 模型下载工具: mineru-models-download一键完成模型权重的自动化下载 。
最后
无论你是想构建自己的 RAG 知识库、给大模型准备训练语料,还是单纯想把手头一堆 PDF 论文批量转成 Markdown 方便阅读整理,MinerU 都是一个值得尝试的开源工具。
项目仍在持续迭代,感兴趣的同学可以去 GitHub 仓库 opendatalab/MinerU 看看。
夜雨聆风