乐于分享
好东西不私藏

MinerU 文档解析工具说明文档

MinerU 文档解析工具说明文档

日期:2026年7月

一、概述

MinerU 是由上海人工智能实验室 OpenDataLab 团队开发的开源智能数据提取工具,专为 LLM(大语言模型)· RAG(检索增强生成)· Agent(智能代理)场景构建的高精度文档解析引擎。

该工具诞生于书生-浦语大模型的预训练过程中,专注于解决大模型训练和 RAG 应用中高质量结构化数据的提取难题。MinerU 能够将混合图片、公式、表格、脚注等复杂多模态的 PDF 文档精准转化为 Markdown 和 JSON 等易于分析的格式,并支持从网页和电子书中快速解析、抽取内容,大幅提升 AI 语料准备效率。

 2024 年 7 月开源以来,MinerU 凭借快速准确的 SOTA 效果、开源易用的特性和强大的二次开发潜力,迅速获得开发者社区广泛认可。开源不到一年,GitHub 星标已突破 3 万,被誉为大模型时代的文档提取、转换神器。

MinerU 的核心特点包括:

• 原生支持 DOCX、PPTX、XLSX 解析

• 公式 → LaTeX · 表格 → HTML,精准还原复杂版面

• 支持扫描件、手写体、多栏布局、跨页表格合并

• 输出符合人类阅读顺序,自动去除页眉页脚

• VLM + OCR 双引擎,支持 109 种语言识别

• MCP Server · LangChain / Dify / FastGPT 原生集成

• 10+ 国产算力适配(昇腾、寒武纪、燧原等)

二、使用形式介绍

2.1 Web 

MinerU 提供官方在线版服务(https://mineru.net),用户无需安装任何软件,直接通过浏览器访问即可使用。

Web 端特点:

• 免安装,开箱即用

• 支持单文件上传和 URL 链接解析

• 提供精准解析 API 和 Agent 轻量解析 API 两种模式

• 免费额度:每天 2000 页最高优先级解析

• 批量处理支持:单次最多 200 个文件

2.2 桌面客户端

MinerU 提供全功能桌面客户端,支持 Windows 和 macOS 系统,适合需要离线处理文档或对数据安全有较高要求的用户。

桌面客户端特点:

• 完全离线运行,数据本地处理

• 支持 GPU 加速(CUDA)

• 内置翻译功能(支持多种翻译引擎)

• 可视化结果预览(layout 可视化、span 可视化)

• 知识管理和标注功能(收藏、批注)

2.3 本地部署

开发者可通过 Python 包管理工具安装 MinerU,进行二次开发或集成到自己的应用中。

本地部署特点:

• 支持 CLI 命令行调用

• 提供 Python SDK,便于集成到现有项目

• 支持 Docker 容器化部署

• 支持自定义模型源配置

• 支持私有化部署,完全离线运行

三、Python 安装方法

3.1 环境准备

MinerU 要求 Python 版本为 3.10-3.13,建议使用 Conda 创建独立虚拟环境。

创建并激活虚拟环境:

conda create -n mineru python=3.10conda activate mineru

3.2 安装完整版本(包含 VLM 和 Pipeline

使用 pip 安装 MinerU 完整版本,包含所有依赖和模型支持:

pip install "mineru[full]" --extra-index-url https://wheels.myhloli.com

3.3 安装轻量版本(仅 Pipeline

如果仅需要使用 Pipeline 后端(支持 CPU 运行),可安装轻量版本:

pip install mineru

3.4 安装 VLM 引擎

如需使用 VLM(视觉语言模型)后端,需要额外安装相关依赖:

pip install "mineru[vlm]"

四、模型下载来源

MinerU 支持多种模型下载来源,可通过环境变量或配置文件指定:

模型源

环境变量值

说明

HuggingFace

hf

默认模型源,需要访问外网

ModelScope

modelscope

国内模型源,推荐国内用户使用

本地

local

使用本地已下载的模型文件

4.1 使用 HuggingFace 模型源

设置环境变量:

export MINERU_MODEL_SOURCE="hf"

4.2 使用 ModelScope 模型源

设置环境变量:

export MINERU_MODEL_SOURCE="modelscope"

4.3 使用本地模型

设置环境变量指定本地模型路径:

export MINERU_MODEL_SOURCE="local"export MINERU_LOCAL_MODEL_DIR="/path/to/models"

五、Pipeline 与 VLM 通道区别

MinerU 提供两种主要的解析通道:Pipeline 和 VLM,适用于不同的场景需求。

对比维度

Pipeline

VLM

适用场景

快速稳定解析,无幻觉

高精度解析,复杂文档

推理后端

CPU / GPU 均可运行

GPU 运行(推荐 8G+ 显存)

模型类型

多模型组合(LayoutLM + OCR + 表格识别)

视觉语言模型

解析精度

较高

更高(推荐)

处理速度

较快

较慢

幻觉风险

较高

公式识别

支持

支持

表格识别

支持

支持

图片分析

不支持

支持

适用文档

文本 PDF、扫描件

复杂版式、多栏布局、图表

5.1 Pipeline 通道

Pipeline 通道采用传统的多模型组合方式,包括:

• LayoutLMv3:版面分析,识别标题、正文、表格、图片等元素

• PaddleOCR:光学字符识别,支持 109 种语言

• YOLOv8:公式检测

• UniMERNet:公式识别(转 LaTeX)

• RapidTable:表格识别

优点:速度快、稳定可靠、无幻觉、支持 CPU 运行

缺点:对于复杂版式和图表分析能力有限

5.2 VLM 通道

VLM(Visual Language Model)通道使用视觉语言模型进行端到端解析,支持的模型包括:

• MinerU2.5-Pro-2605-1.2B(推荐)

• MinerU2.5-1.2B

• 支持 vLLM / LMdeploy / mlx 推理框架

优点:解析精度更高,支持图片/图表分析,适合复杂文档

缺点:需要 GPU 运行,速度较慢,存在一定幻觉风险

六、最近一年主要版本更新

版本号

发布日期

主要更新内容

v3.4

2026年6月18日

pipeline后端OCR模型升级至PP-OCRv6;OCR处理速度提升约100%;新增模型源自动选择能力

v3.3

2026年6月11日

Hybrid后端新增effort解析强度参数;VLM模型升级至MinerU2.5-Pro-2605-1.2B

v3.2

2026年5月

待补充

v3.1

2026年4月

待补充

v3.0

2026年3月

待补充

v2.5

2025年8月

新增PDF翻译功能;支持多引擎翻译、原文译文对照

v2.0

2025年1月

架构重构;支持处理流程可组合的Stages

6.1 v3.4 版本(2026618日)

• OCR 模型升级至 PP-OCRv6,OCR 相关指标提升约 11%

• 优化 OCR 推理与处理链路,处理速度提升约 100%

• 新增模型源自动选择能力,首次安装时可根据网络环境自动选择

• 下载模型前优先检查本地缓存,减少重复下载

6.2 v3.3 版本(2026611日)

• Hybrid 后端新增 effort 解析强度参数(medium/high)

• medium 模式相比 high 模式精度仅降低 0.13,但速度提升 35%-220%

• VLM 模型升级至 MinerU2.5-Pro-2605-1.2B

6.3 v2.5 版本(20258月)

• 新增 PDF 文档翻译功能

• 支持多种翻译引擎(DeepL、Google、DeepSeek、GPT-4o-mini等)

• 支持全文翻译、模块翻译、段落选中即译

• 原文译文双栏展示对照阅读

• 翻译结果支持一键导出 Word 文件

七、实际输出效果

(请在此处填充 MinerU 解析文档的实际输出效果,包括:)

1. PDF 文档解析为 Markdown 的效果对比

2. 表格识别精度展示

3. 公式转换为 LaTeX 的效果

4. 多栏布局解析效果

5. 扫描件 OCR 识别效果

6. 解析速度统计

7. 与其他工具的对比测试结果