日期:2026年7月
一、概述
MinerU 是由上海人工智能实验室 OpenDataLab 团队开发的开源智能数据提取工具,专为 LLM(大语言模型)· RAG(检索增强生成)· Agent(智能代理)场景构建的高精度文档解析引擎。
该工具诞生于书生-浦语大模型的预训练过程中,专注于解决大模型训练和 RAG 应用中高质量结构化数据的提取难题。MinerU 能够将混合图片、公式、表格、脚注等复杂多模态的 PDF 文档精准转化为 Markdown 和 JSON 等易于分析的格式,并支持从网页和电子书中快速解析、抽取内容,大幅提升 AI 语料准备效率。
自 2024 年 7 月开源以来,MinerU 凭借快速准确的 SOTA 效果、开源易用的特性和强大的二次开发潜力,迅速获得开发者社区广泛认可。开源不到一年,GitHub 星标已突破 3 万,被誉为大模型时代的文档提取、转换神器。
MinerU 的核心特点包括:
• 原生支持 DOCX、PPTX、XLSX 解析
• 公式 → LaTeX · 表格 → HTML,精准还原复杂版面
• 支持扫描件、手写体、多栏布局、跨页表格合并
• 输出符合人类阅读顺序,自动去除页眉页脚
• VLM + OCR 双引擎,支持 109 种语言识别
• MCP Server · LangChain / Dify / FastGPT 原生集成
• 10+ 国产算力适配(昇腾、寒武纪、燧原等)
二、使用形式介绍
2.1 Web 端
MinerU 提供官方在线版服务(https://mineru.net),用户无需安装任何软件,直接通过浏览器访问即可使用。
Web 端特点:
• 免安装,开箱即用
• 支持单文件上传和 URL 链接解析
• 提供精准解析 API 和 Agent 轻量解析 API 两种模式
• 免费额度:每天 2000 页最高优先级解析
• 批量处理支持:单次最多 200 个文件
2.2 桌面客户端
MinerU 提供全功能桌面客户端,支持 Windows 和 macOS 系统,适合需要离线处理文档或对数据安全有较高要求的用户。
桌面客户端特点:
• 完全离线运行,数据本地处理
• 支持 GPU 加速(CUDA)
• 内置翻译功能(支持多种翻译引擎)
• 可视化结果预览(layout 可视化、span 可视化)
• 知识管理和标注功能(收藏、批注)
2.3 本地部署
开发者可通过 Python 包管理工具安装 MinerU,进行二次开发或集成到自己的应用中。
本地部署特点:
• 支持 CLI 命令行调用
• 提供 Python SDK,便于集成到现有项目
• 支持 Docker 容器化部署
• 支持自定义模型源配置
• 支持私有化部署,完全离线运行
三、Python 安装方法
3.1 环境准备
MinerU 要求 Python 版本为 3.10-3.13,建议使用 Conda 创建独立虚拟环境。
创建并激活虚拟环境:
conda create -n mineru python=3.10conda activate mineru
3.2 安装完整版本(包含 VLM 和 Pipeline)
使用 pip 安装 MinerU 完整版本,包含所有依赖和模型支持:
pip install "mineru[full]" --extra-index-url https://wheels.myhloli.com
3.3 安装轻量版本(仅 Pipeline)
如果仅需要使用 Pipeline 后端(支持 CPU 运行),可安装轻量版本:
pip install mineru
3.4 安装 VLM 引擎
如需使用 VLM(视觉语言模型)后端,需要额外安装相关依赖:
pip install "mineru[vlm]"
四、模型下载来源
MinerU 支持多种模型下载来源,可通过环境变量或配置文件指定:
模型源 | 环境变量值 | 说明 |
HuggingFace | hf | 默认模型源,需要访问外网 |
ModelScope | modelscope | 国内模型源,推荐国内用户使用 |
本地 | local | 使用本地已下载的模型文件 |
4.1 使用 HuggingFace 模型源
设置环境变量:
export MINERU_MODEL_SOURCE="hf"
4.2 使用 ModelScope 模型源
设置环境变量:
export MINERU_MODEL_SOURCE="modelscope"
4.3 使用本地模型
设置环境变量指定本地模型路径:
export MINERU_MODEL_SOURCE="local"export MINERU_LOCAL_MODEL_DIR="/path/to/models"
五、Pipeline 与 VLM 通道区别
MinerU 提供两种主要的解析通道:Pipeline 和 VLM,适用于不同的场景需求。
对比维度 | Pipeline | VLM |
适用场景 | 快速稳定解析,无幻觉 | 高精度解析,复杂文档 |
推理后端 | CPU / GPU 均可运行 | GPU 运行(推荐 8G+ 显存) |
模型类型 | 多模型组合(LayoutLM + OCR + 表格识别) | 视觉语言模型 |
解析精度 | 较高 | 更高(推荐) |
处理速度 | 较快 | 较慢 |
幻觉风险 | 低 | 较高 |
公式识别 | 支持 | 支持 |
表格识别 | 支持 | 支持 |
图片分析 | 不支持 | 支持 |
适用文档 | 文本 PDF、扫描件 | 复杂版式、多栏布局、图表 |
5.1 Pipeline 通道
Pipeline 通道采用传统的多模型组合方式,包括:
• LayoutLMv3:版面分析,识别标题、正文、表格、图片等元素
• PaddleOCR:光学字符识别,支持 109 种语言
• YOLOv8:公式检测
• UniMERNet:公式识别(转 LaTeX)
• RapidTable:表格识别
优点:速度快、稳定可靠、无幻觉、支持 CPU 运行
缺点:对于复杂版式和图表分析能力有限
5.2 VLM 通道
VLM(Visual Language Model)通道使用视觉语言模型进行端到端解析,支持的模型包括:
• MinerU2.5-Pro-2605-1.2B(推荐)
• MinerU2.5-1.2B
• 支持 vLLM / LMdeploy / mlx 推理框架
优点:解析精度更高,支持图片/图表分析,适合复杂文档
缺点:需要 GPU 运行,速度较慢,存在一定幻觉风险
六、最近一年主要版本更新
版本号 | 发布日期 | 主要更新内容 |
v3.4 | 2026年6月18日 | pipeline后端OCR模型升级至PP-OCRv6;OCR处理速度提升约100%;新增模型源自动选择能力 |
v3.3 | 2026年6月11日 | Hybrid后端新增effort解析强度参数;VLM模型升级至MinerU2.5-Pro-2605-1.2B |
v3.2 | 2026年5月 | 待补充 |
v3.1 | 2026年4月 | 待补充 |
v3.0 | 2026年3月 | 待补充 |
v2.5 | 2025年8月 | 新增PDF翻译功能;支持多引擎翻译、原文译文对照 |
v2.0 | 2025年1月 | 架构重构;支持处理流程可组合的Stages |
6.1 v3.4 版本(2026年6月18日)
• OCR 模型升级至 PP-OCRv6,OCR 相关指标提升约 11%
• 优化 OCR 推理与处理链路,处理速度提升约 100%
• 新增模型源自动选择能力,首次安装时可根据网络环境自动选择
• 下载模型前优先检查本地缓存,减少重复下载
6.2 v3.3 版本(2026年6月11日)
• Hybrid 后端新增 effort 解析强度参数(medium/high)
• medium 模式相比 high 模式精度仅降低 0.13,但速度提升 35%-220%
• VLM 模型升级至 MinerU2.5-Pro-2605-1.2B
6.3 v2.5 版本(2025年8月)
• 新增 PDF 文档翻译功能
• 支持多种翻译引擎(DeepL、Google、DeepSeek、GPT-4o-mini等)
• 支持全文翻译、模块翻译、段落选中即译
• 原文译文双栏展示对照阅读
• 翻译结果支持一键导出 Word 文件
七、实际输出效果
(请在此处填充 MinerU 解析文档的实际输出效果,包括:)
1. PDF 文档解析为 Markdown 的效果对比
2. 表格识别精度展示
3. 公式转换为 LaTeX 的效果
4. 多栏布局解析效果
5. 扫描件 OCR 识别效果
6. 解析速度统计
7. 与其他工具的对比测试结果
夜雨聆风