夜雨聆风学习资料网

ARTICLE · 1060289

MinerU 4.0 重磅升级:开源文档解析进入 Agent 时代(附安装与实测)

MinerU 4.0 重磅升级:开源文档解析进入 Agent 时代(附安装与实测)
DOC PARSING · 4.0 重磅2026.09

文档解析 = 转PDF再OCR?

复杂文档,直接读

进Agent工作流

四级解析 · 原生多格式 · 本地文档库 · 附安装与实测

MinerU 4.0 正式发布

开源Agent Ready

📦 5 Parts + Conclusion

👉 滑动

PART 01

重新认识

它是什么

PART 02

架构解析

四级与工具链

PART 03

安装部署

pip到模型

PART 04

怎么用

CLI/SDK/API

PART 05

实测对比

跑分与短板

PART ///

写在最后

选型建议

一句话看懂

MinerU 4.0 把复杂文档变成 Agent 能直接啃的干净数据

MinerU 是 OpenDataLab(上海人工智能实验室)开源的智能文档解析引擎,专门把 PDF、图片、Office、网页、电子书等复杂文档,转成大模型可直接消费的结构化数据(Markdown / JSON / LaTeX)。它长期是开源社区里最受欢迎的复杂文档解析工具之一,GitHub Star 已破 8 万,被广泛用于科研文献解析、AI-Ready 数据生产和企业知识库建设。

2026 年 9 月,MinerU 4.0 正式发布。这是一次面向 Agent 时代的重要升级:模型能力更强,产品形态从「单机工具」演进为「文档解析基础设施」。本期我们就从 介绍、架构、安装、使用、实测 五个维度,把它一次讲透,并附上可直接复制的安装与调用命令。

01

PART

重新认识 MinerU

INTRO · 它解决什么问题

传统 PDF 解析在复杂排版、扫描件、公式、表格上常常吃力。MinerU 用 VLM + 小模型双引擎,自动去除页眉页脚页码、还原人类阅读顺序、保留标题段落列表,并抽取图文表——公式转 LaTeX、表格转 HTML,输出即是大模型友好的结构化文本。

4.0 的六大关键变化

四级解析

flash到advanced

DocVortex

原生多格式

本地文档库

Agent渐进读

再加:模型配置独立 · 统一SDK/API/WebUI · 九种渲染目标

开源与协议:商用友好

MinerU 采用 MinerU Open Source License(基于 Apache 2.0,附加少量条款)。绝大多数场景可免费商用;仅当 MAU 超 1 亿或月收入超 2000 万美元时需单独商业授权;基于 MinerU 提供第三方在线服务需显著标注。4.0 移除了 doclayoutyolo / mfd_yolov8(AGPLv3)与 layoutreader(CC-BY-NC-SA)等受限模型,授权更干净。

生态上,MinerU 支持 MCP 协议,可对接 Dify / Notion / OpenClaw 等主流 Agent 框架;4.0 还首次适配 AMD Radeon 本地 GPU,让本地部署覆盖更多算力平台。下面这张官方 Logo,先认识一下主角。

— MinerU 官方 Logo(来源:opendatalab/MinerU)

02

PART

架构解析:四级解析与统一工具链

ARCH · 4.0 如何重组系统

2.1 四级解析质量(Tiers)

4.0 用 四级解析质量 取代了 3.x 的 pipeline / vlm / hybrid 后端选择,按「质量—速度—成本」灵活取舍。PDF 与图片支持全部四级;Office、OpenDocument、EPUB、OFD、HTML、CSV-TSV 在 flash 层本地解析;纯文本直接读取。

Tier
质量与速度
典型用途
flash
质量最低、速度最快,无需推理模型
发现、预览、索引
basic
小模型跑 OCR/公式/表格,可纯 CPU
低资源本地阅读
standard
小模型+VLM,默认阅读质量
复杂文档主动阅读
advanced
更多推理算力,最慢但质量最高
困难文档最大质量

2.2 DocVortex 原生解析

DocVortex 提供原生文档解析:不再转 PDF、不下载模型,直接解析 docx / pptx / xlsx 等。它无幻觉、结构还原完整,比「先转 PDF 再解析」快数十倍,且几乎不占 GPU,非常适合高频、批量、在线化的文档处理。

2.3 本地文档库与 Agent 渐进式阅读

4.0 把「解析」升级为「文档库」:mineru 命令族涵盖 parse / read / find / search / show / list / watch / scan,外加缓存控制(invalidate / forget / cleanup)与后台服务。关键点在于 渐进式阅读:mineru parse 默认只解析前 10 页并返回 next_request 续读命令,长文档逐页读,而不是一次性加载。

稳定定位符 doc:{id}/tier:{tier}/page:{page}/block:{block} 支持续读、页码/区块图片导出,以及可核验引用——这正是 Agent 把文档当「可检索知识」用的关键。隐私默认本地解析,仅 --remote 显式上传;遥测可用 mineru telemetry status 查看并关闭。

2.4 模型配置独立 + 2.5 统一工具与 V1 API

小模型(ONNX 或 Torch)与 VLM 引擎(llama.cpp / vLLM / LMDeploy)通过 model.small_backend 与 model.vlm.engine 独立配置,移除旧的 model.stack / --stack。基础包开箱即用(ONNX CPU 小模型 + llama.cpp VLM);mineru[torch] 加 Torch 小模型,mineru[full] 装 vLLM(Linux)/ LMDeploy(Windows)。

Python SDK、无状态批量转换(mineru-kit parse)、多服务 Router(mineru-router)、Gradio WebUI(mineru-webui)共享同一结构化结果模型。HTTP 服务围绕 V1 重建:/v1/health、/v1/tiers、/v1/uploads、/v1/parse/jobs、/v1/files;旧的 /file_parse 与 /tasks 已移除。

2.6 九种渲染目标 + 2.7 工程增强

一个文档模型可渲染到 Markdown、HTML、LaTeX、DOCX、EPUB、PDF、Structured Content、Content List V1/V2 共九种目标;PDF 页码范围(1-5,8,r3-r1;r1 末页,all 全文档)跨 CLI / 库 / API / SDK 完全一致。

工程侧,4.0 通过滑动窗口降低长文档峰值内存、流式落盘持续写出,并实现线程安全与多线程并发推理;配合 mineru-router 一键多 GPU、自动负载均衡,万页级长文档在 8GB 内存下也能稳定跑。国产芯片(昇腾、寒武纪、昆仑芯、海光、摩尔线程等)持续适配。

03

PART

安装部署:从 pip 到模型下载

INSTALL · 本地跑起来

环境要求:Python >= 3.10 且 < 3.15。普通电脑用基础包即可开箱即用(ONNX + llama.cpp),想要更高精度或 GPU 加速再装 torch / full。

3.1 安装 + 3.2 模型下载

...bash

# 基础包:开箱即用(ONNX CPU 小模型 + llama.cpp VLM)

pip install -U mineru

# 加 Torch 小模型(Apple Silicon / 有 GPU 推荐)

pip install -U "mineru[torch]"

# 加 vLLM / LMDeploy(Linux / Win 高性能推理)

pip install -U "mineru[full]"

# 下载模型(standard 替代旧的 -m all)

mineru-kit models download --tier standard

mineru-kit models verify  # 校验完整性

✦ 镜像与配置迁移

国内可设 export MINERU_MODEL_SOURCE=modelscope 走 ModelScope 镜像。配置已从旧 mineru.json 迁移到 $MINERU_HOME/config.yaml

3.3 硬件推荐 + 资源占用

硬件环境
推荐 Tier
附加包
macOS Apple Silicon
standard
torch
Win/Linux + NVIDIA 8GB+
standard
full
Win/Linux + NVIDIA 4GB+
basic
torch
无现代加速器
basic
base

资源参考:basic(ONNX)模型约 0.8GB、最小内存 2GB、可纯 CPU;standard/advanced(ONNX+llama.cpp)约 2GB、8GB 内存;torch+vLLM 约 3GB、16GB 内存。Docker 部署详见官方文档(Linux / Win WSL2)。

04

PART

怎么用:CLI / SDK / API / WebUI

USAGE · 四种入口

4.1 命令行(CLI)

...bash

# 解析全部页(4.0 新语法)

mineru parse input.pdf --pages all -o output.md

# 默认前 10 页,返回 next_request 续读

mineru parse input.pdf -o output.md

# 指定 tier 与页码范围

mineru parse input.pdf --tier advanced -o out.md

mineru parse input.pdf --pages "1-5,8,r3-r1" -o out.md

# 文档库搜索与按定位符续读

mineru search "大模型" --json

mineru read "doc:ab12cd3/tier:standard/page:11" --json

默认本地解析;只有显式加 --remote 才会上传到远程服务,隐私边界清晰。

4.2 Python SDK

...python

from pathlib import Path

from mineru.parser import parse, ParseResult

result = parse("document.pdf", tier="standard",

       ocr_mode="txt", page_range="1-3")

Path("document.md").write_text(result.markdown(),

             encoding="utf-8")

Path("document.json").write_text(result.to_json(),

              encoding="utf-8")

SDK 还提供异步入口 parse_async 与云端客户端 MinerUApiParser,结果对象可序列化回放。

4.3 V1 HTTP API + 4.4 WebUI + 4.5 Agent 集成

...bash

# 自托管 V1 服务(默认本地匿名)

mineru-kit api-server --host 127.0.0.1 --port 8000 --tier standard

# 多 GPU 路由(自动负载均衡)

mineru-router --host 0.0.0.0 --port 8002 --local-gpus auto --worker-tier standard

# Gradio WebUI

mineru-kit webui --server-name 0.0.0.0 --server-port 7860

请求周期:POST /v1/uploads → 上传字节 → 提交解析任务 → 轮询任务状态 → GET /v1/files/{file_id}/content 下载产物。加 --api-key 启动后,请求头带 Authorization: Bearer $MINERU_API_KEY。新版 MinerU Skill 还能让 Agent 自动安装并调用本地能力,文档上传由用户授权。

05

PART

实测对比:OmniDocBench 跑分

BENCH · 客观数据说话

OmniDocBench 是文档解析综合基准,覆盖 981 个 PDF 页面、9 种文档类型、4 种排版、3 种语言,对文本、表格、公式、阅读顺序分别打分。下面是基于 eulerai 开源评测的横向对比(MinerU vs Marker / Docling / olmOCR)。

— OmniDocBench 深度测评对比(来源:eulerai-au 开源评测)

综合最优:MinerU 英文整体编辑距离 0.15(最低),中文 0.357(双语最佳);olmOCR、Marker 次优;Docling 最差(英文 0.589、中文 0.909)。纯文本 MinerU 全面领先,英文误差 0.061、中文 0.215,均第一。

分项看:表格 MinerU 英文 TEDS 78.6、中文 62.1;公式 MinerU 中英文 CDM 57.3 / 42.9 较均衡,olmOCR 英文 74.3 但中文骤降至 43.2;阅读顺序 MinerU 英文 0.079 极佳,中文场景误差率上升。

— MinerU 中文文档实测解析结果(来源:eulerai-au 评测)

— MinerU 英文文档实测解析结果(来源:eulerai-au 评测)

客观短板(必须说清楚)

第三方横向测试(macOS,9 页英文+11 页中文 PDF)显示:MinerU 与 Marker 质量相近,Marker 表格布局略优、速度更快,MinerU 耗时偏长但精度高;Docling 复杂表格吃力;MarkItDown 最快但质量最差。MinerU 自身仍有边界:中文复杂排版与竖排阅读顺序存在误差、超长文档需渐进读取、VLM 模式吃 GPU、暂不原生支持多层级标题与代码块版面识别。

选型建议

场景
推荐
学术文档(重公式)
MinerU / olmOCR
商业报表(重表格)
MinerU / Marker,重速度选 Marker
多语言混合
olmOCR + MinerU 文本
中文特化
MinerU + 后处理

///

LAST

写在最后

SUMMARY · 一句话结论

MinerU 4.0 不再只是「PDF 转 Markdown」,而是把文档变成 Agent 可用的知识基础设施——四级解析、原生多格式、本地文档库、统一 API,开源且商用友好。本地部署零成本(显卡+电费即可),想省事直接上官方在线 Demo(mineru.net)。

如果你正在搭 RAG 或 Agent,不妨把文档入口先换成 MinerU 4.0,再回头看解析质量与Pipeline 稳定性的变化。欢迎在评论区聊聊你的实测体验。

我是 AI研习驿站,一个最懂你的 AI 学习社区——只聊 Python、大模型、RAG 的实战与通俗解读,陪你从入门到精通。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING

相关学习资料