夜雨聆风学习资料网

ARTICLE · 1027950

MinerU 4.0 正式发布:让复杂文档成为 Agent 可用的知识基础设施

MinerU 4.0 正式发布:让复杂文档成为 Agent 可用的知识基础设施
MinerU 是上海人工智能实验室 OpenDataLab 团队开源的智能文档解析工具,也是开源社区中最受欢迎的复杂文档解析工具之一。它面向 PDF、图片、办公文档、网页、电子书等复杂文档,提供结构化解析与内容提取能力。目前,MinerU 已获得超过 8 万 GitHub Star,并在科研文献解析、AI-Ready 数据生产企业知识库建设等场景中持续被使用。

今天,MinerU 4.0 正式发布

这是 MinerU 面向 Agent 时代的一次重要升级:模型能力进一步增强,Skill 产品形态同步升级。

在模型层,MinerU 4.0 支持更多真实文档格式,提供4种更灵活的解析模式,并新增定位器能力支持 Agent 渐进式读取与原文复查;同时,官方首次针对 AMD Radeon GPU 本地算力环境进行适配,让本地模型的部署和使用覆盖更多主流算力平台

在 Skill 层,新版 MinerU Skill 让人告别手动模型部署,Agent 可以自动安装并调用本地 MinerU 能力。本地解析优先,同时支持 MinerU 远程服务按需启用,涉及文档上传时由用户确认授权,让复杂文档处理具备更清晰的隐私安全边界。

从论文、研报、合同,到课件、表格、扫描件,更多复杂文档都可以直接交给 Agent 处理:先快速读懂全貌,再深入分析重点,最后回到原文核验依据。

MinerU 4.0,做到了让复杂文档真正进入 Agent 工作流。

使用入口:

新版 MinerU Skill 安装方式

将下面内容复制给你的Agent:

...bash

npx skills add opendatalab/MinerU --skill mineru --global --yes

GitHub 开源项目地址

https://github.com/opendatalab/MinerU

01

MODEL UPGRADE

模型升级:让更多真实文档进入统一解析能力

MinerU 4.0 的模型能力,进一步面向真实文档场景升级。

01 支持更多文件格式

PDF、图片,以及 DOC/DOCX、PPT/PPTX、XLS/XLSX、RTF、ODT/ODS/ODP、EPUB、OFD、HTML、CSV/TSV 等常见文档与办公格式,现在都可以进入统一解析流程。用户不再需要先转换格式、整理内容、复制文本,再交给 Agent;更多真实文档可以直接通过 MinerU 进入处理链路。

02 提供更清晰的解析模式

面对不同文档和不同任务,用户不需要用同一种方式处理所有文件。新版本提供flashbasicstandardadvanced 四种模式,分别对应快速预览轻量处理日常高质量解析复杂文档处理,让不同难度的文档匹配更合适的处理方式。

03 新增定位器能力

可以把定位器理解为文档内容的“原文坐标”:Agent 读取到一段内容后,不只拿到文本,也能知道它来自哪一页、哪一个内容块。后续需要复查、引用、继续阅读时,可以直接回到对应位置。

定位器让渐进式读取成为可能。Agent 可以先读结构和重点,再围绕具体问题回到原文继续展开,而不必一次性把整份文档压进上下文。

04本地部署门槛进一步降低

MinerU 4.0 进一步拓宽了本地运行环境的覆盖面:Python 版本支持扩展至 3.10–3.14,覆盖 Windows、Linux、macOS 三大主流平台,并适配 AMD Radeon GPUNVIDIA、Intel 主流 GPU。即使没有 GPU,纯 CPU 设备也可以使用完整功能。全部模型文件(含 VLM 模型)合计最低约 2GB,更节省硬盘空间,也让下载、安装和本地部署更轻量

02

SKILL UPGRADE

Skill 升级:让 Agent 自动调用本地与远程能力

新版 MinerU Skill,是 MinerU 4.0 面向 Agent 场景的重要产品入口。

过去,用户要让 Agent 处理复杂文档,往往需要先判断本地环境、安装状态、模型依赖、处理方式和调用路径。现在,这些前置判断可以交给 MinerU Skill。

告别手动模型部署。你只需要让 Agent 安装 MinerU Skill,它就能检查本地环境,判断是否需要安装 MinerU,并根据当前条件自动选择合适的安装方式和处理路径。

对于论文初稿、内部报告、合同材料、企业知识库等敏感文档,Agent 可以优先调用本地算力完成解析,让文档处理尽可能留在本地环境中。

对于开放资料、轻量任务或云端工作流,Agent 也可以按需调用远程能力。远程服务不会默认启用,涉及文档上传时需要用户确认授权,确保文档处理具备清晰的隐私安全边界

Skill 的作用

更多格式支持、多种解析模式、定位器能力、本地与远程服务,构成了 MinerU 4.0 的能力基础;MinerU Skill 则把这些能力组织成 Agent 可以自动执行的文档处理流程。

03

SCENARIOS

典型场景:Agent 如何使用 MinerU 4.0

场景一:混合格式科研资料整理

你可以把几篇 PDF 论文、一份组会 PPT、一个 Excel/CSV/TSV 实验结果表格、几张截图和网页材料直接交给 Agent。MinerU Skill 会调用 MinerU,把不同格式纳入同一处理流程:读取 PDF 正文、图表和公式,提取 PPT 章节与观点,解析 Excel 实验数据,识别图片和扫描件文字内容。

如果只是快速了解资料主题,Agent 可以先用更快的解析模式完成初读;如果需要进一步比较方法差异、实验结果或技术路线,再对关键文档切换到更高质量的解析方式。最终得到的,不是一堆分散文件,而是一份可以继续追问的研究材料,包括核心观点、方法对比、实验结果、待复查问题,以及对应的原文位置。

场景二:长文档渐进式分析与原文定位

对于几百页的技术报告、合同文件、企业内部材料等不适合直接上传的内容,你也可以交给 Agent,让它先判断重点,再深入分析关键部分。MinerU Skill 可以优先调用本地能力完成解析,在本地读取目录、章节结构和主要内容,形成全局判断。

当你继续追问某个指标、条款、实验设置或风险点时,Agent 可以围绕具体问题搜索文档内容,并定位到相关页面和内容块。此时,定位器的价值会非常直接:Agent 给出的结论不再只是摘要,还可以带着可复查的原文依据。

对科研、企业和严肃知识工作来说,Agent 需要生成答案,也需要帮助你验证答案。MinerU 4.0 让复杂文档从“被读入”,进一步走向“可追踪、可复查、可继续使用”。

04

GET STARTED

使用入口

「MinerU 让复杂文档,从此成为 Agent 可直接使用的知识入口。」

新版 MinerU Skill 安装方式

将下面内容复制给你的Agent:

...bash

npx skills add opendatalab/MinerU --skill mineru --global --yes

GitHub 项目地址

https://github.com/opendatalab/MinerU

END

相关阅读:

打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”

2026-08-14

MinerU 团队新产品 | Sciverse 科学数据基座,把可信的科学知识接入你的 AI 工作流

2026-06-26

MinerU 大赛 40 强公布:从科研语料到行业应用,看数据智能如何加速落地

2026-07-17

相关学习资料

返回首页浏览学习资料