夜雨聆风学习资料网

ARTICLE · 1138287

MinerU 4.0:别再把整本 PDF 塞进 AI 上下文了

MinerU 4.0:别再把整本 PDF 塞进 AI 上下文了

MinerU 4.0:别再把整本 PDF 塞进 AI 上下文了

做 Agent 的人大概率翻过车:问合同里的违约金比例,模型一本正经编了个数;300 页研报想让它读,只能先写脚本切页拼字符串,账单比结论还贵。

问题不在模型笨,在于文档从没被结构化地读进来。PDF 对人是页面,对 LLM 是一地坐标和碎片——表格断行、公式乱码、扫描件全是噪点。

这个赛道最受关注的开源项目 MinerU,最近发布了 4.0。关键词不是"又快了 10%",而是更激进的转向:从解析工具,变成 Agent 的阅读系统。

一、四档解析:不是所有文档都值得用最贵的方式读

4.0 把解析分成四档:flash 极速预览建索引、basic 纯 CPU 也能跑 OCR、standard 复杂版面默认档、advanced 啃硬骨头用最高质量。

实际解决一个老问题:500 份 PDF 先用 flash 建索引,真要读某份再换 standard。

MinerU 缓存每个档位的产出,读取时复用最好的那份——不重复烧算力,也不静默降级。

引擎彻底解耦:小模型选 ONNX 或 Torch,VLM 独立选 llama.cpp、vLLM、LMDeploy。同一套代码,CPU 服务器能跑,8 卡机器也能做高吞吐。

基础包装完就能用:

uv pip install -U "mineru>=4.0,<5" mineru-kit parse document.pdf -o document.md --tier standard 

二、真正的重头戏:给文档发"书签"

4.0 真正的新东西,是文档库加一套专为 Agent 设计的阅读协议。核心是一个叫 locator 的东西:

doc:ab12cd3/tier:standard/page:42/block:7

它精确到文档、档位、页码、内容块,交互方式因此彻底变了。

第一次读默认只给前 10 页,想继续就按返回的指令续读。长文档不再意味着上下文爆炸,Agent 像人一样翻页,而不是一口吞。

想引用就精确读某个 block,回答直接带上出处:违约金 3%(doc:ab12cd3/.../page:7/block:3)。可引用、可追溯,这是治幻觉的釜底抽薪。

配套能力也按"使用者是 AI"设计:find 找文件、search 只搜已索引内容;输出全带 --json,错误是结构化的 error.code,Agent 分支靠字段而非猜自然语言。

官方甚至直接给了个 Skill,让你的 Claude Code 一句话学会读 PDF:

npx skills add opendatalab/MinerU --skill mineru --global --yes 

三、精度、格式、License:能真正用进生产

输入覆盖 PDF、图片、Office 全家桶、EPUB、OFD、HTML、CSV。Office 等走原生解析,不绕"转 PDF 再 OCR"的弯路,没幻觉才轮得到模型出场。

输出更夸张——一份统一文档模型,九种渲染目标:Markdown、HTML、LaTeX、DOCX、EPUB、PDF、结构化数据。解析一次,各取所需。

精度上有底气:VLM 主模型 MinerU2.5 仅 1.2B 参数,在 OmniDocBench 上精度全面超越 Gemini2.5-Pro、GPT-4o、Qwen2.5-VL-72B。

pipeline 后端拿到 86.2 分且支持纯 CPU 推理,PP-OCRv6 让 OCR 指标提升约 11%、速度翻倍。1.2B 突破几百 B 的通用大模型,是"专用模型能赢多少"最直观的演示。

两个决定敢不敢用的细节。隐私上默认完全本地解析,文档不上传云端,远程必须显式加 --remote,法务、医疗、金融文档能放心喂。

License 已从 AGPLv3 换成 Apache 2.0 基础上的 MinerU 许可证:可自由商用,仅月活超 1 亿或月收入超 2000 万美元需单独谈授权。

写在最后

过去解析产出的是文本,现在产出的是结构——有页码、有块、有稳定引用、有缓存,可检索、可续读、可验证。

当 Agent 成为软件的主要使用者,工具好坏的标准就变了:机器能否精确、可预测、可追溯地完成任务。

8.1 万 Star 不是终点,但方向已经对了。

GitHub:https://github.com/opendatalab/MinerU 文档:https://opendatalab.github.io/MinerU/zh/

相关学习资料