乐于分享
好东西不私藏

推荐文档处理领域的顶级神器,第二弹:MinerU

推荐文档处理领域的顶级神器,第二弹:MinerU
在多模态文档解析领域,上期给大家说过的百度飞桨的 PaddleOCR-VL-1.6 一直是当之无愧的标杆。而今天我们要重点关注的是另一款快速崛起的国产工具,MinerU,它由上海人工智能实验室 OpenDataLab 团队打造,目前已成为仅次于 PaddleOCR-VL-1.6 的第二大开源文档解析解决方案。

为什么文档解析成为企业 AI 落地的关键瓶颈?

企业内部 80% 以上的数据都以非结构化形式存在:PDF 报告、Word 文档、PPT 演示、Excel 表格、纸质档案等等。这些数据人类可以轻松阅读,但 AI 系统处理起来较为麻烦。
要让 AI 真正为企业创造价值,首先必须将这些非结构化数据转换为机器可读的结构化格式。这正是 MinerU 这类工具的核心价值所在。

两大核心使用场景

  • RAG 系统的 "心脏":文档预处理(占总使用量 60%+)

这是 MinerU 目前最主流的应用场景。任何企业想要搭建内部知识库 RAG 系统,文档预处理都是第一步也是最关键的一步。
没有高质量的结构化数据,后续的切片、嵌入、重排、检索等操作全都是空中楼阁。MinerU 能一次性处理企业内部所有格式的历史文档,为 RAG 系统打下坚实的数据基础。
  • 工业级 OCR 处理:批量数字化利器

对于少量纸质文档,全能扫描王这类工具足够用。但当你面对成百上千页的手写病历、检验报告、企业档案时,就必须依靠 MinerU 这样的专业模型。
它能精准识别手写和打印扫描件,输出保持原格式的文本数据。在医疗、金融、政务等需要大规模文档数字化的行业,MinerU 已经成为了标配工具。

项目信息

项目地址:https://github.com/opendatalab/mineru
github上已经6.5万star了
官网:
https://mineru.net/

使用方式

mineru有四种使用方式:

1.本地部署

MinerU 最新稳定版(2.5)总参数量为 1.2B,和PaddleOCR-VL-1.6的0.9B相差不大,建议3090或4090显卡和32G内存的配置就可以流畅运行。
部署也比较简单,github上也有详细的文档。就不多说了。

2.在线直接使用

注册登录后,点在线使用就行
目前在线的限制是
单日上限 5000 份|单文件 ≤200 页|高优每日 1000 页|
左边是你的文件,右边是解析后的结果,支持很多种格式

3.下载客户端,使用方式和线上使用一样

4.调用api

咱们主要说一下调用api,这种方式自由度高
我使用cluadecode加上他官方的skills来实现
第一步,申请Key
申请通过后,创建KEY,复制备用
第二步,打开claude code,安装skills
帮我安装这个 Skill:https://github.com/opendatalab/MinerU-Ecosystem/blob/main/skills/SKILL.md这是我的Key:xxxx
他有两个模式,精度要求高就把KEY给他,让他配置,效果更好。
测试一下
我扔给他一个GB标准类的文件,pdf格式,让他来转换。
然后就你就可以把md文件导入飞书或ob等软件打开使用了。(部分截图)

写在最后

最后分享一下我个人的实际使用体验和选型建议:
在多格式转结构化 Markdown这个核心能力上,MinerU 是我目前用过体验最好的工具,它的 OCR 能力同样处于第一梯队,完全能满足大多数日常需求。
不过必须提一句,百度飞桨团队才发布的 PaddleOCR-VL-1.6,目前已经是公认的世界第一 OCR 模型。虽然两者是直接竞品,但对我们开发者来说,完全没必要二选一 ,最佳实践是搭配使用:
纯 OCR 识别任务,优先用 PaddleOCR-VL-1.6
文档解析转 Markdown/JSON,直接上 MinerU
另外不得不说,百度的官方文档体验确实比较一般。相比之下,MinerU 的文档结构清晰、示例丰富,对开发者非常友好,尤其是 Agent 调用接口设计得相当简洁,集成成本极低。
以上就是我对这两款神器的使用感受。如果你有更好的使用技巧或者踩坑经验,欢迎在评论区留言分享,我们一起交流进步!

相关学习资料