乐于分享
好东西不私藏

PDF 喂给 AI 全是乱的?我在自己电脑上跑通了这个开源工具

PDF 喂给 AI 全是乱的?我在自己电脑上跑通了这个开源工具

AI 工具分享 · 2026.08.20

PDF 喂给 AI 全是乱的?我在自己电脑上跑通了这个开源工具

这事我踩过太多次。手里一摞 PDF——报告、说明书、合同、扫描件——想丢给 AI 做个总结或者建个能问答的知识库。结果一复制粘贴,全废了

先说清楚废在哪

双栏的论文,复制出来左边一句右边一句,读着像两个人抢话。表格一粘就散架,行列全错位。公式变成一堆看不懂的符号。扫描件更狠,压根复制不出字。

根子上的原因不复杂:PDF 里存的不是"文章",是一堆有坐标的字符。哪个字属于哪段、哪段该先读,文件里根本没写。你眼睛能看出来,程序看不出来。

于是你把这堆乱码喂给 AI,AI 再一本正经地基于乱码回答你。问题不在模型笨,在于你给它的原料就是坏的

这个工具叫 MinerU

上海人工智能实验室 OpenDataLab 团队开源的,干一件事:把 PDF、Word、PPT、Excel、图片,转成干净的 Markdown 或 JSON。阅读顺序理顺,表格转成 HTML 结构,公式转成 LaTeX,图片和图注一并抠出来。

我写这篇时它的最新版本是 3.4(今年 6 月 18 日发布,仓库 opendatalab/MinerU)。核心那个视觉语言模型叫 MinerU2.5,参数量只有 1.2B——在今天这个动辄几百 B 的年代,算是相当苗条了。

苗条但不弱

文档解析这行有个公开评测叫 OmniDocBench,MinerU 在 v1.6 上的成绩落在 95 分档(官方给的数据:混合后端高精度模式 95.39,传统流水线后端 86.47)。中文文档、财报、复杂表格这些难啃的场景是它的强项。

1.2B 这个体量带来的直接好处是——你自己那台电脑就能跑。官方标的最低要求:流水线后端 4GB 显存起,内存 16GB 起(32GB 更舒服)。没独显也行,加个参数走纯 CPU。

还有件事挺重要:授权松了

它以前是 AGPLv3,那个协议做商业项目会让法务皱眉头。从 3.1.0 起换成了基于 Apache 2.0 的自定义许可(MinerU Open Source License),官方明说是为了降低商用采纳的阻力。要真拿去做产品,具体条款还是去仓库的 LICENSE.md 自己读一遍,别听我说。

三种上手方式,按你的段位挑

① 完全不碰命令行——先用在线版试水

官方在 HuggingFace 和魔搭(ModelScope)都挂了免费的在线 Demo,免登录,把文件拖上去等结果就行。想要完整功能的话去 mineru.net,那个需要登录。我建议所有人都先走这一步——五分钟就知道它对你的文档到底行不行,何必先装环境。

② 要批量处理——装到本地

官方给的装法就两行:

pip install uvuv pip install -U "mineru[all]"

转文件也一行:

mineru -p 你的文件 -o 输出目录

Python 版本注意下:官方支持 3.10 到 3.13,但 Windows 上因为依赖问题只到 3.12。

③ 没显卡——切纯 CPU

mineru -p 你的文件 -o 输出目录 -b pipeline

如果卡在下模型那一步(默认源在国外),设个环境变量 MINERU_MODEL_SOURCE=modelscope 换成国内镜像。

还有个懒人路子:官方有云端 API,Flash 模式免登录免费用,限制是每个文件 20 页 / 10MB。临时应急够了。

我为什么坚持在本地跑

因为要解析的东西经常是不该上传的。合同、内部报表、客户资料——这类文件传到任何第三方平台,我都不太踏实。本地跑这件事的价值不在省钱,在于文件从头到尾没离开过这台机器

这也是我一直觉得小模型被低估的地方。1.2B 跑在本地,把敏感数据的活儿接下来,剩下的思考再交给大模型。分工比全都上云更合理。

真正的玩法是接成一条流水线

单独用它转个文件,只解决了一半问题。它真正的位置是在整条链路的最前面

一堆杂乱文档 → MinerU 转成干净 Markdown → 切块做向量索引 → AI 基于这些块回答你的问题。生态这块它也铺了,LangChain、LlamaIndex 都有官方的读取器,n8n、扣子这些平台也有插件,接起来不用自己造轮子。

别听我吹,几个坑得先知道

图表里的数值仍然是难点。公开横评里,柱状图这种能读出数值的已经算领先水平了,但离"完全可靠"还差。要是你的文档命门就在图表数据上,建议再接个专用模型复核一遍。

标题层级会乱升格。署名、日期、引用有时会被误判成标题。这个坑对做知识库的人特别要命——层级一乱,后面切块就跟着污染。转完记得抽几份人工扫一眼。

别指望一个工具吃下所有文档。手写体、糊掉的扫描件、带污渍的、断页断行的,测试的时候都挺美,一上生产就翻车。这行没有银弹,只有"最适合你这批文档的那个组合"。

这两年大家都在抢模型,反而没什么人聊"喂给模型的东西干不干净"。可实际做项目你会发现,八成的翻车都翻在这一步。数据整理干净,AI 才帮得上忙——这句话听着土,但真是这么回事。

你手里有哪批文档一直卡着没数字化?评论区说说是什么类型的,我看看能不能给个更具体的路子。

本文事实来自 MinerU 官方 GitHub 仓库(版本 3.4,2026-06-18)、ModelScope 官方模型页及公开第三方横评,安装命令与参数以官方实时文档为准。配图为原创生成,非官方素材。工具功能与限额可能随版本变化,动手前请复核。