乐于分享
好东西不私藏

PDF解析神器,比付费会员强还完全免费

PDF解析神器,比付费会员强还完全免费

上个月整理一批行业研报,三十多份PDF,双栏排版,里面全是表格和图表。

我需要把内容提出来喂给AI做分析。

先试了某付费转换网站,年费298。咬咬牙开了。转出来一看,双栏文字搅成一锅粥,表格全部错位,研报里的公式直接变成了图片。

298买了个寂寞。

后来一个粉丝说,你试试MinerU。

我试了。然后会员到期没续。


它是什么

github.com/opendatalab/MinerU

MinerU,上海人工智能实验室OpenDataLab团队开源的文档解析引擎。GitHub上7万Star,多次登顶Python Trending榜首。

它干的事用一句话说,把PDF、Word、PPT、Excel、图片、网页,转成大模型能直接读的Markdown和JSON。

你可能纳闷,转个文本而已,至于7万Star吗。

至于。

普通PDF提取工具是把文字抠出来。MinerU是真的在「理解」文档。它能识别标题层级、段落、列表、页眉页脚,按人类阅读顺序输出。双栏论文不会左右串行,跨页表格不会断掉,公式自动转成LaTeX代码。

这玩意最早是给InternLM大模型预训练处理文献用的。工业级标准,后来开放给所有人免费用。


排版还原,真的能处

我拿一份三栏排版的金融研报试过。

之前用商业工具转,正文标题搅在一起,段落顺序全乱。MinerU转完,一级标题二级标题分得清清楚楚,列表归列表,引用归引用。拿过来直接用,不用重排。

它会自动去掉页眉、页脚、脚注、页码。这个细节太重要了。你想想,一份两百页的PDF,每页都有页码和公司名称,普通工具会把这些全混进正文里。MinerU直接给你剔除干净。

单栏、双栏、三栏、复杂混排,它都能识别。竖排文字也支持。


表格和公式,看家本领

表格识别是很多PDF工具的死亡地带。MinerU恰好在这块最猛。

合并单元格、跨页表格、旋转表格,全能处理。转出来的表格是HTML或者CSV格式,机器可读,直接进数据管道。

我上个月处理一份跨了三页的财务报表,之前用别的工具,第二页的表头直接丢了,数据全错位。MinerU自动把跨页表格合并成一张完整的。

公式更不用说了。行内公式、块级公式、多行嵌套公式,转成标准LaTeX。搞科研的朋友说,光这一个功能就值回票价。虽然它本来就不要钱。

3.1版本之后还支持了图表解析和印章文字识别。连化学分子式都能认。


双引擎,老电脑也能跑

MinerU有两套解析引擎。

pipeline引擎,走传统OCR流水线,最大的好处是纯CPU就能跑。没有显卡也没事。3.4版本升级到了PP-OCRv6,官方数据OCR精度提升11%,速度提升一倍。在OmniDocBench评测上拿到86.2分。

VLM引擎,基于视觉语言模型,精度更高,能理解图表和复杂排版。适合有GPU的场景。还有个hybrid混合引擎,取两者优点,低幻觉。

支持109种语言的OCR。扫描件、乱码PDF、手写内容,它会自动检测并启用OCR。

硬件门槛不算高。内存16GB起步,建议32GB。纯CPU跑pipeline的话,显存都不需要。


怎么用

最省事的方式,直接用在线版。

mineru.net

官方网页版,功能和客户端一样。每天5000份免费额度。对个人用户来说,这个量根本用不完。注册登录就能用。

想本地部署的话,一行命令装好。

uv pip install -U "mineru[all]"

然后 mineru -p 输入文件 -o 输出目录,搞定。支持Windows、Linux、macOS。也有Docker部署和桌面客户端。

搞开发的朋友注意,它有MCP Server,能直接接进Cursor、Claude Desktop、Windsurf这些AI编程工具。还原生对接LangChain、Dify、FastGPT、RAGFlow。做RAG知识库的话,基本是开箱即用。

协议方面,从之前的AGPLv3换成了基于Apache 2.0的自定义开源协议,对商用友好多了。


缺点,说清楚

手写体识别还是有翻车的时候。官方自己也承认,复杂布局、扫描页、手写内容,解析结果可能不如预期。印刷体没问题,潦草手写别抱太高期待。

本地部署有门槛。要下载模型,磁盘至少留20GB,推荐SSD。第一次装环境,不熟悉Python的人可能会卡在依赖问题上。

高精度模式吃硬件。VLM引擎要跑满精度,需要像样的GPU。effort=high模式速度慢,你得在速度和精度之间自己权衡。

还有几个平台限制。Windows上不支持Python 3.13,macOS要14.0以上,Docker部署不支持macOS。

另外它毕竟还年轻。官方原话说「与知名商业产品相比,MinerU仍然年轻」。个别边角场景的稳定性,跟老牌商业方案比还有差距。


怎么选

偶尔转几份PDF → 直接用 mineru.net 在线版,每天5000份免费额度

做RAG知识库 → 本地部署,接Dify或FastGPT,结构化输出直接入库

老电脑没有显卡 → pipeline引擎,纯CPU跑,命令行加 -b pipeline

论文公式多 → VLM引擎开 effort=high,LaTeX转换一步到位

接AI编程工具 → 装MCP Server,Cursor里直接解析文档

7万Star真不是白来的。我用了三个月,三十多份研报、十几本扫描版电子书、一堆带公式的论文,全靠它处理。以前298的年费,现在省了。

反正PDF转格式这件事,我再也回不去那些按页收费的网站了。