乐于分享
好东西不私藏

发现一个开源神器:MinerU,PDF转Markdown只要90秒

发现一个开源神器:MinerU,PDF转Markdown只要90秒

律师审500页合同要一周。会计对200张发票要4天。研究员读50篇论文要两周。

>

现在一个开源工具,200页PDF进去,干净Markdown出来,90秒。

>

免费。

前几天刷X看到一条帖子。

一个律师在曼哈顿,500页合同,每一条条款都得能检索。手工干?一周。

一个会计师在芝加哥,200张扫描发票,每个数字得填进表格。手工干?四天。

一个斯坦福的研究员,50篇学术论文,表格公式图表全嵌在PDF里。手工干?两周。

他们都把时间花在复制粘贴上了。

然后有个叫 MinerU 的开源项目把这事解决了。

MinerU是做什么的

把PDF、Word、PPT、Excel、扫描件转成Markdown或JSON。大模型直接就能读。

GitHub上68.7k星,5.8k forks,快6000次提交。不是那种写着玩的项目。

跟其他PDF工具有什么区别

市面上PDF转Markdown的工具不少。MinerU有几个地方确实不一样。

**多栏排版**。两栏三栏的PDF,普通工具从左读到右,文字顺序全乱了。它能识别栏结构,从上往下逐栏读。

**扫描件OCR**。内置OCR,1995年打印的老扫描件拍个照丢进去,照样出干净文本。

**数学公式**。LaTeX级别的公式识别。学术论文里那些方程式,渲染出来是对的。

**表格保留**。合并单元格,跨列表头,跨三页的大表格。结构不丢。

**万页文档**。滑动窗口处理,不需要手动拆分。丢一本一万页的技术手册进去,它自己啃完。

**批量模式**。500个文档丢进一个文件夹,跑一条命令,走人。

**109种语言**。中文当然支持。

三种用法

**命令行**

magic-pdf mydoc.pdf

一行命令,Markdown出来。

**Python SDK**

from mineru import MinerU

doc = MinerU()

result = doc.analyze("合同.pdf")

print(result.markdown)

五行代码,集成到自己系统里。

**网页版**

打开 mineru.net,上传,下载。什么都不用装。

谁该用

做内容的。经常要把PDF资料转成公众号文章?MinerU省掉手动排版的时间。

做量化的。年报财报研报全是PDF,一键转Markdown喂给AI分析。

做AI应用的。RAG应用需要把文档切碎建索引?MinerU的输出天然适合做chunking。

任何人。只要你的工作里还有"打开PDF → 选中文字 → 复制 → 粘贴 → 调格式"这个循环。


工具打包好了,夸克网盘直接下,国内用户不用翻墙。

包里有两个东西:

- **MinerU**:PDF转Markdown/JSON

- **X转公众号工具**:把X文章一键转成公众号HTML,复制即发

👉 [点此下载](链接待更新)

我用夸克网盘给你分享了「MinerU」,点击链接或复制整段内容,打开「夸克APP」即可获取。/~1bf73ZDXAK~:/链接:https://pan.quark.cn/s/6e8ab7513a34提取码:7T14

觉得有用点个赞👇


👥 交流群

每日分享最新开源项目、实用干货,扫码加入👇


☕ 如果觉得有用,请我喝杯咖啡吧~