乐于分享
好东西不私藏

GitHub 70.8k star!PDF转Markdown,找到了最完美解决工具

GitHub 70.8k star!PDF转Markdown,找到了最完美解决工具

GitHub 上的 MinerU 项目已获得超过七万个星标,专为解决 PDF 转 Markdown 时排版混乱的问题而设计。只需将 PDF、扫描件、Word、PPT 或 Excel 文件上传到 MinerU,它就能一键转换成结构清晰的 Markdown、JSON 或 HTML 格式。经过实测,MinerU 能较好地保留原文的层次结构,公式和表格的识别率也非常高。

该项目完全开源免费,适合新手按照文档操作使用,也适合需要批量处理大量论文、合同或报告的专业用户。传送门地址为:https://github.com/opendatalab/MinerU/tree/master。

MinerU 是由上海人工智能实验室旗下的 OpenDataLab 团队开发的一款高精度内容提取工具。它基于 PDF-Extract-Kit 模型,支持从多种格式文件中提取结构化、高质量的内容,包括文本、公式、表格和图片,并能输出为 Markdown、JSON、HTML、LaTeX 和 DOCX 等格式。

虽然市面上已有许多 PDF 转换工具,但大多只能应对排版简单、文字清晰的文档。而面对论文中的复杂公式、多栏排版、扫描件或嵌套表格时,这些工具往往难以直接使用,还需要手动整理。MinerU 在这些方面表现尤为出色。

在公式识别方面,MinerU 能自动将行内和行间公式转成标准 LaTeX 代码,即使是复杂的多行、多层嵌套公式,也能尽可能完整地保留下来,为科研人员节省大量时间。对于双栏或多栏排版的文档,它会先分析页面布局,再按正常阅读顺序提取内容,从而避免文字混乱,比许多传统工具更胜一筹。

此外,MinerU 内置了 OCR 功能,可以识别扫描件中的文字,非常适合处理合同、老书、发票或档案照片等图片型 PDF,只要图片清晰,就能还原出相对干净的文本内容。它还能高效识别复杂表格,包括合并单元格、多行表头、嵌套结构以及跨页长表,对于财务报表和统计报告等场景非常友好。

在输出方面,MinerU 不仅可以保持原有层级关系,还能识别标题、正文段落、列表、脚注等元素,将结构完整保留,为后续建立知识库提供坚实基础。同时,它支持处理几千页甚至上万页的大型文档,通过滑动窗口技术实现无缝解析,无需手动拆分。此外,批量处理功能也十分强大,只需指定文件夹,即可一次性转换大量文档。

最令人欣喜的是,MinerU 完全可以在本地部署,不依赖云端服务,有效保障数据隐私安全。用户可以在自己的电脑或服务器上安装运行,也可以选择使用其提供的在线版本(API需付费)。相关资源可以在官网获取:https://mineru.net/OpenSourceTools/Extractor。

对于开发者而言,可以通过以下步骤在本地部署 MinerU:首先安装 Python 3.11,并确保添加到环境变量中;然后创建虚拟环境,以避免依赖冲突;接着通过 pip 安装 MinerU 及相关依赖包,如果使用国内镜像会更快;最后,用命令行运行转换指令即可完成 PDF 文件的解析。例如,将名为“论文.pdf”的文件转换成输出到“output”文件夹,只需执行命令:mineru -p "论文.pdf" -o "output"。转换完成后,即可在输出目录中找到对应的 Markdown 文件和相关资源。

如果你经常处理学术论文、合同或者财报资料,又希望提高效率,不妨试试 MinerU。这款工具有望帮你节省大量整理时间,让繁琐的数据变得井然有序,只需几分钟甚至几秒钟,就能把复杂资料变成结构清晰的内容,大大提升工作效率。