逛 GitHub 的时候,挑出 4 个今天挺火的文档处理工具——PDF 转 Markdown、Office 秒变 Markdown、OCR 识别文字,都挺不错的。
01. MinerU
GitHub:opendatalab/MinerU Star:78,143
MinerU 在 GitHub 上已经拿下 7.8 万 Star,Apache 协议。它干的事儿很简单——把各种格式的文档(PDF、Word、PPT)转成干净的 Markdown 或 JSON,专门喂给 AI 大模型用。
最实用的是它的 MCP Server,装进去之后 Claude Code、Cursor 这些 AI 工具直接能调文档解析接口,不用你自己写预处理代码。命令行一行 mineru -p /path/to/doc.pdf -o ./output 就能跑,Docker 一键部署也行。
门槛是得有点硬件底子——推荐 32GB 内存加 GPU,CPU 也能跑但慢不少。在线版 mineru.net 零安装能用,但 Token 有时效。适合需要完整文档解析、接 RAG 系统的开发者。
pip install uv
uv pip install -U "mineru[all]"
# MCP 模式需配置环境变量
export USE_LOCAL_API=false
export MINERU_API_KEY=your-token开源地址:https://github.com/opendatalab/MinerU
安装 / 配置要求
运行环境:Python 3.10–3.13,推荐 NVIDIA GPU(Volta+ 或 Apple Silicon) 内存建议 32GB+,最低 16GB;磁盘 ≥20GB 注意:MCP Server 需申请 API Token(mineru.net),或本地启动服务
注意:Benchmark:OmniDocBench v1.6 综合得分 95.39%,文字识别 NED 英文 0.061、中文 0.215(SOTA)。

MinerU Logo
02. anydoc
GitHub:firecrawl/anydoc Star:17,686
anydoc 在 GitHub 上 1.7 万 Star 出头,MIT 协议。火的原因挺实在——它是个 Rust 写的命令行工具,专门对付 Office 全家桶和 PDF 转 Markdown,中位转换时间不到 5 毫秒。
安装方便,npx @firecrawl/anydoc 一行命令就能跑;也支持 Node、Python 绑定,还能装成 Agent Skill 直接接进 Claude Code 或 Cursor。浏览器里也能用,文件不上传。
说点实在的,它对复杂排版的 Office 文档效果最好,PDF 处理反而不如 MinerU 精细。适合需要快速批量转换的开发者。
npx @firecrawl/anydoc report.docx
cd output && cat report.md开源地址:https://github.com/firecrawl/anydoc
安装 / 配置要求
运行环境:Node.js ≥18(npx 自动下载)或 Python 3.8+ 无需额外 Key,开源即用 注意:扫描版 PDF 不支持,纯文本型 PDF 可本地转换
注意:Benchmark:中位转换时间 4.7ms,质量得分 81/100,唯一覆盖全部 14 种格式的工具。
03. PaddleOCR
GitHub:PaddlePaddle/PaddleOCR Star:88,043
PaddleOCR 在 GitHub 上 8.8 万 Star,Apache 2.0。百度飞桨出品的 OCR 工具包,支持 50+ 语言,中文识别尤其强,属于开源方案里的第一梯队。
最新版 PP-OCRv6 只用了 34.5M 参数,就干掉了 GPT-5.5 等千亿参数大模型。pip install paddleocr 就能用;也支持 Docker 部署和 MCP 服务器集成。识别速度快,精度在开源 OCR 里算顶尖。
不过它有门槛——模型下载大(约 150MB),且推荐 NVIDIA GPU 才能跑出速度。纯 CPU 也能跑但慢。对中文文档处理特别友好,国产芯片也兼容。
pip install paddleocr
# MCP 模式
pip install -U paddleocr-mcp
paddleocr_mcp --model PP-OCRv6 --ppocr_source aistudio开源地址:https://github.com/PaddlePaddle/PaddleOCR
安装 / 配置要求
运行环境:Python 3.10+,推荐 NVIDIA GPU(CUDA 11+) 首次运行需下载模型文件(约 150MB) 注意:Windows 用户建议用 conda 安装,避免 CUDA 路径问题
注意:PP-OCRv6 仅 34.5M 参数,精度干掉 GPT-5.5;支持国产芯片。

PaddleOCR 架构示意
04. EasyOCR
GitHub:JaidedAI/EasyOCR Star:29,929
EasyOCR 在 GitHub 上差不多 3 万 Star,Apache 2.0。泰国团队做的 OCR 工具,主打开箱即用——pip install 后几行代码就能识别文字。
支持 80+ 语言,包括中文、日文、韩文、阿拉伯文等;也支持多语言混排识别。GPU 加速可选,CPU 也能跑。界面简洁,错误处理友好。
说实话,它精度不如 PaddleOCR(尤其中文场景),但胜在简单——没有复杂依赖,初学者友好。适合快速原型验证或者对中文精度要求不高的场景。
pip install easyocr
python -c "import easyocr; reader = easyocr.Reader(['ch_sim','en']); result = reader.readtext('image.jpg')"开源地址:https://github.com/JaidedAI/EasyOCR
安装 / 配置要求
运行环境:Python 3.7+,PyTorch 首次运行自动下载模型(约 500 MB) 注意:中文识别需手动指定 'ch_sim' 语言包
注意:准确率:中文 88.3% vs PaddleOCR 92.7%;追求精度选后者,追求简单选前者。

EasyOCR 识别示例
点击下方卡片,关注逛逛开源项目 这个公众号历史发布过很多有趣的开源项目,如果你懒得翻文章一个个找,你直接关注微信公众号:逛逛开源项目,后台对话聊天就行了
夜雨聆风