ARTICLE · 1051383
6款开源文档转Markdown工具,Obsidian究竟怎么选?
6款开源文档转Markdown工具,究竟怎么选?

你准备把 PDF、Word、PPT、Excel、扫描书籍放进 AI 知识库,一搜 GitHub,却冒出 MarkItDown、MinerU、PaddleOCR、Marker、anydoc 等一堆工具。
它们看起来都能“转 Markdown”,但如果把它们当成同一种工具,很容易一开始就选错。
真正应该先问的是:你的文件有没有文本层?是不是扫描件?有没有复杂表格和公式?你更在乎速度还是解析质量?最后是不是要进入 Obsidian、RAG 或 Agent?
一、先搞清楚:这6个项目不是一类工具
所以,不要先问“谁最好”,先判断你属于哪一种场景。
二、MarkItDown:最适合当“万能入口”
GitHub: https://github.com/microsoft/markitdown
MarkItDown 是微软开源的 Python 工具,目标是把常见文件转换成适合大模型、检索和文本分析使用的 Markdown。
它支持 PDF、Word、PowerPoint、Excel、图片、音频、HTML、CSV、JSON、XML、ZIP、EPUB 等多种输入。
优势是覆盖广、上手相对简单。普通本地转换不需要付费 API;Azure Document Intelligence、Content Understanding、LLM/OCR 等属于可选增强能力,启用后才可能产生云端费用。
适合:个人知识库、办公资料、格式混杂的普通文件。
限制:复杂多栏论文、重度扫描件、复杂公式和表格,不是它最强的场景。
三、anydoc:关键词就是“快”
GitHub: https://github.com/firecrawl/anydoc
anydoc 和 MarkItDown 有明显重叠,但更强调批量转换速度。
它支持 DOCX、PPTX、XLSX、PDF、EPUB、CSV 等格式,可通过 CLI、Node.js 或 Python 使用。
如果一个文件夹里有几千份普通 Office 文件和电子 PDF,需要快速批量转 Markdown,anydoc 很有吸引力。
但要注意:本地 anydoc 不负责扫描 PDF 的 OCR。图片型 PDF 会提示需要 OCR,可以改用其他工具,或者启用 Firecrawl 的托管 OCR/Parse。
因此它适合“高速公路”,不适合拿来做所有复杂扫描文档。
四、MinerU:复杂 PDF 的重型解析器
GitHub: https://github.com/opendatalab/MinerU
MinerU 4.0 不只是“把文字抽出来”,而是进一步识别文档结构。
它会处理 OCR、版面、表格、公式、图片和阅读顺序,并支持 PDF、图片、Word、PPT、Excel、EPUB、HTML、CSV 等多种格式。
比如一篇双栏论文,如果只抽文本,很可能左右两栏交叉。MinerU 的价值就在于先理解页面结构,再输出更适合 AI 使用的 Markdown 或结构化结果。
它提供 Flash、Basic、Standard、Advanced 不同解析档位,可以在速度和质量之间取舍。
适合:论文、扫描书籍、研究报告、财报、复杂表格、公式、多栏 PDF。
代价是部署和计算资源要求比轻量工具高,但本地使用并不等于必须购买 API。
五、PaddleOCR:大量中文扫描件时非常有价值
GitHub: https://github.com/PaddlePaddle/PaddleOCR
PaddleOCR 不能只理解成“图片识字”。
现在它已经覆盖 OCR、版面分析、公式识别和文档解析,并直接面向 pdf2markdown、doc2markdown、RAG 等场景。
它特别适合中文扫描书、手机截图、图片型 PDF、合同、票据和老资料。
和 MarkItDown 相比,它更像一套 OCR 与 Document AI 工具箱,因此安装和配置门槛更高,但在需要中文 OCR 和视觉文档解析时价值很大。
六、Marker:最适合和 MinerU 放在一起比较
GitHub: https://github.com/datalab-to/marker
Marker 同样面向复杂文档,可输出 Markdown、JSON、HTML 或 chunks。
它重点处理表格、表单、数学公式、代码块、引用、图片、页眉页脚和 OCR,同时支持 CPU、GPU 和 Apple MPS。
基础本地解析不要求付费 API;如果主动启用外部 LLM 增强,才会产生对应模型费用。
如果你主要处理复杂 PDF,与其争论 MinerU 和 Marker 谁绝对更强,不如拿自己最典型的 10—20 份文档做一次真实对测。
七、Knap:它根本不是 OCR 工具
GitHub: https://github.com/obsidianmd/knap
Knap 是 Obsidian 的 Markdown 模板引擎。
它不负责把 PDF 识别出来,而是负责把已经得到的数据,按统一模板生成 Markdown。
例如自动生成:
1 2 3 4 5 6 7 8 9 10 11 12 ---title:author:date:source:tags:---# 核心观点# 原文# AI总结# 我的思考 它解决的是知识库后半段的问题:怎样让进入 Obsidian 的笔记长期保持统一结构。
八、速度和口碑,应该这样看
对于本身有文本层的普通电子文档,MarkItDown、anydoc 更偏轻量和速度;MinerU、Marker、PaddleOCR 更偏结构理解、OCR 和复杂页面。
因此不能简单做一个“谁最快”的总榜。
同样,GitHub Star 和社区热度也只能说明关注度,不能直接代表你的使用体验。
一个主要处理中文扫描书的人,PaddleOCR 可能比 anydoc 更合适;一个只需要处理 Word、PPT、Excel 的人,则完全没必要先部署重型 OCR 模型。
口碑最终还是要回到你的资料类型。
九、搭建个人AI知识库,我更建议这样组合
如果目标是 Obsidian + AI知识库 + RAG/Agent,没有必要把 6 个项目全部安装。
可以先这样分流:
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 Word / PPT / Excel / EPUB / 普通PDF ↓ MarkItDown复杂PDF / 论文 / 扫描书籍 ↓ MinerU ↓ Markdown ↓ Knap统一模板 ↓ Obsidian ↓ AI知识库 / RAG / Agent 第一阶段先装:
MarkItDown + MinerU。
深度使用 Obsidian,再加入:
Knap。
大量中文扫描件,再增加:
PaddleOCR。
成千上万份普通办公文档需要批量提速,再测试:
anydoc。
复杂 PDF 是核心业务,再把:
MinerU 和 Marker 做真实样本对测。
最后
选择文档解析工具时,先回答 6 个问题:
文件主要是什么格式? PDF 是电子文本还是扫描图片? 有没有复杂表格、公式、多栏排版? 是否必须完全本地运行? 更在乎速度还是解析质量? 最终是给人看,还是给 AI、RAG、Obsidian 使用?
然后找 10 份最典型的真实资料做一次测试,比看几十篇网上测评更有意义。
不要先选工具,再想怎么用;先看清文档,再决定让谁来处理。

AI时代如何搭建自己的知识库资产
一切尽在《知识架构师》
项目下载地址
Microsoft MarkItDownhttps://github.com/microsoft/markitdown Firecrawl anydochttps://github.com/firecrawl/anydoc OpenDataLab MinerUhttps://github.com/opendatalab/MinerU PaddleOCRhttps://github.com/PaddlePaddle/PaddleOCR Markerhttps://github.com/datalab-to/marker Obsidian Knaphttps://github.com/obsidianmd/knap
注:项目功能和版本持续更新。本文信息以 2026-09-21 查询到的各项目官方 GitHub README 为基础,正式部署前建议再次查看最新说明。