把 PDF、Word 或网页文章直接丢给 AI,经常会遇到一些小麻烦:表格不见了,双栏文档的段落顺序乱了,网页复制到一半还夹着菜单和广告。
一个更稳定的思路,是先把资料转成层级清楚、噪声较少的 Markdown,再进入 AI 总结、RAG 检索或个人知识库。下面 3 个工具分别处理日常文件、复杂 PDF 和网页文章。
1doc-cleaner:把 PDF 和 Office 等日常文件转成 Markdown
2RapidDoc:识别复杂 PDF 里的版面、表格和公式
3Markdown Printer:右键将当前网页保存为 Markdown
1doc-cleaner
16 种日常格式,拖进桌面 App 直接转
安装包:https://www.durushi.com/p/NVPBMUEX.html

doc-cleaner 是一款专门把本地文件整理成 Markdown 的工具,支持 PDF、Word、Excel、PowerPoint、Keynote、Numbers、EPUB 等 16 种格式。Windows 和 macOS 都有桌面 App,把文件或整个文件夹拖进去,选择输出位置后即可转换,对不想配环境的人最友好。
它可以在不使用 AI 的情况下完成本地纯提取,普通文档不需要 API Key,表格也会尽量转成 Markdown 表格。如果是扫描 PDF 或版式很复杂的文件,想要更好的结果,则需要额外安装视觉处理依赖,或配置 Ollama、Gemini 等 AI 模式。
2RapidDoc
复杂 PDF 不只提文字,还原阅读顺序和版面结构
安装包:https://www.durushi.com/p/TJTHWVGP.html

处理扫描件、双栏论文、财报或包含大量公式的文档,可以看 RapidDoc。它会结合 OCR、版面分析、公式识别和表格识别,尽量恢复页面的阅读顺序。结果可输出 Markdown、JSON、Word 或 HTML,后续要接知识库或自动化流程也比较方便。
它更偏向技术用户:本地使用需要配置 Python 或 Docker,首次运行还会获取相应模型。项目支持 CPU,但处理很长、很复杂的文档时,速度和内存占用仍要提前考虑。想先看效果,可以用官方的 Gradio 在线演示。
3Markdown Printer
看到值得保留的网页,右键直接存成 .md
安装包:https://www.durushi.com/p/QHMZLEWS.html

Markdown Printer 只解决一个问题:把当前网页保存为 Markdown。它支持 Chrome、Edge 和 Firefox,安装后可以右键选择“Save as Markdown”,也可以点击扩展图标。转换在浏览器本地完成,会尽量保留标题、链接、代码块、列表和表格,并记录原网址和保存日期。
它适合收集教程、文档、新闻和参考资料。不过,复杂站点的菜单、侧边栏和其他界面元素也可能被一起写入,保存后最好打开看一眼,删掉无关内容。
怎么选?
普通 PDF、Word、PPT、Excel 等日常文件,首先用 doc-cleaner。
文档有扫描页、双栏排版、公式和复杂表格,而且能接受技术配置,选 RapidDoc。
只想保存网页文章,Markdown Printer 最直接。
转换完成后,再快速检查标题层级、表格、公式、图片和来源链接。AI 后面怎么总结,很大程度上取决于前面交给它的材料是不是完整。
夜雨聆风