乐于分享
好东西不私藏

把办公文档丢进去就出 Markdown:Firecrawl 开源 anydoc 毫秒转换

把办公文档丢进去就出 Markdown:Firecrawl 开源 anydoc 毫秒转换

# 把办公文档丢进去就出 Markdown:Firecrawl 开源 anydoc 毫秒转换

经常把 Word、PPT、PDF 喂给 AI 的人,大概率遇到过这种麻烦:文档直接丢给 AI,它读得磕磕绊绊,格式乱、表格散、还容易漏内容。anydoc 是 Firecrawl(一个知名的网页抓取服务)开源的文档转换库,专门解决这个问题:把 Word、PowerPoint、Excel、PDF 等办公文档转成干净统一的 Markdown(一种纯文本标记格式,AI 最容易读懂的格式之一),毫秒级完成,输出格式整齐划一。

它是用 Rust 写的,转换速度很快,官方说"个位数毫秒"。支持 8 大类格式:Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF,细分文件类型有 14 种(包括 doc/docx、ppt/pptx、xls/xlsx 这些新旧格式)。不管什么格式进去,出来的 Markdown 风格统一,这也是它和其他转换工具最大的区别。

适合谁:经常要把办公文档整理成文字喂给 AI 的人、批量整理文档的人、做内容搬运和知识库的人。不想碰命令行的话,官方提供了浏览器在线版,直接把文档拖进网页就能转,文件只在本机处理、不会上传。

1. 转出来的东西为什么不一样

市面上不少转换工具的问题在于"输出不稳定":同一个文档,今天转出来一种格式,明天又一种;不同格式的文档转出来的 Markdown 风格各异,喂给 AI 或者进知识库之前还得人工整理。anydoc 的核心卖点就是统一:任何格式进去,出来的都是同一套风格的 GitHub 风格 Markdown,标题、列表、表格、代码块的标记都一致,可以直接喂给大模型,也可以直接进知识库或文档系统。

具体用法很灵活。命令行最直接:一条命令 `npx @firecrawl/anydoc report.docx` 就能把文档转成 Markdown 输出,也可以指定输出文件、甚至从标准输入读 CSV。开发者可以装 Node.js 版或 Python 版,在代码里调用转换函数,实现"文档批量自动转 Markdown"的流程。浏览器在线版则给普通用户用:打开演示页面,把文档拖进去,转换在本地完成,文件不离开你的电脑。

还有一个细节:anydoc 的转换引擎正是 Firecrawl 自家 Parse 服务在用的那套。也就是说,如果你用 Firecrawl 的云端 API,得到的转换能力跟这个开源库是同源的;不想用云服务的话,本地跑开源版就行,免费还没额度限制。

2. 对用户来说意味着什么

最实际的场景是"把文档喂给 AI"。现在很多人的工作流是:收到客户/同事的 Word 或 PPT,想用 AI 总结、提炼、翻译。直接丢文档给 AI,效果时好时坏;先过一遍 anydoc 转成干净的 Markdown,再丢给 AI,输出质量稳定得多。对要建个人知识库的人,把积攒的 PDF、Word 统一转成 Markdown,进知识库搜索和管理都方便。

对批量场景价值更大。做内容搬运、文档整理、资料归档的人,经常有一堆格式杂乱的文档要处理,用 Python 或 Node 版写个小脚本,就能把整个文件夹的文档一次性转完,还不用管每个文件是什么格式。

隐私方面是加分项:转换在本地完成(浏览器版明确标注文件不出本机),敏感文档不用上传到任何第三方服务。

3. 上手门槛和限制,如实说

门槛分两档。普通用户:打开浏览器在线版就能用,零安装、零注册,拖文件进去就转。开发者/自动化用户:需要会用命令行或装 npm/pip 包,有一点编程基础就能接进自己的流程。

限制要说清楚。第一,扫描版的 PDF(就是那种"一整张图片"的 PDF)它转不了文字,因为里面没有可提取的文本层,官方建议扫描件配合 OCR(图片文字识别)服务处理,anydoc 本身不内置 OCR。第二,复杂版式的文档(艺术字、复杂嵌套表格、特殊排版)转换后可能丢失部分视觉信息,内容在,样式不一定完美还原。第三,"14 种格式"是细分扩展名的口径,官方文档按 8 大类表述,新旧格式(比如 .doc 和 .docx)都支持,但一些极冷门的格式不在支持列表里。

/// 一句话结论

经常要把办公文档转成文字喂给 AI 或整理知识库的人,anydoc 值得收藏:免费开源、转换快、输出统一,普通用户用网页版零门槛,开发者能一键接入自动化。扫描版 PDF 和极致复杂版式的需求,要先评估下自己用不用得上。

—— Kail的AI工具箱