文档秒变 Markdown!开源神器 anydoc | 这速度杠杠的

事情是这样的。
昨天整理客户发来的一份方案,Word 格式,八十多页,我想丢给 AI 让它帮忙总结。结果呢,拖进去一问,回答驴唇不对马嘴。问题出在哪?出在文档本身,AI 读不懂那个格式。
这不是我一个人的痛。做内容的人、做知识库的人、搞 RAG 的人,谁没被「把办公文档喂给 AI」这件事恶心过。复制粘贴,格式全乱,表格变天书。转成 PDF 再提取,排版照样稀碎。在线转换网站?文件传到别人服务器上,合同谁敢传。
直到我刷到一个项目,anydoc,来自 Firecrawl。8 月 3 号才创建,十来天就冲到了 1.5 万 Star。干什么的?一句话讲完,把 Word、PPT、Excel、PDF、EPUB、RTF、CSV 这些办公文档,统一秒变干净的 Markdown,官方中位转换时间不到 5 毫秒。
这速度,杠杠的。

01 我先说个我实测的结果
我这人有个毛病,看到工具先动手,不先看介绍。anydoc 装起来确实简单,一条命令的事,我拿自己电脑上真实的工作文件测了一遍。
一份 31KB 的 Word 汇报材料,转出来 3.7 毫秒。一份 43KB 的 PPT 立项汇报,1.5 毫秒。一份 50KB 的 Excel 资料整理表,3.9 毫秒。我连测五轮取中位数,跟官方宣称的 4.4 毫秒基本对上了。什么概念呢,就是你刚按下回车,结果已经出来了,快到你都没感觉到它存在。
转出来的东西我也看了,质量确实能打。Word 里的标题层级完完整整,一级标题、二级标题、正文段落,全给你归置得明明白白,中文标点一个不丢。Excel 更惊艳,一张十几列的大表直接变成 Markdown 表格,单元格里的换行、特殊符号都保留着,拿来就能用。
当然也有翻车的时候。我拿一份扫描版的 PDF 去转,它直接给我弹回来一句话,这文件没有可提取的文字,4 页扫描件,需要 OCR,转头就走。这个后面细说,不是它不行,是边界你得知道。
02 为什么是 Markdown,凭什么这么快
先聊个可能很多人没想过的问题。为什么是 Markdown,不是 HTML,不是 PDF?
你想想人类这四十多年是怎么造文档的。打字机时代,字敲上去就是结果。后来有了 Word,有了「所见即所得」,你看到什么,打印出来就是什么,字体、颜色、间距、阴影,全是视觉。文档是写给眼睛看的,这是当年最高的设计标准。
但 AI 不这么看东西。AI 不读像素,AI 读结构。它需要知道哪行是标题、哪段是列表、哪格是表头,才能理解你在说什么。你精心调的五号宋体和段前段后间距,在 AI 眼里全是噪音。
Markdown 恰好就是那个「只有结构、没有视觉」的语言。标题就是井号,列表就是杠杠,表格就是竖线,干净得像一份电报。所以当大模型时代来临,Markdown 悄悄成了 AI 世界的通用语,几乎所有知识库、笔记软件、Agent 工具链,底层都认它。
那 anydoc 凭什么这么快?这里面有个很反直觉的设计。
DOCX、PPTX、XLSX 看着是三种完全不同的文件,其实底层都是 Office Open XML,坦率的讲,就是一堆 XML 的压缩包。anydoc 用 Rust 写,拿到文件先按字节内容识别真实格式,不看扩展名,然后把每种格式都解析进同一个统一的 Document 模型,最后走同一个 Markdown 渲染器输出。
这个设计妙在哪?妙在它省掉了所有重步骤。不启动 LibreOffice,不下载几 GB 的模型权重,不把每页渲染成图片,不调外部 OCR。对普通办公文件来说,主要工作就是解压、解析 XML、输出文本。路径短,所以快。纯 Rust、无模型、无服务,所以稳。
按字节识别格式这个细节我很喜欢。你把一个 PDF 改后缀名成 .docx 丢给它,它照样认得出来,PDF 头在那摆着呢。你硬盘里那些乱七八糟的老文件,扩展名错了、混着 RTF 和 PDF,它全给你按内容归位。这属于防呆设计,懂的人知道这有多省心。
03 它在解决一个被 AI 放大了十倍的老问题
有人可能觉得,转格式嘛,老工具多了去了,pandoc、LibreOffice、MarkItDown,凭什么是它火。
我把官方那份基准测试翻来覆去看了好几遍,有意思。100 份真实文档、14 种格式,七个工具一起比,anydoc 是唯一一个覆盖全部 14 种格式的,质量分 81,第二名的 MarkItDown 只支持 6 种格式、65 分。速度上更是碾压,MarkItDown 中位 134.8 毫秒,anydoc 4.4 毫秒,差出三十倍。LibreOffice 更惨,一秒钟转一份,质量分才 40。
这个质量分怎么来的?官方用 Claude Sonnet 5 当裁判,把每份文档前六页渲染成图片当标准答案,让裁判盲测对比两个工具的输出,一共 482 次判定,还正反各评一遍消除顺序偏差。这个测法比自说自话扎实多了。
但我想说的不是榜单。我想说的是,为什么一个转换工具能在一周内冲到 1.5 万 Star。
因为文档解析这件事,被 AI 放大成了基础设施。你想想现在所有 AI 工作流的第一步是什么,把人类的内容变成 AI 能读的文本。做企业知识库,几百份 Word 制度、Excel 数据、PPT 培训材料要统一喂进向量库。做 Agent,模型要读合同、读报表、读产品手册。做个人知识管理,PDF、EPUB 要转成 Markdown 进 Obsidian。这些场景的第一步,全是格式转换。
以前文档是给人看的,排版花哨是加分项。现在文档还要给 AI 看,而 AI 只认结构化文本。于是「把任意格式变成干净 Markdown」从一个小工具,变成了任何 AI 工作流的第一公里。这一公里卡住,后面全卡住。这一公里通了,后面全是坦途。
一个被 AI 放大了十倍的老问题,这才是它爆火的真正原因。
04 一家做爬虫的公司,为什么要开源这个
这里我要聊一个更有意思的事。Firecrawl 是干嘛的?它是做网页抓取的,把整个网站爬下来转成 LLM 能读的文本,这是它的主业。现在它开源了一个转文档的工具,而且开源的还是它自家付费产品 Firecrawl Parse 的核心能力。
乍一看,这不是自己砸自己饭碗吗?仔细一想,不是,这是特别聪明的打法。
你发现没有,网页抓取和文档转换,说到底就是同一件事。爬虫把网页这种「给人看的超文本」翻译成「给 AI 读的纯文本」,anydoc 把 Word 这种「给人看的办公格式」翻译成「给 AI 读的 Markdown」。一个管网上,一个管本地,合起来就是一句话,把人类世界的内容,统统翻译成 AI 世界的语言。
这就是 Firecrawl 的生意。它要的不是卖转换工具,它要的是成为 AI 获取内容的基础设施。开源版 anydoc 免费、快速、本地运行,帮它占领开发者心智,让全世界做 Agent 的人第一反应就是用它的工具链。而真正赚钱的部分,OCR、扫描件识别、云端托管、大规模处理,这些留给付费的 Parse。你测完免费的觉得香,遇到搞不定的扫描件,自然就想起它家云服务了。
这个套路眼熟吗?OpenAI 开源 Whisper 语音识别,自己卖 API。Mistral 开源模型,自己卖云服务。开源的不是慈善,是获客。把基础能力免费送出去,把企业级需求留下来收费。anydoc 干的就是这事,而且干得漂亮。
还有个小细节,能看出这家公司的格局。他们给 anydoc 做了一个 Agent Skill,一行命令装进 Claude Code、Codex、Cursor,AI 编程助手遇到看不懂的文档,自己先转成 Markdown 再读。自家的工具主动去适配别家的 AI,为什么?因为它的目标根本不是工具本身,是让每一个模型背后的工作流都跑在它的转换能力上。这才是做基础设施的心态。
05 边界在哪,我踩过的坑
说到这,我得给你泼盆冷水。这工具不是万能的,有几个坑我实测踩过,你得知道。
第一个坑就是扫描件。我拿扫描版 PDF 一测,它直接拒绝,报错说得很直白,没有可提取的文本,需要 OCR。这活儿它不干。所以纸质合同、传真件、老书扫描本,别指望它,那种得走 OCR 服务,或者用带视觉模型的重型解析工具。
第二个坑是 Excel 的数字格式。这个在它 GitHub 的 issue 里有明确案例,7.5% 可能给你转成 0.075,货币符号和千分位可能丢。普通文本检索无所谓,但要是财务数据、利率、毛利率,AI 读到的数字含义就变了。所以重要的 Excel,转完你得校验数字,不能直接信。
第三个坑是嵌套表格。Markdown 原生不支持表格套表格,Word 里那种大表套小表的复杂结构,会被压扁到单元格里,文字在,但行列关系没了。表单、报价单这类,转完得检查。
第四个坑不是它的问题,是项目太年轻。现在版本才 0.x,维护者在 issue 里亲口说,API 还没冻结,随时可能变。你今天写的代码,明天接口可能就改了。好在核心的转换接口目前是稳的,但你要拿它做生产管线,得盯版本。
第五个坑,藏在文档里的图。这个我专门测过,造了一份带架构图的 Word 丢进去转,结果挺扎心。标题、正文、图注,全都在,唯独那张架构图,没了。对,就是凭空消失。官方文档写得很直白,Markdown 不能嵌字节,内嵌图片只会渲染成 alt 文本,有 alt 就留个占位文字,没 alt 就啥也不剩,原始字节倒是存在 assets 里,想要得自己调接口取。因为 anydoc 不接 OCR,图片里的内容它看不懂。
可问题在于,实际业务文档里,图恰恰是最值钱的部分。架构图、截图、流程图、数据图表,信息全在图里。你拿一份带图的方案去喂 AI,AI 读到的文字很完整,但图里的东西一个字都读不到。所以带图文档转完,最好自己再过一眼,重要的图要么补 alt 文本,要么走带视觉模型的工具。这个盲区,也是 Firecrawl 留着收费 Parse 的一个理由,OCR 那部分能力,它没放进开源版。
我说这些不是劝退,恰恰相反,知道边界才能用对地方。它最合适的角色很清楚,有结构的原生办公文件,快车道。扫描件、复杂版面、公式、跨页表格,交给重型工具。两个通道配合,才是一条健康的管线。
06 你可以怎么用
最后给点实在的。四种用法,从懒人到极客,总有一款适合你。
最省事的,浏览器直接开它官方 demo,把文件拖进虚线框,秒出 Markdown,复制走人。关键点在于,这个 demo 跑的是 WebAssembly,转换全在你本地浏览器里完成,文件不出门,合同、财务资料这种敏感文件,可以放心拖。
爱用命令行的,一行搞定,npx 装都不用装,
npx -y @firecrawl/anydoc 报告.docx -o 报告.mdPPT、Excel、PDF 命令一字不改,换文件名就行。批量处理还能配个循环。
写代码的,Python 两行,
pip install firecrawl-anydocimport anydoc
markdown = anydoc.to_markdown("report.docx")Node 也有同款 API。想拿内嵌图片的原始字节,还能用 to_document 拿到统一文档模型,图片、OLE 对象都在 assets 里,方便后续接对象存储或者视觉模型。
玩 Agent 的,一行装技能,
npx skills add firecrawl/anydoc装完 Claude Code、Codex 这些工具遇到文档,自己就会先转再读。我脑补了个场景,让它把项目文件夹里几十份 PPT 全转成 Markdown,提取路线图,对比不同版本,把冲突数据标出来。以前这活儿得人干一晚上,现在一句话。
写到最后
我越来越觉得,我们正在见证一个时代的交接。人类花了四十年,把文档做得越来越好看,越来越会「伺候眼睛」。而 AI 只用了几年,就让这个世界重新意识到,文字最值钱的不是长相,是结构。
anydoc 这类的工具,就是这两个时代之间的翻译官。它做的事朴素到不起眼,把 Word 变成 Markdown,但它背后那个判断很清醒,AI 不需要看到,AI 只需要读到。所以它敢做减法,把视觉噪音全剥掉,只留骨架。这个思路,比任何花哨的功能都值钱。
这速度杠杠的,这话我说得理直气壮。但更让我兴奋的是,你把它装进自己的工具链之后,那些以前要人肉搬运的文档苦力活,从此可以交给机器了。省下来的时间,拿去干点人该干的事。

文档正在变成 AI 的文字。而我们,刚好站在翻译官这一侧。
谢谢你看我的文章,我们,下次再见。
/ 作者:mojianpo
/ 投稿或爆料,请联系邮箱:406223802@qq.com
夜雨聆风