乐于分享
好东西不私藏

「开源项目anydoc」把乱七八糟的文档变成AI能看懂的文字,这个工具只花了4.4毫秒

「开源项目anydoc」把乱七八糟的文档变成AI能看懂的文字,这个工具只花了4.4毫秒
“我模型调了两个月,结果卡在最基础的文档解析上。”
这个问题做AI的人都不陌生——大模型再聪明,喂进去的文档格式不对,出来的结果也是一团浆糊。市面上能解析文档的工具不少,但各有各的毛病:有的只支持PDF,有的处理不了老格式,有的解析一个文档要等好几秒。
最近GitHub上有个叫AnyDoc的项目,把这事儿变得简单了很多。

它到底是什么?

AnyDoc是Firecrawl团队开源的一个文档转换库,能把Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV和PDF统统转换成干净的Markdown格式
Markdown是什么?就是AI最“爱吃”的那种纯文本格式——标题、列表、表格、代码块都有标准写法,没有乱七八糟的样式干扰,大模型读起来几乎不费劲。
项目在GitHub上开源没几个月,已经涨到了超过3700颗星

它到底有多快?

官方公布了一组数据:在Ryzen 9 9950X3D上测试,100份真实文档的转换中位数只有4.4毫秒
4.4毫秒是什么概念?你眨一下眼睛大概要100到150毫秒。AnyDoc转换一份文档的时间,比你眨眼快二三十倍
对比一下同类工具:LibreOffice平均1129.5毫秒,Unstructured是572.9毫秒,微软官方的MarkItDown也要134.8毫秒。AnyDoc比第二快的工具快了一个数量级
而且它是纯Rust写的,没有机器学习模型,不调用任何外部服务。这意味着它不需要联网,不需要API密钥,数据全程在本地处理。

14种格式全覆盖,一个统一的输出

AnyDoc支持14种格式,几乎覆盖了你日常工作能碰到的所有文档类型:
Word:.doc、.docx、.docm
PowerPoint:.ppt、.pps、.pot、.pptx、.pptm、.ppsx、.ppsm
Excel:.xls、.xlsx、.xlsm、.xlsb
OpenDocument:.odt、.ods、.odp
其他:.rtf、.epub、.csv、.pdf
最厉害的一点是:所有格式最终输出的是同一种Markdown。不管你是2003年的老.doc文件,还是昨天刚存的.pptx,出来的Markdown格式完全一致——标题带锚点、粗体斜体删除线保留、表格带合并单元格和表头、代码块语法高亮、脚注尾注、甚至演讲者备注都能提取出来。
公式也能转。Word和PPT里的OMML公式、OpenDocument和EPUB里的MathML公式、RTF里的公式,统统转成GitHub Flavored Markdown标准的$...$行内公式和$块级公式。

它跟别的工具比到底强在哪?

项目主页做了一个很硬核的对比评测:用Claude Sonnet 5做裁判,盲测AnyDoc和其他六个工具的转换质量,从完整性、结构、格式、整洁度四个维度打分。
结果AnyDoc在每一个被评测的格式上都拿了最高分
格式AnyDocLibreOfficeUnstructuredMarkItDownPandocDoclingMammoth
docx88565371687170
pptx74246652
xlsx7230665547
pdf7258
epub77727252
注意一个细节:AnyDoc是唯一覆盖全部14种格式的工具。Mammoth只支持docx一种,Pandoc支持5种,Docling只支持4种。覆盖面广、质量还高、速度还快——这三个维度同时做到,确实不容易。

怎么用?最省事的方式——浏览器直接试

官方提供了一个WebAssembly演示页面,打开就能用,文件在本地转换,不会上传到任何服务器

谁适合用这个东西?

几类人可能会特别感兴趣:
AI应用开发者:RAG系统、文档问答、知识库构建,需要把各种格式的文档统一转成AI好读的格式
数据工程师:批量处理海量文档,速度和稳定性是关键
内容创作者:把不同来源的文档统一转成Markdown格式管理
任何“文档格式太乱、想统一成一种格式”的人
项目采用MIT协议开源,GitHub上搜“firecrawl/anydoc”就能找到。

最后说两句

文档解析这件事,听起来不性感,但做AI应用的人都知道——这是最底层、最绕不开的一关。模型再强,喂进去的数据是乱的,出来的结果一定不行。
AnyDoc做的事情很简单:把一堆乱七八糟的文档格式,变成AI能一口吃下去的干净文本。快、准、全,而且免费。
它解决的不是“让AI更聪明”的问题,而是“让AI吃进去的东西更干净”的问题。有时候,后者比前者更重要。