乐于分享
好东西不私藏

AI必装插件:一条命令,让它读得懂你的office及各类文档

AI必装插件:一条命令,让它读得懂你的office及各类文档


把一份季度报表.xlsx 丢给 AI 助手,它回你一句:这个文件我读不了。

Word、PPT、Excel 这些办公格式,AI 天生读不了。以前你想喂给它,得自己先转:装 LibreOffice、另存为 Markdown、再拖进对话框——麻烦,还慢。下次 AI 对你说「这个文件我读不了」,你有一条命令治它:Firecrawl 开源的 anydoc 把 14 种格式统一转成 Markdown,中位耗时 4.4 毫秒,还自带 Agent Skill,一条命令让 Claude Code、Codex 这类 AI 自己学会读文档。

AI 的母语是文本,docx 是外语

docx 本质是一个压缩包,里面装着 XML;PPT 和 Excel 是更复杂的结构体;老格式的.doc 干脆是二进制。这些内容 AI 直接吃不下,它要的是纯文本,最好还带结构——Markdown(AI 工具和代码平台都能直接读)恰好是那个标准答案。

问题在于你手里的文档绝大多数不是 Markdown:Word 合同、PPT 汇报、Excel 报表、EPUB 电子书、扫描件 PDF。Firecrawl 团队把这 14 种格式挨个收编——Word、PowerPoint、Excel、OpenDocument、RTF(富文本格式)、EPUB、CSV、PDF,输出统一变成干净的 Markdown:标题、表格、列表、脚注全部保留,风格一致。

读文档这事,AI 得先补一课

anydoc 的巧妙之处在它自带 Agent Skill——一套教 AI 怎么用工具的说明书。装一次,你的 AI 从此直接会读文档,不需要你手动转。

npx skills add firecrawl/anydoc

先决条件:机器上有 Node 20 或更高版本。首次运行会下载预编译二进制,装完就生效。

装完怎么验证?拿一份 docx 丢给你的 Claude Code,让它总结内容——它之前会拒绝的文件,现在读得头头是道。这个技能兼容的 AI 相当广:Claude Code、Codex、Cursor、OpenCode,以及任何支持 Agent Skill 规范的代理。

你缺的,是让 AI 读得懂你文件的那一条命令。

日常使用就一个动作:把文档丢给 AI。

日常就一条:npx @firecrawl/anydoc

不装技能也行,自己转文档同样是一行的事。anydoc 的命令行工具最省事的用法连安装都省了,npx 第一次运行会自动下载你平台的预编译版本:

npx @firecrawl/anydoc report.docx                # 转成 Markdown,直接输出到屏幕npx @firecrawl/anydoc slides.pptx -o slides.md   # 想存成文件,加 -onpx @firecrawl/anydoc - --format csv < data.csv  # 也能从 stdin 读入

三个细节要记一下:输出默认打到屏幕上,要保存必须加-o;CSV 没有内容标记可以识别,必须用--format csv指名格式,这是最容易被卡住的一步;想长期使用,可以npm install -g @firecrawl/anydoc装成全局命令——这是唯一需要做的一次性配置。

大文档有个官方建议的用法:转成文件再读需要的部分,别一次性把整份塞进对话上下文。想写进代码,Python 也是一行:

pip install firecrawl-anydoc   # 安装后 import anydoc
import anydocmarkdown = anydoc.to_markdown("report.docx")  # 一行出 Markdown

为什么 4.4 毫秒,还处处最高分

快是这份基准测出来的:100 个真实文档、14 种格式,中位耗时 4.4 毫秒;对比组里 LibreOffice 要 1129.5 毫秒,最快的其他工具 markitdown 也要 134.8 毫秒——anydoc 比第二名快了一个数量级。

质量同样有依据。官方让大模型当裁判盲评:每次给两个工具的输出打分,A/B 对调判两次消除位置偏差,总共 482 次判定。anydoc 综合 81 分(满分 100),LibreOffice 只有 40 分;在每一种被评判的格式上,anydoc 都是最高分。

快的原因写在设计里:纯 Rust、没有机器学习模型、不调任何外部服务。每种格式一个解析器,但解析结果全部汇入同一个共享文档模型,最后只有一个序列化器负责输出——docx 的表格转义修好了,rtf、odt 和剩下十几种一起好。

它检测格式也看内容不看扩展名:PDF 看文件头,RTF 看开头分组,老式 Office 二进制看内部流标记,新版看压缩包声明。后缀名是错的,照样能转对。Node 版转换跑在线程池上不卡主线程,Python 版不阻塞其他线程。

扫描版 PDF 它读不了,这是说好的边界

诚实地说,有它明确不接的活:扫描版和图片版 PDF。这类文件没有可提取的文字,anydoc 会直接报不支持(Unsupported),官方给出的替代方案是托管版的 Firecrawl Parse——加 OCR模型,专门处理 anydoc 读不了的扫描页。加密文档同样拒绝,报 Encrypted 错误。

处理失败的报错一共六类:不支持、结构损坏、加密、超限、缺部件、读不到文件——每类都标明原因,方便你的程序决定跳过还是重试。

anydoc 的 PDF 能力来自 Firecrawl 的另一个开源库 pdf-inspector,它先判断 PDF 是文本型还是扫描型,约 54%的纯文本 PDF 根本不需要 OCR,本地不到 200 毫秒就出 Markdown。浏览器里还有个 WebAssembly 演示页,文件在本地转换,不离开你的电脑。

Firecrawl 的路线很清楚:网页抓取(firecrawl 主仓库 163.1K star)→PDF 解析(pdf-inspector 13.2K star)→文档转换(anydoc 11.6K star),「AI 能读的世界」在一步步变大。1.25M 开发者、150,000 家公司在用它的服务,开源只是这条路线的入口。

给 AI 配上读文档的能力,正在从「会的人才会」变成「装一条命令就有」。它再对你说「这个文件我读不了」,你回它两个字:装过了。

[anydoc GitHub 仓库]https://github.com/firecrawl/anydoc 

[Firecrawl Parse]https://firecrawl.dev/parse 

参考链接:[1] https://raw.githubusercontent.com/firecrawl/anydoc/main/README.md[2] https://raw.githubusercontent.com/firecrawl/anydoc/main/skills/convert-documents-to-markdown/SKILL.md[3] https://github.com/firecrawl/pdf-inspector

「点赞」「转发」「小心心」都点上,欢迎在评论区留下你的想法!


免责与版权声明本文资讯及观点仅供技术交流参考。文中引用图片均源于网络公开渠道(如官方博客、社交平台等),著作权归原作者所有。本文旨在分享与评述技术进展,符合“合理使用”原则。如相关图片/内容涉及版权侵权,请联系我们(留言或私信),我们将核实后立即删除。