
还在为文档格式转换发愁?收到同事的 .docx 文件,打开发现排版全乱?想把 PDF 里的内容提取出来给 AI 处理,却被格式搞得头大?anydoc 就是你的救星。
什么场景下需要用?
场景 1:你的 AI 编程助手看不懂办公文档
当你用 Claude Code、Codex 等 AI 编程工具处理项目时,发现项目文档是 Word 或 PPT 格式。AI 工具读不懂 .docx 和 .pptx,你需要先把它们转成 Markdown。anydoc 一秒搞定,而且转换质量极高,表格、列表、标题层级都保留。
场景 2:批量处理几十份 PDF 报告
每个月要处理几十份 PDF 报告,把内容提取出来做分析。手动复制粘贴太慢,用在线工具又担心隐私泄露。anydoc 在本地运行,文件不离开你的电脑,一条命令就能批量转换所有 PDF。
场景 3:给大模型喂数据前做预处理
想用本地大模型分析公司文档,但 .docx 和 .xlsx 格式大模型不认。anydoc 把各种格式统一转成 Markdown——这是大模型最擅长处理的文本格式。转换后直接丢给 RAG 系统,效果好得惊人。
怎么用?
安装
anydoc 由 Firecrawl 团队开发,用 Rust 编写,速度极快。安装方式多样:
# 最方便:用 npx 直接运行,自动下载
npx @firecrawl/anydoc report.docx
# 全局安装
npm install -g @firecrawl/anydoc
# Python 用户
pip install firecrawl-anydoc
# 直接作为 AI Agent 技能安装
npx skills add firecrawl/anydoc快速开始
# 把 Word 文档转成 Markdown,输出到终端
anydoc 报告.docx
# 保存到文件
anydoc 演示文稿.pptx -o 演示文稿.md
# 从标准输入读取 CSV
anydoc - --format csv < data.csv
# 转换 PDF
anydoc 合同.pdf -o 合同.md转换结果会保留文档结构——标题层级、列表、表格、加粗斜体等格式都不丢失。
进阶用法
Node.js 集成:
import { toMarkdown } from '@firecrawl/anydoc';
// 一行代码转换
const markdown = await toMarkdown('report.docx');
console.log(markdown);浏览器端使用: anydoc 支持 WebAssembly,可以在浏览器中直接运行,文件完全在本地转换,不用担心隐私问题。
搭配 AI Agent: 安装为 Agent Skill 后,你的 AI 编程助手就能自动识别文档格式并调用 anydoc 转换——你只需要说"帮我分析这份报告",剩下的它自己搞定。
注意事项
- • anydoc 专注于格式转换,不支持 OCR。扫描版 PDF 需要配合 Firecrawl Parse 的 OCR 功能
- • 经测试,转换一个 50 页的 Word 文档只需要几毫秒
- • 目前支持:Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF
- • 输出统一为 GitHub Flavored Markdown,所有格式的输出风格一致
总结
anydoc 是文档处理场景里的瑞士军刀——不管什么格式的文档,一条命令转成 Markdown。特别适合需要批量处理文档、给 AI 喂数据、或者单纯想摆脱格式混乱烦恼的开发者。这个项目在 GitHub 上已有 12k Stars,由 Firecrawl 团队维护,质量和更新频率都有保障。
下一篇:多 Agent 协作工作平台 - 给团队配一个 AI 同事
夜雨聆风