
解决痛点:多种格式办公文档统一解析转成Markdown格式。
Ai做知识库、RAG 项目的朋友大概率都踩过文档解析的坑。团队内部一堆杂乱文件:老版 Word 合同、PPT 方案、Excel 报表、PDF 报告、EPUB 电子书,格式五花八门。想要喂给大模型进行训练学习,就得统一转成 Markdown格式。
而传统的方式,使用 Pandoc 转换表格会错乱,LibreOffice 部署笨重还耗资源,在线转换工具又不敢上传企业涉密文档,自研解析逻辑每种格式都要单独写一套,维护成本爆炸。很多项目卡在文档解析这一步,拖慢整个知识库、Agent 项目进度。AnyDoc 就是专门解决这个痛点的开源底层库,毫秒级把十余种文档统一输出标准 Markdown,本地完成处理,文件不用上传第三方服务。

科普介绍:Anydoc 是 Firecrawl 团队用Rust 编写开发的一个多格式文档解析转换库,专门把各类办公文档批量转换成 LLM 友好的 Markdown。AnyDoc 采用统一内部文档模型架构,一套内核处理全部文件格式,面向 RAG、AI Agent、知识库流水线。

五大配套核心能力模块
1. 极致转换性能,无 AI 模型依赖(性能模块)
纯 Rust 实现,不依赖 GPU、不加载大模型,单文档转换中位数耗时5ms 以内,对比 LibreOffice 方案速度提升百倍级别

高吞吐,适合批量文档流水线处理,生产环境高并发场景压力小
浏览器 WASM 编译版本,文件完全本地解析,数据不会上传服务器,保护敏感资料隐私
2. 多格式强兼容,字节级文件识别(解析模块)
不靠文件后缀判断格式,读取文件字节流识别真实文件类型,修改后缀名的损坏文件也可以正常解析
完整保留标题层级、嵌套列表、合并单元格表格、脚注、PPT 演讲备注等复杂排版信息
统一内部文档模型,修复一处解析 bug,全部格式同步受益,不用每种文档单独维护解析器

3. 多语言 SDK + CLI 命令行,适配各类开发场景(接口模块)
CLI 工具:直接命令行完成单文件、批量文档转换,脚本流水线直接调用
Python、Node.js SDK,快速集成进 RAG 服务、后端业务代码
WASM 版本:前端页面直接上传文档浏览器本地转换,不需要后端中转
Agent Skill 原生支持,Cursor、Claude Code 等 AI 编程 Agent 可以直接调用读取本地各类文档
4. LLM 友好标准化输出(输出渲染模块)
统一输出 GitHub 标准 Markdown,格式干净规整,非常适合后续切片、向量化、检索入库
图片资源保留文档模型资产列表,可自行导出处理
输出风格统一,Word、PPT、PDF 输出后结构表现一致,降低大模型理解文档的难度
5. 轻量化部署,无重型依赖(部署模块)
不需要安装 LibreOffice、Office 套件,二进制直接运行,容器镜像体积很小
可嵌入程序,也可独立作为转换服务;支持本地开发、私有化部署,不用调用第三方 API
快速部署教程
方式 1:CLI 快速使用(无需安装环境,推荐体验)
# 转换docx输出到标准输出npx @firecrawl/anydoc contract.docx# 转换ppt并输出到指定markdown文件npx @firecrawl/anydoc plan.pptx -o plan.md
方式 2:Python SDK 安装(RAG 项目集成)
pip install firecrawl-anydoc简易 Python 调用示例
from firecrawl_anydoc import convertresult = convert("./report.docx")# 获取转换后的markdown文本md_content = result.markdownprint(md_content)
方式 3:Node.js 安装
npm install @firecrawl/anydoc方式 4:Rust 项目引入
cargo add anydoc
总结与互动提问
AnyDoc 是面向 AI 时代的底层文档转换基础设施,解决多格式办公文档统一解析的痛点。区别于 Pandoc、LibreOffice 这类传统方案,它以 Rust 实现做到毫秒级处理、轻量化部署、输出格式统一,非常适合私有化 RAG 知识库、AI Agent 文档读取、企业文档批量归档等场景。
开源地址:https://github.com/firecrawl/anydoc
处理企业内部文档,你更愿意本地私有化解析,还是调用第三方解析 API?欢迎留言聊聊你在处理异构文档踩过的坑!
近期热文:
愿你阅有所获,你我同学习、共成长
夜雨聆风