你是否曾为整理会议纪要、处理客户发来的 PDF 报告、或把老旧的 .docx 培训材料导入知识库而反复复制粘贴、手动删页眉页脚、修复表格错位?anydoc 就是为此而生——它是一个用 Rust 编写的高性能文档转换工具,能将 Word、PowerPoint、Excel、PDF、EPUB 等 8 种常见格式,一键转成结构清晰、语义完整、开箱即用的 GitHub 风格 Markdown。不依赖 LibreOffice 或 Adobe,不调用云端 API(可离线运行),转换速度快至「个位数毫秒级」,且输出风格高度统一,彻底告别格式混乱和人工修稿。
核心功能
● 全格式覆盖:原生支持 .docx、.pptx、.xlsx、.odt(OpenDocument)、.rtf、.epub、.csv 和 .pdf(含文字型 PDF),连带公式、列表、标题层级、超链接、内嵌图片(自动转为 Markdown 图片引用)一并精准还原
● 真正「干净」的 Markdown:智能过滤页眉页脚、页码、水印、批注、隐藏文本;自动标准化标题缩进、列表嵌套与表格对齐,输出符合 GitHub/GitLab/Notion 等平台直读规范的 GFM(GitHub Flavored Markdown)
● Rust 原生性能:底层完全用 Rust 编写,无外部运行时依赖,单文件二进制体积小、启动快、内存占用低,适合集成到 CI/CD 流程或高并发文档处理服务中
● 多语言友好绑定:官方提供开箱即用的 Node.js npm 包(@firecrawl/anydoc)和 Python PyPI 包(firecrawl-anydoc),几行代码即可嵌入现有 Web 应用或数据管道
● Agent-ready 技能模块:已封装为标准 Agent Skill,支持通过 npx skills add firecrawl/anydoc 快速接入 Claude Code、OpenAI Codex 等智能体工作流,让 AI 自动「读懂」用户上传的任意文档
● 企业级可靠选项:若需处理扫描版 PDF(OCR 场景),项目方 Firecrawl 提供托管 API 服务(Firecrawl Parse),自动补上 anydoc 无法识别的图像文字,实现「文字 PDF + 扫描 PDF」一站式处理
适合哪些人用
内容运营者可批量将旧 PPT 转为知识库文章;开发者能将其嵌入文档解析微服务,为 RAG 应用注入高质量文本源;科研人员可一键把期刊 PDF 和实验报告 Excel 整理成统一 Markdown 笔记;学生党轻松把老师发的 .rtf 讲义转成 Obsidian 可读笔记;甚至 AI 工程师也能把它作为 LLM 预处理环节的「文档清洗器」——无论你是个人效率追求者,还是团队自动化建设者,anydoc 都在降低文档格式壁垒这件事上做到了极致简洁与强大。
快速上手
最简方式:直接使用 CLI 工具(无需编译)
curl -L https://github.com/firecrawl/anydoc/releases/download/v0.5.0/anydoc-x86_64-unknown-linux-gnu -o anydoc && chmod +x anydoc
./anydoc input.pdf > output.md
Node.js 用户:
npm install @firecrawl/anydoc
const { convert } = require('@firecrawl/anydoc');
const md = await convert('report.docx');
Python 用户:
pip install firecrawl-anydoc
from anydoc import convert
md = convert("data.xlsx")
想让 AI 智能体自动处理文档?只需一行:npx skills add firecrawl/anydoc,随后即可在 agent prompt 中自然调用「请将这份 PDF 转为 Markdown」。
项目信息
编程语言:Rust|Star 数:1324|开源协议:MIT|GitHub 项目地址(https://github.com/firecrawl/anydoc)
专注发现全球优质开源项目,每日精选 GitHub Trending 热门项目,提供深度中文解读,帮你快速找到最适合的开源工具与资源。 🤖 AI 工具⚡ 效率神器🎨 前端框架🛠️ 开发工具🌐 建站资源 🌐 官方网站:https://www.openklc.com/ |
夜雨聆风