RAG 系统 80% 的失败原因不是 embedding 模型不够好,是PDF 解析之后文本混乱。Docling 是 IBM 给出的答案。觉得有用记得收藏 + 转发。下面我把"docling"是什么、它能解决谁的问题、怎么快速上手,一次讲透。
你用 LangChain 接入一份 50 页 PDF,结果 LLM 读到"第 3 页 1.1 节 第 1.2.3 条 (a) 详见下页"这种乱码。

◆ 它到底是什么,我用大白话
Docling 是 IBM Research 出品的文档解析工具,64K Star,MIT 协议, 把 PDF / Word / PPT / Excel 解析成 RAG 友好的结构化 Markdown, 与 PyPDF / pdftotext 的差异:保留标题层级 + 表格结构 + 图片说明
内置多模态模型 docling-ibm-models,表格识别准确率业内领先
本地部署友好,GDPR / HIPAA 合规场景直接用
◆ 4 个真实落地的玩法
RAG 集成 ——直接输出 Markdown + 结构化 JSON,LangChain / LlamaIndex 一行接入。
玩法 1:PDF 智能解析
保留标题层级 / 表格 / 图片依赖,不只是 OCR。
玩法 2:Office 文档
Word / Excel / PPT 全支持,企业内训 / 财务 / 报告场景。
玩法 3:多模态
表格识别 + 图片描述 + OCR 混合输出,docling-ibm-models 加速。

玩法 4:RAG 集成
直接输出 Markdown + 结构化 JSON,LangChain / LlamaIndex 一行接入。
◆ 它跟同类选手比,差在哪
**结论:PyPDF / pdftotext | Docling
表格识别:无 | 业内顶配 段落结构:无 | 保留层级 图片/OCR:无 | 内置多模态 适用:简单文本 | RAG / 知识库**
◆ 八分钟上手
最低成本的方式,一行起服务 / 一行跑 demo:
# 装依赖(伪代码,根据实际项目改)npm install docling # 或 pnpm / pip# 跑 demo# PDF 智能解析:保留标题层级 / 表格 / 图片依赖,不只是 OCR# Office 文档:Word / Excel / PPT 全支持,企业内训 / 财务 / 报告场景# 多模态:表格识别 + 图片描述 + OCR 混合输出,docling-ibm-models 加速# RAG 集成:直接输出 Markdown + 结构化 JSON,LangChain / LlamaIndex 一行接入# 本地部署:企业数据敏感,完全本地运行,IBM 出品安全合规中文文档 + 上手教程,推荐你直接看 GitHub 仓库 README 和 官方文档。
◆ 它跟生态的关系
如果你 2026 年还在搭 RAG 系统,还没听说 Docling,那你的 PDF 解析环节一定在拖你后腿。IBM 出品的工具,北欧 NASA 都用它,免费开源。
◆ 项目资料
🔗 项目地址
GitHub 仓库 docling-project/docling — Star 64,764(2026-08-13 实时核验),Python LICENSE 文件 — MIT 协议,商用情况根据项目实际 Releases 页面 — 长期迭代
🚀 在线体验 / 相关资源
docling 官网/GitHub — 项目入口 官方文档 — 完整使用文档 Docker / npm / PyPI 镜像 — 5 分钟起一个 Discord / Slack 社区 — 官方问答 Awesome 资源合集 — 社区整理的资源
夜雨聆风