PDF图表提不出来?试试IBM开源的Docling
企业IT工作中,处理研究机构的行业报告是常见需求。这类PDF动辄几十页,图表密集——CEO优先级排名、AI投入趋势、行业对比数据等大量调研结果以可视化图表呈现,恰恰是报告的精髓所在。但常规的文档提取工具只能获取纯文字,图表信息全部丢失。
例如IBM商业价值研究院发布的《2030年企业展望》(https://www.ibm.com/downloads/documents/cn-zh/1550f812c451680b),一份7.9MB的报告,用Docling处理后可输出13MB的Markdown文件,图文完整保留。
报告核心洞察
这份报告是IBM商业价值研究院与牛津经济研究院合作,于2025年对全球33个国家和地区、23个行业的2000名高管进行调研后形成的。报告提出了五项核心预测,勾勒出2030年最具竞争力组织的面貌。用Docling可以提取如下洞察:
预测一:竞争高压下,大胆投入成为必然选择。
67%的高管预计AI将突破当前制约组织发展的资源与技能瓶颈;64%的高管认为,竞争优势将源于创新而非资源优化。超半数(57%)高管已意识到,到2030年核心竞争力主要源于AI模型的精密度。
下图展示了高管们对AI如何化解组织挑战的预期分布——这些柱状图中的分组对比、百分比数值和行业分布,都是传统纯文本提取工具无法保留的数据可视化信息,Docling将它们完整提取了出来:
图1 - AI化解组织长期挑战预期
同时,报告还展示了2025年与2026-2030年间CEO战略优先级的变化。下图中产品与服务创新从第三位跃升为首位、商业模式创新优先级提升的排名变化趋势一目了然:
图2 - 最高管理层战略重点
而在AI营收预期方面,79%的高管预计AI将显著增加营收,但仅有24%能清晰描述收益来源。下图中横纵坐标的数据分布、曲线趋势和占比关系,Docling全部保留,读者可以直观看到预期与现实的落差:
图3 - 高管们正将希望押注于未知之上
预测二:今日生产力提升,实为明日行业转型蓄力。
53%的高管表示,到2030年AI将彻底重塑其所在行业的商业模式。高管们预计,到2030年AI将使生产力提升42%,且67%认为届时组织已获取大部分AI驱动的生产力收益。
下图为报告中阐述AI如何提升生产力的路径图——各驱动因素的权重排序、不同策略的预期效果对比,Docling以图片形式原位保留:
图4 - AI驱动的生产力提升路径
AI带来的效率提升最终形成"生产力提升→创新投资→模式转型→市场增长"的增强回路(飞轮效应),下图展示了这一循环的结构和各环节的关联关系:
图5 - AI为先的飞轮效应
预测三:顶尖AI将量身定制,成为独有智慧引擎。
与仅依赖大型预训练模型的组织相比,采用小型模型与基础模型组合策略的组织预计可额外获得24%的生产力提升、55%的营业利润率提升,以及两倍的流程周期缩短。下图中关键数据(24%、55%)以文字形式提取,箭头图标为辅助视觉元素,Docling将文字与图标一并完整保留:
图6 - 精准模型组合放大业务成果
预测四:AI不会替你完成所有思考。
67%的高管认为现在岗位更新越来越快,57%预计当前大部分员工技能将在2030年不再适用。AI为先的组织更有可能(高出79%)认为知识型工作将主要由AI完成。
下图展示了智能体AI在财务职能中的渗透程度预期——横轴为年份(2025→2030),纵轴为渗透率,显示从约20%增长到66%。Docling将这条趋势线和坐标标注完整提取:
图7 - 智能体AI重塑业务职能
报告还列出了未来三年AI将推动哪些核心技能变得更重要——下图以排序或矩阵形式展示了技能重要性变化,这些结构化信息Docling完整呈现:
图8 - 未来核心技能变化
预测五:量子计算将引发下一次范式变革。
尽管量子计算尚处于早期阶段,但报告指出其将在2030年后成为下一波技术变革的驱动力。下图展示了各行业对量子计算的准备程度:
图9 - 量子计算准备度
报告的核心观点是:未来的组织不能满足于在现有流程上"加装"AI,而需要转向"AI为先"的组织形态——从固定流程、线性决策转向模块化、可组装的智能架构。
实战对比:Docling的提取效果
上面这些调研数据,在原始PDF中大量以图表形式呈现。传统工具和Docling的处理结果差异有多大?来看两组对比。
对比一:CEO战略重点排名变化(Figure 2)
报告前瞻性地对比了2025年与2026-2030年间CEO战略优先级的变化——产品与服务创新从第三位跃升为首位,商业模式创新优先级提升,而网络安全、生态建设等从热点变为标配。
用传统工具提取时,输出是这样的——结构混乱,很难还原出原始图表信息:
Figure 1 Top C-suite priorities 最高管理层战略重点2025 2026-2030 Forecast 预测准确性1 1Product and 产品与服务创新service innovation2 2Productivity or 生产力或效率efficiency/profitability 盈利能力Product and 产品与服务创新service innovation3 ...列标签和数据混杂在一起,中英文交错,无法快速判断哪个优先级排在什么位置,趋势变化更是无从谈起。
而Docling的输出——图表完整呈现:
Figure 2 - 最高管理层战略重点
排名变化、趋势对比一目了然。如果后续需要将这些数据用于AI分析,Docling还可以输出JSON格式,直接提取结构化的优先级排序和权重数据。
对比二:AI营收预期数据(Figure 3)
报告中展示了这样一个关键发现:79%的高管预计到2030年AI将对其收入产生重大贡献,但仅有24%的高管能清晰描绘这些收益的具体来源。原文中这组数据以图表形式呈现,让读者能直观看到"预期"与"落地"间的巨大落差。
传统工具的提取结果——只有文字:
如何才能把渐进式进步转化为指数级增长?首先要敢于拥抱未知。79%的受访高管预计,到2030年AI对其组织收入贡献显著增加,而当前只有40%的高管认为AI正在推动营收增长。但与此同时,只有24%的高管能清晰描绘这些收益的具体来源(见图3)。
文字虽然完整,但图表中的数据可视化信息——各行业分布、不同时间段的变化趋势、预期与现实的对比关系——全部丢失。
Docling的输出——文字与图表原位保留:
如何才能把渐进式进步转化为指数级增长?首先要敢于拥抱未知。79%的受访高管预计,到2030年AI对其组织收入贡献显著增加,而当前只有40%的高管认为AI正在推动营收增长。但与此同时,只有24%的高管能清晰描绘这些收益的具体来源(见图3)。
Figure 3 - 高管们正将希望押注于未知之上
文字和数据图表完整对应,读者可以同时看到调研数据和可视化呈现。
一、传统的烦恼
先看看传统方式处理PDF报告时的体验。
常见的做法有几类:
纯文本提取工具(如pdftotext、PyMuPDF、pdfplumber)——速度快,但只拿文字,表格结构丢失、图表完全不保留。
结构化解析工具(如Marker、Unstructured.io、MinerU)——比纯文本工具进了一步,能识别标题层级、提取表格,但仍然以文字为中心,可视化图表数据(柱状图对比、趋势线、饼图比例等)依然无法保留。
商业文档AI服务(如Azure Document Intelligence、AWS Textract)——云服务方案,处理能力更强,但数据需要上传到云端,且遇到自定义格式的复杂图表时同样捉襟见肘。
它们的共同问题是——图表数据的丢失。纯文字、标题层级甚至表格可以保留,但报告中大量以柱状图、饼图、趋势线形式展示的核心调研数据,在这些工具的输出中基本不可用。
比如处理IBV《2030年企业展望》这份报告时,报告中用大量的图表展示调研数据——CEO关注焦点排名、AI投入预期、战略优先级变化等。这些数据是报告的精髓,但是经过传统工具提取后,图表信息化为乌有。
这些问题已经不是"体验差"的程度了,而是数据丢失——报告中大量有价值的结构化信息在转换过程中丢失了。
二、Docling:另一个选择
Docling是IBM苏黎世研究院开源的一个文档处理工具,目前已托管在LF AI & Data基金会下,在GitHub上获得了超过59.9k的Star。
它的核心能力一句话概括:把各种格式的文档,转换成AI可以直接用的结构化数据。
支持的输入格式包括:
PDF、 DOCX 、PPTX 、XLSX 、HTML 、图片、LaTeX 、纯文本等
输出的格式包括:
Markdown(完整保留表格和图片) JSON(无损结构化数据) HTML(保留样式) DocTags(AI训练标签格式)
最关键的——它完全在本地运行,不需要联网,数据不出机器。
三、对RAG知识库的意义
Docling的价值不止于"更好地查看PDF"。在AI时代,它的结构化输出能力对于构建RAG(检索增强生成)知识库有着直接影响。
先看一个典型的RAG知识库构建流程:
PDF文档 → 文档解析 → 文本分块(Chunking) → Embedding向量化 → 存入向量库 ↓用户提问 → 问题向量化 → 向量检索 → 召回相关chunk → LLM生成回答这个流程中,文档解析是最容易被忽视但影响最大的环节。因为后续所有步骤的质量都受制于"进"了什么:
分块策略依赖文档结构(标题层级、段落边界、表格范围) Embedding模型将每个chunk转换为向量,输入文本质量决定了向量质量 检索召回的上限,由chunk中信息是否完整决定
如果解析阶段就把图表数据弄丢了、表格结构搅乱了、多栏文字切错了,后续embedding模型再强也于事无补——垃圾进,垃圾出。
解析质量与embedding模型的关系
embedding模型(如text-embedding-3、bge-m3、gte-Qwen2等)擅长将语义完整的文本段映射到向量空间。但它的能力高度依赖输入:
目前业界已有多种文档解析方案——PyMuPDF4LLM、Marker、Unstructured.io、Azure Document Intelligence等都是常见选择。然而这些方案在处理图表密集的报告时仍有先天局限:柱状图的对比关系、饼图的比例分布、趋势线的走向——这些可视化数据在解析过程中基本都会丢失,embedding模型也就无从处理这些信息。
2026年一篇系统性评测论文对此做了定量对比(arXiv:2604.04948),在同等条件下测试了 Docling、MinerU、Marker、DeepSeek OCR 四种开源框架共19种管线配置,以RAG问答准确率为衡量标准。结果如下:
| Docling + 层级分块 + 图片描述 | 94.1% | 自动化管线中最高 |
Docling以94.1%的准确率领先,而该论文同时指出:元数据增强和层级感知分块的贡献,比转换框架本身更大——这正是Docling的设计核心。
Docling的文档结构保真能力,具体解决了RAG入口的几个关键问题:
层级感知分块。Docling保留了文档的标题层级、段落边界、表格结构和图片位置。分块时可以按语义边界而非字数硬切,每个chunk语义完整,embedding向量准确,检索到的内容上下文更完整,QA准确率更高。 图表数据不丢失。图表中的调研数据以图片形式保留在对应位置,配合多模态embedding或图表解析,AI可以直接"看到"图表信息,而非仅靠数字碎片拼凑。 JSON结构化输出 + 元数据保留。Docling可以输出完整的JSON格式,保留页面布局、段落顺序、表格单元格坐标等结构化信息,并携带章节标题、页码等元数据。论文证实元数据增强对RAG准确率有显著贡献。对于需要精确引用的企业知识库(如合规文档、技术规范),这一点至关重要。 MCP协议接入AI Agent。Docling提供了MCP服务器,可以直接接入LangChain、LlamaIndex等主流AI框架。文档解析不再是独立步骤,而是AI工作流中的预处理管线——文档进入、结构化数据输出、自动进入知识库,一气呵成。
简单说:文档解析 → 分块质量 → embedding质量 → 检索质量,这是一条完整的因果链。Docling在链条起点提供了最高质量的输入,让后续所有环节都能发挥应有水平。
四、更显著的差距:中文PDF
如果处理的是中文PDF,差距就更大了。
Docling采用模块化架构,通过 RapidOCR 插件引擎接入OCR能力。RapidOCR是一个开放的OCR框架,Docling默认使用其集成的百度飞桨(PaddleOCR) PP-OCRv4 模型——该模型由百度开源,在中文文字检测和识别上经过了专门训练。这种插件式架构体现了Docling的开放性,其对中文文档的处理能力正是依托于本土模型的能力。具体使用的模型包括:
ch_PP-OCRv4_det_mobile.onnx(文字检测,4.7MB)ch_PP-OCRv4_rec_mobile.onnx(文字识别,10.6MB)
这两个模型采用轻量级设计(Mobile版本),可在CPU上高效运行。首次使用时自动下载(约100MB),之后就完全离线工作。如果需要更高精度,也可以替换为Server版或文档优化版模型。
PP-OCRv4的官方技术文档(PaddleOCR项目,https://github.com/PaddlePaddle/PaddleOCR)披露了其在各类场景下的评测数据:在中文端到端场景中,PP-OCRv4的Hmean指标达到62.24%,相比PP-OCRv3提升4.5%;检测模型Hmean达到79.87%,识别模型精度达到75.45%;英文数字识别精度70.1%。这些数据表明PP-OCRv4在轻量级移动端设计下,对中文文档(包括印刷体、表格、图表标注等)具备较高的识别精度。
这意味着Docling在处理中文扫描件、图文混排文档、带中文标注的图表时,可以自动执行OCR,文字识别准确率在中文环境下表现不错。而传统解析工具遇到中文文档中的图片文字或扫描件时,几乎无能为力。
本文前面展示的图表就是最好的例子。图1(AI化解组织长期挑战预期)中的分组柱状图对比、中文坐标标签和百分比数据,图2(最高管理层战略重点)中的"产品与服务创新""商业模式创新"等战略优先级排序,图7(智能体AI重塑业务职能)中的年份横轴和渗透率趋势线——这些图表都来自一份中文PDF报告,PP-OCRv4模型在其中发挥了关键作用,确保了图表区域被准确定位、中文标注完整保留。
五、Docling的正确打开方式
Docling的安装非常简单:
pip install docling一行命令即可。
常用命令:
# PDF转Markdowndocling report.pdf --to md --output ./output# PDF转JSON(保留完整结构信息)docling report.pdf --to json --output ./output# 批量转换整个目录docling ./reports/ --to md --output ./output# 关闭OCR(文字类PDF可提速)docling report.pdf --to md --no-ocr --output ./output首次运行时会下载OCR模型(约100MB),之后就可以离线使用。
六、从技术报告到现在的演进
Docling 的首篇技术报告于2024年发布(arXiv:2408.09869),当时的架构相对精简:RT-DETR 做版面分析(基于 DocLayNet 数据集)、TableFormer 做表格结构识别,OCR 依赖 EasyOCR(每页需30秒以上),GPU 加速还是"进行中"。到今天 v2.93.0(2026年5月),短短两年间发生了巨大变化:
OCR 全面升级。从单一的 EasyOCR 发展到支持 RapidOCR(集成百度 PP-OCRv4,中文识别大幅提升)、Nanonets、Falcon-OCR、LightOnOCR 等多种后端,用户可根据场景自由选择。
模型体系大幅扩展。新增 Heron 布局模型(速度更快)、Granite Vision 4.1 多模态模型(可理解图表内容)、DocumentFigureClassifier v2.5 图片分类器,并引入 VLM pipeline 处理复杂版面。论文中只有两个模型,现在已有完整的模型生态。
GPU 加速落地。论文中标注为"进行中"的 GPU 加速,现在已通过 VllmCudaGraphMode 和 CUDA 支持实现,处理速度显著提升。
生态体系成熟。从单一转换工具演化为完整生态:docling-serve(分布式处理,支持 Ray 编排)、MCP Server(AI Agent 接入)、docling-slim(模块化按需安装)。值得一提的还有 Docling-Graph 项目,它在 Docling 结构化输出的基础上,利用 LLM/VLM 从文档中自动抽取实体和关系,生成可查询的知识图谱(支持导出为 CSV、Cypher、JSON 或交互式 HTML 可视化),适用于金融合同条款分析、科研文献知识库、化学实验数据整理等场景。
格式支持丰富。从 PDF/DOCX 扩展到 XBRL 财务报告、LaTeX、WebVTT、CSV、WebP 等20余种格式。
从技术报告到现在172个release、1000+次提交的演进速度来看,Docling 还在快速迭代期,几个方向值得持续关注:图表理解能力(柱状图/饼图/折线图→数据表格和代码)、元数据提取(标题、作者、参考文献自动识别)、化学结构理解等。它的定位已从"文档转 Markdown 工具"升级为 AI 流程中的数据预处理基础设施。
项目已托管在LF AI & Data基金会下,社区活跃度很高——172个release、1000+次提交、4100+ forks——对于需要文档处理能力的开发者来说,是一个值得关注的开源项目。
七、选型建议
综合来看,选型建议如下:
| Docling | ||
| Docling | ||
| Docling |
单一的文字提取工具面对当下大量图表、表格、复杂排版的专业文档已经有些力不从心了。Docling在"保留文档结构完整性"这个维度上有明显优势——而这恰恰是做文档分析时最关键的能力。
参考:
1. IBM商业价值研究院《2030年企业展望》https://www.ibm.com/downloads/documents/cn-zh/1550f812c451680b
2. Docling项目https://github.com/docling-project/docling
3. PaddleOCR PP-OCRv4 官方技术文档https://github.com/PaddlePaddle/PaddleOCR
4. Docling技术报告(2024)https://arxiv.org/pdf/2408.09869
5. Docling-Graph知识图谱工具https://github.com/docling-project/docling-graph
夜雨聆风