夜雨聆风学习资料网

ARTICLE · 1043713

IBM AI4K团队做了个工具,把PDF变成AI能直接啃的数据

IBM AI4K团队做了个工具,把PDF变成AI能直接啃的数据

电脑里躺着几百篇PDF资料,想用AI帮忙读,结果发现它经常答非所问。

问题不在模型,在文件本身。PDF是给人看的排版格式,不是给机器读的数据格式。

IBM苏黎世研究院做了个工具叫Docling,专门解决这件事。


Docling的功能

把各种文档,转成AI能直接用的结构化数据。

支持的文件类型很多:PDF、DOCX、PPTX、XLSX、HTML、EPUB、Apple Pages、WAV、MP3、WebVTT、Box Notes、EML、MSG、PNG、TIFF、JPEG、LaTeX、纯文本,还有ODF、XBRL、Markdown变体。

但真正的重点不是「支持多少格式」,是PDF解析做得细

普通工具读PDF,就是抽文字。Docling会分析页面布局、阅读顺序、表格结构、代码块、公式、图片分类。两栏论文,它知道先读左栏再读右栏。表格,它知道哪是表头哪是数据。

它统一转成一种叫DoclingDocument的表示格式,再导出。可以导出Markdown、HTML、WebVTT、DocLang、DocTags,以及无损JSON。无损JSON这点对科研重要,意味着后续还能还原结构信息。


三个实用场景

  • 本地运行,敏感数据、内网环境都能跑,不用把文件传到别人服务器。对处理未发表数据的人来说,这条是硬需求。
  • OCR支持,扫描版PDF、图片里的文字,它能识别。
  • 和AI框架打通,LangChain、LlamaIndex、Crew AI、Haystack都能直接接,还有MCP server,能连各种智能体。

快速使用

pip安装:

pip install docling

命令行转一个文档:

docling https://arxiv.org/pdf/2206.01062

当前目录会生成一个md文件,里面是结构化的文档内容。Python里用:

from docling.document_converter import DocumentConvertersource = "https://arxiv.org/pdf/2408.09869"converter = DocumentConverter()result = converter.convert(source)print(result.document.export_to_markdown())

Docling是MIT协议开源,托管在LF AI & Data基金会下,最初由IBM Research Zurich的AI for knowledge团队发起。项目还在活跃更新,最近加了视频解析、图表理解这些功能。

开源地址:https://github.com/docling-project/docling

往期精彩

2026可视化工具TOP3

复现IF50.0期刊上6张图

复现Science正刊图

复现顶刊forestplot

师姐认为你会的55个科研图表

师弟师妹偷偷用的7大科研图表

复现Nature中的PCA图

复现Cell图

相关学习资料