AI 三餐 · 工具台 · 今日一句
PDF 塞给 AI 之前,先把目录、表格和阅读顺序理干净。
🍱 今天这道菜
Docling · 💡 值得一试
开发方:IBM Research Zurich AI for Knowledge 团队 · 最新版:v2.118.0(2026-08-03)
价格:免费,MIT 开源许可 · 无订阅、无免费额度上限(2026-08-07 查证)
平台:macOS / Windows / Linux · Python 3.10+
热度:GitHub 64,357 stars · 2026-08-07
🍱它解决什么问题
三个场景最适合它:把论文转成 Markdown 再交给 AI 做笔记;从财报里保住表格结构;把本地合同整理成可检索资料库。普通复制粘贴常把双栏顺序打乱,表格也会塌成一团,模型吃到的原料已经坏了,回答再漂亮也白搭。
📎 Docling GitHub · 支持格式 · 2026-08-07
🧠背后原理
Docling 不只“抄字”。它先识别标题、段落、图片、表格和页面坐标,再按阅读顺序装进统一的文档结构,最后导出 Markdown、HTML 或 JSON。碰到扫描件时再启用 OCR,也就是把图片里的字认出来。它像先把一箱散页分门别类,再交给 AI 阅读。
📊 社区热度
64,357 stars
GitHub 仓库实时口径 · 2026-08-07
🛠跟着做
1装好 uv
访问 uv 安装页,按你的系统复制命令。完成后在终端输入 uv --version,预期看到版本号。
2准备一个单独文件夹
在终端输入 mkdir docling-work && cd docling-work,再把 PDF 拖进这个文件夹。预期文件夹里只有原稿,方便找输出。
3执行转换
输入 uvx --from 'docling==2.118.0' docling convert 文件名.pdf --to md --image-export-mode placeholder --output output。预期出现 output 文件夹;首次运行还会下载模型,会比以后慢。
4检查阅读顺序
打开 output 里的同名 .md 文件,先看标题层级、双栏段落和表格。预期正文顺序连贯,表格以竖线结构保留。
5再交给 AI
把 .md 文件放进你常用的 AI 工具,要求它“只根据这份资料回答,并标出章节”。预期回答能引用正确的小节,而不是在错乱页面里猜。
📎 官方安装文档 · CLI 文档 · 2026-08-07
📊一组实际数据
一份 9 页、5.57 MB 的 Docling 技术报告,用默认标准管线在 CPU 上转换,模型缓存后的第二次运行耗时 41.41 秒。输出保留了 19 个 Markdown 表格结构。把图片设为 placeholder 后,文件从含内嵌图片时的约 1.02 MB 降到 34.2 KB,更适合喂给 AI。
📊 9 页技术报告
41.41 秒
CPU · 标准管线 · 模型已缓存 · Docling v2.118.0
🔒隐私与账单
默认本地转换,文件不必上传,适合合同、内部报告和未发表论文。它没有账号、订阅和自动续费;代码为 MIT 许可。若你主动改用远程服务或外部模型,数据规则就跟着那个服务走,别把“本地工具”四个字当万能护身符。
📎 许可与本地运行说明 · 2026-08-07
⚠️坑与边界
- 慢:用户 MCamblor97 的 51 页工程 PDF 对比里,Docling 用时约 11.7 秒,轻量方案约 0.13 秒;干净文本只求速度,没必要上重管线。来源
- 重:首次运行要拉模型,长文档还可能吃掉大量内存;项目目前有用户报告进程耗尽可用内存。Issue #2779
- 表格不是百分百:合并单元格、跨页表和糟糕扫描件仍可能错位,交给 AI 前必须抽查关键页。用户对比
- 默认图片会撑大 Markdown:加上 --image-export-mode placeholder,别让一堆 Base64 把上下文窗口吃光。
🔁替代怎么选
- MarkItDown:免费 MIT 开源;文件干净、只想快速转文本时选它。GitHub
- Marker:免费 Apache-2.0 开源;批量 PDF、速度优先时选它。GitHub
- MinerU:免费开源;扫描件、公式和复杂多栏排版更重时,拿同一份文件与 Docling 对跑。GitHub
🗣 Leif 怎么看
一个月后仍值得留着,但别把它设成每份 PDF 的默认入口。干净文件用轻工具,表格多、版式乱、资料又不能上云时再叫 Docling;它是工具箱里的扳手,不是拿来削苹果的菜刀。
— AI 三餐 · 明天中午加菜 —
夜雨聆风