乐于分享
好东西不私藏

PDF/图片中的表格转Excel,为你推荐3个实用工具!

PDF/图片中的表格转Excel,为你推荐3个实用工具!

PDF 里的表格看着很整齐,一复制到 Excel,数据却全挤在一列;如果是扫描件或截图,里面的文字甚至根本选不中。

真正省事的做法,不是对着屏幕手动录入,而是先看清原文件属于哪一类。下面 3 个工具都只解决一件事:把 PDF 或图片中的表格,恢复成可编辑、可计算的 Excel/CSV 数据

1Tabula:提取文字可选中的电子版 PDF 表格

2RapidTable:识别截图、照片和扫描件中的表格结构

3ExtractTable-py:通过 API 批量处理图片或扫描 PDF

1Tabula
电子版 PDF,框一下就能导出 CSV

安装包:https://www.durushi.com/p/AUPILQGZ.html

Tabula 是一款专门提取 PDF 表格的开源工具。启动后,它会在浏览器中打开本地操作界面:导入 PDF,翻到表格所在页,用鼠标框选区域,预览无误后导出 CSV,再用 Excel 打开即可。文件全程在本地处理,不必上传到外部服务。

它最适合处理“文字可以直接选中”的电子版 PDF,例如公开报表、论文表格和统计附录。如果 PDF 是扫描生成的图片,Tabula 没有 OCR 能力,就不适用;遇到多层表头、大量合并单元格或复杂跨页表格,导出结果也可能需要再整理。

2RapidTable
表格只有图片?先恢复行列结构

安装包:https://www.durushi.com/p/IXJXOXYM.html

如果输入是截图、手机拍照或扫描件,可以看 RapidTable。它会结合 RapidOCR 识别文字,再分析单元格的位置关系,尽量还原表格的行列结构。项目支持多种表格模型,也已加入批量推理,适合处理一批同类图片。

不过,RapidTable 是 Python 库,不是点开即用的桌面软件。它默认更偏向输出 HTML 表格或结构化结果,如果最终需要 .xlsx,还得用 pandas 等工具再导出一次。对懂 Python 的人很灵活,对完全不写代码的人则有一定门槛。

3ExtractTable-py
要做自动化批处理,可以直接调云端 API

安装包:https://www.durushi.com/p/USKBGEMM.html

ExtractTable-py 是 ExtractTable 云端表格识别服务的 Python 客户端。脚本可以提交图片或扫描 PDF,再把识别结果取回为 DataFrame,后续直接保存为 Excel。它更适合已经有 Python 流程、需要定期或批量处理文件的场景。

这款工具的边界要提前说清:需要注册获取 API Key,请求会消耗 credits,虽然可以试用,但它不是无限免费的本地软件。文件还需要发往外部服务,涉及未公开数据或敏感文档时,先确认是否允许上传。

怎么选?

处理文字可选中的电子版 PDF,首先试 Tabula

处理截图、照片和扫描件,而且会用 Python,选 RapidTable

已经有自动化流程,需要把批量识别接进代码,再考虑 ExtractTable-py

无论用哪一款,自动提取后都要抽查原文,重点看表头是否对齐、合并单元格有没有被拆错,以及小数点、负号和缺失值有没有丢。