ARTICLE · 1125904
50份PDF还在手工复制到Excel?我用Python做了一个批量自动提取工具
50份PDF还在手工复制到Excel?我用Python做了一个批量自动提取工具很多数据录入工作看起来非常简单。 比如一份客户登记PDF里面有姓名、电话、邮箱、公司、地址、日期、金额和备注。我们要做的事情也非常简单:打开PDF,把这些内容复制到Excel。 真正的问题是:如果不是1份PDF,而是50份、500份甚至几千份呢? 这个时候,“复制粘贴”就会变成非常耗费时间的数据录入工作。 最近我做了一个这样的Python自动化案例。 文件夹中有大量格式相同的字段。目标是把所有PDF中的这些信息自动整理到一个Excel文件。 
打开PDF →找到姓名→复制到Excel →复制电话→复制邮箱→复制其他字段→打开下一份PDF。 文件数量越多,重复工作越严重,而且还可能出现漏录、错行、电话号码格式变化、金额格式错误、某个字段没有填写却没有发现等问题。 我把整个流程做成: 选择PDF文件夹→ Python批量读取PDF →自动提取文本→自动识别字段→检查关键字段→汇总DataFrame →生成Excel。 用户实际上只需要运行程序并选择PDF文件夹,剩下的工作由程序自动完成。 最终Excel会包含:文件名、申请编号、姓名、性别、联系电话、电子邮箱、公司名称、联系地址、城市、申请日期、服务类型、预计金额、备注、处理状态。 
程序还会自动完成:自动筛选、冻结首行、自动列宽、自动换行、电话号码文本格式、金额格式和异常状态检查。 如果某份PDF没有提取到关键字段,程序不会悄悄忽略,而是会在“处理状态”中进行标记,这样可以快速找到需要人工复核的数据。 这次主要使用Python、pdfplumber、pandas、openpyxl、Regular Expressions和Tkinter。 pdfplumber负责读取PDF;正则表达式负责定位字段;pandas负责结构化数据;openpyxl负责最终Excel格式;Tkinter负责文件夹选择。 这个案例表面上是“PDF转Excel”,真正解决的是“重复数据录入自动化”。 相同思路可以继续应用到客户登记表、申请表、服务记录、订单、报价单、HR资料、调查表、部分发票资料。扫描图片型PDF还可以进一步加入OCR;如果希望普通员工也能长期使用,还可以继续封装成GUI桌面软件。 我整理了一份这个案例的Demo资料包:Python演示源码+测试PDF + Excel输出示例。 需要的朋友可以关注公众号,并回复关键词:261005。 如果你有几十、几百甚至更多PDF,需要批量整理成Excel,也可以先发1–3份脱敏样例,我可以先帮你判断是否适合自动化。
一、原始需求

二、传统处理方式
三、Python自动化之后
四、最终Excel

五、使用的技术
六、案例源码领取
如果你也在做 Excel、数据分析、Python办公自动化,欢迎关注。
后续会继续更新:Excel自动化、PDF批量处理、Python数据工具、Power BI、AI+办公自动化等真实案例。
本案例源码资料:回复261005。