乐于分享
好东西不私藏

手写台账扫描件 AI 识别转 Excel

手写台账扫描件 AI 识别转 Excel

一、先说背景:那个下班前的"惊喜"

时针刚过四点半,领导发来企业微信。

"这个清查台账扫描件,要转换成表格"

打开文件夹,赫然是18手写体资产清查台账 PDF——各类固定资产、手写编号、字迹潦草,看的头大

WPS 一键转 Excel?

手写体直接报废。 

Adobe 导出?

识别结果惨不忍睹。

 网上在线转换工具?

试了好几个,识别效果堪忧。

作为一个资深老牛马,第一反应是打开 OCRPro 插件,噼里啪啦手动搓了一百来页……然后系统弹出一行提示:您的识别额度已用完……

一年攒下来的一百多次额度,就这么消耗殆尽。充值要联系管理员,项目时间紧,等不起。

怎么办?

自己动手,Vibe coding即兴开发一个转换插件。

二、解题思路刚开始掉入纯OCR陷阱,后转向PaddleOCR+本地 AI 视觉模型,从此海阔天空

面对手写扫描件,OCR 问题的核心矛盾在于:

普通 OCR 引擎(Tesseract 等)对手写汉字识别率极低

商业 OCR API 要花钱、有隐私风险,还有配额限制

解法:调用PaddleOCR+本地视觉大模型进行识别处理

环节

工具

作用

PDF 转图片

pdf2image / PyMuPDF

将每页 PDF 渲染为高分辨率图像

手写识别

PaddleOCR(PP-OCRv4)

提取页面文字区块与坐标

语义理解

LM Studio · 千问VL 8B

理解上下文、输出结构化 JSON

数据汇总

Python · openpyxl

合并写入 Excel

整个方案完全本地运行无需联网,无额度限制,数据不出机器


三、核心实思路

3.1 PDF 转高清图片

3.2 PaddleOCR 提取文字

3.3 调用千问VL 8B 结构化输出

这是整个方案的核心——让大模型理解台账语义,直接输出结构化 JSON:

3.4 批量处理并写入 Excel

3.5 GUI 界面封装:用 PySimpleGUI 或 Gradio 包一层界面,让不懂代码的同事也能直接拖拽使用

四、产品效果

最终生成的插件如上图,界面有添加PDF、添加文件夹选项卡、有转换为word、exel、还是PPT的选择按钮、还可以选择输出文件位置,右边是插件运行日志、最下面是开始转换按钮以及转换进度条

右上角设置窗口可以设置模型配置、OCR设置以及接入APIkey

最终转换效果如下:

原PDF:

转换好的Excel:

相较于纯人工录入(预计 一周),运行约八小时(晚上八点半到十二点,第二天早上五点到九点)完成所有PDF文件转换成Excel,输出整体效率


总结

这套方案的核心逻辑很简单:

PaddleOCR 负责"认字",千问VL 负责"看懂",Python 负责"整理"。

三层分工,各司其职。没有商业 API 的配额焦虑,没有数据外传的合规风险,笔记本即可运行。

对于财务、审计、资管等日常需要处理大量历史手写档案的场景,这套方案的性价比极高——一次搭建,终身使用。

说到底,老牛马最大的竞争力,不是熬夜手动录入无意义加班,而是会思考调用机器替你干活,记住永远不要和机器对着干,所有重复流程都有机器自动化解决方案

工具清单:PaddleOCR · LM Studio · 千问3VL 8B · Python 

如需成品插件,点赞关注踢主包一脚获取。