乐于分享
好东西不私藏

微积分也很想学会的 AI 工具介绍和办公小技巧(五):让 AI 读懂扫描件

微积分也很想学会的 AI 工具介绍和办公小技巧(五):让 AI 读懂扫描件
上次被 DeepSeek 气炸毛了,起因在于我平时让它读文件读的好好的,某天突然跟我说它没有读图的能力所以要我自己去看扫描PDF的内容再给它反馈。
倒反天罡!他是老板我是老板?
看了一下设置是因为我为了省点积分用的是自己的 DeepSeek API。
一怒之下向DeepSeek老师提问:为什么Workbuddy自带的DeepSeek能阅读扫描PDF,官方网页也能阅读,但是我官方API接入的版本不行?
答案太长,但总结一下就是,(当前的)DeepSeek的API是纯文本模型,所以我的API没办法阅读;而Workbuddy内置了一个预处理引擎,在本地完成 PDF 的文字提取后再给DeepSeek发过去。

再翻译一下:为了处理这些非纯文本的材料,它会多花一些token。

抠抠搜搜的本人开始寻找能够单独完成把非文本内容转文本的工具,即OCR工具。
其实OCR平时大家用的也很多,微信截图提取、白描app、apple设备长按图片提取等等,但用途大多是对图片,而不是PDF甚至是一大文件夹的PDF。
最后试了三种办法:把 PaddleOCR 装在电脑上,让 Agent 本地调用;使用 PaddleOCR 提供的免费在线 API;以及调用按量付费的 GLM-OCR。前一种不需要上传文件,后两种省去了本地安装,但文件会被发送到云端。

一、PaddleOCR 本地安装

可以直接让AI自己安装:

请查阅 PaddleOCR-VL 当前官方文档,在本机独立环境安装相互兼容的稳定版 PaddlePaddle 和含 doc-parser 组件的 PaddleOCR,不使用测试版。安装和下载模型可以联网,但处理文件时必须调用本地完整文档解析模型,不得上传文件或使用云端 API。安装后记录版本,用无客户信息的 PDF 测试并保存为 Markdown。测试成功后生成固定调用脚本。以后我说“本地 OCR”时,直接处理指定的 PDF、JPG 或 PNG,结果存入单独文件夹,不修改原文件。

安装可能需要等比较长的一段时间,需要下载和配置。
优点是不上传服务器,识别和文件处理均在电脑本地进行;本地版没有按页收费和调用次数限制,能处理多少主要看电脑性能。文件越长、版面越复杂,耗时和内存占用越高。
缺点在于安装和使用电脑配置要求高。我本地安装过程中内存调用峰值9GB,不包含缓存和临时文件占用存储空间3-4GB,CPU需要支持 AVX 指令集。所以一些内存小于16GB的电脑或者CPU过于古老的电脑可能没法装

二、PaddleOCR线上API调用(免费)

飞桨AI Studio:https://aistudio.baidu.com/paddleocr
需要先获取一个令牌
获取令牌之后回到API调用的界面,令牌已经被自动填充了,直接复制代码,把这段代码喂给Agent工具,让它写一个调用的脚本。

三、GLM-OCR(轻度付费)

智谱开放平台:https://open.bigmodel.cn/
费用 0.2元/百万token
测试使用的一张 A4 大小截图,约 1306 tokens → 费用 ≈ 0.00026元
官方量级参考:1 元约可处理2000张A4扫描图
先生成一个API key
然后让AI写一个GLM-OCR工具的调用脚本,注意这里需要区分智谱OCR服务和GLM-OCR模型,测试的时候可以提醒AI注意接入端口。
注意:
  1. 我直接把API key / 令牌发给了AI让它写,因为我账号里没两毛钱,脚本也不会联网发送只是本地调用,暂时没出过问题。担心安全性可以先把API key添加到环境变量再通过脚本调用。
  2. Paddle OCR的API调用精准度不错,但是使用过程中断联率较高,胜在不花钱且一天能读20000页,要什么自行车。
  3. PaddleOCR API 接入 和 GLM-OCR 都是云端服务。调用时,文件会发送到服务商服务器,可以根据需要选择。如果材料不能离开本机,可以安装本地部署的OCR工具。
  4. 以上仅限于本人使用过的工具,另有一些其他的,比如Umi-OCR(目前仅支持Windows、Linux),可以自行了解 ;Mac办公选手并未实际测试,所以不在本文展开。