ARTICLE · 1082841
我是怎么用 AI 处理 PDF 的
我是怎么用 AI 处理 PDF 的
先说两件大家都遇过的糟心事。
WPS 的 PDF 处理,合并、拆分、编辑,样样要开会员。想找免费的,去下载站下开源工具,页面上广告比下载按钮大,一不小心还给你塞一堆全家桶。PDF 处理这个刚需,就卡在收费和套路中间。
这次我走另一条路:先让 AI 把 PDF 常用功能——合并、拆分、转 Word、转图片、脱敏、加密——完整跑了一遍,每个功能配一个工作里真会碰到的场景。跑完的结论:这些活 AI 都能干,但每次都得开对话、丢文件、等结果,我自己用着爽,同事朋友用不上。
所以第二步,我把这些验证过的功能做成了一个工具:不要会员、没有广告、全程本地处理。这篇按这个顺序写。
第一步:先给文件做体检
场景:拿到一份 PDF 先别急着干活,得先弄清它是什么货色——多少页、多大、能不能复制。
做什么:把文件丢给 AI,查页数、体积、有没有文字层。
结果:75 页,41.9MB,文字层 0 个字符。

⚠️ 注意:0 个文字字符,说明它是 75 张照片装订成册的扫描件——这就是它不能复制、不能搜索的原因。先体检再动手,不知道文件是什么类型,后面全是白干。
第二步:转 Word、转图片
场景:拿到一份 PDF 想直接改里面的数字(改个报价、改个日期),或者把其中一页插进 PPT、发群里让人预览。
做什么:①扫描件直接转 Word;②PDF 按页转成 PNG 图片。
结果:转 Word,❌ 失败,Word 里还是 75 张图。转图片,✅ 单页不到半秒。
⚠️ 注意:扫描件不能直接转 Word,这是最常见的误区——文字锁在照片里,Word 没法认。想让扫描件变回能编辑的文档,先走第三步。
第三步:OCR,让扫描件复活
场景:扫描件里想引用一段话,只能对着屏幕手抄,抄半小时还容易错;几百页想搜个关键词,Ctrl+F 毫无反应。
📖 名词解释:OCR(Optical Character Recognition,光学字符识别),说人话就是"看图识字"——照片里的字人眼能看,机器认不了,OCR 把它认出来,变成能编辑、能搜索的文字。要不要单独装插件、下软件?不用。现在主流的 AI 助手都自带这个能力,把 PDF 或图片直接丢给它就行——不装插件、不下软件、不花钱。老办法是装 OCR 软件:收费的死贵,免费的要敲命令行,小白基本没戏,这也是开头说的"卡在收费和套路中间"的一部分。
做什么:让 AI 直接看图认字。
结果:封面、目录、正文各试一页,我逐句对过,零错字,连页脚的小页码都认出来了。单页 3-5 秒。认完的字重新排一版文字 PDF:扫描版一页 572KB,文字版一页 1.5KB,差了快 400 倍——扫描件为什么那么大,它背着的全是照片。

⚠️ 注意:识别完一定要人工抽查,数字、专有名词重点核。这步偷懒,后面台账全是错。
第四步:合并、拆分
场景:竣工资料几十份扫描件要合成一个文件交付;反过来,几百页的合同只需要把那 3 页发给别人。
做什么:①三个 PDF 按顺序合并;②按页码范围拆分(比如 1-3,5)。
结果:3 份文件合并成 1 份,页数相加分毫不差;按范围拆分正常,范围写法支持"1-3,5"这种逗号混写。
⚠️ 注意:合并的顺序就是文件列表的顺序,合并前先确认先后——标书的章节顺序错了,合完还得拆了重来。
第五步:脱敏涂黑——黑框不是真安全
场景:文件要发给合作方,里面还有真实联系人的姓名、手机号、邮箱、公章。这种东西发出去之前必须处理。
做什么:先按最常见的办法——画个黑框盖住手机号,保存。
结果:看着确实安全。然后我让 AI 把黑框删了——手机号还在,一个数字没少。查哈希值:盖黑框前后文件数据完全一致,黑框只是浮在字上面的一层贴纸。
真脱敏的做法:把那块像素从图里抠掉,填上新颜色。抠完哈希值变了——数据真的动过。两种黑的区别就一条:一种字还在文件里,一种真的没了。

⚠️ 注意(翻车记录):涂黑坐标第一版偏了一行,黑框盖到了上一行的条款上,该盖的手机号露着;改坐标重跑,地址行尾又漏了个字符,再改。涂完务必放大目检边缘,别信一次成型。
第六步:批量加水印和页码
场景:资料发给外部单位,怕被转发扩散,加水印;几百页的册子没页码,评审翻到一半对不上"你说的是第几页"。
做什么:75 页全部盖"内部资料"水印(45 度斜排、半透明),加"第 X 页 / 共 Y 页"页码。
结果:1.5 秒跑完 75 页,水印半透明不挡内容。
⚠️ 注意(翻车记录):45 度斜排的旋转参数连报两次错,改了两回才对。水印角度和透明度先拿 1 页试,效果满意了再跑全量。
第七步:压缩
场景:41.9MB 的文件,微信发出去被压得看不清,邮箱直接超限。
做什么:压缩,目标是能正常发微信、发邮件。
结果:压到 9.7MB,只剩 23%,31 秒。两边各截一块画质对比,我盯了半天没看出区别。

⚠️ 注意:压缩后别只看文件大小,放大目检一遍画质——扫描件里的小字(金额、签字)最容易被压糊。
第八步:上密码锁
场景:标书、报价单发出去,怕被人拿走乱用、随便转发。
做什么:AES-256 加密,同时设置权限:允许打开查看,禁止复制内容。
结果:没密码打不开;输对密码后能看,选中文字复制——被拦。
⚠️ 注意:"能看不能复制"是权限设置,不是加密——真要保密,两把锁都要上。
第二幕:把跑通的活,做成工具
8 个功能跑下来,每个都验证成了。但我很快发现一个尴尬的事:每次都得开对话、丢文件、等结果,还得会描述需求。我自己用着是爽,可同事朋友用不了——总不能每个人每次都来找 AI 描述一遍。
做什么:把这些验证过的功能,直接攒成一个 Windows 工具。GUI 界面,7 个功能页签——合并/拆分、压缩、水印/页码、脱敏涂黑(框选就行)、转换(Word/图片)、发票工具、加密/解密。

结果:点开、选文件、点按钮,三步出结果。核心功能跑了 14 项测试全部通过。
7 个页签里单独说下发票工具。发票处理是工作里用得最多的功能之一:报销季一到,一堆电子发票,号码、日期、金额、购销方,一张张对着屏幕抄进 Excel,抄到眼花还容易错。工具里把这些发票扔进去,自动提取全部字段:

点一下导出,就是一张现成的 CSV 台账,Excel 打开直接用,不用再手抄一个字:

报完账要打印存档,还能按 A4 一页 1/2/4 张拼版,直接打:

这轮我用 12 张真实的打车电子发票验证过:号码、开票日期、价税合计、购买方、销售方、税号、大写金额,全部提取成功,零失败。(截图里的单位、税号、公章都做了脱敏)
回到开头那两个糟心事:这个工具不要会员、没有广告,文件全程在你自己电脑上处理,不上传任何服务器——发给别人的脱敏文件,也不怕先经过第三方的手。
这才是 AI 真正帮助我们的方式——不是每次都喊它来干一遍,而是让它把流程先跑通、验证好,然后固化成一个谁都会用的工具。同事朋友不需要懂 AI、不需要写提示词,点开就能用。
📖 方法提示:用 AI 干活遇到重复的流程,正确姿势是两步——第一次,让 AI 把流程跑通、验证好;然后把它做成工具(或模板、脚本),以后一键复用。第一次是 AI 替你干活,以后是工具替你干活。别每次都从头描述需求,也别把同一件事人肉干第二遍。
exe 打包完放网盘,后台回复「PDF」拿。