夜雨聆风学习资料网

ARTICLE · 1125376

手里一堆零散扫描件要拼成一个 PDF,交给 AI 到底能省多少事 ?

手里一堆零散扫描件要拼成一个 PDF,交给 AI 到底能省多少事 ?

3 个文件 10 页拼成 9 页,AI 删了那页空白,其余全留着等你确认

AI 帮普通人解决问题

最近我在测一件事:报销、办证、交材料,手里一堆零散扫描件要拼成一个 PDF,交给 AI 到底能省多少事。为了不碰任何真实文件,我照着最常见的情况构造了 3 个 PDF:一份 3 页的租房合同,第 2 页是横躺的宽表格;一份 5 页的报销单据,附件说明误排在了发票前面,最后还多扫进来一页空白;一份 2 页的银行流水,第 1 页带了个错误的方向标记,打开显示是横的。然后我只给了一段话:合并成一份报销材料,发票在前、流水其次、合同最后,横的转正,空白页去掉。

它做的第一步不是合并,是体检:3 个文件 10 页逐页过,报出 4 处问题——1 页横躺、1 页方向标记错、1 页空白、页序乱。然后才动手,全流程 1.6 秒,拼出 9 页终稿。

图2:AI 体检 3 个文件 10 页,4 处问题全部发现并处理(真实测试输出)

对出来的结果有几个值得说的细节。空白页是被「拦」下来的,不是碰巧没拼进去——我把单据文件 5 页全量再写入一次做专项验证,检测器拦掉空白页后剩 4 页,证明它是真的在工作。两处方向问题的修法也不一样:流水那页是方向标记错了、内容本身是正的,把标记归零就修好;合同附件那页本来就是个横表格,AI 不敢替我做主它该横读还是竖读,按「统一竖版」加了旋转标记,同时明确标注「宽表格内容是否需保持横读,待人工确认」。

图1:整理后的 9 页报销材料,p8 横躺页统一竖版待人工确认(真实测试输出)

但这期实测里最值钱的,是过程中我自己踩的坑。第一版脚本里,我把「方向标记错」和「页面横躺」用同一套逻辑处理,结果流水页转正后尺寸交换变成了横页,又被「横躺统一」逻辑二次旋转——修一下、歪一下,连环出错。这两件事看起来都是「页面是横的」,本质完全不同:一个是内容正、标记歪,撤销标记就好;一个是内容本来就横着,要不要转取决于它是不是宽表格。人分得清,规则如果混着写就出事。AI 帮你执行没问题,但它不会替你发现「你的规则本身有歧义」——这一层,得自己想明白。

丑话也要说。这次能自动排序,是因为构造的页面带文字层,AI 能读出「发票 1」「附件说明」这些标题;手机拍的纯图像 PDF 没有文字层,AI 根本不知道哪页是发票,页序必须人工给清单,或者先做 OCR——而 OCR 认错一个数字,页序就跟着错。空白页检测也有边界:扫描仪产出的空白页往往是一张「白纸的照片」,文本层判空无效,得靠像素分析,这是另一层工序。还有体积:合并只是把页面原样搬进一个文件,合并后 152KB 就是三份之和,想压小得另走压缩,压完还得回头检查小字有没有糊。

最后是隐私这条线。扫描件里最常见的正是身份证、合同、银行流水这类最敏感的东西,而网上搜「PDF 合并」排在前面的全是在线工具——文件要传到别人的服务器。多数工具承诺「1 小时删除」,但删除不等于真删:备份、缓存都可能让文件多活一段时间。我的做法是把敏感文件留在本地处理,手机上用自带扫描或本地工具,电脑上用离线方案;在线工具只处理不敏感的东西。这次实测里那页银行流水要是传给了陌生服务器,省下的两分钟可能不划算。

那次整理完,9 页材料按顺序躺在同一个文件里,只有横表格那页旁边留着一行「待人工确认」。让我踏实的不是 1.6 秒的速度,是它把「不敢替你决定」的地方明明白白标了出来——文件要交出去,最后的把关人还是你。

相关学习资料