夜雨聆风学习资料网

ARTICLE · 1133423

(7)文件批处理:30份PDF合同,一次把关键信息全提出来

(7)文件批处理:30份PDF合同,一次把关键信息全提出来

连载第七天。今天这个功能,我第一次用的时候是有点惊讶的。

事情是这样的:我朋友在一家公司做采购,手头有三十多份 PDF 合同,老板让她把每份的甲乙方、金额、签约日期、付款方式整理成一张表。她原本打算一份份打开抄,估计得抄一下午。

我说你试试 WorkBuddy。结果批量传进去,一条指令,几分钟出来一张完整的表。

01 批量上传的姿势

先说操作。点「+」,可以多选文件,一次性把三十份全传上去。传完界面上会列出来,你能看到都传了哪些。

这里有个提醒:文件名最好规范一点。如果全是"扫描件001.pdf""未命名2.pdf"这种,它提取的时候可能会串。命名清楚,比如"XX公司采购合同.pdf",后面核对起来也方便。

02 指令要写清"提取什么"

批量任务最忌讳指令含糊。你要明确告诉它:从每份文件里提哪几个字段,最后整理成什么形式。

比如:"请从这30份合同中,提取每份的甲方名称、乙方名称、合同金额、签约日期、付款方式,整理成一张表格,每份合同一行,导出Excel。"

字段名尽量用文件里实际出现的说法,别自己造词。比如合同里写的是"合同价款",你就说"合同价款",说"金额"它可能要找一会儿。

03 结果长什么样

跑完之后,它会给你一张表,三十行,每行一份合同的关键信息。

这里说个我朋友的真实反馈。第一次跑完,三十份里有两份的金额提错了——一份是把附件里的报价当成了主合同金额,另一份是扫描件太模糊,数字认成了别的。这两份要是没查出来直接上报,麻烦就大了。

但这里必须泼盆冷水:批量提取的结果,一定要抽查。

PDF 这东西格式五花八门,有的是扫描件(本质是图片),有的是表格排版,有的字段位置很刁钻。它大部分能提对,但偶尔会看走眼,比如把"含税金额"当成"合同金额"。

我的做法是随机抽三到五份,打开原文对照一下。如果这几份都对,基本可以放心;如果发现系统性错误,就调整指令重跑。

04 这个能力还能用在哪

举一反三,凡是"一堆文件里找信息"的活,都能这么干:

  • 从一堆简历里提取姓名、学历、工作年限、技能关键词;
  • 从一堆发票里提取金额、开票日期、抬头;
  • 从一堆报告里提取核心结论和数据;
  • 从一堆问卷里提取关键选项分布。

还有文件格式转换也是同理。PDF 转 Word、Word 转 PDF、图片里的文字识别出来,都是传进去说一句的事。

这里提醒一句,转换类的活,转完一定要打开看一眼。PDF 转 Word 有时候排版会跑,尤其是那种多栏排版的文档;图片识别更是,字迹潦草的、有背景干扰的,识别出来可能有错别字。看一眼,比后面返工强。

说个我自己的用法:我平时收集的行业报告都是 PDF,以前想引用里面的数据得手动敲。现在直接传进去让它提取,省事不少。

再补充一个细节:提取出来的表格,建议你顺手加一列『原文页码』。这样后面万一有争议,翻回去找也快。这个习惯是我从做审计的朋友那学来的,她说凡是提取类的活,留个溯源线索准没错。

顺便说下扫描件怎么办。扫描件本质是图片,它得先做文字识别。识别质量取决于扫描清晰度——歪的、糊的、有印章压字的,识别率都会打折。所以如果你手头有纸质合同,扫描的时候尽量摆正、调高分辨率,后面能省很多事。

还有个提效的小做法:如果这三十份合同是同一个模板,你可以先拿两份试跑,确认字段提取的规则没问题,再全量跑。这样即使要调指令,也只调一次。

💡 一句话提醒:批量任务先拿2-3份试跑,确认格式没问题再全量跑。跑完必须抽查。

明天讲信息检索——让它帮你查资料,还得查得靠谱。明天见。

相关学习资料