ARTICLE · 1130015
别再人肉翻 PDF 了:把合同、发票和报告变成可用数据的 2 套工具
一边是同事抱着 30 份合同,逐页找金额、日期和到期条款;
另一边,只用一条清晰指令,就把同样的信息汇总进表格。
差距不在于谁更能熬,而在于:你还把 PDF 当“文件”看,还是已经把它当成“可调用的数据源”。
今天教你分清两套工具:pdf 负责把 PDF 读懂、提取、整理;pdfkit-py 负责处理更复杂的编辑、转换和安全操作。

先别急着打开文件:先判断你要解决什么
很多人处理 PDF 的第一反应是:打开、搜索、复制、粘贴。
文件少时,这不算问题;一旦遇到合同归档、发票核对、报告拆分,时间会花在反复切换和人工校对上。
更好的判断方式只有一句:
我要的是“读出信息”,还是“改造文件”?
如果目标是读取 PDF、抽取字段、识别扫描件、汇总表格,选 pdf。如果目标是加密、加水印、转换格式、处理表单或做批量编辑,选 pdfkit-py。
别一上来就找最复杂的工具。先把任务分对类,后面的指令才会稳定。
用 pdf,把文件里的关键信息拿出来
pdf 适合三类高频工作:批量信息提取、PDF 合并拆分、扫描件 OCR 识别。
1.合同台账:让工具先读,你只做复核
当你面对一批合同时,不要说“帮我看一下”。要把交付物说清楚。
可以这样下指令:
@pdf 读取“合同文件夹”下所有 PDF 文件,提取合同编号、甲方名称、乙方名称、合同金额及币种、签约日期、到期日期和 100 字以内的关键条款摘要;将结果汇总为 Excel 表格,保存为“合同台账.xlsx”。
这条指令的关键,不是工具名称,而是包含了四个要素:
1.范围:读取哪个文件夹、哪些文件。2.字段:每份文件必须找什么。3.格式:摘要长度、金额是否带币种等细节。4.去向:最终输出成什么文件、存到哪里。
以后凡是批量提取,都按这四格写。描述越具体,返工越少。
2.合并与拆分:把“文件管理”写成明确动作
比如要把封面、正文、附录合成完整报告,再按每 10 页拆开。指令不要只写“合并一下”,而要把顺序和规则写进去:
@pdf 将“封面.pdf”“正文.pdf”“附录.pdf”按顺序合并为“完整报告.pdf”,确保页码连续;再按每 10 页拆分为独立文件,保存到“拆分”文件夹,命名为“第 X 部分.pdf”。
这里最容易漏掉两件事:合并顺序和拆分规则。不写清楚,得到的往往只是“做完了”,而不是“能直接交付”。
3.扫描发票:OCR 之后,仍要留一道校验
扫描件不能直接复制文字时,可以让 pdf 做 OCR 识别,并把发票号码、开票日期、购销双方名称、金额、税额、价税合计输出为结构化表格。
但请记住:OCR 是帮你省去录入,不是替你承担责任。
金额、日期、名称中容易混淆的字符,尤其需要抽样核验。把流程设成“识别—校验—导出”,才是真正可用的自动化。

pdfkit-py:当 PDF 不只是“读”,而是要“管”
当任务涉及权限、格式、批量操作时,就轮到 pdfkit-py 上场。它覆盖 PDF 读取、编辑、转换、表单、加密、OCR 等多类命令。
1.机密文件:密码和权限要分开写
给“机密报告.pdf”加密时,至少要明确四件事:打开密码、权限密码、禁止的操作、输出文件名。
例如:
@pdfkit-py 对“机密报告.pdf”加密:设置打开密码和权限密码;禁止打印、复制、修改;保存为“机密报告_加密.pdf”。
密码是否由工具执行,不等于密码可以随意传递。涉及正式文件时,密码应通过团队约定的安全渠道管理,不要长期写进聊天记录或公开文档。
2.格式转换:先说清“为了什么”
“把 PDF 转成 Word”看似简单,实际目标可能完全不同:
要继续编辑正文,目标是可编辑 Word。 要用于展示或图文排版,目标是按页导出的 PNG 图片。 要复用报告中的视觉素材,目标是提取全部图片。
同一句“转换”,对应的是三种不同交付物。下指令时把用途写出来,才能避免拿到不适合的格式。
3.批量水印:内容、样式、范围,一个都别省
给合同文件夹中的全部 PDF 加水印,可以明确说明:水印文字、字体与颜色、透明度、旋转角度、位置和保存目录。
你真正要表达的不是“加个水印”,而是“用统一规则保护这一批文件”。

一张选择表,帮你不再选错工具
pdf | ||
pdf | ||
pdf | ||
pdfkit-py | ||
pdfkit-py | ||
pdfkit-py |
最后,把你最常用的一类任务保存成模板。下次不必重想提示词,只需替换文件夹、字段和输出名称。
真正的效率,不是更快地点开一份 PDF,而是让每一份 PDF 都能按同一套规则变成可用结果。
你手里最想先自动化的是合同、发票,还是报告?
把答案留在评论区。也许下一次,你就不再需要在一堆文件里寻找答案。