采购员面对供应商发来的采购订单 PDF,一份接一份存进文件夹里。等到月底对账或跟催交期时,要在几十份 PDF 之间反复横跳——找订单号、查交期、核金额。真正让人头疼的不是找不到,而是表做完了,回头想确认某个数据时,已经忘记它来自哪份 PDF 的第几页。
把采购订单整理成台账,核心任务不是把 PDF 上的字全部识别出来,而是先定好一张台账表里的一行代表什么、哪些字段必须填、每一项数据留好回到原件的路径。
1. 先确定台账的一行代表什么
采购台账的最小单位就是一张采购订单。每一行对应一个订单号,而不是一行对应一个物料。如果同一订单包含多条采购明细,台账层仍按订单号汇总;明细行是后续入库对账才需要的粒度。
以下是建议的最小字段结构,可按实际任务删减。
这几个字段不是硬性规定,而是提供一个起点。具体到每家公司的采购流程,可以根据实际需要增加物料摘要、付款条件、贸易术语等列,但核心原则不变:每行记录必须能回溯到原始订单 PDF。
2. 把识别值和确认值分开
处理采购订单 PDF 时,识别出的数字不应当直接覆盖手头的数据。建议在台账中保留三列:识别值、确认值和复核状态。
举个例子:一份订单 PDF 的金额区域带有扫描阴影,"8" 和 "3" 看起来十分接近。OCR 给出了识别值 "38,500.00",但页面放大后实际是 "88,500.00"。如果台账里只保留一个值,这个偏差就会被带入后续的付款对账。
这样做不是增加工作量,而是把"机器看到了什么"和"你确认了什么"分开保存。遇到相似字符、遮挡或多处出现同一字段值时,处理人可以明确知道该回看哪份 PDF 的哪个位置。
3. 按固定字段走完一轮完整流程
资料整理的关键不在于技术本身,而在于先把字段规则写出来,再批量处理。以下是一个可复用的操作流程:
第一步:准备原始文件。 把同一批次的采购订单 PDF 统一放到一个文件夹中,使用稳定、可辨识的文件名。理想情况下,文件名里就包含供应商和订单号的缩写,这样即使 Excel 里的来源列被截断,也能快速对应。
第二步:定义提取字段。 按第 1 节的字段结构,在工具中预先设定好要提取的列。这个步骤看似简单,但把"币种"也设为一个字段,会让后续的多币种场景不用从头重做。

图 1:导入 PDF 前,先按批次整理原始文件并定义字段。图片来自文档工作台客户端。
第三步:批量导入并提取。 将整个文件夹导入工具,系统按预先定义的字段逐份提取。此时不用追求全部字段一次填满——遇到模糊页面或字段缺失,留作待复核比强行补写更可靠。
第四步:逐项原件核对。 提取完成后,不是直接导出 Excel。而是把每个字段结果与原始 PDF 并排对照。文档工作台在识别结果旁边保留了原始页面预览,可以逐条核对订单号是否完整、金额数字是否正确、日期格式是否统一。

图 2:字段结果与原始页面并排核对,确认后再标记复核状态。图片来自文档工作台客户端。
第五步:导出 Excel,保留复核状态。 确认过的记录导出为 Excel。导出的表不应把"待复核"和"已确认"混为一谈,而应该让每条记录的状态一目了然。

图 3:导出 Excel 后,仍应保留来源文件、页面定位和复核状态列。图片来自文档工作台客户端。
4. 哪些情况不适合直接确认
采购订单的来源多种多样:有些是系统生成的电子 PDF,文字清晰;有些是盖章后扫描回来的图片,光照不均、方向歪斜;有些供应商的订单模板完全不同,字段位置年年变化。
下面四种情况,不建议让系统识别值直接覆盖确认值:
页面模糊或遮挡。 扫描件中金额或日期区域有反光、印章叠加或裁切,OCR 结果存在不确定性。
多处出现同一字段。 一份订单的页眉和表格正文各有一个日期,仅靠位置规则可能取错。
多币种混合。 同一批订单中包含人民币、美元、欧元计价,仅导出数字而丢失币种列,后续无法对账。
供应商名称不一致。 同一家供应商的简称、全称、英文名可能在多份订单中混用,需要事先统一映射规则。
这些记录保留为待复核状态是正确做法。本文讨论的是资料整理阶段,不是订单审批、入库或三单匹配——那些是后续业务系统的职责。
5. 先用一小批真实订单验证
不要一上来就把全年几百份采购订单全部扔进同一个任务。先选一批能覆盖常见供应商和格式的真实 PDF——5 到 10 份足够——跑通"导入、字段提取、原件核对、导出"的完整链路。检查字段是否够用、异常能否定位、导出的 Excel 能否直接用于下一步跟催或对账。
确认字段规则没问题后,再逐步扩展到更多订单。这样做的好处是:如果发现某个字段需要调整(比如增加了"贸易术语"列),只需要修正一批,而不是推翻全部。
不想自行配置 OCR 环境、只需要按字段整理出可复核 Excel 的读者,可以使用文档工作台。一键安装、打开即用,本地运行,资料不出电脑。
获取方式:
私信公众号“文档工作台”获取哦
夜雨聆风