产品合格证、检验报告一开始看起来只是几份 PDF。等到要按批次找资料、交接给同事,或核对某一批产品对应的文件时,问题才会出现:同一批资料散在不同文件夹,编号和日期抄进表了,却不知道来自哪一页原件。
这类整理任务的重点不是把 PDF 里的所有文字都搬到 Excel,而是建立一张能按批次回查的归档表。先定义批次和资料之间的关系,再提取固定字段,后续检索、补件和交接才有稳定的依据。
1. 先定义一行归档记录代表什么
合格证和检验报告经常是一批产品对应多份资料。如果直接让“一行代表一个批次”,就容易把多份报告、多个编号和不同日期塞进同一单元格,之后很难确认每个值来自哪里。
更稳妥的做法是让一行代表一份“批次-资料”记录:同一批产品的合格证和检验报告分别占一行,通过批次号关联。这样每一份原始资料都保留了独立的编号、日期和页码,也能在 Excel 中筛选出一个批次的全部材料。
如果业务必须交付“一批一行”的汇总表,可以在这张资料明细表稳定后,再按批次生成汇总视图。不要一开始就把多个文件的字段合并成一个单元格,否则原件的对应关系会丢失。
2. 把字段字典写清楚,特别是日期和原文结论
开始处理前,先把每一列从哪里取、怎样输出、遇到异常怎么标出来写清楚。字段字典不需要复杂,但必须让后续处理人员知道:同一页里有多个日期或多个结论时,不能凭印象选择。
这里的“原文结论”只用于保留资料中的原始表述,方便回查。它不是质量判定,更不能代替验收、认证、审计或其他需要业务人员负责的结论。
归档表先解决“资料能否按批次找回”,不替代“这批产品是否合格”的判断。
3. 先把原始文件按批次整理好
字段规则确定后,再处理 PDF、图片和文件夹。建议先按到货批次、生产批次或现有资料包分组,并为原始文件保留稳定的命名方式。一个 PDF 有多页时,页码顺序也不要改动。
对于一批资料中同时存在合格证和检验报告的情况,文件名可以保留资料类型和批次线索,但不需要依赖文件名自动判断归属。最终仍应以原始页面中的批次号、产品信息和人工复核为准。
随后,将同一批次的文件导入处理任务,录入已定义好的字段。文档工作台可以导入图片、PDF 或文件夹,并按字段要求整理初步结果。

图 1:先按批次准备资料,再配置需要提取的固定字段。图片来自文档工作台客户端。
4. 提取结果要和原始页面一起复核
批次号、编号和日期的字符通常很相似,扫描不清、印章遮挡或同页多个候选值,都可能让初步结果需要再次确认。较好的做法是保留识别值、确认值和复核状态,而不是直接用识别出的内容覆盖最终归档信息。

图 2:字段结果先形成结构化记录,随后仍需与原始资料核对。图片来自文档工作台客户端。

图 3:对批次号、编号、日期和原文结论,回到原始页面确认具体位置。图片来自文档工作台客户端。
如果批次号缺失、同一页存在多个报告编号,或者合格证和报告之间的关联无法确认,就应保留待复核状态。此时补充规则或人工确认,比为了凑齐表格而猜测更可靠。
5. 导出前检查归档表能否真正回查
确认后的字段可以导出为 Excel。导出前可以随机抽几条记录,检查下面四件事:
通过批次号能否找到该批的全部资料记录。 通过资料编号、来源文件和页码能否回到原始 PDF。 原文结论是否保留为原始资料内容,而没有被改写为质量判断。 缺失字段、多个候选值和对应关系不清的记录,是否仍清楚标为待复核或需补件。

图 4:导出的 Excel 应保留批次、资料来源和复核状态,便于后续归档与交接。图片来自文档工作台客户端。
通过这些检查后,Excel 才可以作为批次归档的基础台账,继续用于资料查找、交接或后续系统录入。它不代表质量流程已经完成,也不替代任何专业结论。
6. 先用少量真实资料验证字段规则
正式处理全部历史资料前,先选几个包含不同版式、不同批次和不同资料类型的样本。重点验证:批次号能否稳定关联、字段是否够用、来源定位是否清晰,以及待复核记录是否能被接手的人理解。
不想自行配置 OCR 环境,只需要按字段把合格证和检验报告整理成可复核 Excel 的读者,可以使用文档工作台。它是一键安装、打开即用的本地 OCR 字段提取桌面工具,适合先从一小批真实资料验证流程。具体结果仍需结合实际资料、字段规则和人工复核确认。
获取方式:
私信公众号“文档工作台”获取哦
夜雨聆风