简历、入职材料和员工档案混在一批 PDF 里时,最容易发生的返工,不是某一页没有识别出来,而是整理完才发现:简历与在职档案混在同一张表,字段名称不统一,某条记录也找不到原始页面。
这类任务的起点不该是“先把 PDF 全部转成文字”,而是先回答三个问题:这张表给谁用,一行代表什么记录,需要留下哪些最少字段。字段先定下来,后面的提取、核对和交接才有共同标准。
1. 先确认个人资料的处理边界
简历和员工档案包含个人信息。开始前,先确认这批资料是否已获得处理授权,谁可以访问结果,文件保存在哪里,以及这次工作真正需要哪些字段。
字段不是越多越好。只收集用于当前工作流程的内容,能够减少后续核对负担,也让表格更容易交接。例如,若任务只是建立档案目录,就不必把与目录无关的联系方式、照片或附件内容搬入表格。
本文讨论的是资料整理:把页面中已经存在的指定字段,整理成能回查的工作表。它不用于候选人筛选、评分、排序、招聘判断、人事决定或身份核验。
2. 不要让一行同时代表两种资料
简历和员工档案看起来都属于“人员资料”,但表格中的一行通常不应同时代表两者。简历的对象可以是一份投递材料;员工档案的对象则可能是一位在职员工或一份档案材料。两种对象混在一起,字段含义会很快失去一致性。
更稳妥的做法有两种:分别建立两张表,或在同一张表中增加“资料类型”并为不同类型设定不同字段规则。无论采用哪种方式,每条记录都要保留来源文件和页面定位。
表格中的字段可以按实际用途删减。关键不是复制一份固定模板,而是让每一列都有明确的来源、格式和使用目的。
3. 先写字段清单,再导入 PDF
在开始处理前,建议用一页字段清单把规则写清楚。每个字段至少说明:字段名称、从页面什么位置取值、输出格式、是否必填,以及遇到空值或多个候选值时怎么办。
YYYY-MM-DD | |||
字段清单的作用,是让不同人面对不同版式的 PDF 时仍按同一套规则处理。比如“日期”究竟是简历更新时间、入职日期还是档案材料日期,必须在处理前说明;否则导出的单元格即使都有值,也未必能用于下一步工作。
💡 字段清单先于识别结果 先确定需要什么,再提取页面中的对应内容,才能避免把一堆文本搬进 Excel 后重新分类。
4. 给每条记录留下回到原件的路径
一张可用的整理表,不只保存字段值,还要保存“这个值从哪里来”。建议至少保留来源文件、页面定位、识别值、确认值和复核状态。
把“识别值”和“确认值”分开,是为了避免初步结果直接覆盖人工确认的内容。对于姓名相似字、页面模糊、同页存在多个日期等情况,处理人可以清楚地知道应该回看哪一页,而不是凭记忆改写单元格。
5. 先用小批次跑通完整流程
资料准备阶段,先按时间范围、部门或资料类型分批,并保持文件名稳定。随后用一小批能覆盖常见版式的 PDF,依次验证字段清单、提取结果、原件核对和 Excel 导出。
文档工作台可以导入图片、PDF 或文件夹,按预先定义的字段整理结果。它适合把需要核对的字段集中出来;导出 Excel 前,仍应由处理人员对照原始页面确认关键内容。
遇到以下情况,不要为了让表格看起来完整而补写:
页面裁切、模糊或遮挡,关键字符无法确认。
同一页出现多个可能的姓名、日期或编号,字段规则没有明确取值位置。
原件缺少指定字段,或不同资料类型的字段含义不一致。
表格记录无法定位到来源文件和页面。
这些记录应保留为“待复核”或“需补件”。可以解释的空值和状态,比一个没有来源的猜测值更能支持后续交接。
6. 导出前做一次最小检查
把确认过的字段导出为 Excel 后,可以随机抽查几条记录:是否能由表格回到对应 PDF,字段含义是否符合字段清单,未确认项是否仍保留状态和原因。通过这三个检查,再逐步扩大到更多资料。
7. 用文档工作台把字段清单落到表格里
当字段清单、资料边界和复核规则已经确定后,文档工作台可以作为执行这一流程的工具:导入图片、PDF 或文件夹,按预先定义的字段整理结果,再与原始页面对照确认后导出 Excel。

图 1:文档工作台客户端中的资料导入与字段配置界面。截图使用教学资料示例。
它适合不想自行配置 OCR 环境、只需要按字段整理出可复核 Excel 的场景。具体结果仍应结合实际资料、字段规则和人工复核确认。
产品获取入口:
私信公众号“文档工作台”获取哦!
夜雨聆风