给每本书拍过版权页,图片很快会堆成一整个文件夹。可当你要找某本书的出版者、出版日期或 ISBN(国际标准书号)时,还是得一张张打开照片。
要把版权页照片变成真正能使用的图书清单,关键不在于把所有文字都抄进 Excel,而在于让每个字段都有来源、每条记录都有状态,发现异常时能回到对应照片核对。
1. 先定义一行书目代表什么
最容易出错的地方,是一张表里混用了“一个书名一行”“一套书一行”和“一本实体书一行”三种规则。对于从版权页照片建立书目,建议先采用最稳妥的规则:一本实体书对应一行。
这样处理有两个好处:同名不同版不会被无意合并,照片来源也能和实体书一一对应。套装、上下册或多卷本可以在“册次”“套系”或“备注”列中说明,但不要用猜测的方式把它们压成一条记录。
每行至少要保留一个能回到照片的来源定位。
💡 照片不是附件,而是书目的一部分 书目表中的值可能需要修正,来源照片则是复核依据。先把照片定位写进表里,之后才不会为了一个可疑字段重新翻完整个文件夹。
2. 从最终 Excel 反推要提取的字段
版权页上的信息很多,但未必都需要进入你的第一张书目表。先写出确定会使用的列名,再决定 OCR 要找什么。
下面是一组常见的起始字段,可按自己的用途增减。
书架位置、购买日期、阅读状态和个人标签不属于版权页字段,适合在导出 Excel 后自己补充。把“原件里有什么”和“我打算怎么管理”分开,表格会更清楚,也更容易维护。
3. 让照片、字段和行号对得上
先按书架、房间或处理批次整理文件夹,再给每张版权页照片一个稳定的名称。文件名不必复杂,但要能和 Excel 中的藏书编号对应。
例如,先处理 A 书架的第一批书时,可以把照片命名为 A-01-001.jpg、A-01-002.jpg。对应的 Excel 记录也使用同一个藏书编号。后续看到待复核项,就能从编号定位照片,再从照片定位实体书。
在准备图片时,重点检查这些事项:
文字区域是否清晰,反光、阴影和装订线是否遮住字段。
一张照片是否只对应一本书的版权页,避免多本书混拍。
同一本书是否拍到了不同页面,若是,需要明确哪张是本次字段来源。
没有版权页或页面缺失的书,是否已保留照片并标记待补拍。
4. 批量提取后,先在原图旁核对字段
当照片名称和字段定义稳定后,就可以按批次导入图片。文档工作台可按字段名和字段描述提取信息,结果可与原始页面对照;确认后的字段可以导出为 Excel。
对图书清单来说,最有价值的不是“识别出最多文字”,而是每一列的含义稳定。例如,“责任者”到底只放作者,还是把作者和译者分别列出,应在导入前写清楚。规则不明确时,同一批书很容易得到难以比较的结果。

图 1:原始页面与按字段整理的结果并排显示,便于确认书目字段来自正确位置。图片来自文档工作台客户端。
下面的顺序适合先做小批量验证:
在 Excel 中建立列名、来源照片和复核状态。
选取一小批版权页照片,按书名、责任者、出版者等字段处理。
对照原图,集中检查空值、相似字符和同页出现多个候选值的情况。
导出字段结果,在 Excel 中补藏书编号、书架位置等个人管理列。
将未确认项保留为待复核,补拍或回看后再更新状态。
5. 给异常记录留出位置
图书整理中,最常见的异常不是识别完全失败,而是信息不完整或不能直接对应。可以把异常保留在表里,而不是删掉再靠记忆补。
尤其是 ISBN、出版日期等容易被视为“应该有答案”的列,缺失时也不应通过外部检索来填满。本文的任务是把照片上的信息整理为可核对表,不是替代图书编目或版本判断。
6. 导出 Excel 后,再做一次可用性检查
导出后的 Excel 可以继续成为你的长期书目表。交付或开始下一批前,抽查几条记录:能否由藏书编号找到实体书,能否由来源照片找到版权页,字段为空时是否有明确状态。

图 2:字段结果导出为 Excel 后,可继续添加书架位置、个人标签和复核状态。图片来自文档工作台客户端。
如果这些路径都通了,说明第一版表格已经可以使用。之后不论是继续拍下一层书架,还是补录以前遗漏的书,都沿用同一套编号、字段和复核规则即可。
夜雨聆风