



引言
在文化遗产数字化浪潮下,全球档案机构已完成海量视觉档案的数字化采集,但相关元数据的生产在数量与质量上,均远滞后于图像数字化进程。这一问题在1890-1918年早期冲突摄影这类敏感历史档案的处理中尤为显著--这类照片不仅物理载体易受损,内容更涉及殖民暴力、帝国扩张等具有争议性的历史议题,其配套元数据往往残缺不全、信息失准,甚至部分描述语言因时代局限带有明显的偏见。由英国艺术与人文研究理事会(AHRC)与法国LABEX(“过往在当下”实验室)联合资助的 EyCon项目(Visual AI and Early Conflict Photography,即“早期冲突摄影与视觉人工智能”项目)[1],致力于破解这一双重难题。
该项目以视觉人工智能技术为核心,旨在构建包含近13万张图像的早期冲突摄影开放语料库,并探索多模态AI在提升档案可及性、还原历史语境、负责任处理敏感内容等方面的应用潜力。相较于单一模态AI,多模态AI系统可解析并处理视觉、语言、声音等不同模态的数据,其模仿人类多感官感知的特性,能融合多维度信息,进而提供更丰富[2]、精准的分析结果与决策支撑(见图1)。借助多模态AI技术,机器在自动识别视觉档案数据时可有效整合多维度信息,从而保障档案元数据自动录入的真实性、准确性与完整性。

图1 多模态AI工作原理框架图
1
EyCon项目介绍:目标、范围与方法论
EyCon项目于2019年12月正式启动,是由英法两国联合资助,英国诺森比亚大学、拉夫堡大学,法国巴黎西岱大学、巴黎楠泰尔大学等学术机构,联合多家文化遗产机构(主要为各个档案馆)共同开展的“档案学+计算机科学”的数字人文跨学科研究项目。其核心目标是借助人工智能技术自动整合碎片化的视觉档案,打破长期存在的民族例外主义叙事与西方中心主义视角。
项目聚焦于1890—1918年间武装冲突的摄影档案,重点关注非洲、亚洲等被主流叙事忽视的非欧洲战场殖民战役相关素材。项目团队与法国国防部历史服务处、英国帝国战争博物馆等英法核心机构深度合作,汇集了个人相册、官方摄影集、明信片、报刊杂志等多类型档案素材;这些素材既涵盖已完成数字化的档案,也新增了数千份此前未公开的稀缺资料,例如记录法国对非洲殖民战争的《拉蒂格相册》。
在研究方法上,项目团队开发并应用基于计算科学与人工智能的工具,开展以下实践:①比对并检索图像间的相似性;②通过图像整合、主题建模与聚类,优化大型视觉语料库的可视化呈现效果;③识别视觉档案中的摄影范式、子类型及具有研究价值的“异常内容”;④基于早期冲突摄影素材重新训练现有数据集[1]。
2
项目运用的主要技术方法[3]
2.1 布局分析与内容提取
项目借助Layout Parser工具包训练专用模型,从版式复杂的报刊页面与老式相册中精准提取单张图像及其配图说明(见图2)。这是将图像从物理载体中“剥离”,此为后续的图像分析提供了原始数据。

图2 Layout Parser工具包对近代报刊版面的图文识别效果示例
2.2 目标检测与命名实体识别
项目采用预训练的YOLO模型,在全语料库范围内检测“人物”、“马匹”两类受历史偏差影响较小的对象,以此补充视觉元数据维度(见图3);同时运用SpaCy模型从配图说明中提取命名实体,并将其与Wikidat关联,实现多语言检索与地理定位。

图 3 YOLO 模型对早期冲突照片中人物与马匹的检测结果标注示例
2.3 视觉与多模态相似性分析
为追踪照片图像在不同机构、媒体间的传播与复用轨迹,项目首先通过卷积神经网络(CNN)实现早期冲突照片的“图像字符化”——将照片的视觉特征转化为可计算的特征向量(见图 4),这是后续相似性分析的核心基础。

图4 卷积神经网络实现早期冲突照片图像字符化的方法流程示意图
在此基础上,项目采用底层依托CNN架构的预训练ImageNet模型,提取经Jarvis算法优化后的低质量网版图像特征,生成标准化的视觉特征向量。项目后续研发出多模态分析方法,将上述CNN提取的视觉特征向量与文本特征向量融合,以此识别视觉特征与历史背景均高度关联的图像集群。而多模态工具的文本处理环节,则通过向量化文本元数据并生成语序概率分布,将文本信息转化为可与视觉特征向量匹配的标准化文本特征向量(见图5),从而实现了文本与视觉特征的有效融合。

图5 向量化文本元数据以创建语序的概率预测的图形解释(多模态工具文本部分的工作原理)
基于上述技术,用户可通过两种方式检索数据库:一是上传图片,获取系统推荐的十张视觉与历史语境最相似的图像(见图6);二是输入文本关键词,查看算法匹配的相关敏感摄影照片档案。

图6 EyCon数据库多模态检索相似图像界面
3
成果与启示
通过上述一系列技术手段的应用,EyCon项目也取得了多项具有实质价值的成果与研究发现。在元数据增强层面,项目成功识别出超7万个人物形象与8000匹马匹,为大量描述信息匮乏的图像补充了基于视觉内容的标签;借助命名实体识别技术,数千个地点、人物信息被精准提取并关联至Wikidata,大幅提升了敏感照片档案的可检索性[4]。
此外,多模态AI的相似性分析成功构建起了图像之间的关联网络,清晰地揭示出同一历史事件照片被不同机构收藏、同一底片在不同报刊中被裁剪复用的历史轨迹。这些发现让原本分散割裂、语境缺失的档案重新建立关联,形成了更完整的历史叙事脉络。
现今,上述成果均整合至基于国际图像互操作框架(IIIF)构建的开放访问的EyCon数据库[5]中(见图7),其访问网址为:https://eycon.huma-num.fr/s/en/page/accueil。该项目始终恪守数据透明原则,所有元数据均明确标注来源,确保研究者可清晰区分AI生成与人工审核的内容。

图7 EyCon早期冲突摄影开放数据库主界面展示
尽管成果显著,EyCon的实践也深刻揭示了AI应用于自动识别处理敏感历史照片档案时面临的系列技术局限与严峻的伦理挑战。
一是受控词汇表的固有偏见。项目发现现有受控词汇表与主流AI训练数据集普遍存在欧洲中心主义倾向,这导致在规避殖民色彩术语的前提下,精准描述殖民地部队相关内容的难度极大。
二是敏感内容检测能力不足。测试显示,商用通用工具无法有效识别历史图像中的暴力内容。例如一张呈现士兵尸体的照片,经Google Vision API检测仅被判定为“极低概率可能存在暴力”(见图8)。

图8 Google Vision API 对含士兵尸体的敏感历史照片:暴力内容检测结果示例
三是大量暴力内容具有语境依赖性。一张表面看似普通的“街头游行”照片,实则记录了意大利殖民者押送阿拉伯囚犯前往公开绞刑的场景(见图9),这类图像背后的权力关系与隐性暴力,是现有算法仍无法解读的。

图9 语境性暴力的殖民历史照片示例
(1911年意大利入侵利比亚押送囚犯场景)
因此,针对上述困境,EyCon项目也秉持着审慎的伦理立场:对于带有时代局限性或冒犯性的历史元数据,项目选择“保留并丰富”而非直接“替换”,完整留存各历史阶段的元数据,供研究者开展批判性分析[6]。
4
结语
EyCon项目通过构建大规模早期冲突摄影数据集、研发多模态AI分析方法,为敏感历史照片档案的数字化识别以及处理,提供了丰富的实践经验。该项目不仅验证了人工智能在整合碎片化视觉档案、还原历史语境方面的巨大潜力,还深刻揭示了当前AI应用于敏感的档案文化遗产时直面的伦理复杂性。
EyCon的实践经验表明,技术工具的有效应用离不开深厚的领域知识支撑与审慎的伦理考量,“人机协作”是处理这类复杂档案材料的核心路径。项目构建的开放数据库与透明化研究方法,为未来在文化遗产领域负责任地开发、应用人工智能技术提供了宝贵范例。在此基础上,该项目不仅在技术层面“解锁”了尘封的历史照片档案,更在方法论层面为运用多模态AI处理承载集体记忆的敏感历史照片档案指明了前进方向。
参考文献与注释:
[1] Le projet EyCon (Fr.)[EB/OL]. (16.0.1)[2025-12-01]. https://eycon.hypotheses.org/le-projet-en-quelques-mots/le-projet-eycon.
[2] 前沿技术解读:多模态AI的潜力与应用前景[EB/OL]. (2025-03-21)[2025-12-01]. https://bbs.huaweicloud.com/blogs/449541.
[3] EyCon[EB/OL]. (2302-06-20)[2025-12-01]. https://eycon.hypotheses.org/category/posts.
[4] Aske K, Giardinetti M. (Mis)Matching Metadata: Improving Accessibility in DigitalVisual Archives through the EyCon Project[J]. J. Comput. Cult. Herit., 2023, 16(4): 76:1-76:20.
[5] Early Conflict Photography Database (1890-1918)[EB/OL].[2025-12-01]. https://eycon.huma-num.fr/s/en/page/accueil.
[6] Giardinetti M, Foliard D, Schuh J, et al. The EyCon Dataset: A Visual Corpus of Early Conflict Photography | Journal of Open Humanities Data[J]. 2024.

撰文:朱彤
编辑:唐潇
审核:周文泓


夜雨聆风