乐于分享
好东西不私藏

HyGEN:融合概念约束与实例记忆的文档级事件知识图谱抽取方法

HyGEN:融合概念约束与实例记忆的文档级事件知识图谱抽取方法

事件抽取的目标,是把自然语言中的事件转化成可以直接计算和分析的结构化信息。相比只处理单个句子的事件抽取,文档级事件论元提取需要从整篇文档中寻找与某个事件相关的人物、地点、时间、设备等论元。真正困难的地方在于,这些论元可能距离事件触发词很远,同一篇文档中还可能同时出现多个类型相同或相近的事件。

针对这两个问题,作者提出 HyGEN,Hybrid Prompt GENeration。HyGEN没有单纯增加更长的提示文本,而是将信息分成两条路径处理。一条路径利用事件定义和触发词位置建立明确的概念约束,解决多个事件之间容易混淆的问题。另一条路径从同类型历史实例中检索有用信息,并直接在表示空间进行融合,帮助模型寻找分散在长文档不同位置的论元。最后,模型通过混合生成器整合两类信息并完成论元生成。

实验覆盖 RAMS、ACE05-EN、CMNEE 和 ACE05-CH 四个英文及中文数据集。论文报告 HyGEN 相比已有最好结果,F1 分数分别取得 3.5、0.8、5.2 和 5.2 个百分点的绝对提升。这组结果说明,显式的事件概念与隐式的实例经验可以形成互补。

1. 文档级事件论元提取难在哪里

事件通常可以表示为“事件类型、触发词、论元角色、论元”组成的结构。

例如,一段新闻描述某支部队“部署”了一套装备,那么“部署”可能是事件触发词,“美国陆军”对应执行主体,“某套作战系统”对应设备,“阿富汗某地”对应部署地点。事件论元提取需要把这些文本片段找出来,并判断它们分别承担什么角色。

句子级任务通常只需要在触发词所在句子附近寻找信息。文档级任务则不同,一个论元可能出现在触发词前后的其他句子甚至更远的位置。模型不仅需要理解局部语义,还必须建立跨句甚至跨段落的联系。

论文首先利用两个案例说明了这一困难。

第一个案例是论元分散问题。文档描述一个“部署”事件,其中主体、设备和地点分布在文档不同位置。“2013年能力组件中的其他部件”距离触发词“部署”已经隔了数句话,已有模型因此漏掉了这一设备论元。

第二个案例是多事件混淆问题。同一篇文档中存在两个由“测试”和“多次测试”触发的实验事件。两者属于同一事件类型,但是对应的时间和设备不同。已有模型把第一个事件的时间分配给了第二个事件,同时又把第二个事件的设备分配给第一个事件。

这两个案例对应 DocEAE 中非常典型的两类错误:

第一类是找不到。
论元离触发词太远,模型无法建立有效联系。

第二类是找到了,但是分错事件。
文档里存在多个相似事件,模型虽然识别出候选论元,却无法准确判断它究竟属于哪个事件实例。

2. 现有方法为什么还不够

近年来,生成式方法已经成为事件论元提取的重要路线。一个典型做法是先根据事件类型构造模板,然后让预训练语言模型按照模板生成对应论元。

例如,可以把某种事件写成类似:

执行者:[Agent]
地点:[Place]
设备:[Instrument]

模型阅读文档以后,将对应文本填入这些角色位置。

这种方法把复杂的多分类任务转化成了条件生成任务,能够充分利用预训练语言模型本身的语义能力。早期的文档级条件生成方法已经证明,基于事件模板进行生成能够明显改善 DocEAE 的效果。

问题在于,只有角色名称还不够

“Agent”“Participant”“Target”“Instrument”等角色之间存在细微的语义差异。对于简单事件,模型可以依靠上下文区分。但在多个相似事件同时出现时,只告诉模型角色名称,很难形成足够精确的事件边界。

已有研究因此开始加入提示信息,希望通过任务描述、事件模式等知识增强生成过程。HyGEN认为,这类提示仍然存在一个问题,即提示提供的概念粒度不够细

另一方面,检索增强方法提供了另一条思路。模型可以从训练数据或外部实例中寻找和当前事件相似的案例,然后利用这些案例辅助预测。

这种方法对于文档级任务很有吸引力,因为一个训练实例中学到的角色结构可能帮助另一个相似实例完成抽取。

但传统 RAG 通常需要:

检索文本 → 拼接到输入 → 一起送入生成模型。

这在问答任务中比较自然,在 DocEAE 中却会遇到现实限制。输入本身已经是一篇长文档,如果再拼接多个检索实例,序列长度会迅速增长。额外文本还可能带来新的干扰,使模型需要在原文、事件模板和多个示例之间重新判断哪些信息真正有用。

HyGEN因此没有继续增加输入文本,而是把问题重新拆成两部分:

用概念知识告诉模型“当前到底在找什么”。
用实例记忆告诉模型“类似事件过去通常是怎样表达的”。

前者负责约束,后者负责补充经验。

3. HyGEN的整体思路

HyGEN的核心结构可以概括为一个概念驱动的双路径框架

作者将文档级事件论元提取看成两类知识共同作用的过程。

第一类是显式概念知识

事件类型是什么,事件具有哪些角色,每个角色表达什么含义,当前触发词位于什么位置,这些信息都具有明确的结构和定义。HyGEN利用这些信息建立精细的概念约束。

第二类是隐式实例知识

同一种事件在不同文档中可能具有相似的语言表达、论元组合和语义模式。这些知识很难全部写成自然语言规则,但可以通过检索相关训练实例获得。

基于这一划分,HyGEN由三个主要部分组成:

这种设计的关键并不是单纯加入更多信息,而是让不同类型的信息通过不同路径进入模型

规则明确、结构清晰的信息通过 Prompt 表达。

实例丰富但难以完全语言化的信息通过 Memory 表达。

两部分最终在生成阶段汇合。

4. 第一条路径:把“找什么”定义得更清楚

HyGEN的第一部分是 Fine Concept-Guided Prompt,精细概念引导提示

传统模板提示通常只给模型一个角色框架。例如某类事件具有 Agent、Place、Instrument 等角色,然后要求模型寻找对应文本。

HyGEN进一步向模板中加入了两类信息:

事件类型的结构化定义

以及

当前事件触发词的位置锚点

这两个信息分别回答两个问题。

事件定义负责限定语义

一个角色名称本身能够提供的信息很有限。

例如“Participant”和“Agent”看起来都可能指某个参与事件的人或组织,但两者在具体事件模式中的含义并不完全相同。模型如果只看到角色名称,就需要完全依赖上下文猜测它们之间的边界。

事件定义相当于向模型提供更完整的概念说明。

模型不再只是知道“这里需要填一个 Agent”,而是能够结合当前事件的类型以及对应语义判断什么实体真正符合这个角色。

这种设计尤其适合多事件文档。

当多个事件共享大量实体甚至属于同一类型时,单纯依靠词语相似性容易产生错误。加入事件级概念约束以后,模型的判断范围被进一步收紧。

Trigger Anchor负责限定事件实例

只知道事件类型仍然无法解决全部问题。

同一篇文档可能存在两个完全相同类型的事件。此时,即使模型理解了事件模式,也仍然可能把第一个事件的论元分配给第二个事件。

HyGEN因此进一步使用触发词位置作为锚点

它告诉模型当前正在处理的是哪一个具体事件实例。

可以把这种设计理解为从三个层次逐渐缩小搜索范围:

事件类型决定大的语义空间。
角色定义决定需要寻找什么信息。
触发词锚点确定当前处理的是哪一个事件实例。

因此,Fine Concept-Guided Prompt主要解决的并不是“模型完全看不懂文章”,而是模型知道很多可能答案,却缺少足够精确的条件判断哪个答案属于当前事件

这也是HyGEN针对多事件混淆问题设计的主要机制。

5. 第二条路径:不用拼接文本的实例记忆

第一条路径解决“不要分错”,第二条路径更关注“不要漏掉”。

作者提出 Soft Instance-Aware Memory,软实例感知记忆机制

它的出发点来自检索增强生成。

当模型处理一个新的事件时,训练数据中往往存在其他同类型或语义相近的事件。这些实例包含有价值的信息,例如某类事件通常涉及哪些角色,不同论元通常以什么语言形式出现,以及不同角色之间存在哪些潜在联系。

最直接的方法是检索几个案例,把原始文本放到当前输入前面。

HyGEN没有这样做。

原因在于,DocEAE面对的本来就是长文档,再拼接多个完整实例会明显扩大输入长度。同时,检索结果中必然存在与当前样本不完全相关的信息,直接拼接会把这些噪声一并交给生成模型。

HyGEN选择在表示空间完成检索信息的利用。

模型首先围绕当前事件类型执行编码后的实例检索,然后获得相关实例的向量表示。之后,模型不把这些实例重新转成一大段文本,而是直接对检索到的表示进行组合,并利用自适应聚合机制确定不同实例信息的重要程度。

可以把两种方式进行直观比较:

这里的“Soft”很关键。

HyGEN不是选择某个检索实例以后完全相信它,也不是简单平均多个实例,而是让模型学习不同检索记忆对当前样本应该贡献多少信息。

因此,这条路径本质上建立了一种非参数化的实例经验补充机制

模型参数保存训练过程中形成的通用能力,实例记忆则保存更加具体的案例信息。当当前文档中的论元距离触发词较远、局部上下文不足时,相关实例能够为模型提供额外语义线索。

这也是HyGEN处理“论元分散”问题的重要组成部分。

6. 两条路径最终如何结合

只有概念约束,模型可能知道应该寻找什么,却仍然缺少处理复杂上下文的经验。

只有实例检索,模型又容易把相似案例中的模式机械迁移到当前事件,甚至受到检索噪声影响。

HyGEN最后使用 Hybrid Generator 将两类信息融合。

一侧输入来自 Fine Concept-Guided Prompt,代表当前事件明确的模式、定义和位置约束。

另一侧输入来自 Soft Instance-Aware Memory,代表模型从相关事件实例中获得的隐式经验。

作者通过表示拼接和线性映射把两部分转换为统一的联合表示,再交给生成模型进行最终的事件论元预测。

因此,整个HyGEN可以压缩成一个很清楚的逻辑:

Concept负责“边界”。
Memory负责“经验”。
Generator负责“融合并生成”。

从任务角度看,两条路径分别对应论文开头提出的两类错误:

多个事件同时出现时容易串事件
→ 利用细粒度概念提示和触发词锚点加强约束。

论元散落在长文档不同位置时容易漏掉
→ 利用实例感知记忆补充跨实例语义信息。

这种问题与模块之间的一一对应关系,也是HyGEN方法设计比较清晰的地方。

7. 四个中英文数据集上的实验结果

作者在四个事件抽取数据集上进行了实验:

RAMS、ACE05-EN、CMNEE 和 ACE05-CH。

其中既包含英文数据,也包含中文数据。CMNEE还是面向中文军事新闻构建的大规模文档级事件抽取数据集,包含17,000篇文档和29,223个事件,具有8种事件类型和11种论元角色。

论文采用 Precision、Recall 和 F1 作为主要评价指标,其中重点报告 Argument Classification,Arg-C

这一指标要求比较严格。只有模型提取出的论元文本和对应角色同时正确,才算一次正确预测。

因此,模型仅仅找到正确实体并不够。

例如模型正确找到了“美国陆军”,但将其预测成错误的事件角色,这个结果仍然不能算正确。

主实验结果

HyGEN在四个数据集上均取得了新的最佳结果。

论文报告,相较于此前方法,HyGEN的F1绝对提升分别为:

这组结果有两个比较明确的特点。

第一,提升并不局限于单个数据集。HyGEN在 RAMS、ACE05-EN、CMNEE 和 ACE05-CH 上都取得优势,说明该设计并非只适用于某一种语料结构。

第二,中文数据上的提升比较明显。尤其是在CMNEE和ACE05-CH上,论文均报告5.2个百分点的F1绝对提升。CMNEE本身包含复杂的文档级中文军事事件,原始数据集研究也表明这一领域的事件抽取明显比一般领域更困难,因此这一结果体现出HyGEN处理复杂文档上下文的能力。

8. HyGEN真正有效的地方

从方法设计来看,HyGEN比较有价值的一点,是它没有把DocEAE中的所有困难统一归结为“上下文建模不足”。

作者把错误进一步拆成了两个来源。

一类错误来自缺少精确约束。

模型看到多个相似事件和多个可能论元,却无法判断哪个论元属于当前事件。Fine Concept-Guided Prompt通过事件定义和触发词位置解决这一问题。

另一类错误来自缺少有效证据。

论元位于远距离上下文中,仅依靠当前事件附近的信息不足以完成判断。Soft Instance-Aware Memory通过跨实例知识进行补充。

这种拆分使模型结构具有比较明确的可解释性。

HyGEN的另一个特点是对RAG进行了适合DocEAE任务的调整。

传统RAG习惯把检索结果视为新的文本上下文。HyGEN则认为,对于已经很长的文档,再继续向输入中增加文档并不一定合理。因此,它保留“利用外部实例”的核心思想,却把知识注入位置从文本空间移到了表示空间

这一变化看似简单,实际上对应了长文本信息抽取中的一个重要问题:

外部信息并不是越多越好,关键在于以什么形式进入模型。

对于事件抽取、关系抽取和其他长文档信息抽取任务,这种“结构化显式知识 + 表示级实例记忆”的组合具有一定参考价值。

方法仍然存在的几个边界

论文的实验已经验证了HyGEN在四个公开数据集上的效果,但从目前的方法设计和实验范围来看,还有几个问题值得继续研究。

首先,HyGEN仍然依赖预定义的事件类型、角色模式以及事件定义。因此,目前的结果主要说明它能够更好地完成已定义事件模式下的论元抽取,并不能直接说明模型已经具备开放域事件理解能力。对于训练阶段没有见过的新事件类型,概念提示和实例记忆如何构建仍然需要进一步验证。

其次,Soft Instance-Aware Memory的效果与检索到的实例质量存在天然联系。表示级融合降低了把大量文本直接塞入Prompt带来的问题,但并不意味着检索噪声已经完全消失。当候选记忆本身与当前事件存在较大语义偏差时,自适应聚合能够在多大程度上消除这种干扰,是后续可以进一步分析的方向。

第三,实例记忆意味着系统需要额外维护可检索的事件表示。与单纯的生成模型相比,这种设计增加了一套检索与记忆机制。因此,在超大规模事件库上的检索效率、存储开销以及推理速度,同样是实际部署时需要考虑的问题。

最后,目前实验集中在 RAMS、ACE05 和 CMNEE 等事件抽取基准上。论文已经提供了英文与中文结果,但在更加开放的真实长文档、超长文本,以及跨领域迁移环境下的表现仍有进一步验证空间。

这些问题并不改变论文当前实验得到的结论,它们更多反映了HyGEN下一步可以扩展的方向。

更多详细内容可以参考论文原文.