【论文速递】ACL 2022 - 查询和抽取:将事件抽取细化为面向类型的二元解码

简介: 事件抽取通常被建模为一个多分类问题,其中事件类型和论元角色被视为原子符号。这些方法通常仅限于一组预定义的类型。

【论文原文】:Query and Extract: Refining Event Extraction as Type-oriented Binary Decoding


【作者信息】:Wang, Sijia and Yu, Mo and Chang, Shiyu and Sun, Lichao and Huang, Lifu


论文:https://arxiv.53yu.com/pdf/2110.07476.pdf
代码:https://github.com/VT-NLP/Event_Query_Extract


博主关键词:事件抽取,二元解码


推荐论文:无


摘要


事件抽取通常被建模为一个多分类问题,其中事件类型和论元角色被视为原子符号。这些方法通常仅限于一组预定义的类型。我们提出了一种新颖的事件抽取框架,该框架使用事件类型和论元角色作为自然语言查询,从输入文本中抽取候选触发词和论元。通过查询中的丰富语义,我们的框架受益于注意力机制,可以更好地捕获事件类型或论元角色与输入文本之间的语义相关性。此外,查询-抽取公式(query-and-extract formulation)允许我们的方法利用来自各种本体的所有可用事件标注作为统一模型。在ACE和ERE上的实验表明,我们的方法在每个数据集上都达到了最先进的性能,并且在零样本事件抽取上显著优于现有方法。


1、简介


事件抽取(Grishman, 1997; Chinchor and Marsh, 1998; Ahn, 2006)是一项从自然语言文本中识别和分类事件触发词和参与者的任务。如图1所示,married和left分别是Marry和Transport事件类型的两个事件提到的触发词。left事件提到了两个论元:she is an Artifact, and Irap is the Destination.


283ddf357c374ab9b8a692f5f53a6273.png


传统研究通常将事件抽取建模为多类分类问题(McClosky et al, 2011; Li et al, 2013; Chen et al, 2015; Yang and Mitchell, 2016; Nguyen et al, 2016; Lin et al, 2020),其中首先定义了一组事件类型,然后有监督的机器学习方法将检测并将每个候选事件提到或论元分类为其中一个目标类型。但是,在这些方法中,每个事件类型或论元角色都被视为原子符号,忽略了它们丰富的语义。一些研究通过利用事件类型结构(Huang et al, 2018),种子事件提及(Bronstein et al, 2015; Lai and Nguyen, 2019),或问题回答(QA)(Du and Cardie, 2020; Liu et al, 2020)。然而,这些方法仍然是为单个目标事件本体设计的,因此仅限于单个目标事件本体,例如ACE (Consortium, 2005)或ERE (Song et al, 2015)。


随着多个本体的存在和处理新出现的事件类型的挑战,有必要研究可泛化的事件抽取方法,并且可以使用来自不同事件本体的所有可用训练数据。


为此,我们提出了一个遵循查询-抽取范式的新的事件抽取框架。我们的框架将事件类型和论元角色表示为具有丰富语义的自然语言查询。然后,通过利用我们提出的注意力机制来捕获它们与输入文本的交互,查询用于抽取相应的事件触发词和论元。具体来说,(1)对于触发词检测,我们根据每个事件类型的类型名和原型触发词的简短列表将每个事件类型化为一个查询,并根据每个token的查询感知嵌入对其进行二元解码(binary decoding)。(2)对于论元抽取,我们将每个事件类型下定义的所有论元角色放在一起作为一个查询,然后采用多路注意力机制对每个事件提及的所有论元进行一次性编码(one-time encoding),每个论元预测为二元解码(binary decoding)。


与之前的研究相比,我们的方法可以自然地将各种本体作为统一模型处理(Nguyen and Grishman, 2016; Wadden et al, 2019; Lin et al, 2020),我们的二元解码机制直接适用于表示为自然语言查询的任何事件类型或论元角色,从而有效地利用跨本体事件标注并进行零样本预测。此外,与基于QA的方法相比(Du and Cardie, 2020; Liu et al, 2020; Li et al, 2020a)也可以进行零样本论元抽取,我们的方法不需要为论元角色单独创建高质量的问题,也不需要为不同的论元角色单独创建多次编码,因此更加准确和高效。


我们在两个公共基准数据集ACE和ERE上评估了我们的方法,并在标准监督事件抽取和具有挑战性的迁移学习设置中展示了最先进的性能,这些设置可以推广到新的事件类型和本体。值得注意的是,在零样本迁移到新事件类型时,我们的方法在触发词检测方面优于强基线16%,在论元检测方面优于强基线26%。我们工作的总体贡献是:


  • 我们将事件抽取细化为查询和抽取范式,这比以前的自顶向下分类或基于QA的方法更一般化和高效。
  • 我们设计了一个新的事件抽取模型,利用事件类型和论元角色的丰富语义,提高了准确性和泛化性。
  • 我们在有监督和零样本事件抽取方面建立了ACE和ERE的最新性能,并演示了我们的框架作为跨本体迁移的有效统一模型。


2、方法


如图2所示,给定一个输入句子,我们首先通过将其作为对句子的查询来确定每个事件类型的候选触发词。每个事件类型(如Attack)都用自然语言文本表示,包括其类型名称和原型触发词的短列表,如入侵(invaded)和空袭(airstrikes),这些触发词是从训练示例中选择的。然后,我们将输入句子与事件类型查询连接起来,用预训练好的BERT编码器对它们进行编码(Devlin et al, 2019),计算每个输入token在事件类型查询的顺序表示上的注意力分布,最后将每个token分类为一个二元标签,表明它是否是特定事件类型的候选触发词。


7770b702ffe74005a01ee32472ae0b3e.png


为了抽取每个候选触发词的论元,我们遵循类似的策略,并将其对应事件类型的预定义论元角色集作为对输入句子的查询。我们使用另一个BERT编码器来学习输入句子的上下文表示和论元角色的查询。然后,将输入句子中的每个实体作为候选论元,计算实体与候选论元角色之间的多向注意力语义相关性,最后根据每个论元角色将每个实体划分为一个二元标签。


3、实验


监督的事件抽取


5434b872f2bd4c2ea35bd8639239fc39.png


零样本事件抽取


3c10007ef5994ac7b39f0afe1d18d381.png

2db4701ea7734918bab6efd0b804674c.png


跨本体迁移


17c8e63919594cd0aacc8fb1f9813bf8.png


消融实验


1547b0484b00497b9369b3d982bf2e17.png


【论文速递 | 精选】


fcc8fa9f87404652beb9e08a0ac9652d.png


论坛地址:https://bbs.csdn.net/forums/paper

目录
相关文章
|
机器学习/深度学习 运维
Moment:又一个开源的时间序列基础模型
MOMENT团队推出Time-series Pile,一个大型公共时间序列数据集,用于预训练首个开源时间序列模型家族。模型基于Transformer,采用遮蔽预训练技术,适用于预测、分类、异常检测和输入任务。研究发现,随机初始化比使用语言模型权重更有效,且直接预训练的模型表现出色。MOMENT改进了Transformer架构,调整了Layer norm并引入关系位置嵌入。模型在长期预测和异常检测中表现优异,但对于数值预测的效果尚不明朗。论文贡献包括开源方法、数据集创建和资源有限情况下的性能评估框架。
1662 0
|
安全 前端开发 Java
SpringSecurity如何放行资源
SpringSecurity如何放行资源
1008 2
|
机器学习/深度学习 测试技术
ChronosX: 可使用外生变量的时间序列预测基础模型
时间序列预测中,基础模型虽在单变量任务中表现出色,但引入协变量支持仍面临挑战。Chronos研究团队提出ChronosX架构,通过适配器层有效整合历史与未来协变量信息,适用于任何单变量模型。实验表明,ChronosX显著提升预测性能,尤其在复杂数据集上优势明显。消融研究进一步验证了协变量模块的重要性。尽管需要轻量训练,但其灵活性和通用性为时间序列建模提供了新思路,未来或可通过类似LLM提示机制实现更高效的协变量处理。
1241 16
ChronosX: 可使用外生变量的时间序列预测基础模型
|
存储 自然语言处理 数据处理
信息抽取UIE(二)--小样本快速提升性能(含doccona标注
需求跨领域跨任务:领域之间知识迁移难度高,如通用领域知识很难迁移到垂类领域,垂类领域之间的知识很难相互迁移;存在实体、关系、事件等不同的信息抽取任务需求。 - 定制化程度高:针对实体、关系、事件等不同的信息抽取任务,需要开发不同的模型,开发成本和机器资源消耗都很大。 - 训练数据无或很少:部分领域数据稀缺,难以获取,且领域专业性使得数据标注门槛高。
信息抽取UIE(二)--小样本快速提升性能(含doccona标注
|
消息中间件 负载均衡 Java
【深入浅出RocketMQ原理及实战】「底层原理挖掘系列」透彻剖析贯穿RocketMQ的消息消费长轮训机制体系的原理分析
【深入浅出RocketMQ原理及实战】「底层原理挖掘系列」透彻剖析贯穿RocketMQ的消息消费长轮训机制体系的原理分析
617 0
|
存储 数据管理 网络虚拟化
特殊网络类型分类
本文介绍了网络技术中的关键概念,包括虚拟局域网(VLAN)、存储区域网络(SAN)、网络桥接、接入网以及按拓扑结构和交换方式分类的网络类型。VLAN通过逻辑分隔提高性能与安全性;SAN提供高性能的数据存储解决方案;网络桥接实现不同网络间的互联互通;接入网解决“最后一千米”的连接问题。此外,文章详细对比了总线型、星型、树型、环型和网状型等网络拓扑结构的特点,并分析了电路交换、报文交换和分组交换的优缺点,为网络设计与应用提供了全面参考。
684 8
|
人工智能 自然语言处理 运维
AI性能极致体验:通过阿里云平台高效调用满血版DeepSeek-R1模型
DeepSeek是近期热门的开源大语言模型(LLM),以其强大的训练和推理能力备受关注。然而,随着用户需求的增长,其官网在高并发和大数据处理场景下常面临服务不稳定的问题。本文将深度测评通过阿里云平台调用满血版DeepSeek模型(671B),以充分发挥其性能和稳定性。阿里云提供高效、低延迟、大规模并发支持及稳定的云服务保障,并为用户提供100万免费token,简化操作流程,确保企业在AI应用上的高效性和成本效益。尽管如此,DeepSeek API目前不支持联网搜索和图片、文档分析功能,需结合其他工具实现。
2172 17
|
存储 JavaScript 算法
JS垃圾回收机制有哪些?
本文介绍了JavaScript中的垃圾回收(GC)机制,包括其概念、产生原因及重要性。文章详细讲解了几种常见的垃圾回收算法,如引用计数、标记清除、标记整理和分代回收,并分析了它们的优缺点。最后总结了垃圾回收对JS开发的重要作用,强调了其在自动内存管理和性能优化中的关键地位。
871 2
JS垃圾回收机制有哪些?
|
自然语言处理
掩码语言模型(MLM)
掩码语言模型(MLM)