删除或更新信息,请邮件至freekaoyan#163.com(#换成@)

基于语言学扰动的事件检测数据增强方法

本站小编 Free考研考试/2022-01-02

摘要近年来,深度学习在事件检测领域取得了长足进展。但是,现有方法通常受制于事件检测标注数据的规模和训练阶段的不稳定性。针对上述问题,本文提出了基于语言学扰动的事件检测数据增强方法,从语法和语义两个角度生成伪数据来提升事件检测的性能。为了有效的利用生成的伪数据,该文探索了数据增加和多实例学习两个训练策略。在KBP 2017事件检测数据集上的实验验证了我们方法的有效性。此外,在人工构造的少量ACE2005数据集上的实验结果证明该文方法可以大幅度提升小数据情况下的模型学习性能。

PDF全文下载地址:

http://jcip.cipsc.org.cn/CN/article/downloadArticleFile.do?attachType=PDF&id=2804
相关话题/数据 实验 语言学 语法 事件

  • 领限时大额优惠券,享本站正版考研考试资料!
    大额优惠券
    优惠券领取后72小时内有效,10万种最新考研考试考证类电子打印资料任你选。涵盖全国500余所院校考研专业课、200多种职业资格考试、1100多种经典教材,产品类型包含电子书、题库、全套资料以及视频,无论您是考研复习、考证刷题,还是考前冲刺等,不同类型的产品可满足您学习上的不同需求。 ...
    本站小编 Free壹佰分学习网 2022-09-19
  • 基于序列到序列模型的事件识别
    摘要事件识别是以事件为单位进行信息抽取的起点,对后续各个子任务都意义重大。针对事件识别任务,该文提出了一种融入文档信息的序列到序列方法,一方面借助神经网络减少了特征工程产生的人工依赖,另一方面借助注意力机制将局部的词、实体与全局的文档中事件的共现等信息统一建模。在LDC2017E02语料上实验结果表 ...
    本站小编 Free考研考试 2022-01-02
  • 面向新类型人名识别的数据增强方法
    摘要人名识别常被作为命名实体识别任务的一部分,与其他类型的实体同时进行识别。当前使用NER方法的人名识别依赖于训练语料对特定类型人名的覆盖,在遇到新类型人名时性能显著下降。针对上述问题,该文提出了一种基于数据增强(dataaugmentation)的方法,使用新类型人名实体替换的策略来生成伪训练数据 ...
    本站小编 Free考研考试 2022-01-02
  • 基于主题词向量聚类的话题内新事件检测
    摘要目前关于话题内新事件检测的研究较少,传统的新事件检测方法多采用基于主题模型的方法,无法兼顾主题信息和语义信息,效果不够理想。针对该问题,该文提出一种基于主题词向量聚类的话题内新事件检测方法。该方法首先使用主题词嵌入(TWE)模型对经过预处理的语料进行训练,获取主题词向量;其次,通过对主题词向量进 ...
    本站小编 Free考研考试 2022-01-02
  • 微博谣言事件自动检测研究
    摘要互联网大数据环境下,谣言事件的散播已成为以微博为代表的在线社交网络持续健康稳定发展的主要障碍之一,因此及时有效地进行谣言事件自动检测对营造清朗的网络环境和维护社会和谐发展有着现实意义。该文以微博事件为背景,综合谣言事件特征随时间变化特性以及时间维度上谣言事件的分布特点,引入论域划分思想,基于模糊 ...
    本站小编 Free考研考试 2022-01-02
  • 文本摘要常用数据集和方法研究综述
    摘要文本摘要成为人们从互联网上海量文本信息中便捷获取知识的重要手段。现有方法都是在特定数据集上进行训练和效果评价,包括一些公用数据集和作者自建数据集。已有综述文献对现有方法进行全面细致的总结,但大多都是对方法进行总结,而缺少对数据集的详细描述。该文从调研数据集的角度出发,对文本摘要常用数据集及在该数 ...
    本站小编 Free考研考试 2022-01-02
  • 面向文本数据的正则化交叉验证方法
    摘要面向文本数据建模时,交叉验证方法是特征选择及模型比较任务中的常用方法。许多研究表明,文本数据模型的性能估计对交叉验证的数据切分方式较为敏感,不合理的切分方式可能会导致不稳定的性能估计值,使得实验结果可复现性差。该文试图论证基于多次重复(m次)的2折交叉验证,通过引入对训练集、验证集分布差异的约束 ...
    本站小编 Free考研考试 2022-01-02
  • 基于框架语义扩展训练集的有监督事件检测方法
    摘要事件检测是信息抽取领域的一个重要研究方向,目前的事件检测方法往往受限于数据稀疏、语料例句分布不平衡和歧义问题。该文研究发现框架语义知识库FrameNet(FN)含有丰富的已标注框架的语料,并且FN中定义的框架和事件检测中定义的事件具有极其相似的结构。框架由词法单元和一组框架元素组成,可与事件中的 ...
    本站小编 Free考研考试 2022-01-02
  • 基于混合表示的中文事件检测方法研究
    摘要传统中文事件检测方法采用人工定义的特征表示候选触发词,耗时耗力。基于神经网络的特征学习方法在中英文事件检测任务中得到了验证。现有的基于神经网络的中文事件检测方法初步探索了字信息对解决分词错误的作用。字是中文的最小结构单元和语义表示单元。词语的字符级信息能够提供词语的结构性信息和辅助词语级语义。该 ...
    本站小编 Free考研考试 2022-01-02
  • 面向非任务型对话系统的人工标注中文数据集
    摘要该文针对非任务导向型对话的回复质量构建了一个大规模的人工标注中文数据集,该数据集包含了从社交媒体收集到的超过27000个对话问题以及超过82000个对话问题的回复。为了产生高质量的标注数据,邀请了专业人员根据对话回复的相关性、连贯性、信息性、趣味性,以及是否潜在地具有让对话继续延续的特性进行标注 ...
    本站小编 Free考研考试 2022-01-02
  • 利用领域外数据对口语风格短文本的相近语种识别研究
    摘要该文以维吾尔语和哈萨克语这一组相近语言为例,在哈语语料受限的情况下,使用领域外语料增补原始语料,经同化后提高了在口语风格短文本上进行语种识别的精确度。该文分析了维、哈两种语言的词形学特点,设计了多种特征,构建了一个最大熵分类器,在测试集上识别维语和哈语口语风格短文本的精确度达到95.7%,而CN ...
    本站小编 Free考研考试 2022-01-02