国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:季一木,汤淑宁,刘尚东,张 旺,洪 程,邱晨阳,刘 强,肖 婉
单位:南京邮电大学 计算机学院,江苏 南京 210023;南京邮电大学 高性能计算与大数据处理研究所,江苏 南京 210023;国家高性能计算中心南京分中心,江苏 南京 210023;南京邮电大学 高性能计算与智能处理工程研究中心,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023;南京邮电大学 高性能计算与大数据处理研究所,江苏 南京 210023;国家高性能计算中心南京分中心,江苏 南京 210023;南京邮电大学 高性能计算与智能处理工程研究中心,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023;南京邮电大学 高性能计算与大数据处理研究所,江苏 南京 210023南京邮电大学 高性能计算与大数据处理研究所,江苏 南京 210023;南京邮电大学 教育科学与技术学院,江苏 南京 210023
关键词:远程监督;关系抽取;TransH;注意力机制
基金:国家重点研发计划专项(2018AAA0103302)、江苏省自然科学及高校自然科学重大项目(BK20170900,19KJB520046,20KJA520001)、江苏省创新创业人才项目及江苏博士后基金(2019K024)、江苏省六大人才高峰项目(JY02)、江苏省博士后研究实践创新项目(KYCX19_0921, KYCX19_0906)、之江实验室开放项目(2021KF0AB05)、南京邮电大学鼎山人才培养对象项目和南京邮电大学人才引进启动基金(NY219132)资助项目
远程监督为关系抽取任务提供了大量自动标注的数据集,且领域迁移性强,为实现自动抽取奠定了基础。然而,构造的数据集伴随了强约束性的假设,存在着严重的错误标签问题,且这些噪声数据极大影响了最终的性能结果。为了缓解错误标注的问题,文中提出了一种双重注意力模型:第一层注意力机制通过在句子编码部分引入TransH预训练好的实体向量,与句子特征共同进行注意力选择,为体现关系信息的特征分配更高的权重来提高句子编码质量;第二层则是从句子级别再进行一次注意力计算,挑选出有效的实例,进一步降低噪声数据的权重。通过在广泛使用的数据集上进行多次对比实验,表明文中所提模型可以充分利用所有信息资源,结果明显优于其他基线模型。
来源:2022年第06期
《南京邮电大学学报(自然科学版)》期刊编辑部