国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:余传旗,王婷婷,郭海燕,杨震
单位:南京邮电大学 通信与信息工程学院,江苏 南京 210003南京邮电大学 通信与信息工程学院,江苏 南京 210003南京邮电大学 通信与信息工程学院,江苏 南京 210003南京邮电大学 通信与信息工程学院,江苏 南京 210003;南京邮电大学 通信与网络技术国家地方联合工程研究中心,江苏 南京 210003
关键词:语音分离;通道注意力;图神经网络;图注意力网络
基金:国家自然科学基金(62071242)资助项目
目前,基于深度学习的时域单通道语音分离模型在无噪声场景下取得了显著的成效。然而,在含噪场景下,这些模型的编码器会将噪声特征误认为是源语音特征,影响掩码估计的准确性,导致分离性能不理想。针对此问题,提出一种基于注意力机制的时域语音分离模型,来降低噪声对语音分离任务的影响。具体地,考虑到时域编码器输出特征的各通道重要性差异,提出在编码器内部嵌入一个高效通道注意力(Efficient Channel Attention, ECA)模块,对编码特征的通道进行加权处理。在此基础上,提出采用图注意力网络(Graph Attention Network, GAT)来计算相邻帧间的注意力系数,以此聚合相邻帧间的编码特征,从而隐式地减小了噪声对掩码估计的影响。系统模型在WHAM!、Libri2Mix-Noisy和Libri3Mix-Noisy数据集上的实验结果表明,所提出的基于GAT和ECA的DPRNN(GACA-DPRNN)方法比基线DPRNN性能更优。
来源:2024年第06期
《南京邮电大学学报(自然科学版)》期刊编辑部