声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:黄天阳,侯元波,李圣辰,邵 曦
单位:南京邮电大学 通信与信息工程学院,江苏 南京 210003根特大学 信息技术学院,比利时 根特 9000西交利物浦大学 智能工程学院,江苏 苏州 215123南京邮电大学 通信与信息工程学院,江苏 南京 210003
关键词:视听场景分类;自注意力机制;多模态学习;编码器;变分自编码器
基金:国家科技创新2030—“新一代人工智能”重大项目(2020AAA0106200)和国家自然科学基金(61936005,61872199,61872424)资助项目
为了解决多模态场景分类准确率不高的问题,文中提出一种由互编码器辅助视频的多模态场景分类方法。音频部分首先对输入音频数据进行特征提取并且使用自注意力机制取得关注信息,图像部分首先对视频进行分帧图片提取,然后通过ResNet50网络进行特征提取,随后提取到的双模态信息进入互编码器,互编码器通过提取各个模态隐层特征进行特征融合,融合后的新特征结合attention机制辅助视频特征。在该模型中,互编码器为融合特征的辅助系统。实验基于DCASE2021 Challenge Task 1B数据集进行验证,结果表明互编码器能够提升分类准确率。
来源:2023年第01期
《南京邮电大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。