国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:顾 正,徐新洲
单位:南京邮电大学 物联网学院,江苏 南京 210003南京邮电大学 物联网学院,江苏 南京 210003
关键词:音频分类;零样本学习;人工听觉描述子;预训练神经网络
基金:中国博士后科学基金(2022M711693)、国家自然科学基金青年基金(61801241,61902187)和国家自然科学基金(62071242,62172235)资助项目
音频分类使机器具有识别音频样本类别的功能,而与传统音频分类模型不同,零样本学习模型可以识别训练期间未出现的音频类别样本。但是,当前的零样本音频分类方法在做类间信息迁移时大多依靠类别标签文本语义信息的先验知识,而语义的先验知识包含大量与音频非相关的冗余信息,所导致的知识转移性能的局限性大大限制了零样本学习模型识别能力。基于此,文中提出将与音频信息高度相关的人工听觉描述子作为类间迁移信息,同时使用合成分类器,构建了零样本音频分类模型。在ESC 50数据集的实验中,与先前的工作相比较,基于人工听觉描述子的零样本音频分类具有更好的分类性能。
来源:2023年第05期
《南京邮电大学学报(自然科学版)》期刊编辑部