《计算机应用研究》|Application Research of Computers

基于多分辨率特征和时频注意力的环境声音分类

Environmental sound classification based on multi-resolution features and time-frequency attention

免费全文下载 (已被下载 次)  
获取PDF全文
作者 刘慧,李小霞,何宏森
机构 西南科技大学 信息工程学院;特殊环境机器人技术四川省重点实验室(西南科技大学)
统计 摘要被查看 次,已被下载
摘要 环境声音分类(ESC)是声音信号处理领域中一个重要且具有挑战性的课题。针对该任务,提出了一种基于多分辨率特征和时频注意力的卷积神经网络环境声音分类方法。首先,相较单一分辨率的谱图,多通道多分辨率特征可以丰富特征信息,实现不同特征分辨率之间信息互补,增强特征的表达能力。其次,针对声信号提出了一种时频注意力模块,该模块先利用不同大小的一维卷积分别关注时域和频域有效信息,再用二维卷积将两者进行融合,从而抑制环境声中背景噪声并消除由多通道多分辨率带来的冗余信息干扰。实验结果表明,在ESC-10和ESC-50两个基准数据集上的分类准确率达到了98.50%和88.46%,与现有的最新方法相比分别提高了2.70%和0.76%。
关键词 环境声音分类;卷积神经网络;时频注意力;多通道;多分辨率
基金项目 国家自然科学基金资助项目(62071399)
本文URL http://www.arocmag.com/article/02-2021-12-030.html
收稿日期
修回日期
页码 -
中图分类号 TP391.42
文献标志码