语音顶会 ICASSP 2022 成果分享:基于时频感知域模型的单通道语音增强算法

简介: 融合语音分布特性的 T-F attention (TFA) 模块

近日,阿里云视频云音频技术团队与新加坡国立大学李海洲教授团队合作论文 《基于时频感知域模型的单通道语音增强算法 》(Time-Frequency Attention for Monaural Speech Enhancement ) 被 ICASSP 2022 接收, 并受邀于今年 5 月在会议上向学术和工业界做研究报告。ICASSP(International Conference on Acoustics, Speech and Signal Processing)是全世界最大的,也是最全面的融合信号处理、统计学习、及无线通信的语音领域顶级会议。


七琦|作者


本次合作论文提出了融合语音分布特性的 T-F attention (TFA) 模块,可以在几乎不额外增加参数量的情况下显著提高语音增强的客观指标。


arxiv 链接:https://arxiv.org/abs/2111.07518


往期研究成果回顾:

INTERSPEECH 2021:《Temporal Convolutional Network with Frequency Dimension Adaptive Attention for Speech Enhancement》


链接:

https://www.isca-speech.org/archive/pdfs/interspeech_2021/zhang21b_interspeech.pdf


1.背景

语音增强算法旨在去除语音信号中的背景噪声等多余信号成分,它是许多语音处理应用的基本组件,例如在线视频会议与通话,智能短视频剪辑,实时视频直播,社交娱乐与在线教育等。


2.摘要

目前大多数关于语音增强的监督学习算法的研究中,通常没有在建模的过程中明确考虑时频域(T-F)表示中语音的能量分布,而其对于准确预测掩码或频谱至关重要。 在本文中,我们提出了一个简单而有效的 T-F 注意力(TFA)模块,使得在建模过程中可以显式引入对语音分布特性的先验思考。 为了验证我们提出的 TFA 模块的有效性,我们使用残差时序卷积神经网络(ResTCN)作为基础模型,并使用语音增强领域中两个常用的训练目标 IRM [1](The ideal ratio mask)和 PSM [2] (The phase-sensitive mask)分别进行了探索实验。 我们的实验结果表明,应用所提的 TFA 模块可以在几乎不额外增加参数量的情况下显著提高常用的五个客观评估指标,且 ResTCN+TFA 模型始终以较大的优势优于其他 baseline 模型。


3.方法解析

图 1 展示了所提 TFA 模块的网络结构,其中 TA 和 FA 模块分别以黑色和蓝色虚线框标识。AvgPool 和 Conv1D 分别为 average pooling 和 1-D convolution operation 的缩写。⊗ 和 ⊙ 分别表示矩阵乘法和元素级乘法。

image.png

图 1

TFA 模块以变换后的时频表示image.png为输入,利用两个独立的分支来分别进行 1-D time-frame attention mapimage.png和 1-D frequency-dimension attention map image.png 的生成,然后将其融合为最终需要的 2-D T-F attention map image.png ,最终的结果可以重写为:image.png  。


4.实验结果

训练误差曲线

图 2-3 显示了每个模型在 150 epoch 训练中产生的训练和验证集误差曲线。可以看出,与 ResTCN 相比,使用了所提出的 TFA(ResTCN+TFA)的 ResTCN 产生的训练和验证集误差显著降低,这证实了 TFA 模块的有效性。同时,与 ResTCN+SA 和 MHANet 相比,ResTCN+TFA 实现了最低的训练和验证集误差,并显示出明显的优势。在三个 baseline 模型中,MHANet 表现最好,ResTCN+SA 优于 ResTCN。此外,ResTCN、ResTCN+FA 和 ResTCN+TA 之间的比较证明了 TA 和 FA 模块的功效。

image.png

图 2 IRM 训练目标下的训练误差曲线


image.png

图 3 PSM 训练目标下的训练误差曲线


语音增强客观指标评估

我们使用了五个指标用于对增强性能的评估,包括 wideband perceptual evaluation of speech quality (PESQ) [3], extended short-time objective intelligibility (ESTOI) [4], 以及三个综合指标 [5], mean opinion score (MOS) predictors of the signal distortion (CSIG), background-noise intrusiveness (CBAK),  overall signal quality (COVL)。

image.png

image.png

表 1 和表 2 分别显示了每个信噪比等级下(含四个噪声源)的平均 PESQ 和 ESTOI 分数。评估结果表明,我们提出的 ResTCN+TFA 在 IRM 和 PSM 上的 PESQ 和 ESTOI 方面始终比 ResTCN 取得显著改进,且参数增量可以忽略不计,这证明了 TFA 模块的有效性。具体而言,在 5 dB 条件下,IRM 训练目标下的 ResTCN+TFA 相比baseline ResTCN来说,在 PESQ 指标上提高了 0.18,在 ESTOI 指标上提高了 4.94%。与 MHANet 和 ResTCN+SA 相比,ResTCN+TFA 在所有情况下都表现最好,并且表现出明显的性能优势。在三个 baseline 模型中,整体看下来效果排名是 MHANet > ResTCN+SA > ResTCN。同时,ResTCN+FA 和 ResTCN+TA 相比 ResTCN 也有了可观的改进,这进一步证实了 FA 和 TA 模块的有效性。

image.png

表 3 列出了所有测试条件下的平均 CSIG、CBAK 和 COVL 分数。与在表 1和表 2中观察到的趋势一致,所提的 ResTCN+TFA 在三个指标上显著优于 ResTCN,并且在所有模型中表现最好。具体而言,与 ResTCN 相比,PSM 训练目标下 ResTCN+TFA 的 CSIG 提高了 0.21,CBAK 提高了 0.12,COVL 提高了 0.18。


关于阿里云视频云音频技术团队

阿里云视频云音频技术团队,专注于采集播放-分析-处理-传输等全面的音频技术,服务于实时通信、直播、点播、媒体生产、媒体处理,长短视频等业务。通过神经网络与传统信号处理的结合,持续打磨业界领先的 3A 技术,深耕设备管理与适配、qos 技术,持续提升各场景下的直播、实时音频通信体验。


参考文献

[1] Y. Wang, A. Narayanan, and D. Wang, “On training targets for supervised speech separation,” IEEE/ACM Trans. Audio, speech, Lang. Process., vol. 22, no. 12, pp. 1849–1858, 2014.

[2] H. Erdogan, J. R. Hershey, S. Watanabe, and J. Le Roux, “Phase-sensitive and recognition-boosted speech separation using deep recurrent neural networks,” in Proc. ICASSP, 2015, pp. 708–712.

[3] R. I.-T. P. ITU, “862.2: Wideband extension to recommendation P. 862 for the assessment of wideband telephone networks and speech codecs. ITU-Telecommunicatio.

[4] J. Jensen and C. H. Taal, “An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,” IEEE/ACM Trans. Audio, speech, Lang. Process., vol. 24, no. 11, pp. 2009–2022, 2016.

[5] Y. Hu and P. C. Loizou, “Evaluation of objective quality measures for speech enhancement,” IEEE Trans. Audio, Speech, Lang. process., vol. 16, no. 1, pp. 229–238, 2007.


「视频云技术」你最值得关注的音视频技术公众号,每周推送来自阿里云一线的实践技术文章,在这里与音视频领域一流工程师交流切磋。公众号后台回复【技术】可加入阿里云视频云产品技术交流群,和业内大咖一起探讨音视频技术,获取更多行业最新信息。

相关文章
|
5天前
|
算法 数据可视化 数据挖掘
算法金 | 一个强大的算法模型:t-SNE !!
**t-SNE算法简介** t-SNE(t-Distributed Stochastic Neighbor Embedding)是一种非线性降维技术,用于高维数据的可视化和结构保留。它通过保持高维数据点间的局部相似性来创建低维表示,尤其适用于揭示复杂数据集的模式。算法的关键在于使用高斯分布计算高维相似性,而用t分布计算低维相似性,并通过最小化Kullback-Leibler散度来优化低维空间的位置。t-SNE在图像、文本和生物信息学等领域有广泛应用,但计算复杂度高,不适合大规模数据。
21 6
算法金 | 一个强大的算法模型:t-SNE !!
|
10天前
|
机器学习/深度学习 存储 人工智能
算法金 | 一个强大的算法模型,GP !!
高斯过程是一种非参数机器学习方法,利用高斯分布描述数据,并通过核函数衡量相似性。它在小样本和不确定性估计上有优势,常用于回归、分类和优化。高斯过程基于函数分布,通过核函数(如线性、RBF、多项式)捕捉数据关系。与传统方法相比,它在处理不确定性和非线性问题时更具灵活性。虽然计算复杂度高、内存需求大,但通过稀疏高斯过程等方法可改善。高斯过程还可扩展到非平稳和多任务场景。本文通过代码示例展示了高斯过程在战斗胜率预测中的应用。
36 11
算法金 | 一个强大的算法模型,GP !!
|
8天前
|
机器学习/深度学习 数据采集 监控
算法金 | 选择最佳机器学习模型的 10 步指南
许多刚入门的学习者也面临着相似的挑战,特别是在项目启动初期的方向确定和结构规划上。本文意在提供一份全面指南,助你以正确的方法开展项目。 遵循本文提供的每一步至关重要(虽有少数例外)。就像不做饭或点餐就无法享用美食一样,不亲自动手构建模型,就无法实现模型部署。
34 7
算法金 | 选择最佳机器学习模型的 10 步指南
|
11天前
|
数据采集 机器学习/深度学习 人工智能
算法金 | 一个强大的算法模型,多项式回归!!
```markdown # 多项式回归简述 - 多项式回归是线性回归扩展,用于处理非线性关系。 - 通过添加高次项来拟合复杂模式,但可能引发过拟合。 - 示例中展示了如何用Python创建模拟数据,使用`PolynomialFeatures`生成多项式特征,训练线性回归模型并可视化结果。 - 优点:灵活捕捉非线性关系,易于理解。 - 缺点:易过拟合,计算复杂度高。 - 相关概念:正则化(岭回归、Lasso回归)及其他非线性模型(如支持向量回归)。 - 注意事项:选择合适阶数,避免过拟合,重视数据预处理和模型评估。 ```
22 0
算法金 | 一个强大的算法模型,多项式回归!!
|
3天前
|
机器学习/深度学习 算法 语音技术
基于语音信号MFCC特征提取和GRNN神经网络的人员身份检测算法matlab仿真
**语音识别算法概览** MATLAB2022a中实现,结合MFCC与GRNN技术进行说话人身份检测。MFCC利用人耳感知特性提取语音频谱特征,GRNN作为非线性映射工具,擅长序列学习,确保高效识别。预加重、分帧、加窗、FFT、滤波器组、IDCT构成MFCC步骤,GRNN以其快速学习与鲁棒性处理不稳定数据。适用于多种领域。
|
5天前
|
机器学习/深度学习 算法 搜索推荐
【机器学习】近邻类模型:KNN算法在数据科学中的实践与探索
【机器学习】近邻类模型:KNN算法在数据科学中的实践与探索
24 0
|
11天前
|
机器学习/深度学习 人工智能 自然语言处理
让非算法同学也能了解 ChatGPT 等相关大模型
让非算法同学也能了解 ChatGPT 等相关大模型
|
1天前
|
机器学习/深度学习 算法
基于鲸鱼优化的knn分类特征选择算法matlab仿真
**基于WOA的KNN特征选择算法摘要** 该研究提出了一种融合鲸鱼优化算法(WOA)与K近邻(KNN)分类器的特征选择方法,旨在提升KNN的分类精度。在MATLAB2022a中实现,WOA负责优化特征子集,通过模拟鲸鱼捕食行为的螺旋式和包围策略搜索最佳特征。KNN则用于评估特征子集的性能。算法流程包括WOA参数初始化、特征二进制编码、适应度函数定义(以分类准确率为基准)、WOA迭代搜索及最优解输出。该方法有效地结合了启发式搜索与机器学习,优化特征选择,提高分类性能。
|
2天前
|
机器学习/深度学习 算法 数据可视化
基于BP神经网络的64QAM解调算法matlab性能仿真
**算法预览图省略** MATLAB 2022A版中,运用BP神经网络进行64QAM解调。64QAM通过6比特映射至64复数符号,提高数据速率。BP网络作为非线性解调器,学习失真信号到比特的映射,对抗信道噪声和多径效应。网络在处理非线性失真和复杂情况时展现高适应性和鲁棒性。核心代码部分未显示。
|
4天前
|
机器学习/深度学习 算法 数据可视化
m基于PSO-LSTM粒子群优化长短记忆网络的电力负荷数据预测算法matlab仿真
在MATLAB 2022a中,应用PSO优化的LSTM模型提升了电力负荷预测效果。优化前预测波动大,优化后预测更稳定。PSO借鉴群体智能,寻找LSTM超参数(如学习率、隐藏层大小)的最优组合,以最小化误差。LSTM通过门控机制处理序列数据。代码显示了模型训练、预测及误差可视化过程。经过优化,模型性能得到改善。
21 6