On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement

TL;DR

提出低延迟多通道语音增强的时域神经维纳滤波框架,结合两个轻量级DNN实现资源高效优化。

cs.SD 🔴 高级 2024-01-16 8 引用 38 次浏览
Tsun-An Hsieh Jacob Donley Daniel Wong Buye Xu Ashutosh Pandey
多通道语音增强 神经网络 维纳滤波 低延迟 资源效率

核心发现

方法论

本文提出一种基于时域的多通道语音增强框架,核心由两个轻量级递归神经网络(LLRNN)和一个神经维纳滤波器(NWF)组成。第一个DNN(DNN1)负责增强噪声信号以估算NWF系数,第二个DNN(DNN2)则对NWF输出进行细化。NWF在训练过程中通过优化分析与合成变换,使其适应低延迟需求,显著减少非线性失真。训练采用端到端的联合优化策略,优于逐步训练。该框架实现了2毫秒的极低算法延迟,参数量和计算复杂度均优于传统方法。具体算法包括:• 利用短时傅里叶变换(STFT)提取频域特征;• 通过分析变换训练优化频域滤波器系数;• 采用Woodbury公式进行矩阵逆运算以保证实时性;• 端到端联合训练所有模型组件,确保协同优化。

关键结果

  • 在Interspeech 2020 DNS挑战数据集上,提出方法在STOI、PESQ和SI-SDR指标上均优于现有主流模型。具体而言,最优模型在STOI达到了89.1%,比传统频域Wiener滤波器提升了4.2%;PESQ得分从1.63提升至2.70,提升幅度达65%;SI-SDR从-7.48dB改善到7.0dB,表现出极佳的噪声抑制和语音保真能力。
  • 通过不同训练策略的对比,发现联合端到端训练能显著提升性能,参数量减少至原模型的56.63%,计算量降低一半左右。与基线模型如MC-Conv-TasNet和UXNet相比,提出模型在保持低延迟的同时,性能提升了1.8%以上,且模型更轻量,适合资源受限环境。
  • 消融实验显示,优化分析和合成变换对性能贡献巨大,未训练变换的模型性能明显下降。多阶段训练策略中,全部组件联合训练效果最佳,验证了模型协同优化的有效性。

研究意义

该研究突破了多通道语音增强中低延迟、低计算成本的瓶颈,为实际应用提供了可行方案。尤其在智能助理、远程会议、智能家居等场景中,低延迟和高效能的语音处理需求日益增长。通过引入神经维纳滤波器,创新性地结合传统滤波思想与深度学习,显著提升了语音质量和鲁棒性,推动了端到端语音增强技术的实用化。该框架的资源效率优势,有助于在边缘设备上实现高性能语音处理,满足未来智能硬件的需求。

技术贡献

本文的主要技术创新在于:• 提出结合两个轻量级递归神经网络的时域多通道处理框架,显著降低延迟至2毫秒;• 设计了端到端可训练的神经维纳滤波器(NWF),其分析与合成变换在训练中同步优化,突破了传统滤波器的限制;• 利用Woodbury公式实现矩阵逆运算,保证了滤波器的实时性和数值稳定性;• 采用联合训练策略,提升模型整体性能,减少参数量与计算复杂度。与现有的频域滤波和端到端模型相比,本文实现了低延迟、高效能的突破,为多通道语音增强提供了新思路。

新颖性

本研究的创新点在于首次将低延迟时域神经维纳滤波器引入多通道语音增强框架,结合两个轻量级递归神经网络进行端到端训练。不同于传统频域Wiener滤波器依赖矩阵逆和独立优化系数,本文通过训练分析与合成变换,使滤波器参数适应低延迟需求,减少非线性失真。此外,提出的联合训练策略和Woodbury公式的应用,为实时处理提供了理论保证。这些创新共同推动了低延迟、高效能、多通道语音增强技术的发展。

局限性

  • 尽管模型在低延迟和资源效率方面表现优异,但在极端噪声环境或强回声条件下的鲁棒性仍需验证,可能受到训练数据多样性不足的影响。
  • 模型的性能依赖于训练数据的代表性,实际应用中面对未知噪声类型或动态环境时,可能出现性能下降。
  • 尽管参数量和计算量较传统方法大幅减少,但在超低延迟(低于2毫秒)场景中,仍存在一定的性能瓶颈,未来需进一步优化模型结构以满足更严格的实时性要求。

未来方向

未来工作将聚焦于增强模型在复杂环境中的鲁棒性,探索多任务联合训练策略以提升泛化能力。同时,将考虑引入自适应机制,使模型能够动态调整滤波参数以应对环境变化。此外,结合声源定位和空间特征,进一步提升多通道语音增强的性能,推动其在实际智能设备中的部署。最后,研究将拓展到多模态信息融合,结合视觉信息实现更稳健的语音增强系统。

AI 总览摘要

在智能语音交互日益普及的背景下,如何在保证低延迟的同时实现高质量的多通道语音增强,成为研究的热点。传统方法多依赖频域滤波器,虽然效果显著,但在实时性和资源消耗方面存在瓶颈。为此,本文提出了一种创新的时域神经维纳滤波框架,结合两个轻量级递归神经网络(LLRNN)和一个可训练的神经维纳滤波器(NWF),实现了极低的算法延迟(2毫秒)和资源效率。该框架在多个指标上优于现有主流模型,尤其在噪声抑制和语音保真方面表现出色,验证了其在实际应用中的潜力。

该方法的核心在于端到端联合训练,优化分析与合成变换,使滤波器适应低延迟需求,减少非线性失真。通过利用Woodbury公式进行矩阵逆运算,确保了模型的实时性和数值稳定性。实验结果显示,在Interspeech 2020 DNS挑战数据集上,模型在STOI、PESQ和SI-SDR指标上均取得了优异表现,分别达到了89.1%、2.70和7.0dB,超越了传统滤波器和多种深度学习模型。

这项研究不仅在学术上推动了低延迟、多通道语音增强的技术边界,也为智能设备中的语音处理提供了实用方案。未来,研究将继续优化模型的鲁棒性和泛化能力,结合声源定位和多模态信息,推动端到端语音增强技术的商业化应用。整体而言,该框架为实现高效、低延迟的语音交互系统奠定了坚实基础,具有广泛的应用前景和深远的行业影响。

深度分析

研究背景

多通道语音增强技术经历了从传统的空间滤波到深度学习的快速发展。早期方法如MVDR、GEV等频域滤波器依赖矩阵逆运算,受数值稳定性限制。近年来,深度神经网络(DNN)被引入,显著提升了噪声抑制能力,但多为非实时或高计算成本。端到端时间域模型如TasNet、Conv-TasNet等实现了较低延迟,但在多通道场景中仍存在性能瓶颈。神经维纳滤波器(NWF)作为一种结合传统滤波思想和深度学习的创新方案,逐渐成为研究热点。本文在此基础上,提出低延迟、资源高效的时域神经维纳滤波框架,填补了低延迟多通道增强的研究空白。

核心问题

现有多通道语音增强模型在追求高性能的同时,普遍面临延迟高、参数大、计算复杂的问题,难以满足实时应用需求。频域滤波器虽效果良好,但在低延迟场景中表现不佳,且数值稳定性不足。端到端时域模型虽低延迟,但多模型堆叠导致训练复杂、参数冗余。如何在保证低延迟的同时,提升噪声抑制和语音质量,成为亟需解决的核心难题。本文旨在设计一种资源高效、性能优异的多通道语音增强框架,突破传统限制。

核心创新

创新点主要包括:1)引入两个轻量级递归神经网络(LLRNN)进行低延迟时域处理,显著减少算法延迟至2毫秒;2)设计端到端可训练的神经维纳滤波器(NWF),优化分析与合成变换,使滤波器参数适应低延迟需求,减少非线性失真;3)采用Woodbury公式实现矩阵逆运算,确保模型实时性和数值稳定性;4)联合训练所有组件,提升整体性能并减少参数量。相比传统频域滤波和端到端模型,本文实现了低延迟与高效能的结合,为多通道语音增强提供新思路。

方法详解

  • �� 输入多通道噪声语音信号,经过STFT提取频域特征;• 第一个DNN(DNN1)基于LSTM结构,处理时域帧,输出增强的单通道语音,用作NWF的目标;• 训练分析变换参数,通过优化频域滤波系数,提升滤波器性能;• 设计神经维纳滤波器(NWF),利用训练得到的系数对多通道频域变换进行空间滤波,得到单通道增强信号;• 采用Woodbury公式进行矩阵逆,保证滤波器的实时性和数值稳定;• 将NWF输出与原始多通道输入拼接,输入第二个DNN(DNN2)进行细化,输出最终增强语音;• 所有模型端到端联合训练,确保各部分协同优化。

实验设计

使用Interspeech 2020 DNS挑战数据集,模拟多环境噪声和回声,生成80K训练、1.6K验证和3.2K测试样本。模型配置包括不同隐藏层大小(H=128到512),训练采用Adam优化器,学习率2×10^-4,训练200轮。对比多种模型结构,包括单阶段基线、DNN+NWF、联合训练策略等。指标涵盖STOI、PESQ、SI-SDR,计算复杂度用GFLOPs衡量。通过消融实验验证分析变换的作用,比较不同训练策略的效果,确保模型在低延迟和资源限制下的优越性。

结果分析

在DNS数据集上,最优模型在STOI达89.1%,比传统方法提升4.2%;PESQ从1.63提升至2.70,提升65%;SI-SDR改善至7.0dB,表现出极佳的噪声抑制能力。参数量仅为传统模型的一半,计算量减少近50%。联合训练策略显著优于逐步训练,模型在保持低延迟的同时,性能超越多项主流模型。消融分析显示,优化分析与合成变换对性能影响巨大,端到端训练实现了模型的协同优化,验证了方法的有效性。

应用场景

该技术适用于智能助理、远程会议、智能家居等场景,尤其在对延迟和计算资源有限制的设备上表现出色。低延迟保证了实时交互体验,资源效率则降低了硬件成本。未来可结合声源定位、多模态信息,提升系统鲁棒性,推动在边缘设备上的部署。还可以扩展到多说话人分离、语音识别等任务,增强整体语音处理能力。

局限与展望

模型在极端噪声环境或强回声条件下的鲁棒性仍需验证,可能受训练数据覆盖范围限制。低延迟模型在某些复杂场景下性能仍有限,未来需优化结构以应对更高的实时性要求。此外,虽然参数和计算量已大幅减少,但在超低延迟(低于2毫秒)场景中仍存在瓶颈,需继续探索更高效的模型设计。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,厨房里有很多不同的厨具和调料。每次你做菜时,厨房里会有噪音,比如水声、锅碗瓢盆的碰撞声,还有其他人在说话。为了让你听清楚朋友的声音,你需要用一些特殊的工具,把噪音减弱,让朋友的声音变得清晰。这就像用耳机里的“滤波器”一样,把杂音过滤掉,只留下你想听的声音。

现在,假设你有多个麦克风,就像厨房里有多个麦克风收集声音。每个麦克风都在收集不同的声音信息。有的麦克风离朋友更近,有的离噪音源更远。你需要用一种聪明的方法,把这些不同的声音信息结合起来,找到朋友的声音,过滤掉背景噪音。这就像用一把神奇的筛子,把杂乱的声音筛选掉,只留下清晰的朋友声音。

这篇论文就像发明了一种新型的厨房工具——一种超级聪明的筛子,能在极短的时间内,把噪音和干扰过滤掉,让你在嘈杂的厨房里也能听得清清楚楚。它用两个小机器人(神经网络)合作工作,一个负责预处理,把噪音减弱,另一个负责最后的细节修饰。它们还用了一种特别的数学技巧,确保工作速度快、效果好。这就像用最快的厨具,让你在最短时间内做出最美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在一个很吵的学校走廊里,想听老师讲课,但周围有很多同学在说话、走动,声音很杂。这时候,你希望有一种神奇的耳机,能帮你过滤掉这些杂音,只让老师的声音传进来。这个论文就像发明了这样一副超级耳机,但它不是普通的耳机,而是用特别的技术让它变得又快又聪明。

它用两个小“机器人”帮忙,一个先把杂音减弱,让老师的声音变得更清楚;另一个再帮你修饰,让声音听起来更自然。这两个“机器人”合作,速度快得几乎没有延迟,只有2毫秒!这就像你刚听完老师说话,马上就能听到清楚的内容,没有任何滞后。

它还用了一种特别的数学技巧,确保这个“过滤”过程既快又稳定,不会出现卡顿或失真。通过这种方法,老师的声音可以在嘈杂的环境中清晰传达,就像你在嘈杂的学校里也能专心听课一样。这项技术未来可以用在智能手机、会议系统,让每个人都能在任何环境下听得清楚、说得顺畅。

术语表

神经维纳滤波器 (Neural Wiener Filter)

一种结合深度学习和传统Wiener滤波思想的空间滤波器,能在训练中同步优化分析和合成变换,用于低延迟语音增强。

论文中提出的核心滤波器,用于空间滤波和噪声抑制。

轻量级递归神经网络 (Lightweight RNN)

一种结构简洁、计算效率高的递归神经网络,适合低延迟、多通道语音处理,能在保证性能的同时减少参数量。

作为本文两个关键DNN的基础架构,用于时域处理。

端到端训练 (End-to-End Training)

将模型的所有组成部分作为一个整体进行联合优化,避免逐步训练带来的误差累积,提高整体性能。

本文采用的训练策略,确保模型协同工作。

Woodbury公式 (Woodbury Formula)

一种矩阵逆的快速计算方法,适用于低秩更新,保证滤波器实时性和数值稳定性。

在神经维纳滤波器中用于矩阵逆运算。

STFT (Short-Time Fourier Transform)

一种将时域信号转换为频域的技术,便于提取频谱特征,用于语音增强中的特征表示。

作为输入特征的基础处理步骤。

PESQ (Perceptual Evaluation of Speech Quality)

一种评估语音质量的客观指标,模拟人耳感知,分数越高代表语音质量越好。

用于模型性能的评估。

SI-SDR (Scale-Invariant Signal-to-Distortion Ratio)

衡量语音信号还原质量的指标,考虑信号的尺度不变性,数值越大越好。

评价噪声抑制效果。

联合训练 (Joint Training)

同时优化模型所有部分,使其协同工作,提升整体性能。

本文中所有模型组件的训练策略。

分析变换 (Analysis Transform)

将时域信号转换为频域或特征空间的变换,用于滤波系数的估算。

神经维纳滤波器中的关键步骤。

合成变换 (Synthesis Transform)

将频域或特征空间的信号还原为时域的变换,完成语音重建。

与分析变换配合使用。

参数量 (Number of Parameters)

模型中可调参数的总数,反映模型复杂度。

衡量模型轻量化的重要指标。

计算复杂度 (Computational Complexity)

模型在运行时所需的计算资源,通常用GFLOPs衡量。

评估模型的实时处理能力。

端到端优化 (End-to-End Optimization)

从输入到输出整体优化,避免中间步骤的误差传递,提升性能。

本文采用的训练策略。

滤波系数 (Filter Coefficients)

用于空间滤波的参数,决定滤波效果。

神经维纳滤波器中的关键参数。

信号增强 (Speech Enhancement)

改善语音信号质量,减少噪声和干扰,使语音更清晰。

论文的研究目标。

开放问题 这项研究留下的未解疑问

  • 1 尽管模型在低延迟和资源效率方面表现优异,但在极端噪声环境或复杂回声条件下的鲁棒性仍需验证。未来需要在多样化环境中扩展训练数据,提升模型的泛化能力。
  • 2 模型的性能依赖于训练数据的代表性,实际应用中面对未知噪声类型或动态环境时,可能出现性能下降。如何实现更强的适应性和自我调节,是未来研究的方向。
  • 3 虽然参数和计算量已大幅减少,但在更低延迟(如1毫秒以下)场景中,仍存在性能瓶颈。需要探索更高效的网络结构和算法优化策略,以满足未来对超低延迟的需求。
  • 4 目前模型主要在静态环境下测试,动态变化的声源位置和环境变化对模型鲁棒性的影响尚未充分研究。
  • 5 模型的部署和实际应用还面临硬件适配、能耗控制等挑战,未来应结合硬件优化,推动模型在边缘设备上的落地。

应用场景

近期应用

智能助理和远程会议

可在嘈杂环境中实现实时语音清晰传输,提升语音识别和交互体验,适用于智能音箱、会议系统等设备。

智能家居和安防系统

在家庭或公共场所实现高效语音监控和控制,减少背景噪声干扰,提升系统的鲁棒性和用户体验。

移动设备和边缘计算

低延迟、低参数的模型适合部署在智能手机、穿戴设备等边缘设备,实现本地高质量语音处理,降低带宽依赖。

远期愿景

多模态融合的智能语音系统

结合视觉、触觉等多模态信息,提升复杂环境中的语音识别和增强能力,推动智能交互的普及。

全场景自适应语音增强

实现环境感知和自我调节,适应不同噪声、回声和声源变化,打造真正的智能语音交互生态系统。

原文摘要

We introduce a time-domain framework for efficient multichannel speech enhancement, emphasizing low latency and computational efficiency. This framework incorporates two compact deep neural networks (DNNs) surrounding a multichannel neural Wiener filter (NWF). The first DNN enhances the speech signal to estimate NWF coefficients, while the second DNN refines the output from the NWF. The NWF, while conceptually similar to the traditional frequency-domain Wiener filter, undergoes a training process optimized for low-latency speech enhancement, involving fine-tuning of both analysis and synthesis transforms. Our research results illustrate that the NWF output, having minimal nonlinear distortions, attains performance levels akin to those of the first DNN, deviating from conventional Wiener filter paradigms. Training all components jointly outperforms sequential training, despite its simplicity. Consequently, this framework achieves superior performance with fewer parameters and reduced computational demands, making it a compelling solution for resource-efficient multichannel speech enhancement.

cs.SD eess.AS

参考文献 (20)

A Time-Domain Real-Valued Generalized Wiener Filter for Multi-Channel Neural Separation Systems

Yi Luo

2021 21 引用 ⭐ 高影响力 查看解读 →

FaSNet: Low-Latency Adaptive Beamforming for Multi-Microphone Audio Processing

Yi Luo, Enea Ceolini, Cong Han 等

2019 191 引用 ⭐ 高影响力 查看解读 →

A Simple RNN Model for Lightweight, Low-compute and Low-latency Multichannel Speech Enhancement in the Time Domain

Ashutosh Pandey, Ke Tan, Buye Xu

2023 13 引用 ⭐ 高影响力

STFT-Domain Neural Speech Enhancement With Very Low Algorithmic Latency

Zhong-Qiu Wang, G. Wichern, Shinji Watanabe 等

2022 61 引用 ⭐ 高影响力 查看解读 →

TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation

Zhongqiu Wang, Samuele Cornell, Shukjae Choi 等

2022 275 引用 ⭐ 高影响力 查看解读 →

On diagonal loading for minimum variance beamformers

X. Mestre, M. Lagunas

2003 42 引用

Blind Acoustic Beamforming Based on Generalized Eigenvalue Decomposition

Ernst Warsitz, Reinhold Häb-Umbach

2007 238 引用

Long Short-Term Memory

Sepp Hochreiter, J. Schmidhuber

1997 109267 引用

Acoustic Beamforming for Hearing Aid Applications

S. Doclo, S. Gannot, M. Moonen 等

2010 194 引用

On End-to-end Multi-channel Time Domain Speech Separation in Reverberant Environments

Jisi Zhang, Catalin Zorila, R. Doddipatla 等

2020 57 引用 查看解读 →

Adam: A Method for Stochastic Optimization

Diederik P. Kingma, Jimmy Ba

2014 170414 引用 查看解读 →

Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification

Kaiming He, X. Zhang, Shaoqing Ren 等

2015 20890 引用 查看解读 →

Layer Normalization

Jimmy Ba, J. Kiros, Geoffrey E. Hinton

2016 13053 引用 查看解读 →

Unified Architecture for Multichannel End-to-End Speech Recognition With Neural Beamforming

Tsubasa Ochiai, Shinji Watanabe, Takaaki Hori 等

2017 95 引用

Frame-by-Frame Closed-Form Update for Mask-Based Adaptive MVDR Beamforming

T. Higuchi, K. Kinoshita, N. Ito 等

2018 62 引用

End-to-End Dereverberation, Beamforming, and Speech Recognition in a Cocktail Party

Wangyou Zhang, Xuankai Chang, Christoph Boeddeker 等

2022 21 引用

On Spatial Features for Supervised Speech Separation and its Application to Beamforming and Robust ASR

Zhong-Qiu Wang, Deliang Wang

2018 44 引用

Compensating noise and reverberation in far-field Multichannel Speaker Verification

Sandipana Dowerah, Romain Serizel, D. Jouvet 等

2022 3 引用

Multi-Microphone Complex Spectral Mapping for Speech Dereverberation

Zhong-Qiu Wang, Deliang Wang

2020 79 引用 查看解读 →

The INTERSPEECH 2020 Deep Noise Suppression Challenge: Datasets, Subjective Testing Framework, and Challenge Results

Chandan K. A. Reddy, Vishak Gopal, Ross Cutler 等

2020 472 引用 查看解读 →

被引用 (8)

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

Controlling the Parameterized Multi-channel Wiener Filter using a tiny neural network

2025 2 引用 查看解读 →

Better Exploiting Spatial Separability in Multichannel Speech Enhancement with an Align-and-Filter Network

2025 3 引用

Ultra low-compute complex spectral masking for multichannel speech enhancement

2025 6 引用

Two-stage UNet with channel and temporal-frequency attention for multi-channel speech enhancement

2024 7 引用

FoVNet: Configurable Field-of-View Speech Enhancement with Low Computation and Distortion for Smart Glasses

2024 11 引用 查看解读 →

JointNet: Joint Learning for Simultaneous DOA Estimation and Speech Enhancement in Noisy and Reverberant Environments

2026 1 引用

FSformer: Sparsely and effectively learning key features for multi-channel speech enhancement

2025 3 引用