Real-Time Target Sound Extraction

TL;DR

Waveformer采用扩张因果卷积和Transformer,实时提取目标声源,提升SI-SNRi达3.3dB。

cs.SD 🔴 高级 2022-11-04 49 次浏览
Bandhav Veluri Justin Chan Malek Itani Tuochao Chen Takuya Yoshioka Shyamnath Gollakota
声源分离 实时处理 深度学习 Transformer 音频信号

核心发现

方法论

本文提出Waveformer架构,结合扩张因果卷积(DCC)作为编码器,有效扩大感受野,降低计算复杂度,同时利用Transformer解码器实现目标声源的掩码估计。模型输入为小块音频,通过多层DCC提取上下文特征,再由Transformer解码器在有限的lookahead下生成掩码。训练采用SI-SNRi作为优化目标,模型参数显著减少(1.2-4倍),推理速度快(RTF 0.66-0.94),在多个数据集上优于现有非流模型。

关键结果

  • 在单目标提取任务中,Waveformer在SI-SNRi上比ReSepformer提升2.2-3.3dB,模型参数减少至1.1-3.9M,推理速度提升1.5-2倍,达到实时性能。
  • 多目标提取中,模型在2-3个目标类别上平均提升1.2-1.4dB,表现优于Conv-TasNet和ReSepformer,特别在多声源环境中表现稳定。
  • 模型在不同编码维度(E=256/512,D=128/256)下均表现优异,参数与速度的折中效果明显,验证了架构的灵活性与高效性。

研究意义

该研究突破了目标声源提取的实时流处理瓶颈,为智能耳机、听力辅助设备等应用提供技术基础。通过引入混合架构,有效兼顾感受野和计算效率,推动深度学习在音频实时处理中的应用前沿。模型在提升声源提取质量的同时,显著降低了硬件资源需求,具有广泛的工业推广潜力。

技术贡献

创新点在于将扩张因果卷积与Transformer结合,提出流式的掩码估计机制,解决传统Transformer在大感受野下的高计算负担。模型采用多层DCC实现感受野指数级扩展,结合Transformer的注意力机制实现目标相关性建模,显著提升性能与效率。此架构为实时音频处理提供了新思路,兼具高性能与低延迟。

新颖性

本研究首次实现了基于混合扩张因果卷积和Transformer的流式目标声源提取架构,突破了以往非流模型的限制。区别于传统纯卷积或Transformer方法,结合两者优势,解决大感受野与实时性矛盾,开创了音频流处理新范式。

局限性

  • 模型在极端噪声环境或多声源重叠严重时仍存在性能下降,主要由于掩码估计的困难。
  • 当前模型主要在单麦克风数据上验证,多麦克风阵列或空间信息利用尚未充分探索。
  • 对超高采样率(如96kHz)或长时段连续音频的处理能力有限,未来需优化模型结构以适应更复杂场景。

未来方向

未来将探索多麦克风阵列信息融合,提升空间定位能力;同时,扩大数据集规模,增加多样性和复杂度,提升模型泛化能力。还计划优化模型结构以降低延迟,适应更高采样率和长时段连续音频处理,推动其在实际应用中的部署。

AI 总览摘要

声源提取在多声环境中一直是音频信号处理的核心难题。传统方法多依赖离线处理,难以满足实时应用需求。本文提出Waveformer,一种结合扩张因果卷积(DCC)与Transformer的混合架构,专为流式目标声源提取设计。其核心思想在于利用DCC高效扩大感受野,降低计算复杂度,同时借助Transformer的注意力机制实现目标声源的精准掩码估计。

该架构在多个公开数据集上经过验证,显示出显著优于现有非流模型的性能提升,SI-SNRi达3.3dB,模型参数减少至1.1-3.9M,推理速度达实时要求(RTF 0.66-0.94)。此外,模型在多目标提取任务中表现稳定,提升1.2-1.4dB,展现出强大的多声源处理能力。

这项工作不仅在技术上实现了突破,也为智能耳机、听力辅助等场景提供了实用解决方案。未来,作者计划结合空间信息,扩展多麦克风阵列应用,并优化模型以适应更复杂环境和更高采样率,推动目标声源提取的工业化落地。

深度分析

研究背景

声源分离技术经历了从盲源分离到目标声源提取的演变。早期方法如ICA和非负矩阵分解(NMF)在静态场景中取得一定效果,但难以应对复杂、多声源环境。近年来,深度学习模型如Conv-TasNet、Transformer在单声道语音分离中表现优异,推动了端到端学习的发展。特别是,基于注意力机制的模型在捕获长距离依赖方面表现出色。然而,实时性和多声源处理仍是挑战,尤其在有限计算资源下实现高质量提取。此前研究多集中在离线处理,缺乏适应流式场景的架构。

核心问题

核心问题在于如何在保证低延迟的同时,提升多声源环境下的提取质量。传统模型多依赖大块音频输入,导致延迟高、计算量大,不适合实时应用。现有流式模型在感受野和效率之间难以兼顾,尤其在高采样率下性能下降明显。此外,模型难以在多目标、多类别场景中保持稳定性和鲁棒性。这些限制阻碍了目标声源提取在实际设备中的部署。

核心创新

本研究提出Waveformer架构,创新点包括:1)采用多层扩张因果卷积(DCC)作为编码器,有效扩大感受野,降低复杂度,支持流式处理;2)引入Transformer解码器,通过注意力机制实现目标相关性建模,提升掩码估计精度;3)结合两者优势,设计低延迟(约1.45ms)且高效的流式模型。该架构突破了传统单一模型在感受野和实时性上的限制,为音频流处理提供新思路。

方法详解

  • �� 输入:短时音频块(如44.1kHz采样率下的32样本块)
  • �� 编码:多层扩张因果卷积(DCC)提取上下文特征,感受野指数级扩展,参数较少
  • �� 掩码生成:利用Transformer解码器在有限lookahead(仅前后各一块)条件下,结合目标标签(one-hot或multi-hot)生成掩码
  • �� 目标重建:掩码与编码特征相乘,通过反卷积还原目标声源
  • �� 训练:采用SI-SNRi作为损失函数,优化模型参数
  • �� 流式处理:每次处理一个块,动态更新上下文缓冲区,确保低延迟
  • �� 评估:在多个公开数据集上测试,比较参数量、推理速度和信噪比提升

实验设计

采用FSD Kaggle 2018和TAU Urban Acoustic Scenes 2019合成数据集,生成包含多类别声源的混合音频。模型参数在不同配置(E=256/512,D=128/256)下训练,基线为Conv-TasNet和ReSepformer。指标包括SI-SNRi、模型参数、RTF。训练采用90%信噪比和10%SI-SNR的复合损失,训练100轮,验证最佳模型。模型在单目标和多目标任务中均表现优异,参数少、速度快,满足实时需求。

结果分析

在单目标提取中,Waveformer在SI-SNRi上比ReSepformer提升2.2-3.3dB,模型参数减少至1.1-3.9M,推理RTF达0.66-0.94,优于传统模型。多目标任务中,提升1.2-1.4dB,表现出良好的多声源处理能力。不同配置的模型均验证了架构的灵活性和高效性,特别是在高采样率和多类别环境下表现稳定。

应用场景

该技术适用于智能耳机、助听器、远程会议系统等场景,能实时过滤环境噪声,提取用户关注的声音。只需少量硬件资源,即可实现高质量的声源提取,为个人化音频体验提供技术支撑。未来还可结合空间信息,拓展多麦克风阵列应用,提升空间定位和分离能力。

局限与展望

模型在极端噪声或多声源重叠严重时性能下降,且主要在单麦克风环境下验证。对超高采样率(如96kHz)或长时段连续音频的适应性有限。未来需优化模型结构,降低延迟,增强鲁棒性,扩展多麦克风和复杂场景的应用能力。

通俗解读 非专业人士也能看懂

想象你在一个繁忙的厨房里,很多人在同时做饭,声音交织在一起。你想专注听某个朋友说话,但其他声音像锅碗瓢盆的碰撞声一样吵。传统的方法就像用耳朵去听,慢慢分辨每个声音,但很费时间。现在,科学家设计了一台特别的“耳机助手”,它能在你说话时,快速识别出你想听的声音,把其他声音过滤掉。它就像一个聪明的厨师,知道每个声音的特点,迅速找到目标声音,把它放大,让你听得清清楚楚。这种新技术用数学和计算机算法,让机器像人一样聪明,能在瞬间帮你筛选出想要的声音,应用在手机、助听器等设备上,让我们的生活变得更方便、更智能。

简单解释 像给14岁少年讲一样

想象你在学校的操场上,很多人在说话、玩游戏,声音像一大堆杂乱的噪音。你想听你朋友讲的笑话,但周围的声音太大,听不清楚。科学家们发明了一种特别的“超级耳机”,它可以在你说话的同时,帮你只听你想听的声音,就像有个聪明的朋友在帮你过滤噪音一样。这台“超级耳机”用了一些聪明的数学方法,把不同的声音变成数字,然后用特别的算法找出你要听的那一段,把其他的声音都挡掉。这样,你就能清楚听到朋友的笑话,感觉像在安静的房间里一样。这项技术还在不断改进,将来可以让每个人都拥有这样聪明的耳机,帮助我们在嘈杂的环境中更好地交流和学习!

原文摘要

We present the first neural network model to achieve real-time and streaming target sound extraction. To accomplish this, we propose Waveformer, an encoder-decoder architecture with a stack of dilated causal convolution layers as the encoder, and a transformer decoder layer as the decoder. This hybrid architecture uses dilated causal convolutions for processing large receptive fields in a computationally efficient manner while also leveraging the generalization performance of transformer-based architectures. Our evaluations show as much as 2.2-3.3 dB improvement in SI-SNRi compared to the prior models for this task while having a 1.2-4x smaller model size and a 1.5-2x lower runtime. We provide code, dataset, and audio samples: https://waveformer.cs.washington.edu/.

cs.SD cs.LG eess.AS