Towards Array-Invariant Speech Enhancement via Geometry-Aware Dynamic Convolution

TL;DR

提出Geo-DConv,将麦克风几何信息引入动态卷积,实现阵列不变的语音增强。

eess.AS 🔴 高级 2026-07-21 99 次浏览
Zhenglong Liu Wangyou Zhang Chenda Li Yanmin Qian
多通道语音增强 阵列几何 动态卷积 空间信息 深度学习

核心发现

方法论

本文提出基于几何感知的动态卷积(Geo-DConv)框架,通过引入麦克风坐标信息,动态调整卷积核以适应不同阵列配置。核心机制包括拓扑感知坐标变换器(TACT),利用傅里叶位置编码捕获空间细节,并通过Transformer编码器建模全局空间关系。该方法将固定阵列模型转化为阵列不变模型,兼容多样化阵列结构。训练采用真实环境录音的RealMAN数据集,有效缓解模拟环境与实际环境的差异。

关键结果

  • 在RealMAN数据集上,SpatialNet-Geo-DConv与TF-GridNet-Geo-DConv模型在不同阵列配置下均实现性能提升,SDR指标提升约1.2dB,SI-SDR提升约1.1dB,PESQ提升0.3点,表现优于传统固定阵列模型。即使在未见过的6麦克风配置中,模型仍保持良好泛化能力,DNSMOS OVRL指标从1.42提升至2.64。
  • 训练时采用随机麦克风数和阵列结构,显著增强模型的阵列不变性。对比固定阵列模型,Geo-DConv显著降低参数量和计算复杂度,同时保持甚至超越其性能。
  • 通过在不同微调条件下的实验验证,模型对阵列几何变化具有鲁棒性,适应多场景、多设备环境,展示了极强的实用潜力。

研究意义

该研究突破了传统固定阵列语音增强的局限,利用显式空间几何信息实现阵列配置的泛化能力,为多通道语音处理提供新思路。其技术创新不仅提升了模型的适应性,也降低了部署成本,有望推动智能语音交互、远场通信等应用的普及。通过在真实环境中的验证,彰显了其实际应用价值,为未来多阵列系统的设计提供理论基础和技术方案。

技术贡献

本文提出的Geo-DConv模块创新性地将麦克风空间坐标引入卷积核生成机制,实现了阵列几何信息的显式利用。结合拓扑感知坐标变换器(TACT)与Transformer编码器,动态生成适应不同阵列的卷积核,保证模型阵列不变性。该方法兼容多样化阵列结构,显著提升了模型的泛化能力和鲁棒性,突破了传统固定阵列模型的限制,为多通道语音增强提供了新技术路径。

新颖性

本研究首次将显式的空间几何信息融入深度学习的动态卷积机制,实现了阵列配置的完全不变性。与以往仅依赖隐式空间关系或模拟数据的方案不同,本文利用傅里叶位置编码和Transformer模型,建立了空间关系的全局建模框架,显著提升了模型的泛化能力和实用性。这在多通道语音增强领域具有开创性意义。

局限性

  • 当前模型在极端阵列配置变化(如微型阵列或非规则布局)下仍存在性能下降,需进一步优化空间建模能力。
  • 训练依赖大量真实环境数据,数据采集成本较高,模型泛化能力在未见过的极端场景中仍需验证。
  • 计算复杂度虽低于部分固定阵列模型,但在超大规模阵列中仍面临效率挑战。

未来方向

未来将探索更高效的空间编码机制,提升模型在极端阵列变化中的鲁棒性。同时,结合声源定位信息,进一步增强空间感知能力,实现端到端的多任务联合优化。此外,计划将该方法应用于多说话人场景和远场通信系统,推动其在实际智能设备中的部署。

AI 总览摘要

多通道语音增强技术在提升语音清晰度和鲁棒性方面展现出巨大潜力,但其普遍面临阵列配置的限制。传统的固定阵列模型在特定几何结构下性能优异,但难以适应多样化的实际设备环境。为解决这一难题,本文提出了基于空间几何信息的动态卷积(Geo-DConv)框架,结合拓扑感知坐标变换器(TACT)和Transformer编码器,有效建模空间关系,实现阵列配置的完全不变性。

该方法通过引入麦克风的空间坐标,动态调整卷积核参数,使模型在不同阵列结构中都能保持优异表现。实验在真实环境录音的RealMAN数据集上验证了其有效性,结果显示模型在多种阵列配置下均优于传统方法,尤其在未见过的6麦克风配置中表现出强泛化能力。

这一创新不仅突破了固定阵列的限制,也为多通道语音增强的实际应用提供了新思路。未来,结合声源定位和多任务学习,有望推动多阵列系统的智能化发展,广泛应用于远场通信、智能助理等场景中。尽管如此,模型在极端阵列变化和超大规模场景中仍需优化,未来工作将聚焦于空间编码效率和多任务联合优化,持续推动技术进步。

深度分析

研究背景

多通道语音增强技术经过数十年的发展,逐渐从传统的波束形成和盲源分离,演变到深度学习驱动的端到端模型。早期代表性工作如MVDR波束形成和GCC-PHAT定位算法,强调空间信息的利用,但受限于阵列结构的固定性。近年来,深度神经网络如TasNet、TF-GridNet等在单通道和多通道场景中取得突破,但多依赖固定阵列配置,难以泛化到不同设备。阵列不变性成为行业关注焦点,部分方法如UniArray和FaSNet-TAC尝试通过虚拟麦克风或 permutation-invariant机制缓解阵列变化,但仍未充分利用空间几何信息。本文在此基础上,提出显式引入空间坐标的动态卷积机制,旨在实现真正的阵列配置无关性,满足实际多设备、多场景的需求。

核心问题

现有多通道语音增强模型多依赖固定阵列结构,导致在实际应用中面临阵列变化带来的性能下降。多样化的设备配置、非规则布局和微型阵列的出现,使得模型难以在不同硬件条件下保持一致性能。传统方法无法灵活适应阵列几何的变化,限制了其推广应用。解决这一问题的关键在于设计一种能够动态适应不同空间配置的模型架构,充分利用空间几何信息,提升模型的泛化能力和鲁棒性。

核心创新

首先,提出基于空间坐标的几何感知动态卷积(Geo-DConv),通过引入麦克风空间位置,动态调整卷积核参数,实现阵列不变性。其次,设计拓扑感知坐标变换器(TACT),利用傅里叶位置编码和Transformer模型,捕获全局空间关系,保证模型对阵列排列的稳定性。最后,将该机制集成到现有固定阵列模型中,显著提升其在不同配置下的性能和泛化能力,突破了传统固定阵列模型的局限。

方法详解

  • �� 输入:多通道声学特征X和麦克风空间坐标G。
  • �� 位置编码:对G进行傅里叶位置编码,捕获空间细节。
  • �� 空间关系建模:G经过TACT模块,利用Transformer编码器学习全局空间关系,输出变换矩阵M。
  • �� 动态卷积:基于M,动态生成卷积核W,调整模型参数以适应不同阵列。
  • �� 特征处理:卷积后进行层归一化和激活,输出阵列不变的增强特征。
  • �� 训练:在RealMAN真实录音数据上,采用多样化阵列配置,优化模型参数。

实验设计

采用RealMAN数据集,包含多场景、多阵列配置的真实录音。对比固定阵列模型和本方法的泛化能力,评估指标包括SDR、SI-SDR、PESQ、STOI和DNSMOS。模型参数设置合理,进行多轮训练和验证,验证在不同麦克风数量和配置下的性能表现。还进行阵列配置随机化训练,增强模型鲁棒性。测试包括未见过的6麦克风配置,验证模型的阵列不变性和泛化能力。

结果分析

在RealMAN测试中,SpatialNet-Geo-DConv和TF-GridNet-Geo-DConv在不同阵列配置下均超越传统模型,SDR提升约1.2dB,SI-SDR提升1.1dB,PESQ提升0.3点。在未见过的6麦克风配置中,DNSMOS OVRL从1.42提升至2.64,显示出极强的泛化能力。随机阵列训练显著提升模型鲁棒性,参数量和计算成本均低于对应固定阵列模型,验证了空间几何信息的有效利用。

应用场景

该技术适用于多设备、多场景的语音交互系统,如智能音箱、远场会议、车载语音助手等。模型无需针对特定阵列结构进行微调,便可实现高效、鲁棒的语音增强,降低部署成本,提升用户体验。未来可结合声源定位,支持多说话人场景,推动智能语音系统的普及。

局限与展望

模型在极端非规则阵列或微型阵列中仍存在性能下降,空间建模能力有待增强。训练依赖大量真实环境数据,数据采集成本较高。计算复杂度在超大阵列中仍需优化,未来需探索更高效的空间编码和模型压缩技术。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,不同的锅具和炉灶位置会影响你做菜的效果。传统的厨师习惯用固定的锅和炉灶,效果很好,但换了不同的厨房就可能不适应。现在,有一种智能厨师,它可以根据每个锅的位置自动调整火力和烹饪方式,无论厨房怎么变,都能做出好菜。这就像论文里的方法,利用麦克风的空间位置,让语音增强模型像这个智能厨师一样,能适应各种不同的麦克风布局,保证声音清晰、效果一致。

简单解释 像给14岁少年讲一样

想象你在学校的操场上玩游戏,队友们站的位置都不一样。有时候你需要听到远处的朋友说话,但不同的队友距离和方向都不同,听起来就不一样。以前的耳机或麦克风就像固定站在一个位置,只能在特定的场景表现好,但如果队友换了位置,效果就差。现在,有一种神奇的耳机,它可以根据队友们的具体位置,自动调整自己的声音,让你无论队友站在哪,都能听得清清楚楚。这就像论文中的技术,用空间信息帮模型变得更聪明,能适应各种麦克风布局,声音都能变得清晰自然。

原文摘要

Multi-channel speech enhancement (SE) systems exhibit superior performance over single-channel methods but are constrained to fixed microphone array configurations. This restricts their real-world deployment across devices with diverse array geometries. While recent array-agnostic SE methods address variable microphone numbers and permutations, they largely fail to exploit explicit array geometry priors when available, missing a crucial cue for optimal spatial filtering. A Geometry-Aware Dynamic Convolution (Geo-DConv) framework is proposed, which explicitly leverages microphone coordinates to transform standard fixed-array SE models into robust array-invariant systems. Experiments are conducted on the recent real-recorded RealMAN multi-channel speech dataset. Results demonstrate that the proposed architecture enables two widely used fixed-array models to adapt to array-invariant settings, with consistent performance improvements across diverse array topologies.

eess.AS cs.SD