NVV-Locator: From Transcript Tags to Acoustic Boundaries for Fine-Grained Nonverbal Vocalization Grounding

TL;DR

NVV-Locator通过非自回归槽填充架构实现71.0% Micro F1,精确定位非语言声事件。

eess.AS 🔴 高级 2026-09-09 2 次浏览
Yuang Cao Bingshen Mu Zhennan Lin Guojian Li Haoyue Zhan Jie Liu Chuan Xie Qiang Zhang Liumeng Xue Lei Xie
非语言声事件 时间定位 槽填充 语音对齐 大规模数据集

核心发现

方法论

NVV-Locator采用非自回归槽填充架构,结合音频编码器和语言模型解码器,预测词汇时间戳和非语言声事件边界。通过统一26类NVV分类,构建大规模时间戳监督数据集,并引入NVV-TimeBench基准进行评估。

关键结果

  • 在NVV-TimeBench上,NVV-Locator实现了71.0% Micro F1和70.2% Macro F1,Macro mIoU达到80.4%,Macro mMAE为59.6毫秒,显著优于现有大音频模型。
  • 在外部语料库上验证了NVV-Locator的跨语料库泛化能力,显示出其在不同数据集上的稳健性。
  • 通过消融实验,验证了非自回归槽填充架构在时间一致性和边界精度上的优势。

研究意义

该研究在学术界和工业界具有重要意义。它解决了现有方法在非语言声事件识别和时间定位上的不足,为语音理解和生成提供了新的可能性。通过精确的时间定位,NVV-Locator可用于语音编辑和情感分析等应用。

技术贡献

NVV-Locator在技术上突破了现有方法的局限,通过非自回归槽填充架构实现了更高的时间定位精度。它引入了统一的26类NVV分类和大规模时间戳监督数据集,为非语言声事件的研究提供了新的基础。

新颖性

NVV-Locator首次将非自回归槽填充架构应用于非语言声事件的时间定位,与现有方法相比,显著提高了时间一致性和边界精度。

局限性

  • 在处理长时间音频时,可能会出现计算资源消耗过大的问题。
  • 某些类别的非语言声事件在数据集中仍然较为稀疏,可能影响识别精度。

未来方向

未来的研究方向包括扩展数据集以涵盖更多非语言声事件类别,以及优化模型以提高长时间音频处理的效率。

AI 总览摘要

人类语音中包含笑声、叹息、呼吸等非语言声事件,这些事件传递情感和互动信息。然而,现有方法通常将这些事件表示为转录级别的标签,无法提供其在波形时间上的精确边界。NVV-Locator通过非自回归槽填充架构实现了精细的非语言声事件时间定位。该方法结合音频编码器和语言模型解码器,预测词汇时间戳和非语言声事件边界。通过统一26类NVV分类,构建大规模时间戳监督数据集,并引入NVV-TimeBench基准进行评估。

在NVV-TimeBench上,NVV-Locator实现了71.0% Micro F1和70.2% Macro F1,Macro mIoU达到80.4%,Macro mMAE为59.6毫秒,显著优于现有大音频模型。通过消融实验,验证了非自回归槽填充架构在时间一致性和边界精度上的优势。该研究在学术界和工业界具有重要意义,解决了现有方法在非语言声事件识别和时间定位上的不足,为语音理解和生成提供了新的可能性。

未来的研究方向包括扩展数据集以涵盖更多非语言声事件类别,以及优化模型以提高长时间音频处理的效率。NVV-Locator的成功展示了非自回归槽填充架构在时间定位任务中的潜力,推动了非语言声事件研究的进步。

深度分析

研究背景

非语言声事件(NVVs)如笑声、叹息、呼吸等,在人类交流中传递情感和互动信息。然而,这些事件往往缺乏稳定的语言形式,难以在连续语音中准确识别和定位。现有方法多将其表示为转录级别的标签,无法提供其在波形时间上的精确边界。

核心问题

现有方法在非语言声事件识别和时间定位上存在不足,无法提供精确的波形时间边界。这限制了语音理解和生成的能力,尤其是在需要精细时间定位的应用中。

核心创新

NVV-Locator通过非自回归槽填充架构实现了精细的非语言声事件时间定位。该方法结合音频编码器和语言模型解码器,预测词汇时间戳和非语言声事件边界。通过统一26类NVV分类,构建大规模时间戳监督数据集,并引入NVV-TimeBench基准进行评估。

方法详解

  • �� 采用非自回归槽填充架构,避免时间不一致性。
  • �� 结合音频编码器和语言模型解码器,预测词汇时间戳和非语言声事件边界。
  • �� 统一26类NVV分类,构建大规模时间戳监督数据集。
  • �� 引入NVV-TimeBench基准进行评估。

实验设计

在NVV-TimeBench上进行实验,评估NVV-Locator的性能。与四个大音频模型进行比较,包括Gemini-2.5-Pro、Qwen3-Omni-Instruct、Step-Audio-R1.1和MOSS-Audio-8B-Instruct。采用Micro F1、Macro F1、Macro mIoU和Macro mMAE作为评估指标。

结果分析

NVV-Locator在NVV-TimeBench上实现了71.0% Micro F1和70.2% Macro F1,Macro mIoU达到80.4%,Macro mMAE为59.6毫秒,显著优于现有大音频模型。

应用场景

NVV-Locator可用于语音编辑、情感分析等应用,尤其是在需要精细时间定位的场景中。其精确的时间定位能力为语音理解和生成提供了新的可能性。

局限与展望

在处理长时间音频时,可能会出现计算资源消耗过大的问题。某些类别的非语言声事件在数据集中仍然较为稀疏,可能影响识别精度。未来的研究方向包括扩展数据集和优化模型。

通俗解读 非专业人士也能看懂

想象你在一个音乐会现场,周围的人在欢呼、鼓掌、甚至吹口哨。这些声音虽然不是音乐的一部分,但它们传递了观众的情感和互动信息。NVV-Locator就像一个超级麦克风,能够精确地捕捉这些非音乐的声音,并告诉你它们在音乐中的具体位置。通过这种方式,它帮助音乐制作人更好地理解观众的反应,并在后期制作中进行更精细的编辑。

简单解释 像给14岁少年讲一样

想象你在玩一个音乐游戏,游戏中不仅有音乐,还有观众的欢呼声和掌声。这些声音让游戏更有趣,但你需要知道它们的确切位置才能得分。NVV-Locator就像游戏中的一个超级助手,它能准确告诉你这些声音的开始和结束时间。这样,你就能更好地掌握游戏节奏,获得高分!是不是很酷?

术语表

非语言声事件 (Nonverbal Vocalizations)

指笑声、叹息、呼吸等不含语言信息但传递情感的声音。

用于识别和定位这些事件在语音中的具体位置。

槽填充架构 (Slot-Filling Architecture)

一种用于预测时间戳和事件类别的模型架构,避免时间不一致性。

用于NVV-Locator的核心架构。

时间戳监督数据集 (Timestamp-Supervised Dataset)

包含精确时间标记的数据集,用于训练模型进行时间定位。

用于训练NVV-Locator的关键数据集。

Macro F1

一种评估模型在不同类别上平均性能的指标。

用于评估NVV-Locator在NVV-TimeBench上的表现。

Macro mIoU

评估模型预测边界与真实边界重叠程度的指标。

用于评估NVV-Locator的时间定位精度。

开放问题 这项研究留下的未解疑问

  • 1 如何在长时间音频中有效识别和定位非语言声事件,仍需进一步研究。
  • 2 数据集中某些类别的非语言声事件稀疏,影响识别精度。

应用场景

近期应用

语音编辑

通过精确定位非语言声事件,帮助音频工程师在后期制作中进行更精细的编辑。

远期愿景

情感分析

通过识别和分析非语言声事件,帮助研究人员更好地理解人类情感和互动。

原文摘要

Human speech includes nonverbal vocalizations (NVVs), such as laughter, sighs, breaths, and coughs, which convey affective and interactional information. Existing approaches typically represent NVVs as transcript-level tags, providing limited supervision for their waveform-time boundaries. We present NVV-Locator for fine-grained NVV temporal grounding. We first unify 26 NVV categories across public resources and construct large-scale timestamp-supervised training data through dual-LLM verification, transcript-guided forced alignment, and energy-based boundary refinement. We further introduce NVV-TimeBench, an expert-refined benchmark with 667 utterances and 1,094 events. NVV-Locator uses a non-autoregressive slot-filling architecture to jointly predict lexical timestamps, NVV categories, and event boundaries. On NVV-TimeBench, it achieves 71.0% Micro F1, 70.2% Macro F1, 80.4% Macro mIoU, and 59.6 ms Macro mMAE, outperforming the evaluated large audio model counterparts. Evaluation on an external corpus further demonstrates the cross-corpus generalization of NVV-Locator.

eess.AS cs.SD