Source-Adaptive Data Curation for Bilingual NVV-Aware ASR

TL;DR

提出了一种源自适应数据管理策略,提升了双语NVV感知ASR系统的性能,最终得分从33.32提高到53.61。

eess.AS 🔴 高级 2026-09-09 4 次浏览
Yuang Cao Qirui Zhan Jingbin Hu Ziyu Zhang Yunxiang Chen Houdun Liu Shuo Feng Bengu Wu Lei Xie Liumeng Xue
非语言声响 自动语音识别 数据增强 双语 机器学习

核心发现

方法论

该研究提出了一种基于Whisper-medium的NVV感知ASR系统,通过检查点兼容的词汇重映射实现词汇和NVV标签的联合解码。系统采用源自适应数据管理策略,结合声学增强和多模态LLM过滤,改进公共NVV语料库,并从野外媒体中挖掘自发NVV。

关键结果

  • 系统在官方双语评估协议下,最终得分从33.32提高到53.61,表明数据管理策略显著提升了NVV事件识别和相对定位能力。
  • 在中文中,F1micro从0.3325提升到0.5666,mNTD从0.6602降低到0.4443。
  • 在英文中,F1micro从0.2964提升到0.5081,mNTD从0.7459降低到0.4357。

研究意义

该研究在学术界和工业界具有重要意义,解决了传统ASR系统中非语言声响信息丢失的问题,提升了对话理解和媒体分析的能力。通过引入NVV感知,系统在双语环境下实现了更精确的语音识别和事件定位。

技术贡献

技术贡献包括提出了一种新的NVV感知解码方法,通过词汇重映射实现词汇和NVV标签的联合生成。数据管理策略结合了声学增强和多模态过滤,改进了现有语料库的多样性和标注一致性。

新颖性

该研究首次在双语环境下实现了NVV感知的联合解码,创新性地引入了源自适应数据管理策略,显著提升了语音识别的准确性和事件定位能力。

局限性

  • 系统在英文语音识别中存在一定的词汇准确性下降,需进一步优化。
  • 某些细分类别的NVV仍然难以识别,可能需要更有针对性的监督。

未来方向

未来工作将致力于改善语言平衡,提升英文词汇识别的鲁棒性,并减少NVV识别与词汇准确性之间的权衡。

AI 总览摘要

非语言声响(NVV)如笑声、叹息等在对话中传递情感和互动信息,但传统ASR系统常忽略这些信息。本文提出了一种双语NVV感知ASR系统,通过检查点兼容的词汇重映射实现词汇和NVV标签的联合解码。系统采用源自适应数据管理策略,结合声学增强和多模态LLM过滤,改进公共NVV语料库,并从野外媒体中挖掘自发NVV。

在实验中,系统在官方双语评估协议下,最终得分从33.32提高到53.61,表明数据管理策略显著提升了NVV事件识别和相对定位能力。中文和英文的F1micro分别提升至0.5666和0.5081,mNTD分别降低至0.4443和0.4357。

尽管取得了显著进展,系统在英文语音识别中存在一定的词汇准确性下降,需进一步优化。未来工作将致力于改善语言平衡,提升英文词汇识别的鲁棒性,并减少NVV识别与词汇准确性之间的权衡。

深度分析

研究背景

非语言声响(NVV)在对话中传递情感和互动信息,但传统ASR系统常忽略这些信息。近年来,多个数据集扩展了非语言语音的覆盖范围,如ESC、VocalSound等,但现有资源在标注质量、类别平衡和声学多样性方面存在不足。

核心问题

传统ASR系统在处理NVV时通常将其简化为非语音符号,导致对话理解和媒体分析中重要信息的丢失。特别是在双语环境中,不同语言和来源的说话风格、声学实现和标注分布差异显著。

核心创新

本文提出了一种基于Whisper-medium的NVV感知ASR系统,通过检查点兼容的词汇重映射实现词汇和NVV标签的联合解码。系统采用源自适应数据管理策略,结合声学增强和多模态LLM过滤,改进公共NVV语料库,并从野外媒体中挖掘自发NVV。

方法详解

  • �� NVV感知解码:通过词汇重映射实现词汇和NVV标签的联合生成。
  • �� 数据管理策略:结合声学增强和多模态LLM过滤,改进公共NVV语料库。
  • �� 自发NVV挖掘:从野外媒体中自动预处理和标注自发NVV。

实验设计

实验在官方双语评估协议下进行,使用Clean Public NVV Data和Movie NVV Data进行训练,评估在Final Stage测试集上的性能。系统在中文和英文的F1micro和mNTD上均取得显著提升。

结果分析

系统在官方双语评估协议下,最终得分从33.32提高到53.61。中文和英文的F1micro分别提升至0.5666和0.5081,mNTD分别降低至0.4443和0.4357。

应用场景

该系统可用于对话理解、媒体分析和计算副语言学等领域,提升语音识别的准确性和事件定位能力。

局限与展望

系统在英文语音识别中存在一定的词汇准确性下降,需进一步优化。某些细分类别的NVV仍然难以识别,可能需要更有针对性的监督。

通俗解读 非专业人士也能看懂

想象你在一个厨房里,传统的语音识别系统就像一个只关注食材的厨师,而忽略了烹饪过程中的所有声音,比如搅拌、切菜和煮沸的声音。本文的系统就像一个全能厨师,不仅关注食材,还能识别这些声音,帮助更好地理解整个烹饪过程。通过这种方式,系统能够更准确地识别语音中的非语言声响,如笑声和叹息,提升对话理解和媒体分析的能力。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下,你在玩一个超级酷的游戏,里面有很多角色在说话。传统的语音识别系统就像一个只关注角色说了什么的玩家,而忽略了角色的笑声、叹息等声音。本文的系统就像一个全能玩家,不仅能听懂角色说了什么,还能识别这些声音,让游戏体验更真实!是不是很酷?

术语表

NVV (非语言声响)

指在对话中传递情感和互动信息的声音,如笑声、叹息。

在本文中用于改进语音识别的准确性。

ASR (自动语音识别)

将语音信号转化为文本的技术。

本文中用于识别双语环境下的词汇和NVV。

Whisper-medium

一种用于语音识别的模型,支持内联标签生成。

作为本文NVV感知ASR系统的基础。

数据增强

通过添加噪声和速度扰动等方法增加数据多样性。

用于改进公共NVV语料库的多样性。

多模态LLM过滤

使用多模态大语言模型过滤不可靠的标签。

用于提高语料库的标注一致性。

开放问题 这项研究留下的未解疑问

  • 1 如何在不影响词汇识别的情况下进一步提升NVV识别的准确性?
  • 2 在不同语言和文化背景下,如何优化NVV的识别和标注?

应用场景

近期应用

对话理解

提升对话中情感和互动信息的识别能力,增强人机交互体验。

媒体分析

在媒体内容中识别和分析非语言声响,提高内容理解和分类的准确性。

远期愿景

多语言语音识别

实现更广泛的多语言支持,提升全球范围内的语音识别能力。

原文摘要

Nonverbal vocalizations (NVVs), such as laughter, sighs, breaths, and coughs, convey affective and interactional information that conventional automatic speech recognition (ASR) systems often discard. We present a bilingual Mandarin-English system for Track 1 of the NVVSpeech Challenge at ISCSLP 2026, which requires joint transcription of lexical content and 16 NVV categories at their transcript-relative positions. Our NVV-Aware Whisper adapts Whisper-medium through checkpoint-compatible vocabulary remapping, enabling lexical tokens and inline NVV tags to be decoded within a unified autoregressive sequence without expanding the vocabulary. To provide reliable and diverse supervision, we further introduce a source-adaptive data curation strategy that refines public NVV corpora through acoustic augmentation and multimodal LLM filtering, while mining spontaneous NVVs from in-the-wild media through automated preprocessing and annotation. Under the official bilingual evaluation protocol, the proposed system improves final score from 33.32 to 53.61, with ablations confirming the complementary benefits of the proposed data-curation components.

eess.AS cs.SD