Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation
提出一种基于LALM反馈的偏好优化框架,提升连续自回归非语言发声生成,最终得分75.80。
核心发现
方法论
本文提出了一种偏好优化框架,利用大型音频语言模型(LALM)反馈进行非语言发声生成。首先构建双语提示语料库,通过随机模型展开和LALM评估生成偏好数据对。采用两阶段优化策略:拒绝采样微调(RSFT)和锚定流动DPO,分别适应高评分样本和进行偏好优化。
关键结果
- 在NVVSpeech Challenge Track 2测试集上,方法最终得分75.80(中文79.39/英文72.21),较VoxCPM2基线提高1.84分。
- 主要提升体现在NVV准确性和感知效果,而整体质量保持稳定。
- 实验表明,RSFT和流动DPO结合能显著提升偏好学习效果。
研究意义
该研究通过偏好优化框架显著提升了非语言发声生成的准确性和感知效果,解决了传统监督学习中数据稀缺的问题,为语音生成领域提供了新的思路和方法。
技术贡献
技术贡献包括:提出了一种无需显式序列似然的DPO偏好学习方法,利用流动匹配损失进行偏好优化,并通过LALM反馈实现自动化偏好数据构建。
新颖性
首次将偏好优化应用于连续自回归语音生成,提出了流动匹配损失作为偏好信号的新颖方法,区别于传统的序列似然方法。
局限性
- 模型在处理复杂语境下的非语言发声时可能表现不佳,需进一步优化。
- 偏好数据构建依赖于LALM评分,可能存在评分偏差。
未来方向
未来工作可探索更复杂的语境下的偏好优化方法,并进一步优化LALM评分机制以提高偏好数据的准确性。
AI 总览摘要
非语言发声(NVV)如笑声、叹息等在表达情感和意图上具有重要作用。然而,现有的语音生成系统在控制NVV方面仍存在挑战,尤其是在保持自然性和整体声学质量的同时实现准确的NVV类型和出现频率。
本文提出了一种偏好优化框架,利用大型音频语言模型(LALM)反馈进行NVV生成。通过构建双语提示语料库和自动化偏好数据对,采用两阶段优化策略:拒绝采样微调(RSFT)和锚定流动DPO,分别适应高评分样本和进行偏好优化。
实验结果显示,在NVVSpeech Challenge Track 2测试集上,该方法最终得分75.80,较VoxCPM2基线提高1.84分,主要提升体现在NVV准确性和感知效果,而整体质量保持稳定。该研究为语音生成领域提供了新的思路和方法,解决了传统监督学习中数据稀缺的问题。
深度解读
原文摘要
We propose a preference optimization framework with Large Audio-Language Model (LALM) feedback for controllable non-verbal vocalization (NVV) generation in continuous autoregressive speech models. To construct preference data without human preference annotation, we build a bilingual prompt corpus by combining NVV-injected real transcripts with LLM-generated semantically aligned prompts, perform stochastic model rollouts, and use a LALM to rank candidate utterances and form same-prompt chosen--rejected pairs. We then adopt a two-stage optimization strategy: Rejection Sampling Fine-Tuning (RSFT) first adapts the model to LALM-selected high-scoring samples, followed by Anchored Flow-DPO, which formulates pairwise preference optimization using utterance-level flow-matching loss and retains the chosen-sample flow-matching objective as an SFT anchor. This design enables DPO-style preference learning without explicit sequence likelihoods while preserving direct supervision on preferred realizations. On the official 1,600-utterance NVVSpeech Challenge Track~2 test set, our method achieves a Final Track2Score of \textbf{75.80} (79.39 ZH / 72.21 EN), outperforming the VoxCPM2 baseline by \textbf{+1.84}. The improvements are mainly driven by higher NVV Accuracy and NVV Perceptual Effect, while Overall Quality remains stable.