Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

TL;DR

提出经验校准对比解码(ECCD)减缓语音幻觉,提升WER/CER最高55.6%。

eess.AS 🔴 高级 2026-08-01 193 次浏览
Chenlin Liu Minghui Fang Zhonghao Bi Zekai Su Rong Wang Jiqing Han
语音合成 对比解码 Hallucination Mitigation 解码控制 多语种

核心发现

方法论

本文提出基于条件信息的视角,将文本对齐信息与声学经验信息区分。利用同一语音语言模型(Speech LM)在有无文本条件下的预测差异,设计无训练的ECCD方法,通过增强对齐支持同时保留有用的经验信息。该方法只加强正向对齐,利用集合级体验兼容性调节增强力度,适用于多模型、多语种场景。实验中,ECCD在SeedTTS-Eval和CV3-Eval数据集上显著降低WER/CER达55.6%,同时保持语者相似性和自然度。

关键结果

  • 在四个不同模型上,ECCD平均降低WER和CER达50%以上,最高达55.6%,在多语种环境中表现尤为优异。听感测试中,CMOS提升0.644,保持强烈的语者相似性。分析显示,声学对齐影响在不同语言和句子边界变化明显,尤其在首次错误边界低于匹配正确边界,验证了条件信息调控的有效性。
  • 通过对比full条件预测与无文本条件预测,量化了对齐信息在生成中的作用。提出的ECC系数调节增强力度,确保在不同生成阶段平衡对齐支持与经验信息,避免幻觉的发生。实验证明,该方法优于传统采样策略和纯架构改进,具有解码时实时调控潜力。
  • 多语种和长文本场景中,ECCD依然保持优越性能,特别在低资源语言和复杂句子中减少幻觉。自动指标和人工听感均验证了其有效性,显示出解码时条件信息调控在提升语音合成质量中的广泛应用前景。

研究意义

该研究突破了传统依赖架构或训练的幻觉缓解策略,提出解码时基于条件信息的调控新思路。通过强化对齐支持,改善长句和复杂内容的内容一致性,显著提升语音合成的可靠性与自然度。多语种适应性强,为多模态AI应用提供理论基础。此方法为未来端到端语音系统的鲁棒性设计提供了重要参考,有望推动智能语音交互的广泛应用。

技术贡献

本文创新性地将对比解码引入语音生成,结合集合级体验兼容性调节增强力度,提出无训练的ECCD机制。区别于传统采样或架构优化,强调解码时动态调控条件信息,确保对齐支持与经验信息的平衡。提出的ECC系数实现了对增强强度的自适应调节,为语音生成提供更细粒度的控制手段。该方法在多模型、多语种场景中验证了其广泛适用性和优越性能,推动了解码策略的理论与工程创新。

新颖性

这是首次将条件信息区分引入LM-based TTS的解码控制,提出基于对齐支持的正向增强策略。不同于以往架构或训练优化,本文实现了无训练、实时调节的解码时控制机制。利用集合级体验兼容性调节增强力度,创新性地解决了幻觉在长文本和多语种环境中的难题,为语音合成领域提供了全新思路。

局限性

  • 该方法依赖声学模型的预测能力,可能在极端噪声或极端语音变异场景下表现不足。调节系数的参数设置需要经验调优,可能影响泛化能力。
  • 在某些语言或特殊内容(如诗歌、方言)中,条件调控可能无法充分捕捉语音特性,导致效果有限。
  • 算法在长文本或高复杂度场景中仍存在一定的幻觉风险,未来需结合多模态信息进一步优化。

未来方向

未来将探索多模态条件信息融合,如视觉或上下文信息,增强对齐支持的鲁棒性。结合自适应调节机制,实现更智能的解码策略。此外,扩展到端到端训练框架,结合强化学习优化生成质量,提升多场景适应能力。还计划在真实应用中测试,推动工业化落地。

AI 总览摘要

语音合成技术近年来取得巨大突破,但幻觉问题仍困扰其实际应用。传统方案多依赖架构改进或后端训练,难以在解码时灵活调控。本文提出基于条件信息的解码策略——经验校准对比解码(ECCD),通过强化声学对齐支持,有效缓解幻觉,显著提升内容准确率。该方法利用模型在有无文本条件下的预测差异,动态调节对齐力度,确保生成内容既符合文本,又保持自然流畅。实验结果显示,ECCD在多个模型和多语种场景中,平均降低WER/CER达55.6%,同时保持语者相似性和自然度。分析表明,声学对齐在不同语言和句子边界变化中影响明显,验证了条件调控的有效性。该研究突破了传统依赖架构或训练的限制,为解码时内容控制提供新思路,推动语音合成技术向更高鲁棒性和多样性发展。未来,结合多模态信息和自适应调节机制,将进一步提升系统的泛化能力和应用范围,为智能语音交互带来更大变革。

深度分析

研究背景

语音合成技术经历了从传统拼接到端到端深度学习的演变。早期方法如HMM和统计参数模型逐渐被神经网络取代,代表作包括Tacotron、FastSpeech等。近年来,基于离散声学编码的LM模型(如VALL-E、Casanova等)实现了高质量、零样本迁移和长文本生成。然而,这些系统仍面临幻觉问题,包括内容偏离、重复、误发音等,特别在长句和复杂内容中表现突出。解决方案多集中在模型架构优化、训练数据增强或后处理技术,但解码时的内容控制研究较少,成为亟待突破的瓶颈。

核心问题

核心问题在于LM-based TTS在生成过程中容易出现幻觉,表现为偏离目标文本的内容错误。这些错误在长句和多语种场景尤为严重,影响系统的实用性和可信度。传统方法依赖架构改进或训练优化,难以在解码时灵活调节,且难以应对多变的语境。如何在保持自然流畅的同时,有效抑制幻觉,成为当前研究的难点。尤其是,模型在生成过程中对齐信息与声学经验信息的平衡缺乏有效调控机制,导致幻觉的发生与传播。

核心创新

本文创新点在于提出基于条件信息的解码调控策略。第一,区分文本对齐信息与声学经验信息,明确其在生成中的作用。第二,利用模型在有无文本条件下的预测差异,设计无训练的ECCD机制,通过增强正向对齐支持,抑制偏离。第三,引入集合级体验兼容性系数(ECC)调节增强力度,动态适应不同生成阶段。该方法区别于传统架构优化或后处理技术,强调解码时的实时调控,具有高度的灵活性和适应性。实验验证其在多模型、多语种、多场景下均优于现有技术,显著降低幻觉发生率。

方法详解

  • �� 构建模型的full条件预测pE(xi),结合文本和声学信息。
  • �� 构建无文本条件预测pA(xi),仅依赖声学上下文。
  • �� 计算分布差异指标Ii(KL散度)衡量对齐信息影响。
  • �� 计算决策支持指标Gi(对比对齐支持的对数比)评估单个预测的对齐力度。
  • �� 设计ECCD:在候选集内增强正向对齐,利用系数Ci调节增强力度,确保声学经验信息不被破坏。
  • �� 结合专家分布和经验信息,动态调节生成概率,避免幻觉。
  • �� 通过集合级调节机制实现无训练、实时调控,适应多模型、多语种场景。

实验设计

采用SeedTTS-Eval和CV3-Eval数据集,测试CosyVoice2/3、Llasa、GLM-TTS模型。指标包括WER、CER、语者相似性(SS)和UTMOS。对比基线包括纯采样和调节系数不同的ECCD。参数设置为α=1,k=25,采用GPU加速。进行多语种、长文本和噪声环境下的评估,结合人工听感验证效果。还设计消融实验验证ECC系数调节的作用,分析声学对齐在不同边界的影响。

结果分析

实验显示,ECCD在四个模型中平均降低WER/CER达50%以上,最高达55.6%,在多语种和长文本场景中表现优异。听感测试中,CMOS提升0.644,保持语者相似性。对比传统采样,ECCD效果更稳定,尤其在复杂内容中显著减少幻觉。分析表明,声学对齐在错误边界影响较大,调节机制有效缓解了长文本中的偏离,验证了条件信息调控的有效性。

应用场景

该方法适用于高质量语音合成系统,尤其在多语种、长文本和低资源场景中。可用于智能助手、语音导航、自动配音等行业,提升内容准确性和自然度。实现无需额外训练,便于集成到现有系统中,具有广泛的工业应用潜力。

局限与展望

当前方法依赖声学模型的预测能力,在极端噪声或极端语音变异场景下可能效果有限。调节参数需调优,且在某些特殊内容(如诗歌、方言)中效果不佳。未来需结合多模态信息和自适应机制,进一步提升鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的菜肴,厨师需要不断调整火候和调料,确保每一步都完美。语音合成也是如此,模型在生成每个音节时,要平衡两件事:一是要让声音听起来像目标内容(对齐信息),二是要让声音听起来自然流畅(经验信息)。如果只关注内容,可能会出现偏差,就像菜太咸或太淡;只关注自然,可能偏离主题,就像菜没有味道。本文提出一种聪明的调味方法——在解码时实时调节火候,确保菜既好看又好吃。这种方法通过强化对齐支持,减少偏离,提升语音的准确性和自然感。实验显示,这样的调控能大幅降低错误率,让合成的语音更贴近人类,同时保持自然流畅,就像厨师掌握了火候的艺术一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,每次拼完一块都要确保它和整体图案对得上。语音合成也是这样,模型每次生成一个声音片段时,要确保它既符合你想要的内容,又听起来像自然的说话。可是,有时候模型会偏离主题,像拼图拼错了地方,虽然听起来还挺自然,但内容错了。科学家们发现,这种偏离其实是因为模型在平衡“内容对齐”和“自然流畅”这两件事时出了问题。于是,他们设计了一种聪明的“调味料”,在模型拼每块拼图时,实时加强对内容的支持,让偏离变少。这样,生成的语音既准确又自然,就像厨师用心调味,做出美味佳肴一样。这个新方法让语音变得更像人说话,不会偏离目标,也更自然流畅,未来可以让智能助手、导航语音变得更聪明、更贴心!

原文摘要

Language model-based text-to-speech (LM-based TTS) remains vulnerable to speech hallucinations that deviate from the target text. Existing mitigation mainly relies on architectural changes or additional training, while decoding-time control remains underexplored. We present a conditional information view that distinguishes text-derived alignment information from experience information supplied by acoustic context and learned speech regularities. We hypothesize that an important class of hallucinations begins when alignment support is insufficiently reflected in the selected token at a vulnerable transition. Using predictions from the same speech LM with and without text conditions, we propose Experience-Calibrated Contrastive Decoding (ECCD), a training-free method that strengthens alignment support while preserving useful experience information. ECCD preserves the original expert distribution, applies only positive alignment enhancement, and calibrates its strength using set-level experience compatibility. Across four models, ECCD reduces WER/CER by up to 55.6% in all SeedTTS-Eval settings and 24 of 25 multilingual CV3-Eval settings. A listening test yields a CMOS gain of $+0.644$ while retaining strong speaker similarity. Further analysis shows that alignment influence and decision-level gain vary within linguistic units and are lower at first-error boundaries than at matched correct boundaries. Overall, these extensive experiments and analyses identify conditional information control as a promising decoding-time direction for mitigating speech hallucination.

eess.AS cs.LG eess.SP