Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

TL;DR

通过可控多样化和漂移过滤稳定Instruct-TTS的指令监督,提升指令遵循率至56.4%。

cs.SD 🔴 高级 2026-09-08 3 次浏览
Yizhong Geng Kecan Mao Qifei Li Cong Wang Yingming Gao Ruimin Wang Chunfeng Wang Hao Li Ya Li
Instruct-TTS 语义漂移 数据稳定性 指令多样化 漂移过滤

核心发现

方法论

本文提出了一种数据中心的稳定化方法,通过可控指令多样化、基于LLM的漂移过滤和属性对齐监督来提高覆盖率和保真度。具体来说,使用LLM生成多样化的指令变体,同时通过漂移过滤器剔除语义漂移的指令,最终结合属性对齐监督来实现更高的语音合成控制能力。

关键结果

  • 在InstructTTSEval的中文数据集上,使用本文方法的指令遵循率从未调优的34.5%和简单调优的51.0%提升至56.4%。
  • 通过限制性重写,语义漂移率从40.4%降至15.4%。
  • 消融实验表明,三种机制是互补的,且漂移分类法可能推广到其他指令驱动的生成任务。

研究意义

该研究通过解决指令监督不稳定性问题,提高了Instruct-TTS系统的指令遵循能力,特别是在语音合成的低级属性控制方面。这一方法不仅在学术上具有重要意义,还为工业应用提供了更可靠的指令生成和处理框架。

技术贡献

本文在现有方法的基础上,通过引入数据中心的稳定化策略,显著提高了指令生成的覆盖率和保真度。提出的漂移过滤机制为语义漂移问题提供了新的解决方案,并通过属性对齐监督增强了语音合成的可控性。

新颖性

这是首次将数据中心的稳定化策略应用于Instruct-TTS系统,通过结合可控多样化和漂移过滤,解决了指令生成中的语义漂移问题。

局限性

  • 该方法在处理极端复杂的指令时可能仍存在漂移。
  • 需要大量标注数据以实现高效的漂移过滤。

未来方向

未来的研究方向包括优化漂移过滤算法以减少对标注数据的依赖,以及探索该方法在其他生成任务中的适用性。

AI 总览摘要

在语音合成领域,Instruct-TTS系统通过自然语言指令来控制语音的风格、情感和韵律。然而,现有方法在指令生成过程中常常出现语义漂移,导致监督信号不稳定,影响系统的泛化能力。本文提出了一种数据中心的稳定化方法,通过可控指令多样化、基于LLM的漂移过滤和属性对齐监督来提高指令生成的覆盖率和保真度。

在实验中,本文方法在InstructTTSEval的中文数据集上显著提高了指令遵循率,从未调优的34.5%和简单调优的51.0%提升至56.4%。通过限制性重写,语义漂移率从40.4%降至15.4%。消融实验表明,三种机制是互补的,且漂移分类法可能推广到其他指令驱动的生成任务。

该研究不仅在学术上具有重要意义,还为工业应用提供了更可靠的指令生成和处理框架。未来的研究方向包括优化漂移过滤算法以减少对标注数据的依赖,以及探索该方法在其他生成任务中的适用性。

深度分析

研究背景

语音合成技术正从固定标签和数值控制转向Instruct-TTS系统,用户通过自然语言指令指定风格、情感和韵律。然而,现有方法在指令生成过程中常常出现语义漂移,导致监督信号不稳定,影响系统的泛化能力。

核心问题

Instruct-TTS系统在指令生成过程中常常出现语义漂移,导致监督信号不稳定,影响系统的泛化能力。语义漂移问题是指生成的指令在语义上偏离了原始控制意图。

核心创新

本文提出了一种数据中心的稳定化方法,通过可控指令多样化、基于LLM的漂移过滤和属性对齐监督来提高指令生成的覆盖率和保真度。可控多样化通过限制性重写生成多样化的指令变体,漂移过滤通过LLM过滤掉语义漂移的指令,属性对齐监督增强了语音合成的可控性。

方法详解

  • �� 数据准备:使用结构化标签数据和音频扰动生成指令。
  • �� 可控多样化:通过限制性重写生成多样化的指令变体。
  • �� 漂移过滤:使用LLM过滤掉语义漂移的指令。
  • �� 属性对齐监督:通过属性对齐增强语音合成的可控性。

实验设计

实验在InstructTTSEval的中文数据集上进行,使用CosyVoice 2.0-0.5B模型进行微调。实验设计包括对比基线、漂移过滤和属性对齐监督的消融实验。

结果分析

实验结果表明,本文方法在指令遵循率、语音合成的自然度和可控性方面均有显著提升。限制性重写将语义漂移率从40.4%降至15.4%。

应用场景

该方法可用于需要高精度语音合成控制的应用场景,如有声读物、虚拟助手和内容创作。

局限与展望

该方法在处理极端复杂的指令时可能仍存在漂移。需要大量标注数据以实现高效的漂移过滤。未来的研究方向包括优化漂移过滤算法以减少对标注数据的依赖。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一份食谱,但每次你做饭时,食谱的描述都不太一样,有时甚至会误导你。为了确保每次都能做出美味的菜肴,你决定制定一个稳定的食谱。首先,你会确保食谱的每个步骤都清晰明确,不会偏离原意。然后,你会根据不同的口味需求调整食谱,但保持核心步骤不变。最后,你会不断检查和调整食谱,以确保每次做出的菜肴都符合预期。这就像本文的方法,通过可控多样化和漂移过滤来稳定指令生成,确保语音合成的质量和一致性。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要给你的角色下达指令,但有时候游戏会误解你的指令,导致角色做出奇怪的动作。为了避免这种情况,你决定制定一个计划。首先,你会确保每个指令都非常清晰,不会被误解。然后,你会根据不同的游戏场景调整指令,但保持核心策略不变。最后,你会不断检查和调整指令,以确保角色的动作总是符合你的预期。这就像本文的方法,通过可控多样化和漂移过滤来稳定指令生成,确保语音合成的质量和一致性。

术语表

Instruct-TTS (指令文本到语音合成)

一种通过自然语言指令控制语音合成的技术。

本文中用于生成语音的系统。

Semantic Drift (语义漂移)

指令在生成过程中偏离原始语义的现象。

本文中需要解决的问题。

LLM (大语言模型)

一种用于生成和理解自然语言的机器学习模型。

用于生成和过滤指令。

Attribute-Aligned Supervision (属性对齐监督)

通过属性对齐增强语音合成的可控性的方法。

用于提高语音合成的控制精度。

Drift Filtering (漂移过滤)

通过过滤掉语义漂移的指令来提高指令生成质量的方法。

用于提高指令生成的保真度。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加标注数据的情况下提高漂移过滤的效率?
  • 2 如何在处理极端复杂指令时减少语义漂移?

应用场景

近期应用

有声读物

通过稳定的指令生成提高有声读物的语音合成质量。

虚拟助手

增强虚拟助手的语音控制能力,提高用户体验。

远期愿景

内容创作

通过高精度语音合成支持更复杂的内容创作场景。

原文摘要

Instruct-TTS systems expand structured style labels into natural-language training instructions through LLM rewriting, yet we find that over 40% of unconstrained rewrites contain semantic drift that corrupts supervision and weakens generalization. We formalize this problem as instruction supervision instability and propose a data-centric stabilization recipe that jointly improves coverage and fidelity through three mechanisms: controllable instruction diversification for systematic expansion, LLM-based drift filtering for quality control, and attribute-aligned supervision that grounds prosody control in acoustic perturbations. On the Chinese split of InstructTTSEval, our recipe raises instruction-following from 34.5% without fine-tuning and 51.0% with naive fine-tuning to 56.4%, while constrained rewriting reduces drift from 40.4% to 15.4%. Ablations confirm the three mechanisms are complementary, and the drift taxonomy may generalize to instruction-driven generation beyond TTS.

cs.SD