DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism

TL;DR

DiffSinger通过浅扩散机制生成高质量歌声,提升0.11 MOS。

eess.AS 🔴 高级 2021-05-06 2 次浏览
Jinglin Liu Chengxi Li Yi Ren Feiyang Chen Zhou Zhao
歌声合成 扩散模型 声学模型 机器学习 音频处理

核心发现

方法论

DiffSinger基于扩散概率模型,使用参数化马尔可夫链将噪声逐步转换为mel频谱图,结合音乐谱。通过隐式优化变分界限,DiffSinger实现稳定训练和逼真输出。引入浅扩散机制,利用简单损失学习的先验知识,提高音质并加速推理。

关键结果

  • DiffSinger在中文歌声数据集上,MOS得分比最先进的SVS模型高0.11,显示出其卓越的音质和稳定性。
  • 浅扩散机制加速推理45.1%,CMOS提升0.14,证明了其有效性。
  • 在TTS任务上,DiffSpeech相较于FastSpeech 2和Glow-TTS分别提升0.24和0.23 MOS。

研究意义

DiffSinger在歌声合成领域具有重要意义,解决了以往模型过平滑和不稳定训练的问题。通过扩散模型的引入,提供了新的生成路径,提升了合成歌声的自然度和表现力。对于学术界和工业界,该方法为音频合成技术提供了新的视角和工具。

技术贡献

DiffSinger是首个基于扩散概率模型的SVS声学模型,解决了过平滑和不稳定训练问题。引入浅扩散机制,提高音质并加速推理。扩展实验显示其在TTS任务中的泛化能力。

新颖性

DiffSinger首次将扩散模型应用于歌声合成,提供了一种新的生成路径。与现有方法相比,DiffSinger通过浅扩散机制有效利用先验知识,显著提升音质和推理速度。

局限性

  • 在某些复杂音频场景下,DiffSinger可能无法完全捕捉音频细节,导致合成音质下降。
  • 模型训练时间较长,需大量计算资源。
  • 对不同语言的泛化能力尚需进一步验证。

未来方向

未来研究可探索DiffSinger在多语言歌声合成中的应用,优化模型结构以减少计算资源需求,并进一步提升音质。

AI 总览摘要

歌声合成技术旨在从音乐谱中合成自然且富有表现力的歌声。然而,现有方法存在过平滑和训练不稳定的问题,影响了合成音质。DiffSinger通过引入扩散概率模型,提供了一种新的生成路径,将噪声逐步转换为mel频谱图。该方法通过隐式优化变分界限,实现了稳定训练和逼真输出。

DiffSinger的核心技术包括浅扩散机制,利用简单损失学习的先验知识,提高音质并加速推理。实验结果显示,DiffSinger在中文歌声数据集上的MOS得分较现有最先进模型提高0.11,推理速度加快45.1%。

DiffSinger的成功为歌声合成领域带来了新的视角和工具,解决了长期存在的音质和训练稳定性问题。未来研究可探索其在多语言合成中的应用,并进一步优化模型结构以减少计算资源需求。

深度分析

研究背景

歌声合成技术近年来受到广泛关注,其目标是从音乐谱中合成自然且富有表现力的歌声。传统方法如L1和L2损失或生成对抗网络(GAN)存在过平滑和训练不稳定的问题。扩散概率模型作为一种新兴的生成模型,提供了新的生成路径,有望解决这些问题。

核心问题

现有歌声合成模型在生成音质和训练稳定性上存在瓶颈。过平滑导致合成音质不自然,而GAN方法的训练不稳定性则影响了模型的可靠性。如何在保证音质的同时提高训练稳定性是一个重要的研究问题。

核心创新

DiffSinger通过扩散概率模型实现歌声合成,首次将扩散模型应用于此领域。引入浅扩散机制,利用简单损失学习的先验知识,提高音质并加速推理。与传统方法相比,DiffSinger提供了更稳定的训练和更自然的音质。

方法详解

  • �� 使用扩散概率模型,将噪声逐步转换为mel频谱图。
  • �� 引入浅扩散机制,利用简单损失学习的先验知识。
  • �� 通过隐式优化变分界限,实现稳定训练和逼真输出。
  • �� 采用边界预测方法,自适应确定浅扩散步骤。

实验设计

在中文歌声数据集上进行评估,比较DiffSinger与现有最先进模型的性能。使用MOS和CMOS作为评价指标,分析浅扩散机制对音质和推理速度的影响。扩展实验验证DiffSinger在TTS任务中的泛化能力。

结果分析

DiffSinger在中文歌声数据集上的MOS得分较现有最先进模型提高0.11,推理速度加快45.1%。浅扩散机制显著提升音质和推理速度。在TTS任务上,DiffSpeech相较于FastSpeech 2和Glow-TTS分别提升0.24和0.23 MOS。

应用场景

DiffSinger可用于音乐制作、虚拟歌手等场景,提升音质和推理速度。其在TTS任务中的泛化能力也为语音合成技术提供了新的可能性。

局限与展望

DiffSinger在某些复杂音频场景下可能无法完全捕捉音频细节,影响合成音质。模型训练时间较长,需大量计算资源。对不同语言的泛化能力尚需进一步验证。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统的歌声合成方法就像用固定的食谱做菜,结果可能不够美味。DiffSinger就像一个聪明的厨师,能根据食材的不同调整做法,做出更美味的菜肴。它通过一种叫做扩散模型的方法,把噪声一步步变成美妙的歌声,就像厨师一步步调整调料,直到味道恰到好处。这个过程不仅让歌声更自然,还能更快完成。

简单解释 像给14岁少年讲一样

想象你在玩一个音乐游戏,游戏里需要你合成一段完美的歌声。传统方法就像用固定的乐谱,结果可能不够好听。而DiffSinger就像一个超级音乐制作人,它能根据不同的乐谱调整合成方法,让歌声更动听。它用一种叫做扩散模型的技术,把噪声一步步变成美妙的音乐,就像制作人一步步调整音效,直到音乐完美无缺。这个过程不仅让音乐更自然,还能更快完成。

术语表

扩散模型 (Diffusion Model)

一种生成模型,通过逐步添加噪声将数据转换为高斯分布,然后通过反向过程恢复数据。

用于将噪声转换为mel频谱图。

马尔可夫链 (Markov Chain)

一种随机过程,其中下一个状态仅依赖于当前状态。

用于扩散过程和反向过程的参数化。

mel频谱图 (Mel-spectrogram)

一种音频特征表示,显示音频在不同频率上的能量分布。

作为声学模型的输出。

变分界限 (Variational Bound)

一种优化技术,用于稳定训练生成模型。

用于优化DiffSinger的训练过程。

浅扩散机制 (Shallow Diffusion Mechanism)

一种改进扩散模型的方法,通过在浅层步骤开始生成,提高音质并加速推理。

用于提高DiffSinger的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语言环境下优化DiffSinger的性能?
  • 2 扩散模型在其他音频合成任务中的应用潜力如何?
  • 3 如何减少DiffSinger的计算资源需求?

应用场景

近期应用

音乐制作

DiffSinger可用于生成高质量的虚拟歌声,提升音乐制作效率。

虚拟歌手

通过DiffSinger,开发更自然的虚拟歌手,为娱乐产业带来创新。

远期愿景

多语言合成

探索DiffSinger在多语言环境下的应用,推动全球化音频合成技术的发展。

原文摘要

Singing voice synthesis (SVS) systems are built to synthesize high-quality and expressive singing voice, in which the acoustic model generates the acoustic features (e.g., mel-spectrogram) given a music score. Previous singing acoustic models adopt a simple loss (e.g., L1 and L2) or generative adversarial network (GAN) to reconstruct the acoustic features, while they suffer from over-smoothing and unstable training issues respectively, which hinder the naturalness of synthesized singing. In this work, we propose DiffSinger, an acoustic model for SVS based on the diffusion probabilistic model. DiffSinger is a parameterized Markov chain that iteratively converts the noise into mel-spectrogram conditioned on the music score. By implicitly optimizing variational bound, DiffSinger can be stably trained and generate realistic outputs. To further improve the voice quality and speed up inference, we introduce a shallow diffusion mechanism to make better use of the prior knowledge learned by the simple loss. Specifically, DiffSinger starts generation at a shallow step smaller than the total number of diffusion steps, according to the intersection of the diffusion trajectories of the ground-truth mel-spectrogram and the one predicted by a simple mel-spectrogram decoder. Besides, we propose boundary prediction methods to locate the intersection and determine the shallow step adaptively. The evaluations conducted on a Chinese singing dataset demonstrate that DiffSinger outperforms state-of-the-art SVS work. Extensional experiments also prove the generalization of our methods on text-to-speech task (DiffSpeech). Audio samples: https://diffsinger.github.io. Codes: https://github.com/MoonInTheRiver/DiffSinger. The old title of this work: "Diffsinger: Diffusion acoustic model for singing voice synthesis".

eess.AS cs.LG cs.SD