LeVo: High-Quality Song Generation with Multi-Preference Alignment

TL;DR

LeVo框架通过多偏好对齐方法显著提升歌曲生成质量。

cs.SD 🔴 高级 2025-06-09 5 次浏览
Shun Lei Yaoxun Xu Zhiwei Lin Huaicheng Zhang Wei Tan Hangting Chen Jianwei Yu Yixuan Zhang Chenyu Yang Haina Zhu Shuai Wang Zhiyong Wu Dong Yu
音乐生成 语言模型 多偏好对齐 音频质量 深度学习

核心发现

方法论

LeVo框架结合了LeLM和Music Codec,使用混合和双轨道令牌进行并行建模。通过Direct Preference Optimization (DPO)方法实现多偏好对齐,处理多样化的人类偏好。

关键结果

  • LeVo在FAD、MuQ-T和MuQ-A指标上优于开源方法,FAD为2.68,MuQ-T为0.34,MuQ-A为0.83。
  • 在主观评价中,LeVo的MOS评分达到3.42,显著高于其他模型。
  • 消融研究显示,去除AR解码器后性能下降,验证了其重要性。

研究意义

LeVo框架在学术界和工业界具有重要影响,解决了现有方法在音频质量和指令遵循方面的长期痛点。

技术贡献

LeVo通过三阶段训练策略优化语言模型,显著提升了音乐生成的多样性和质量,提供了新的工程可能性。

新颖性

LeVo首次在歌曲生成中应用多偏好DPO方法,与现有方法相比,显著提高了音乐性和指令遵循能力。

局限性

  • 数据质量不均影响模型的训练效果,导致某些生成结果不稳定。
  • 模型在长时间序列生成时计算成本较高。

未来方向

未来工作可探索更多样化的音乐风格和情感表达,进一步优化模型的计算效率。

AI 总览摘要

LeVo框架通过创新的语言模型和音乐编解码器组合,显著提升了歌词到歌曲的生成质量。现有方法在音频质量和指令遵循方面存在不足,LeVo通过多偏好对齐方法解决了这些问题。实验结果表明,LeVo在多个指标上优于开源方法,并与行业系统竞争。未来,LeVo有望在更多音乐风格和情感表达上取得突破。

深度分析

研究背景

音乐生成领域经历了从符号音乐到端到端生成的演变。早期工作如Jukebox和SongCreator在音乐性上取得了进展,但仍面临音频质量和指令遵循的挑战。

核心问题

现有方法在生成高质量的声乐和伴奏时面临困难,尤其是在长时间序列中保持音乐性和指令遵循。

核心创新

LeVo引入了并行建模的混合和双轨道令牌,结合DPO方法实现多偏好对齐,显著提升了音乐生成的质量和多样性。

方法详解

  • �� LeLM模型并行预测混合和双轨道令牌。• 使用AR解码器捕捉细节。• DPO方法实现多偏好对齐。

实验设计

使用200万首歌曲进行训练,采用FAD和PER等指标评估性能。消融研究验证了各组件的重要性。

结果分析

LeVo在FAD、MuQ-T和MuQ-A指标上优于开源方法,主观评价中MOS评分最高。

应用场景

LeVo可用于自动化音乐创作、歌词到歌曲生成,具有广泛的行业应用潜力。

局限与展望

模型在长时间序列生成时计算成本较高,数据质量不均影响生成稳定性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。LeVo就像一个智能厨师助手,它能根据你的食谱和口味偏好,自动为你准备美味的菜肴。它不仅能准确遵循你的指令,还能根据你的喜好调整味道,就像LeVo在生成歌曲时根据歌词和音乐风格进行调整一样。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个音乐游戏。LeVo就像一个超级智能的游戏助手,它能根据你的歌词和音乐风格要求,自动生成超酷的歌曲。它不仅能完美地遵循你的指令,还能根据你的喜好调整音乐风格,就像游戏中的角色根据你的选择改变一样。是不是很酷?

术语表

LeLM (语言模型)

LeLM是用于并行建模混合和双轨道令牌的语言模型。

LeVo框架中用于生成歌曲的核心组件。

Music Codec (音乐编解码器)

Music Codec用于将令牌重构为高保真音乐音频。

LeVo框架中用于音频重建的关键组件。

DPO (直接偏好优化)

DPO方法用于处理多样化的人类偏好,通过半自动数据构建过程实现。

用于提升音乐性和指令遵循能力。

FAD (弗雷歇音频距离)

FAD用于评估生成音频与真实音频的相似性。

用于客观评估模型性能的指标。

AR解码器 (自回归解码器)

AR解码器用于并行预测双轨道令牌,捕捉细节。

LeVo框架中用于细节建模的组件。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升长时间序列生成的计算效率?
  • 2 如何优化模型在不同音乐风格上的表现?

应用场景

近期应用

自动化音乐创作

音乐家可以使用LeVo快速生成高质量歌曲,减少创作时间。

远期愿景

音乐教育

LeVo可以用于音乐教育,帮助学生理解音乐创作过程。

原文摘要

Recent advances in large language models (LLMs) and audio language models have significantly improved music generation, particularly in lyrics-to-song generation. However, existing approaches still struggle with the complex composition of songs and the scarcity of high-quality data, leading to limitations in audio quality, musicality, instruction following, and vocal-instrument harmony. To address these challenges, we introduce LeVo, a language model based framework consisting of LeLM and Music Codec. LeLM is capable of parallel modeling of two types of tokens: mixed tokens, which represent the combined audio of vocals and accompaniment to achieve better vocal-instrument harmony, and dual-track tokens, which separately encode vocals and accompaniment for high-quality song generation. It employs two decoder-only transformers and a modular extension training strategy to prevent interference between different token types. To further enhance musicality and instruction following ability, we introduce a multi-preference alignment method based on Direct Preference Optimization (DPO). This method handles diverse human preferences through a semi-automatic data construction process and post-training. Experimental results demonstrate that LeVo significantly outperforms existing open-source methods in both objective and subjective metrics, while performing competitively with industry systems. Ablation studies further justify the effectiveness of our designs. Audio examples and source code are available at https://levo-demo.github.io and https://github.com/tencent-ailab/songgeneration.

cs.SD cs.AI eess.AS