V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

TL;DR

V2A-DPO通过直接偏好优化提升视频转音频生成,显著提高语义一致性和时间对齐。

cs.SD 🔴 高级 2026-03-11 21 次浏览
Nolan Chan Timmy Gang Yongqian Wang Yuzhe Liang Dingdong Wang
视频转音频 直接偏好优化 人类偏好对齐 流匹配 课程学习

核心发现

方法论

V2A-DPO框架结合了音频评分系统AudioScore、自动化偏好对生成管道和课程学习优化策略。AudioScore用于评估生成音频的语义一致性、时间对齐和感知质量。通过结合少量人工标注的偏好对和自动生成的偏好对,形成大规模数据集用于优化。课程学习策略分阶段优化模型,提升生成音频的质量和一致性。

关键结果

  • 在VGGSound数据集上,V2A-DPO优化的MMAudio在音质和语义对齐上超越了DDPO优化和预训练模型,IS提升1.81,IB-score提升0.86,DeSync减少0.09。
  • Frieren模型在V2A-DPO优化下,性能也显著提升,尤其在语义一致性和时间对齐方面。
  • 消融实验表明,课程学习策略和KL散度约束参数对模型性能有显著影响。

研究意义

V2A-DPO框架在视频转音频生成领域具有重要意义,解决了现有模型在风格控制、审美质量评估和综合评分系统方面的不足。通过人类偏好对齐,提升了生成音频的沉浸感和质量。这一方法不仅在学术界具有理论创新性,还为工业界提供了更高效的音频生成解决方案。

技术贡献

V2A-DPO引入了AudioScore评分系统和课程学习策略,显著提升了生成音频的质量和一致性。与现有的DDPO方法相比,V2A-DPO在流匹配模型中实现了更高效的偏好对齐和优化。该框架为视频转音频生成提供了新的理论保障和工程可能性。

新颖性

V2A-DPO是首个将直接偏好优化应用于流匹配视频转音频生成的框架。与现有方法相比,V2A-DPO通过综合评分系统和课程学习策略实现了更高效的人类偏好对齐,显著提升了生成音频的质量和一致性。

局限性

  • V2A-DPO在处理与训练数据显著不同的场景时,生成音频的风格控制仍有限。
  • 审美质量的量化评估仍具挑战性,可能影响音频的沉浸感。
  • 模型在处理复杂偏好对时,可能需要更高的计算资源。

未来方向

未来研究可以探索更高效的审美质量评估方法,以及在不同场景下的风格控制。进一步优化课程学习策略,以提升模型在复杂偏好对上的性能。

AI 总览摘要

视频转音频生成(V2A)旨在合成与视频特征匹配的高质量音频。然而,现有模型在风格控制、审美质量评估和综合评分系统方面存在不足。V2A-DPO框架通过引入音频评分系统AudioScore和课程学习策略,显著提升了生成音频的质量和一致性。

V2A-DPO框架结合了音频评分系统AudioScore、自动化偏好对生成管道和课程学习优化策略。AudioScore用于评估生成音频的语义一致性、时间对齐和感知质量。通过结合少量人工标注的偏好对和自动生成的偏好对,形成大规模数据集用于优化。课程学习策略分阶段优化模型,提升生成音频的质量和一致性。

实验结果表明,V2A-DPO优化的MMAudio在音质和语义对齐上超越了DDPO优化和预训练模型,IS提升1.81,IB-score提升0.86,DeSync减少0.09。该方法在视频转音频生成领域具有重要意义,解决了现有模型在风格控制、审美质量评估和综合评分系统方面的不足。

深度解读

原文摘要

This paper introduces V2A-DPO, a novel Direct Preference Optimization (DPO) framework tailored for flow-based video-to-audio generation (V2A) models, incorporating key adaptations to effectively align generated audio with human preferences. Our approach incorporates three core innovations: (1) AudioScore-a comprehensive human preference-aligned scoring system for assessing semantic consistency, temporal alignment, and perceptual quality of synthesized audio; (2) an automated AudioScore-driven pipeline for generating large-scale preference pair data for DPO optimization; (3) a curriculum learning-empowered DPO optimization strategy specifically tailored for flow-based generative models. Experiments on benchmark VGGSound dataset demonstrate that human-preference aligned Frieren and MMAudio using V2A-DPO outperform their counterparts optimized using Denoising Diffusion Policy Optimization (DDPO) as well as pre-trained baselines. Furthermore, our DPO-optimized MMAudio achieves state-of-the-art performance across multiple metrics, surpassing published V2A models.

cs.SD cs.MM eess.AS