Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

TL;DR

利用OSSL-v2数据集,提出了基于对话的视频生成音乐方法,提升了生成音乐的时序一致性。

cs.SD 🔴 高级 2026-08-12 1 次浏览
Haven Kim Zachary Novack Julian McAuley Hao-Wen Dong
视频生成 音乐生成 对话信号 数据集 时序一致性

核心发现

方法论

该研究提出了一种新的视频生成音乐的方法,利用公开域电影集合中的对话作为条件信号。具体来说,研究通过扩展现有模型的视频交叉注意力机制,加入时间轴,并逐帧调制对话轨道。通过这种方法,模型能够更好地捕捉电影音乐与屏幕对话之间的时间耦合关系。

关键结果

  • 在OSSL-v2测试集上,GVMGen模型表现最佳,尤其在配对保真度上表现出色。
  • 对话适配器显著降低了VidMuse模型在OES-Com数据集上的KL散度,从1.47降至0.85。
  • 在低残留音乐子集上,对话信号的引入仍然改善了配对保真度,表明其贡献不依赖于音乐泄漏。

研究意义

该研究通过提供一个自托管且大规模的OSSL-v2数据集,解决了视频生成音乐领域中数据集不稳定的问题。通过引入对话作为条件信号,研究展示了在电影音乐生成中对话的重要性。这一方法不仅提高了生成音乐的时序一致性,还为未来的研究提供了一个稳定的基准。

技术贡献

技术贡献包括引入了对话信号作为条件输入,增强了视频生成音乐模型的时序一致性。通过逐帧调制对话轨道,该方法在不同数据集上均表现出色,尤其在配对保真度上显著优于现有基线。

新颖性

该研究首次将对话信号引入视频生成音乐的过程中,显著提高了生成音乐的时序一致性。这一创新在于利用对话与音乐之间的时间耦合关系,而非仅依赖于全局视频信息。

局限性

  • 该方法在处理无对话的视频时效果有限,因为缺乏对话信号作为条件输入。
  • 对话信号的质量可能影响最终生成音乐的效果。

未来方向

未来研究可以探索如何在无对话信号的情况下增强模型的生成能力,以及如何进一步优化对话信号的提取和利用。

AI 总览摘要

视频生成音乐是一个重要的研究领域,旨在根据视频内容自动生成匹配的音乐。然而,现有方法常常依赖于不稳定的网络数据集,导致可重复性差。为了解决这一问题,研究团队引入了一个新的自托管数据集OSSL-v2,该数据集包含34,343个视频片段,总时长达246.4小时,均来自公共领域电影。

该研究的核心创新是利用对话信号作为条件输入,增强视频生成音乐模型的时序一致性。通过在现有模型中加入时间轴,并逐帧调制对话轨道,研究展示了对话与音乐之间的时间耦合关系如何影响生成音乐的质量。实验结果表明,该方法在多个数据集上均优于现有基线,尤其在配对保真度上表现突出。

尽管该方法在有对话的视频上表现出色,但在无对话信号的情况下效果有限。未来研究可以探索如何在无对话信号的情况下增强模型的生成能力,以及如何进一步优化对话信号的提取和利用。

深度解读

原文摘要

Video-to-music generation has drawn growing interest for its role in conveying the emotion of visual media, including film. Progress in the field, however, is hampered by a reproducibility gap: models are often trained on crawled corpora referenced through YouTube URLs that may be deleted, with the underlying data often difficult and time-consuming to retrieve. To address this, we introduce the Open Screen Soundtrack Library version 2 (OSSL-v2), a self-hosted corpus of 34,343 video clips totaling 246.4 hours, sourced from public-domain films. Unlike crawled corpora, OSSL-v2 is reproducible (i.e., not subject to link rot) and copyright-conscious, yet still large enough to train functional video-to-music models. We then use this film-domain corpus to study dialogue as a conditioning signal for video-to-music generation, motivated by the close temporal coupling between film music and on-screen speech. Specifically, we augment existing models' video cross-attention with a time axis and modulate it frame-by-frame with the dialogue track. Evaluated on both public-domain and commercial films, our approach shows improvement over the state-of-the-art baselines. The dataset is available at https://huggingface.co/datasets/McAuley-Lab/OSSL-v2.

cs.SD cs.CV cs.MM