NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation

TL;DR

NUWA-XL通过“扩散上的扩散”生成超长视频,推理时间减少94.26%。

cs.CV 🔴 高级 2023-03-22 39 次浏览
Shengming Yin Chenfei Wu Huan Yang Jianfeng Wang Xiaodong Wang Minheng Ni Zhengyuan Yang Linjie Li Shuguang Liu Fan Yang Jianlong Fu Gong Ming Lijuan Wang Zicheng Liu Houqiang Li Nan Duan
视频生成 扩散模型 长视频 并行推理 深度学习

核心发现

方法论

NUWA-XL采用“扩散上的扩散”架构,通过全局扩散模型生成关键帧,然后局部扩散模型填充相邻帧之间的内容。此方法支持并行推理,显著提高了生成效率。

关键结果

  • 在FlintstonesHD数据集上,NUWA-XL生成1024帧视频的推理时间从7.55分钟减少到26秒,平均FID从48.56降至35.79。
  • 与现有方法相比,NUWA-XL在长视频生成中表现出更高的帧一致性和细节保真度。
  • 通过消融实验验证,NUWA-XL的多尺度注入和对称注入策略显著提高了视频质量。

研究意义

NUWA-XL在长视频生成领域具有重要意义,解决了训练与推理间的巨大差距问题,并通过并行化提高了推理速度。这一突破为生成高质量、长时间的视频内容提供了新的可能性,尤其在影视制作和虚拟现实等领域具有广泛应用潜力。

技术贡献

NUWA-XL首次实现了直接在长视频上训练的扩散模型,消除了训练与推理的差距。其“粗到细”的生成策略和并行推理能力显著提升了长视频生成的效率和质量。

新颖性

NUWA-XL是首个在长视频上直接训练的扩散模型,采用“扩散上的扩散”架构,与传统的“自回归”方法相比,显著提高了生成效率和视频质量。

局限性

  • 目前仅在FlintstonesHD数据集上验证,缺乏开放域长视频的测试。
  • 对数据需求较高,训练长视频时可能面临数据不足的问题。
  • 并行推理需要合理的GPU资源支持。

未来方向

未来工作包括扩展到开放域长视频数据集,并优化模型以减少对数据和计算资源的依赖。此外,探索更高效的并行推理策略也是一个重要方向。

AI 总览摘要

NUWA-XL通过“扩散上的扩散”架构解决了长视频生成中的训练-推理差距问题。传统方法在短视频上训练,推理长视频时面临帧间不一致和推理时间长的问题。NUWA-XL采用全局扩散模型生成关键帧,然后局部扩散模型填充帧间内容,实现并行推理,大幅提高了效率。

实验结果表明,NUWA-XL在FlintstonesHD数据集上生成1024帧视频的推理时间从7.55分钟减少到26秒,平均FID显著降低。通过直接在长视频上训练,NUWA-XL克服了传统方法的局限性,生成的视频在帧一致性和细节保真度上表现优异。

尽管NUWA-XL在长视频生成中取得了显著进展,但仍需在开放域视频上进行验证,并优化模型以减少对资源的依赖。未来的研究方向包括扩展数据集和改进并行推理策略,以进一步提升生成效率和质量。

深度分析

研究背景

视频生成技术近年来取得了显著进展,尤其是在短视频生成领域。然而,长视频生成仍面临挑战,主要由于计算资源需求高和训练推理差距大。现有方法多采用“自回归”架构,在短视频上训练,再通过滑动窗口生成长视频,但存在帧间不一致和推理时间长的问题。

核心问题

长视频生成的核心问题在于训练和推理间的差距。传统方法在短视频上训练,推理长视频时无法保证帧间一致性,且推理时间长,难以满足实际应用需求。解决这一问题对于提升视频生成质量和效率至关重要。

核心创新

NUWA-XL的核心创新在于其“扩散上的扩散”架构。通过全局扩散模型生成关键帧,再由局部扩散模型填充帧间内容,实现并行推理。这一策略不仅提高了生成效率,还消除了训练与推理间的差距。

方法详解

  • �� 全局扩散模型生成关键帧,形成视频的“粗略”故事线。
  • �� 局部扩散模型填充相邻帧间的内容,生成“精细”帧。
  • �� 通过并行推理显著提高生成效率,支持在长视频上直接训练。

实验设计

在FlintstonesHD数据集上进行实验,使用平均FID和B-FVD-16评估生成质量。与Phenaki和FDM等方法相比,NUWA-XL在生成质量和推理速度上均有显著提升。消融实验验证了多尺度注入和对称注入策略的有效性。

结果分析

NUWA-XL在1024帧视频生成中,推理时间从7.55分钟减少到26秒,平均FID从48.56降至35.79。与现有方法相比,NUWA-XL在帧一致性和细节保真度上表现更优。

应用场景

NUWA-XL可用于影视制作、虚拟现实等需要长视频生成的领域。其高效的并行推理能力使其在需要快速生成高质量视频的场景中具有优势。

局限与展望

目前仅在FlintstonesHD数据集上验证,缺乏开放域长视频的测试。对数据需求较高,训练长视频时可能面临数据不足的问题。并行推理需要合理的GPU资源支持。

通俗解读 非专业人士也能看懂

想象你在制作一部动画电影。传统方法就像逐帧画出每个场景,耗时且容易出错。NUWA-XL则像是先画出关键场景,再自动填充细节,速度快且效果好。它通过并行处理多个场景,大幅减少了制作时间。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏。传统方法是逐块拼出整个图案,耗时且容易出错。NUWA-XL就像先拼出几个关键部分,然后自动填充其他部分,速度快且效果好。它通过并行处理多个部分,大幅减少了拼图时间!

术语表

扩散模型 (Diffusion Model)

一种生成模型,通过逐步添加噪声来生成数据。

用于生成关键帧和填充帧之间的内容。

自回归模型 (Autoregressive Model)

一种生成模型,依赖于前一时刻的数据生成下一时刻的数据。

传统长视频生成方法中常用的架构。

FID (Fréchet Inception Distance)

用于评估生成图像质量的指标,数值越低表示质量越高。

用于评估生成视频的平均帧质量。

B-FVD (Block Fréchet Video Distance)

用于评估生成视频质量的指标,将长视频分成短片段计算平均FVD。

用于评估长视频生成的质量。

并行推理 (Parallel Inference)

同时处理多个任务以提高计算效率的方法。

NUWA-XL通过并行推理显著提高了生成效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在开放域长视频上验证NUWA-XL的有效性?
  • 2 如何减少NUWA-XL对数据和计算资源的依赖?

应用场景

近期应用

影视制作

NUWA-XL可用于快速生成高质量的长视频,提升影视制作效率。

虚拟现实

在虚拟现实中应用NUWA-XL,可生成高质量的沉浸式视频体验。

远期愿景

开放域长视频生成

扩展NUWA-XL至开放域长视频生成,需解决数据和资源问题。

原文摘要

In this paper, we propose NUWA-XL, a novel Diffusion over Diffusion architecture for eXtremely Long video generation. Most current work generates long videos segment by segment sequentially, which normally leads to the gap between training on short videos and inferring long videos, and the sequential generation is inefficient. Instead, our approach adopts a ``coarse-to-fine'' process, in which the video can be generated in parallel at the same granularity. A global diffusion model is applied to generate the keyframes across the entire time range, and then local diffusion models recursively fill in the content between nearby frames. This simple yet effective strategy allows us to directly train on long videos (3376 frames) to reduce the training-inference gap, and makes it possible to generate all segments in parallel. To evaluate our model, we build FlintstonesHD dataset, a new benchmark for long video generation. Experiments show that our model not only generates high-quality long videos with both global and local coherence, but also decreases the average inference time from 7.55min to 26s (by 94.26\%) at the same hardware setting when generating 1024 frames. The homepage link is \url{https://msra-nuwa.azurewebsites.net/}

cs.CV cs.AI