Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

TL;DR

Gen-L-Video以时序协同去噪扩展短视频模型,帧一致性达93.18%。

cs.CV 🔴 高级 2023-05-30 21 次浏览
Fu-Yun Wang Wenshuo Chen Guanglu Song Han-Jia Ye Yu Liu Hongsheng Li
长视频生成 扩散模型 多文本条件 时序协同去噪 视频编辑

核心发现

方法论

Gen-L-Video不训练新的长视频模型,而将任意长视频拆为带时间重叠的短片段。对每段使用现成短视频扩散模型独立去噪,再以加权最小二乘方式融合重叠帧,近似整体长视频的反向扩散轨迹。片段文本可独立指定,缺失文本则线性插值。框架兼容VideoCrafter、Pix2Video和Tune-A-Video。

关键结果

  • 在论文定量评测中,Gen-L-Video的帧一致性平均分为93.18,孤立去噪基线为91.65;人类偏好分别为85.38%和14.62%。文本对齐平均分为21.18,略高于基线21.16;方差由0.57降至0.48。
  • 框架可生成数百帧、含多个语义片段的视频,并统一支持预训练t2v、免调优t2v和一次调优t2v。相较孤立片段去噪,它显著减少颜色、主体和细节在片段边界处的不连续。
  • 当步长S取短片长度M的1/2或1/4时,作者观察到较好的质量—效率平衡;S=M时退化为孤立去噪。双向跨帧注意力优于以首帧为锚点的稀疏因果注意力。

研究意义

论文缓解了视频扩散模型长期存在的长度、连贯性与单文本限制。它不依赖大规模长视频数据或自回归生成,因此避免误差累积和严格串行推理。对研究者而言,该工作提供了把成熟短视频模型组合成可扩展长视频系统的通用范式;对产业而言,它降低了长视频生成、分段叙事和精确编辑的工程门槛。

技术贡献

核心贡献是Temporal Co-Denoising:定义映射Fi从长视频提取重叠短片,并通过vt−1=argminvΣi‖Wi⊗(Fi(v)−vit−1)‖²₂重建长视频。作者还提出中间锚点的Bi-Directional Cross-Frame Attention,改善信息双向传播;在Tune-A-Video中加入片段标识符ei并随机丢弃,结合CFG抑制过拟合。该设计无需额外训练即可复用现有模型。

新颖性

与LVDM、NUWA-XL等直接建模或自回归生成长视频的方法不同,Gen-L-Video把长视频去噪重新表述为重叠短片的并行协同去噪。其新颖性不在于新的基础扩散网络,而在于一个模型无关、可迁移、支持多文本的组合式长视频推理机制。

局限性

  • 方法近似整体长视频反向过程,质量依赖短视频模型本身;复杂运动、长期身份保持和极长时序仍可能出现漂移。
  • 论文主要报告汇总分数与视觉比较,未提供统一的大规模长视频数据集、完整运行成本或不同长度下的系统曲线。
  • 重叠片段会增加计算量;文本插值假设语义变化可平滑过渡,对突变叙事未必适用。

未来方向

未来可研究自适应重叠步长、全局身份记忆和更高效的窗口调度,并建立标准化长视频、多文本评测集。结合更强的运动控制、分层扩散和开放集分割,可进一步支持镜头级叙事、对象级编辑及实时生成。

AI 总览摘要

长视频生成面临两个相互牵制的难题:扩散模型通常只处理少于24帧,且一个视频往往需要多个文本提示。直接拼接短片会造成颜色、主体和细节跳变;自回归长视频方法则会累积误差、降低推理效率,并常需额外长视频训练。

Gen-L-Video提出Temporal Co-Denoising,将长视频视为时间上重叠的短片集合。每个窗口由现成短视频扩散模型在独立文本条件下去噪,再依据重叠位置的权重融合回长序列。窗口步长S可取M/2或M/4;文本不足时使用条件插值。框架被接入VideoCrafter、Pix2Video和Tune-A-Video,并以中间锚点的双向跨帧注意力改善一致性。

结果显示,帧一致性从孤立去噪的91.65升至93.18,人类偏好从14.62%升至85.38%,文本对齐为21.18,对比基线21.16;方差由0.57降至0.48。该方法展示了无需额外训练即可生成数百帧、多语义片段视频的可行性,但其效果仍受短视频基础模型、重叠计算和长期语义记忆限制。

深度分析

研究背景

文本到图像扩散模型、LDM、Classifier-Free Guidance和大规模图文预训练推动了视频生成。VideoCrafter在WebVid-10M上训练并加入Temporal Attention;Pix2Video、Fate-Zero和Text2Video-Zero尝试免调优编辑;Tune-A-Video支持单视频调优。然而多数方法少于24帧,长视频工作如Phenaki、NUWA-Infinity和TATS多采用自回归机制,存在误差累积与串行效率问题。

核心问题

目标是生成或编辑任意长度、跨多个语义片段且内容连续的视频。直接运行短视频模型会在片段边界产生颜色和身份不一致;全局Temporal Attention的计算随帧数近似二次增长;单文本条件也无法表达真实视频中随时间变化的叙事。

核心创新

  • ��以重叠窗口近似长视频去噪,而非训练新长视频生成器。
  • ��以加权最小二乘融合所有窗口的对应帧,保持边界连续。
  • ��每个窗口使用独立文本,未标注窗口可由相邻条件插值。
  • ��将锚点置于窗口中部,提出双向跨帧注意力。
  • ��通过片段标识符与随机丢弃结合CFG,使Tune-A-Video区分窗口又保留编辑能力。

方法详解

  • ��输入:纯噪声或经DDIM inversion得到的长视频潜变量vt。
  • ��切分:Fi(vt)=vt,S*i:S*i+M,窗口长度为M、步长为S;S=M/2或M/4通常有效。
  • ��去噪:每个窗口由短视频模型psθ(vit−1|vit,ci)并行处理,ci可为独立提示。
  • ��融合:求解argminvΣi‖Wi⊗(Fi(v)−vit−1)‖²₂,重叠帧按权重平均回写。
  • ��编辑:对输入视频执行DDIM inversion,再以新提示采样。
  • ��适配:VideoCrafter用于预训练t2v,Pix2Video用于免调优,Tune-A-Video加入ei和CFG;ControlNet、T2I-Adapter、DreamBooth和LoRA可扩展控制。

实验设计

作者覆盖三类范式:VideoCrafter、Pix2Video和Tune-A-Video,并比较Isolated、稀疏因果注意力与Gen-L-Video。评估指标包括Frame Consistency、Textual Alignment、人类偏好及文本对齐方差。论文还考察窗口步长、双向注意力和片段标识符,并展示ControlNet、检测分割与对象级视频修复案例。基础预训练视频模型使用WebVid-10M。

结果分析

Gen-L-Video的Frame Consistency为93.18,Isolated为91.65;人类偏好为85.38%对14.62%。Textual Alignment平均分为21.18对21.16,方差为0.48对0.57,说明一致性提升没有明显牺牲文本匹配。视觉结果显示,孤立去噪会使吉普车颜色跨片段变化,而协同去噪更平滑。双向注意力修复了首帧锚定导致的早期帧不一致。

应用场景

可用于多镜头广告、故事板预演、分段叙事、长时环境模拟和视频风格编辑。用户可为不同窗口输入“兔子吃西瓜”“老虎奔跑”等提示,也可用ControlNet提供姿态或分割布局,并借助开放集检测与分割只修改指定对象、保留背景。

局限与展望

该方法依赖已有短视频扩散模型,不能从根本上解决长期运动规划、身份保持和物理一致性。窗口重叠虽改善边界,却增加显存和计算;窗口独立文本的插值不适合语义突变。论文尚缺少统一长视频基准、详细耗时和规模化用户研究,未来需要全局记忆、自适应窗口及更系统的评测。

通俗解读 非专业人士也能看懂

把视频想成一条很长的餐厅流水线,而现有模型只会一次处理一小盘菜。若把长订单硬切成互不相干的小盘,后一盘的颜色和味道可能突然变化。Gen-L-Video让相邻小盘共享一部分菜品:每个小厨房根据自己的菜单制作,但共享部分要反复对照,最后按重叠部分把整条订单拼起来。

不同时间段可以有不同菜单,例如前半段是海边,后半段是森林;如果只写了开头和结尾,系统还会在中间逐步改变菜单。它不是先做完一段再决定下一段,而是让所有小厨房同时工作,所以不会因为前面的小错误不断传给后面。这个方法的代价是重叠工作会增加,但成品更连贯。

简单解释 像给14岁少年讲一样

想象你要制作一部很长的游戏过场动画,但手里的生成器一次只能做20帧。把每20帧单独做完再拼接,角色衣服可能变色,汽车也可能突然换样子。Gen-L-Video的办法是让相邻片段重叠,比如第二段从第一段的后10帧开始;大家同时制作,再把重叠画面对齐。

每段还可以听不同指令:先说“兔子吃西瓜”,后来改成“老虎走过沙滩”。如果只给少数指令,系统会在中间慢慢过渡。论文把这种方法接到VideoCrafter、Pix2Video和Tune-A-Video上,帧一致性达到93.18,远高于孤立处理的91.65。酷的地方是不用重新训练长视频模型,但更长的故事、复杂动作和计算速度仍然是挑战。

术语表

Temporal Co-Denoising(时序协同去噪)

让多个时间重叠的短视频窗口并行去噪,再融合为长视频。它用局部模型近似全局反向扩散过程。

论文的核心框架。

DDIM inversion(DDIM反演)

将给定视频沿确定性扩散轨迹映射回近似噪声。这样可在保持原内容的基础上进行编辑。

长视频编辑的初始化步骤。

Classifier-Free Guidance(无分类器引导)

按公式(1+w)ε条件−wε无条件增强文本方向。引导过强可能损害多样性。

文本生成与片段标识符训练。

Bi-Directional Cross-Frame Attention(双向跨帧注意力)

让窗口中部锚点向前后传播信息,而非只从第一帧单向传播。它改善长序列的早期帧一致性。

Pix2Video和Tune-A-Video适配。

WebVid-10M

大规模文本—视频数据集。VideoCrafter在其上进行视频扩散训练。

预训练t2v基础模型。

Sparse Causal Attention(稀疏因果注意力)

每帧主要关注前一帧和首帧,以较低成本传递时序信息。长视频中可能造成单向漂移。

论文比较并改进的注意力机制。

开放问题 这项研究留下的未解疑问

  • 1 长期身份与运动如何在数百乃至数千帧中稳定保持,当前实验尚未给出按视频长度分解的系统曲线。
  • 2 窗口融合的近似误差、最优权重Wi与文本突变场景之间的关系仍缺少理论界限和大规模评测。

应用场景

近期应用

多镜头广告预演

广告团队可为不同时间窗口输入产品、场景和动作提示,用VideoCrafter生成连续草案,再以ControlNet约束构图,快速比较多种分镜方案。

对象级视频编辑

结合开放集检测与分割,用户可只替换视频中的动物、车辆或人物,并保留背景;适合短片后期、素材改版和个性化内容制作。

远期愿景

长篇交互式叙事

未来可把脚本拆成连续语义片段,由全局记忆管理角色和场景,再用协同去噪并行生成影视预览、虚拟世界或游戏剧情。

原文摘要

Leveraging large-scale image-text datasets and advancements in diffusion models, text-driven generative models have made remarkable strides in the field of image generation and editing. This study explores the potential of extending the text-driven ability to the generation and editing of multi-text conditioned long videos. Current methodologies for video generation and editing, while innovative, are often confined to extremely short videos (typically less than 24 frames) and are limited to a single text condition. These constraints significantly limit their applications given that real-world videos usually consist of multiple segments, each bearing different semantic information. To address this challenge, we introduce a novel paradigm dubbed as Gen-L-Video, capable of extending off-the-shelf short video diffusion models for generating and editing videos comprising hundreds of frames with diverse semantic segments without introducing additional training, all while preserving content consistency. We have implemented three mainstream text-driven video generation and editing methodologies and extended them to accommodate longer videos imbued with a variety of semantic segments with our proposed paradigm. Our experimental outcomes reveal that our approach significantly broadens the generative and editing capabilities of video diffusion models, offering new possibilities for future research and applications. The code is available at https://github.com/G-U-N/Gen-L-Video.

cs.CV