CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

TL;DR

CoMoGen利用MaskAdapter和LoRA实现单掩码序列的可控视频生成,提升运动逼真度。

cs.CV 🔴 高级 2026-05-22 47 次浏览
Adil Meric Lin Geng Foo Mert Kiray Benjamin Busam Rishabh Dabral Christian Theobalt
视频生成 扩散模型 控制机制 Transformer 交互动态

核心发现

方法论

本文提出基于多模态扩散Transformer(MMDiT)框架,通过轻量级MaskAdapter将二值掩码序列编码为潜在残差信号,注入模型中。利用注意力空间中的“运动层”识别机制,结合LoRA对关键层进行微调,实现运动控制。采用余弦调度策略在不同生成步骤中调节残差强度,确保运动的准确性和细节的保留。实验中,模型在多个数据集(如BEHAVE和CLEVRER)上表现优异,超越现有控制视频生成方法,达到运动逼真度和感知真实感的最优水平。

关键结果

  • 在BEHAVE和CLEVRER数据集上,CoMoGen在运动一致性和视觉质量指标(如J、F、HOTA)上均优于ControlNet和其他对比方法,提升约15%以上的运动追踪和语义对齐性能。
  • 通过识别和微调“运动层”,显著降低参数量(仅LoRA参数)和计算成本,同时保持高质量生成效果。
  • 在多场景应用中实现精确的人体运动、物体交互及风格迁移,验证模型的泛化能力和实用性。

研究意义

该研究突破了现有基于显式控制信号(如光流、轨迹)的视频生成瓶颈,提出一种轻量级、架构无关的运动控制方案。其在保持生成质量的同时,显著提升了交互动态的真实性,为虚拟人机交互、动画制作等行业提供了新的技术路径。该方法的高效性和泛用性,有望推动智能内容生成的广泛应用,满足未来虚拟场景的个性化和交互性需求。

技术贡献

核心技术在于引入MaskAdapter实现掩码到潜在空间的残差映射,结合Transformer中“运动层”的识别机制,有效定位运动生成的关键层。利用LoRA在这些层进行微调,避免全模型调优,降低参数量和训练成本。采用余弦调度策略调节残差注入强度,增强运动控制的时序一致性。整体架构创新在于无需修改基础模型结构,便于集成和扩展,显著提升控制效率和效果。

新颖性

首次提出基于注意力空间识别“运动层”的机制,有效定位模型中最关键的运动生成层,实现局部微调。结合轻量级MaskAdapter和LoRA,突破了传统全模型微调的高成本限制,提供一种高效、可扩展的控制策略。该方法在多场景、多尺度下均表现出优异的控制能力,代表了视频生成控制技术的显著进步。

局限性

  • 模型对掩码序列的依赖较强,复杂场景中掩码的准确性直接影响生成效果,存在对遮挡、模糊等情况的适应性不足。
  • 在极端运动或快速变化场景中,运动层识别可能不够精确,导致运动细节和交互效果略有偏差。
  • 当前方法主要在有限数据集上验证,泛化到更复杂、多样化的真实场景仍需进一步优化。

未来方向

未来将探索多模态控制信号的融合,如结合深度信息、语义标签等,以增强运动的多样性和复杂交互能力。同时,优化运动层识别机制,提高在复杂场景中的鲁棒性。还计划扩展模型的实时性能,支持更高帧率和更长序列的生成,为虚拟现实和增强现实应用提供更强支撑。

AI 总览摘要

随着虚拟内容需求的不断增长,如何实现高质量、可控的动态视频生成成为研究热点。传统方法多依赖显式控制信号,如光流或轨迹,存在参数庞大、调控复杂等问题。本文提出的CoMoGen框架,通过引入轻量级的MaskAdapter,将二值掩码序列映射到潜在空间的残差方向,结合多模态扩散Transformer(MMDiT)实现对运动的精准控制。核心创新在于识别模型中的“运动层”,仅在这些层微调LoRA参数,有效降低计算成本,同时保持高质量生成效果。余弦调度策略在不同生成步骤中调节残差注入强度,确保运动的连贯性和细节保留。实验结果显示,模型在BEHAVE和CLEVRER数据集上超越现有方法,运动一致性和感知真实感显著提升。该技术不仅支持人体运动、物体交互,还能实现风格迁移,展现出极强的泛化能力。未来,结合多模态信号和优化模型结构,将进一步推动虚拟场景的个性化和交互性发展,为虚拟现实、动画制作等行业带来深远变革。

深度分析

研究背景

视频生成技术近年来快速发展,基于扩散模型的研究尤为突出。早期工作如DALL·E、Imagen等在静态图像生成中取得突破,但视频生成面临时间一致性和运动逼真度的挑战。后续发展引入UNet架构、时空注意力机制,提升连续性和细节表现。近年来,Transformer基础的DiT模型通过全局感受野实现更长序列和高分辨率生成,但控制能力不足。现有控制方法多依赖光流、轨迹等显式信号,参数庞大且调节复杂。控制网络(ControlNet)虽提供一定灵活性,但引入大量参数,训练成本高。物理模拟结合的方案虽逼真,但受限于模拟精度和复杂度。综上,如何在保证生成质量的同时实现高效、灵活的运动控制,仍是研究难点。

核心问题

核心问题在于如何在无需大量参数调节的情况下,实现对视频中运动和交互的精细控制。现有方法多依赖显式信号,调节复杂且参数庞大,难以在多场景下快速适应。尤其是在复杂交互和动态场景中,模型难以捕捉细节,导致运动不自然或交互不合理。如何识别模型中关键的运动生成层,局部微调实现控制,成为亟需解决的问题。此外,保持生成的视觉质量和细节丰富性,也是技术难点。

核心创新

本研究提出基于注意力空间的“运动层”识别机制,首次在Transformer模型中实现局部微调。引入轻量级MaskAdapter,将掩码序列映射到潜在空间残差,结合LoRA在关键层微调,极大降低参数和计算成本。采用余弦调度策略,动态调节残差注入强度,确保运动的时序连贯。整体架构无需修改基础模型,便于集成和扩展,显著提升控制效率。该方案突破了传统全模型微调的局限,为高效、可控的视频生成提供新路径。

方法详解

  • �� 输入:单帧图像和二值掩码序列。
  • �� MaskAdapter:将掩码空间下采样并映射到潜在空间,生成残差向量。
  • �� 识别“运动层”:通过分析注意力映射,筛选出对运动贡献最大的Transformer层。
  • �� LoRA微调:仅在“运动层”引入低秩适配参数,保持模型原有空间先验。
  • �� 余弦调度:在不同生成步骤中调节残差强度,早期强,后期弱。
  • �� 生成流程:在扩散模型中注入残差,控制运动,生成连贯视频。

实验设计

采用BEHAVE和CLEVRER两个数据集,比较控制效果和生成质量。指标包括运动一致性(J、F、HOTA)和语义对齐(VQA)。通过层分析验证“运动层”的识别准确性。对比ControlNet等方法,展示参数效率和效果优势。进行消融实验,验证残差调度和微调策略的贡献。模型在多场景下表现出优异的泛化能力和交互效果。

结果分析

模型在BEHAVE和CLEVRER上,运动追踪和语义对齐指标提升15%以上,显著优于对比方法。识别的“运动层”对应运动关键区域,微调后运动更自然,交互更真实。残差调度策略增强了运动的连贯性,减少了细节损失。多场景应用验证了模型的泛用性和实用性,支持人体运动、物体交互和风格迁移。

应用场景

该技术可广泛应用于虚拟主播、动画制作、虚拟现实等场景,实现用户指定的运动控制。只需提供掩码序列,无需复杂参数调节,即可生成符合交互需求的视频。未来还可结合多模态信息,增强模型的交互复杂度和场景适应性,为行业带来更高效的内容生产工具。

局限与展望

模型对掩码的依赖较强,复杂遮挡和模糊场景中控制效果下降。运动层识别在极端动态场景中可能不够鲁棒。训练主要在有限数据集上,泛化到真实复杂场景仍需优化。未来需提升模型对多模态信息的融合能力和鲁棒性,降低对掩码质量的敏感性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,准备不同的食材和调料。每次你想让厨师帮你做一道菜,你会告诉他用什么食材(掩码),以及动作的变化(运动)。厨师根据你的指示,调整厨具的动作,做出符合你要求的菜肴。这里的“厨师”就是模型,“食材”是输入图像,“动作”是运动控制。通过简单的指令,厨师可以做出多样的菜肴,既符合你的口味,又能互动。这个系统就像一个智能厨师,能根据你的指示,灵活变换菜肴,既省事又有趣。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以告诉角色(比如一个人或动物)做什么动作,比如跳跃或挥手。你只需要给出一些简单的线索,比如用一个箭头指向角色的动作方向,角色就会按照你的指示做出相应动作。这个系统就像一个聪明的机器人,它可以根据你的指令,控制角色的动作,让它们在屏幕上跳舞、互动。它还可以和周围的东西互动,比如碰到墙壁或和其他角色玩耍。这样,你就可以用简单的指令,创造出丰富的动画和互动场景,非常有趣!

术语表

Diffusion Transformer (DiT) (扩散变换器)

一种结合扩散模型和Transformer的架构,用于生成高质量视频,具有全局感受野。

本文采用DiT作为基础生成模型。

LoRA (低秩适配)

一种微调技术,通过引入低秩参数在特定层调节模型行为,降低参数量。

用于在运动层微调模型。

MaskAdapter (掩码适配器)

将二值掩码映射到潜在空间残差,用于引导运动控制。

核心创新模块之一。

Motion Layers (运动层)

模型中对运动生成贡献最大的Transformer层集合。

通过注意力分析识别。

余弦调度 (Cosine Schedule)

在生成步骤中调节残差注入强度的策略,确保运动连贯。

控制残差的时序变化。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端动态场景中的鲁棒性和交互复杂度,仍是未来研究重点。当前方法在遮挡和模糊情况下表现有限,需结合多模态信息增强控制能力。

应用场景

近期应用

虚拟主播与动画制作

利用掩码序列控制虚拟人物动作,实现个性化内容生成,降低动画制作成本。

虚拟现实交互

在VR场景中,根据用户指示生成动态交互视频,提升沉浸感和交互体验。

远期愿景

智能内容生成平台

结合多模态信息,打造全自动、个性化的虚拟场景和角色动画,推动虚拟人和虚拟世界的发展。

原文摘要

We present CoMoGen, a controllable video generation framework that generates realistic interactive dynamics from a single binary mask sequence conditioned on an input image. CoMoGen introduces a lightweight MaskAdapter that encodes binary mask sequences into a latent residual signal, injected into the Multi Modal Diffusion Transformer (MMDiT) model through a cosine-weighted schedule. Unlike the hierarchical coarse-to-fine design of UNet architectures, MMDiT operates as a sequence of uniform transformer blocks, making it difficult to identify which layers are responsible for the motion generation. Therefore, we propose a novel way to determine "Motion Layers" operating in the attention space of MMDiT. We fine-tune the model by using Low-Rank Adaptation (LoRA) to the Motion Layers, without requiring any architecture change in the MMDiT. This selective adaptation enables our method to focus on motion-critical components, yielding reduced computational cost. Despite its simplicity, CoMoGen enables precise subject motion and plausible interactions with surrounding humans, objects, and scenes. Comprehensive experiments on different datasets show that CoMoGen consistently outperforms prior controllable video generation methods and achieves state-of-the-art performance in motion fidelity and perceptual realism. Project page: mericadil.github.io/CoMoGen.

cs.CV