Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling
Motion-I2V利用扩散模型和显式运动建模,实现高一致性和可控的图像转视频,支持稀疏轨迹和区域控制。
核心发现
方法论
Motion-I2V将图像转视频任务分为两个阶段:第一阶段基于扩散模型预测像素轨迹,采用扩散式运动场预测器;第二阶段引入运动增强的时间注意机制,通过像素轨迹引导特征传播,增强时间一致性。训练中利用稀疏轨迹控制Net实现精细运动控制,支持区域动画和零样本视频转换。模型在WebVid-10M数据集上训练,结合预训练的Stable Diffusion和AnimateDiff,优化目标包括轨迹预测和帧生成的条件一致性。
关键结果
- 在80个多类别测试样本上,Motion-I2V在指令一致性指标上达34.86,优于VideoComposer的32.62,且在大幅运动场景中表现出更强的时间一致性和运动准确性,平均运动幅度达20.06像素,显著优于对比方法。定量指标显示其在prompt-following和帧连续性方面均优于SOTA方法。
- 通过消融实验验证,加入第一阶段运动预测显著提升视频的稳定性和运动真实性,使用注意力融合机制进一步改善帧间一致性,平均运动幅度降低至20像素,提升了整体生成质量。
- 在稀疏轨迹和区域动画控制方面,用户可以用少量标注实现精细运动编辑,模型支持多种控制方式,包括轨迹引导、区域遮罩和零样本视频迁移,增强了交互性和实用性。
研究意义
本研究突破了现有图像转视频在一致性和控制性上的瓶颈,提出的双阶段框架结合扩散模型与显式运动建模,有效应对大运动和视角变化,推动了视频生成技术的实用化。其支持精细控制和零样本迁移,为内容创作、虚拟现实和动画制作提供强大工具,具有广泛应用潜力。该方法的创新在于将运动预测与特征传播结合,显著提升生成质量与交互能力,填补了当前技术在大规模、多样化场景中的空白。
技术贡献
论文提出了基于扩散模型的运动场预测器,结合稀疏轨迹控制Net实现运动的精细操控。引入运动增强的时间注意机制,有效扩大时间感受野,改善时间一致性。模型在两个阶段中解耦运动建模与细节生成,提升了运动的真实性和细节的丰富性。该框架支持区域动画和零样本视频迁移,显著优于传统端到端方法,提供了更强的可控性和泛化能力。
新颖性
首次将扩散模型与显式像素轨迹预测结合,提出运动增强的时间注意机制,有效解决大运动场景中的时间一致性问题。引入稀疏轨迹控制Net,实现用户对运动轨迹的精细操控,支持区域动画和零样本迁移,突破了现有方法在控制性和一致性上的限制。这些创新使Motion-I2V在多样化场景中表现出优越性能,是图像转视频领域的重要突破。
局限性
- 模型对极端大运动或复杂场景仍存在一定的挑战,尤其在轨迹预测不准确时会影响生成效果。
- 训练依赖大量视频数据,计算成本较高,实时应用尚需优化。
- 对稀疏轨迹和区域控制的依赖可能在某些复杂场景下表现有限,未来需增强模型的鲁棒性。
未来方向
未来将探索多模态条件融合,如结合深度信息或语义指导,提升运动预测的准确性。还将优化模型的实时性能,扩展到更复杂的场景和更高分辨率的生成。此外,计划引入自监督学习和少样本训练策略,增强模型的泛化能力和交互性,推动其在虚拟现实、动画和内容创作中的广泛应用。
AI 总览摘要
Motion-I2V提出了一种创新的图像转视频框架,通过显式运动建模与扩散模型相结合,有效解决了大运动和视角变化带来的时间一致性问题。该方法将任务拆分为两个阶段:第一阶段利用扩散式运动场预测器,基于参考图像和文本条件,预测像素轨迹;第二阶段引入运动增强的时间注意机制,利用预测轨迹引导特征传播,增强时间一致性。训练中采用稀疏轨迹控制Net,实现用户对运动轨迹的精细操控,支持区域动画和零样本视频迁移。实验结果显示,Motion-I2V在WebVid-10M数据集上优于现有方法,特别在大幅运动场景中表现出更高的指令遵循性和帧间一致性。其创新点在于将运动预测与特征传播结合,有效扩大时间感受野,提升生成质量。该框架不仅增强了生成的控制性,也拓展了应用场景,为虚拟内容创作、虚拟现实和动画制作提供了强大工具。未来,作者计划结合多模态信息,优化实时性能,推动模型在更复杂场景中的应用,具有广阔的研究和产业前景。
深度分析
研究背景
随着深度学习和扩散模型的发展,图像生成已取得巨大突破,但视频生成面临时间一致性和控制性难题。早期方法多依赖光流或运动模板,难以应对复杂场景。近年来,扩散模型在图像合成中表现优异,推动了视频生成技术的发展,例如VideoDiffusion、Imagen-Video等,但仍存在运动真实性不足和控制能力有限的问题。现有方法多采用端到端训练,难以兼顾运动的精细操控与长时间序列的稳定性。本论文基于WebVid-10M大规模数据集,结合预训练的Stable Diffusion和AnimateDiff,试图解决大运动场景中的时间一致性和用户控制难题,推动图像转视频技术的实用化。
核心问题
当前图像转视频方法在处理大幅运动和视角变化时,容易出现时间不一致和运动模糊的问题。传统端到端模型难以同时保证运动的真实性和细节的丰富性,且缺乏细粒度控制能力。特别是在复杂场景中,模型难以准确预测运动轨迹,导致生成视频的连贯性不足。此外,现有技术在用户交互方面有限,难以实现精确的运动编辑和区域动画,限制了其在内容创作中的应用潜力。这些问题的根源在于缺乏显式的运动建模和有效的时间感受野扩展机制。
核心创新
本论文提出了双阶段框架:第一阶段利用扩散式运动场预测器,结合稀疏轨迹控制Net,实现像素级运动预测,增强运动真实性;第二阶段引入运动增强的时间注意机制,通过像素轨迹引导特征传播,扩大时间感受野,提升时间一致性。创新点包括:• 结合扩散模型与显式运动预测,突破端到端限制;• 利用稀疏轨迹实现用户交互式控制;• 引入运动增强的时间注意机制,有效应对大运动场景;• 支持区域动画和零样本视频迁移,增强实用性。这些创新使模型在多样场景中表现优越,兼顾运动真实性和控制性。
方法详解
- �� 利用预训练的Stable Diffusion作为基础,训练扩散式运动场预测器,输入参考图像和文本条件,输出像素轨迹;• 采用FlowFormer++和DOT作为光流和轨迹的监督工具,训练运动预测模型;• 设计稀疏轨迹控制Net,接受少量轨迹和区域掩码,生成密集运动场;• 在第二阶段,将预测的运动场作为引导,利用像素级特征变形,增强时间注意机制,通过Warp操作引入动态时间感受野;• 采用多尺度交叉注意,将变形特征融合到生成帧中,确保运动一致性和细节丰富;• 训练过程中,结合条件编码和多模态信息,优化运动预测与帧生成的协同效果。
实验设计
在WebVid-10M数据集上进行训练,第一阶段采用320×512分辨率,第二阶段320×320。模型性能通过prompt-following、帧连续性和运动幅度指标评估,比较对象包括VideoComposer、I2VGen-XL和DynamiCrafter。定量结果显示,Motion-I2V在prompt一致性上达34.86,优于对比方法的32.62,平均运动幅度为20.06像素,显著优于其他方法。还通过消融实验验证运动预测和注意机制的贡献,显示模型在大运动场景中的优越表现。用户控制方面,支持稀疏轨迹、区域遮罩和零样本迁移,验证其交互性和多样性。
结果分析
实验结果表明,Motion-I2V在多个指标上优于现有方法,尤其在大幅运动和复杂视角变化中表现出更高的时间一致性和运动真实性。定量指标如prompt-following得分34.86,优于VideoComposer的32.62,平均运动幅度20.06像素,显示其在运动控制和细节保持方面的优势。消融实验验证了运动预测和增强机制的有效性,模型在多场景下均表现出稳定性和鲁棒性。用户控制实验表明,稀疏轨迹和区域动画能实现精细运动编辑,增强了模型的交互性。
应用场景
该技术可广泛应用于虚拟内容创作、动画制作、虚拟现实和增强现实等领域。用户只需提供参考图像和少量运动标注,即可生成高质量、长时间连续的视频内容。模型支持零样本迁移,方便将已有视频风格迁移到新内容中,极大提升内容生产效率。未来还可结合语义理解和多模态信息,推动个性化虚拟主播、虚拟偶像等应用的发展,满足多样化的产业需求。
局限与展望
模型在极端大运动或复杂场景中仍存在轨迹预测不准确的问题,导致生成效果下降。训练依赖大量视频数据,计算成本高,难以实现实时应用。对稀疏轨迹和区域控制的依赖在某些复杂场景中表现有限,未来需增强鲁棒性和泛化能力。此外,模型在高分辨率和多模态条件下的性能仍需优化,以满足实际应用需求。
通俗解读 非专业人士也能看懂
想象你在厨房里做菜,准备各种食材和调料。每次做菜都需要按照食谱步骤,控制火候和时间,确保菜肴美味。现在,假设你有一台智能厨师,它可以根据你的指示,自动调整火候、时间和调料,用最合适的方式完成一道菜。Motion-I2V就像这个智能厨师,它可以根据你给的图片和指令,自动“炒”出一段连续的视频,表现出食材的变化和动作。它先预测每个“食材”的运动轨迹,然后用这些轨迹引导整个“烹饪”过程,确保每一帧都符合预期的动作和场景变化。这样,无论动作多大或视角怎么变,视频都能保持连贯和真实,就像厨师精心烹饪一样。
简单解释 像给14岁少年讲一样
想象你在用手机拍视频,但你希望让视频里的动作更酷、更大或者更有趣。现在有一种特别的技术,可以帮你做到这一点。它先观察你给的图片,预测里面的物体会怎么动,就像提前知道运动轨迹一样。然后,它用这些预测的运动,把图片变成一段连续的视频,就像动画一样。你还可以用手指画出一些轨迹,告诉它你想让哪个部分动得更厉害,或者只让某个区域动起来,就像用画笔在画画一样。这项技术还能把别的视频风格变成你喜欢的样子,变成动画或电影场景。虽然还不能完美应对所有复杂动作,但它已经让视频变得更真实、更可控,未来会变得更厉害!
原文摘要
We introduce Motion-I2V, a novel framework for consistent and controllable image-to-video generation (I2V). In contrast to previous methods that directly learn the complicated image-to-video mapping, Motion-I2V factorizes I2V into two stages with explicit motion modeling. For the first stage, we propose a diffusion-based motion field predictor, which focuses on deducing the trajectories of the reference image's pixels. For the second stage, we propose motion-augmented temporal attention to enhance the limited 1-D temporal attention in video latent diffusion models. This module can effectively propagate reference image's feature to synthesized frames with the guidance of predicted trajectories from the first stage. Compared with existing methods, Motion-I2V can generate more consistent videos even at the presence of large motion and viewpoint variation. By training a sparse trajectory ControlNet for the first stage, Motion-I2V can support users to precisely control motion trajectories and motion regions with sparse trajectory and region annotations. This offers more controllability of the I2V process than solely relying on textual instructions. Additionally, Motion-I2V's second stage naturally supports zero-shot video-to-video translation. Both qualitative and quantitative comparisons demonstrate the advantages of Motion-I2V over prior approaches in consistent and controllable image-to-video generation. Please see our project page at https://xiaoyushi97.github.io/Motion-I2V/.