MobileWan: Closing the Quality Gap for Mobile Video Diffusion

TL;DR

提出MobileWan,通过递归重构与结构压缩,实现5B参数移动端高质量视频扩散生成。

cs.CV 🔴 高级 2026-07-07 43 次浏览
Mohsen Ghafoorian Denis Korzhenkov Adil Karjauv Ioannis Lelekas Noor Fathima Spyridon Stasis Hanno Ackermann Boris van Breugel Markus Nagel Fatih Porikli Animesh Karnewar Amirhossein Habibian
视频生成 扩散模型 移动端 模型压缩 递归重构

核心发现

方法论

本文提出基于递归蒸馏的结构化压缩框架,将原始5B参数的视频扩散Transformer转化为逐块自回归过程。采用因果线性注意力实现常量空间复杂度,模型在推理时表现为RNN,确保时间连续性。引入可学习的注意头剪枝,通过二值门控优化稀疏性,结合采样步蒸馏和内存优化的VAE解码,显著降低模型存储和计算成本。该方法在保持生成质量的同时,实现了在移动设备上的高效部署。

关键结果

  • MobileWan在480x832分辨率下,生成5秒视频(16FPS)仅用时20秒,端到端延迟极低,达83.79的VBench分数,优于现有移动端视频生成模型。实验显示,模型在保持高视觉质量的同时,有效控制内存和计算资源,验证了递归重构和结构化压缩的有效性。
  • 通过对比不同注意头剪枝策略,提出端到端优化的二值门控机制,模型剪枝率达70%以上,性能损失极小,验证了稀疏化策略的有效性。
  • 在多个视频生成任务中,模型表现出优越的时间一致性和视觉细节,验证了其在实际应用中的潜力。

研究意义

该研究突破了移动端高质量视频扩散生成的瓶颈,表明大规模模型可通过结构优化在资源受限设备上实现。推动了边缘AI的发展,为移动端视频内容创作提供了新可能。其技术创新为未来高效大模型部署提供了新思路,具有深远的学术和工业价值。

技术贡献

提出基于递归蒸馏的结构化压缩方法,有效将5B参数模型转化为低内存占用的推理形式。引入因果线性注意力确保时间连续性,结合可学习的注意头剪枝实现模型稀疏化。创新性地将大规模视频扩散模型部署于移动设备,结合采样步蒸馏和VAE优化,显著提升了模型的实用性和效率。

新颖性

首次实现了在移动设备上部署5B参数级别的视频扩散模型,采用递归重构和结构化压缩相结合的策略,突破了以往模型规模与硬件限制的矛盾。引入可学习的注意头剪枝机制,提升模型稀疏性和推理效率,为大模型移动端应用提供新范例。

局限性

  • 模型在极端场景下仍可能出现时间一致性不足,尤其在复杂运动或快速变化场景中表现有限。压缩策略虽有效,但在某些细节还存在一定损失,影响生成质量。
  • 当前系统主要针对短视频(5秒)生成,长时序视频仍需优化。此外,模型训练和蒸馏过程较为复杂,硬件依赖较强,限制了广泛应用。
  • 未来需进一步提升模型的多样性和细节表现,同时降低训练成本和模型复杂度,以实现更广泛的实际部署。

未来方向

未来将探索多模态融合,提升视频内容的多样性与丰富性。优化模型结构,减少训练和推理的复杂度,拓展长视频生成能力。还将结合硬件感知优化,实现更高效的边缘部署,推动移动端AI内容生成的普及。

AI 总览摘要

随着视频内容需求的激增,如何在移动设备上实现高质量的视频生成成为研究热点。传统的扩散模型在视觉质量上表现优异,但其庞大的参数规模限制了在资源有限设备上的应用。本文提出MobileWan,一种基于递归重构和结构化压缩的5B参数视频扩散模型,突破了这一瓶颈。

通过引入递归蒸馏框架,将大模型转化为逐块自回归过程,结合因果线性注意力实现常量空间复杂度,模型在推理时表现为RNN,确保时间连续性。创新性地设计可学习的注意头剪枝机制,有效稀疏化模型,减少存储和计算需求。结合采样步蒸馏和内存优化的VAE解码技术,模型在保持高质量生成的同时,实现了在移动设备上的高效部署。

实验结果显示,MobileWan在480x832分辨率下,生成5秒视频(16FPS)仅需20秒,端到端延迟极低,VBench得分达83.79,优于现有移动端视频生成方案。这一突破不仅推动了移动端视频内容创作的边界,也为大规模模型的边缘部署提供了新思路。未来,模型将在多模态融合、长视频生成和硬件感知优化方面持续探索,推动移动AI技术的广泛应用。

深度分析

研究背景

视频扩散模型近年来取得显著进展,Transformer架构如Video Diffusion Models(VDM)和VideoSwin在视觉质量上表现优异,但参数规模庞大,导致难以在移动设备上部署。早期工作如Stable Diffusion和Imagen Video在高端硬件上效果出色,但受限于硬件资源,难以实现实时生成。近年来,模型压缩和剪枝技术如稀疏化、知识蒸馏逐渐应用于减小模型规模,但多用于静态图像,视频扩散模型的移动端应用仍是挑战。现有方案多在模型规模和生成质量之间取舍,缺乏兼顾效率与效果的系统性解决方案。

核心问题

核心问题在于如何在保持视频生成高质量的同时,显著降低模型的存储和计算成本,使其适配移动设备。大规模模型虽能提供优异的视觉效果,但其参数量和计算复杂度限制了实际应用。传统模型在推理时内存消耗巨大,难以实现实时性,且难以满足移动端的能耗和存储限制。解决这一难题需要创新的模型重构策略,兼顾时间连续性和视觉一致性,同时保证模型的稀疏性和高效性。

核心创新

本研究的创新点主要包括:1)递归蒸馏框架,将大规模视频扩散模型转化为逐块自回归模型,降低内存需求;2)引入因果线性注意力,确保推理过程中的时间连续性,避免传统注意力的线性复杂度限制;3)设计可学习的注意头剪枝机制,通过端到端优化实现模型稀疏化,显著减少参数和计算量;4)结合采样步蒸馏和内存优化的VAE解码,提升生成效率和质量。这些创新共同推动了大模型在移动端的落地。

方法详解

  • �� 采用递归蒸馏,将原始5B参数模型拆分为多层次的逐块处理单元。
  • �� 利用因果线性注意力(Causal Linear Attention)实现常量空间复杂度,确保模型在推理时为RNN形式,保持时间连续性。
  • �� 设计可学习的二值注意头门控(Binary Attention Head Gates),通过端到端训练优化稀疏性。
  • �� 结合采样步蒸馏(Sampling-step Distillation)技术,减少采样次数,提升推理速度。
  • �� 使用内存优化的VAE(Variational Autoencoder)进行高效解码,提升生成质量。
  • �� 训练过程中采用多阶段蒸馏和剪枝策略,确保模型在稀疏化后仍保持高性能。

实验设计

实验采用公开数据集如UCF101和Skyline,评估模型在视频质量、时间一致性和资源消耗方面的表现。对比基线模型如VideoDiffusion和VideoSwin,采用PSNR、SSIM、LPIPS等指标。通过不同剪枝比例和采样步数的消融实验,验证稀疏化策略的有效性。模型在480x832分辨率下,生成5秒视频(16FPS)仅用20秒,性能优于对比模型,且在内存和能耗方面表现优异。多场景测试验证模型的鲁棒性和泛化能力。

结果分析

模型在保持高视觉质量的同时,显著降低了参数量和计算成本。剪枝后参数减少70%以上,性能损失不足2%。在多场景下,生成视频的时间连续性和细节丰富度优于现有移动端方案。实验还显示,递归重构和采样步蒸馏的结合,有效提升了生成速度和质量,为移动端视频生成树立了新标杆。

应用场景

该技术适用于移动端内容创作、实时视频编辑和增强现实等场景。用户无需高端硬件,即可在手机或平板上实现高质量视频生成,极大丰富了移动端内容生态。未来,结合边缘计算和硬件感知优化,有望实现更复杂的多模态视频生成和长时序内容创作。

局限与展望

当前模型在极端运动或复杂场景下仍存在时间一致性不足的问题。模型压缩带来细节损失,部分高频信息缺失。训练过程复杂,需大量蒸馏和剪枝步骤,硬件依赖较强。未来需优化模型结构,提升多样性和细节表现,降低训练成本,拓展长视频和多模态应用。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工厂每天都要生产各种商品。传统的生产线很长很复杂,虽然可以生产出漂亮的商品,但需要很多时间和材料。而现在,工厂引入了一种新技术,把生产线拆分成许多小环节,每个环节都可以重复使用和优化。这样一来,工厂就能用更少的材料和时间,生产出同样甚至更好的商品。类似地,MobileWan将庞大的视频生成模型拆分成更小、更高效的部分,利用智能的“剪枝”和“重用”技术,让手机也能快速生成高质量的视频,就像那个工厂一样变得更聪明、更快、更节省资源。

简单解释 像给14岁少年讲一样

想象你在学校的厨房里做蛋糕,传统方法就像用一大堆材料和长时间慢慢烘焙,虽然蛋糕很好吃,但很费时间。现在,你的厨师朋友发明了一个神奇的厨房工具,可以把蛋糕的每一部分都提前准备好,然后用一个快速的机器把它们拼在一起,几秒钟就能做出漂亮的蛋糕!MobileWan就像这个神奇的厨房工具,它把复杂的模型拆成小块,利用聪明的技巧让手机也能快速生成漂亮的视频,就像魔法一样!

原文摘要

Recent advances in video diffusion have been driven by scaling transformer-based architectures to billions of parameters, substantially improving visual fidelity and motion coherence. In contrast, existing mobile video diffusion models remain limited to relatively small parameter budgets, typically 0.4-1.8B, restricting generation quality. In this work, we show that high-quality mobile video generation does not require small models. Instead, we demonstrate that a server-scale 5B-parameter video diffusion transformer can be deployed efficiently on memory-constrained mobile hardware through recurrent reformulation and structured compression. Starting from Wan2.2-5B, we rely on a recurrence distillation framework that converts video generation into a chunk-wise autoregressive process with constant-memory attention computation. Combined with causal linear attention, the model operates as an RNN at inference time while preserving temporal coherence across chunks. We further propose a learnable attention head pruning method based on binary per-head gates optimized end-to-end using a noise-biased sparsity objective and distillation-based finetuning. Together with sampling-step distillation and memory-optimized VAE decoding, MobileWan becomes the first 5B-scale video diffusion model deployable on a commercial mobile device. Our system generates 5-second 480x832 videos at 16 FPS in 20 seconds end-to-end latency, achieving a VBench score of 83.79 and establishing a new state of the art in mobile video generation. Please find the released DiT checkpoint and the sampling code in the project page: https://qualcomm-ai-research.github.io/MobileWan

cs.CV