MobileWan: Closing the Quality Gap for Mobile Video Diffusion
提出MobileWan,通过递归重构与结构压缩,实现5B参数移动端高质量视频扩散生成。
核心发现
方法论
本文提出基于递归蒸馏的结构化压缩框架,将原始5B参数的视频扩散Transformer转化为逐块自回归过程。采用因果线性注意力实现常量空间复杂度,模型在推理时表现为RNN,确保时间连续性。引入可学习的注意头剪枝,通过二值门控优化稀疏性,结合采样步蒸馏和内存优化的VAE解码,显著降低模型存储和计算成本。该方法在保持生成质量的同时,实现了在移动设备上的高效部署。
关键结果
- MobileWan在480x832分辨率下,生成5秒视频(16FPS)仅用时20秒,端到端延迟极低,达83.79的VBench分数,优于现有移动端视频生成模型。实验显示,模型在保持高视觉质量的同时,有效控制内存和计算资源,验证了递归重构和结构化压缩的有效性。
- 通过对比不同注意头剪枝策略,提出端到端优化的二值门控机制,模型剪枝率达70%以上,性能损失极小,验证了稀疏化策略的有效性。
- 在多个视频生成任务中,模型表现出优越的时间一致性和视觉细节,验证了其在实际应用中的潜力。
研究意义
该研究突破了移动端高质量视频扩散生成的瓶颈,表明大规模模型可通过结构优化在资源受限设备上实现。推动了边缘AI的发展,为移动端视频内容创作提供了新可能。其技术创新为未来高效大模型部署提供了新思路,具有深远的学术和工业价值。
技术贡献
提出基于递归蒸馏的结构化压缩方法,有效将5B参数模型转化为低内存占用的推理形式。引入因果线性注意力确保时间连续性,结合可学习的注意头剪枝实现模型稀疏化。创新性地将大规模视频扩散模型部署于移动设备,结合采样步蒸馏和VAE优化,显著提升了模型的实用性和效率。
新颖性
首次实现了在移动设备上部署5B参数级别的视频扩散模型,采用递归重构和结构化压缩相结合的策略,突破了以往模型规模与硬件限制的矛盾。引入可学习的注意头剪枝机制,提升模型稀疏性和推理效率,为大模型移动端应用提供新范例。
局限性
- 模型在极端场景下仍可能出现时间一致性不足,尤其在复杂运动或快速变化场景中表现有限。压缩策略虽有效,但在某些细节还存在一定损失,影响生成质量。
- 当前系统主要针对短视频(5秒)生成,长时序视频仍需优化。此外,模型训练和蒸馏过程较为复杂,硬件依赖较强,限制了广泛应用。
- 未来需进一步提升模型的多样性和细节表现,同时降低训练成本和模型复杂度,以实现更广泛的实际部署。
未来方向
未来将探索多模态融合,提升视频内容的多样性与丰富性。优化模型结构,减少训练和推理的复杂度,拓展长视频生成能力。还将结合硬件感知优化,实现更高效的边缘部署,推动移动端AI内容生成的普及。
AI 总览摘要
随着视频内容需求的激增,如何在移动设备上实现高质量的视频生成成为研究热点。传统的扩散模型在视觉质量上表现优异,但其庞大的参数规模限制了在资源有限设备上的应用。本文提出MobileWan,一种基于递归重构和结构化压缩的5B参数视频扩散模型,突破了这一瓶颈。
通过引入递归蒸馏框架,将大模型转化为逐块自回归过程,结合因果线性注意力实现常量空间复杂度,模型在推理时表现为RNN,确保时间连续性。创新性地设计可学习的注意头剪枝机制,有效稀疏化模型,减少存储和计算需求。结合采样步蒸馏和内存优化的VAE解码技术,模型在保持高质量生成的同时,实现了在移动设备上的高效部署。
实验结果显示,MobileWan在480x832分辨率下,生成5秒视频(16FPS)仅需20秒,端到端延迟极低,VBench得分达83.79,优于现有移动端视频生成方案。这一突破不仅推动了移动端视频内容创作的边界,也为大规模模型的边缘部署提供了新思路。未来,模型将在多模态融合、长视频生成和硬件感知优化方面持续探索,推动移动AI技术的广泛应用。
深度分析
研究背景
视频扩散模型近年来取得显著进展,Transformer架构如Video Diffusion Models(VDM)和VideoSwin在视觉质量上表现优异,但参数规模庞大,导致难以在移动设备上部署。早期工作如Stable Diffusion和Imagen Video在高端硬件上效果出色,但受限于硬件资源,难以实现实时生成。近年来,模型压缩和剪枝技术如稀疏化、知识蒸馏逐渐应用于减小模型规模,但多用于静态图像,视频扩散模型的移动端应用仍是挑战。现有方案多在模型规模和生成质量之间取舍,缺乏兼顾效率与效果的系统性解决方案。
核心问题
核心问题在于如何在保持视频生成高质量的同时,显著降低模型的存储和计算成本,使其适配移动设备。大规模模型虽能提供优异的视觉效果,但其参数量和计算复杂度限制了实际应用。传统模型在推理时内存消耗巨大,难以实现实时性,且难以满足移动端的能耗和存储限制。解决这一难题需要创新的模型重构策略,兼顾时间连续性和视觉一致性,同时保证模型的稀疏性和高效性。
核心创新
本研究的创新点主要包括:1)递归蒸馏框架,将大规模视频扩散模型转化为逐块自回归模型,降低内存需求;2)引入因果线性注意力,确保推理过程中的时间连续性,避免传统注意力的线性复杂度限制;3)设计可学习的注意头剪枝机制,通过端到端优化实现模型稀疏化,显著减少参数和计算量;4)结合采样步蒸馏和内存优化的VAE解码,提升生成效率和质量。这些创新共同推动了大模型在移动端的落地。
方法详解
- �� 采用递归蒸馏,将原始5B参数模型拆分为多层次的逐块处理单元。
- �� 利用因果线性注意力(Causal Linear Attention)实现常量空间复杂度,确保模型在推理时为RNN形式,保持时间连续性。
- �� 设计可学习的二值注意头门控(Binary Attention Head Gates),通过端到端训练优化稀疏性。
- �� 结合采样步蒸馏(Sampling-step Distillation)技术,减少采样次数,提升推理速度。
- �� 使用内存优化的VAE(Variational Autoencoder)进行高效解码,提升生成质量。
- �� 训练过程中采用多阶段蒸馏和剪枝策略,确保模型在稀疏化后仍保持高性能。
实验设计
实验采用公开数据集如UCF101和Skyline,评估模型在视频质量、时间一致性和资源消耗方面的表现。对比基线模型如VideoDiffusion和VideoSwin,采用PSNR、SSIM、LPIPS等指标。通过不同剪枝比例和采样步数的消融实验,验证稀疏化策略的有效性。模型在480x832分辨率下,生成5秒视频(16FPS)仅用20秒,性能优于对比模型,且在内存和能耗方面表现优异。多场景测试验证模型的鲁棒性和泛化能力。
结果分析
模型在保持高视觉质量的同时,显著降低了参数量和计算成本。剪枝后参数减少70%以上,性能损失不足2%。在多场景下,生成视频的时间连续性和细节丰富度优于现有移动端方案。实验还显示,递归重构和采样步蒸馏的结合,有效提升了生成速度和质量,为移动端视频生成树立了新标杆。
应用场景
该技术适用于移动端内容创作、实时视频编辑和增强现实等场景。用户无需高端硬件,即可在手机或平板上实现高质量视频生成,极大丰富了移动端内容生态。未来,结合边缘计算和硬件感知优化,有望实现更复杂的多模态视频生成和长时序内容创作。
局限与展望
当前模型在极端运动或复杂场景下仍存在时间一致性不足的问题。模型压缩带来细节损失,部分高频信息缺失。训练过程复杂,需大量蒸馏和剪枝步骤,硬件依赖较强。未来需优化模型结构,提升多样性和细节表现,降低训练成本,拓展长视频和多模态应用。
通俗解读 非专业人士也能看懂
想象你在一个工厂里,工厂每天都要生产各种商品。传统的生产线很长很复杂,虽然可以生产出漂亮的商品,但需要很多时间和材料。而现在,工厂引入了一种新技术,把生产线拆分成许多小环节,每个环节都可以重复使用和优化。这样一来,工厂就能用更少的材料和时间,生产出同样甚至更好的商品。类似地,MobileWan将庞大的视频生成模型拆分成更小、更高效的部分,利用智能的“剪枝”和“重用”技术,让手机也能快速生成高质量的视频,就像那个工厂一样变得更聪明、更快、更节省资源。
简单解释 像给14岁少年讲一样
想象你在学校的厨房里做蛋糕,传统方法就像用一大堆材料和长时间慢慢烘焙,虽然蛋糕很好吃,但很费时间。现在,你的厨师朋友发明了一个神奇的厨房工具,可以把蛋糕的每一部分都提前准备好,然后用一个快速的机器把它们拼在一起,几秒钟就能做出漂亮的蛋糕!MobileWan就像这个神奇的厨房工具,它把复杂的模型拆成小块,利用聪明的技巧让手机也能快速生成漂亮的视频,就像魔法一样!
原文摘要
Recent advances in video diffusion have been driven by scaling transformer-based architectures to billions of parameters, substantially improving visual fidelity and motion coherence. In contrast, existing mobile video diffusion models remain limited to relatively small parameter budgets, typically 0.4-1.8B, restricting generation quality. In this work, we show that high-quality mobile video generation does not require small models. Instead, we demonstrate that a server-scale 5B-parameter video diffusion transformer can be deployed efficiently on memory-constrained mobile hardware through recurrent reformulation and structured compression. Starting from Wan2.2-5B, we rely on a recurrence distillation framework that converts video generation into a chunk-wise autoregressive process with constant-memory attention computation. Combined with causal linear attention, the model operates as an RNN at inference time while preserving temporal coherence across chunks. We further propose a learnable attention head pruning method based on binary per-head gates optimized end-to-end using a noise-biased sparsity objective and distillation-based finetuning. Together with sampling-step distillation and memory-optimized VAE decoding, MobileWan becomes the first 5B-scale video diffusion model deployable on a commercial mobile device. Our system generates 5-second 480x832 videos at 16 FPS in 20 seconds end-to-end latency, achieving a VBench score of 83.79 and establishing a new state of the art in mobile video generation. Please find the released DiT checkpoint and the sampling code in the project page: https://qualcomm-ai-research.github.io/MobileWan