Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching

TL;DR

DM-Align联合蒸馏与偏好对齐,4-NFE下VBench达84.40。

cs.CV 🔴 高级 2026-09-03 21 次浏览
Jiuzhou Lin Junlong Wu Fei Zuo Huan Ouyang Dewen Fan Boheng Zhang Huaiqing Wang Jia Sun Fan Yang Houde Liu Kehai Chen Min Zhang Tingting Gao Han Li
视频生成 分布匹配 偏好对齐 知识蒸馏 扩散模型

核心发现

方法论

论文提出单阶段Sample-Guided Distribution Matching框架,将DMD蒸馏梯度与DM-Align偏好梯度相加。前者以真实教师模型与fake模型的分数差逼近KL散度,后者利用偏好样本或组内高奖励样本构造目标分数;具体实现为DM-PairLoss和DM-GroupLoss,分别对应DPO式配对数据与GRPO式组探索。

关键结果

  • 在Wan 2.1 T2V-1.3B、ConsistID约6K样本上,DM-Align (Pair)仅4 NFE取得82.78平均VBench,超过raw模型78.20、DMD2的79.68及Flow-DPO+DMD2的79.89;动态程度66.25,美学质量60.89。
  • 在VidProM的20K提示词上,DM-Align (Group)平均VBench为84.40,动态程度80.19,优于DanceGRPO的82.76和75.78;DanceGRPO蒸馏后动态程度降至60.85,显示顺序流程明显崩塌。
  • 人类GSB评测显示Pair版本相对基线获得最高约48%净偏好提升;Group版本提升约30%和12%。文本对齐分数为1.65,高于DanceGRPO+DMD2的1.40。

研究意义

该工作将视频生成中的“快速蒸馏”和“人类偏好对齐”从两个串行阶段统一为一次优化,绕开RL通常需要的20—40步采样、轨迹概率估计及反向SDE转换。其意义不仅在于降低训练成本,也在于缓解蒸馏模型接受稀疏RL损失时的结构破坏,为高质量、低步数视频生成提供更稳定的工程路径。

技术贡献

理论上,论文把DMD与偏好优化都表示为噪声分布上的score-space梯度,并依据Bradley-Terry最优分布p*(x)=Z^-1 pref(x)exp(r(x)/β)推导对齐方向。工程上,fake模型通过denoising loss估计当前生成分布的score;共享生成样本、噪声空间和score估计器,再以Ltotal=λDMD LDMD+λalign Lalign联合更新,避免显式MDP建模。

新颖性

相较Flow-DPO、DanceGRPO及RL+DMD2,本文不是把现成RL损失附加到蒸馏损失上,而是原生在分布匹配框架中构造偏好梯度。DM-PairLoss和DM-GroupLoss分别把偏好对和组奖励转成score差异,形成统一、单阶段的视频优化范式。

局限性

  • Group版本仍需对K=8个视频进行采样并调用奖励模型;若VideoAlign把白噪声或闪烁误判为高运动质量,训练可能崩溃,因此实验主要采用文本对齐奖励。
  • 主要验证集中于Wan 2.1 T2V-1.3B、CogVideoX敏感性分析及640条测试样本,尚不足以证明对更大模型、长视频或更复杂人类偏好的普适性。

未来方向

后续可研究更可靠的多维视频奖励、在线人类反馈、动态λ调度及更大规模模型;还需评估长时一致性、物理真实性和安全偏好,并探索减少Group采样次数的目标构造方法。

AI 总览摘要

视频生成模型已经能够制作高质量内容,但快速生成与符合人类偏好往往难以兼得。传统流程若先做RL对齐,必须进行大量多步采样;若先做蒸馏再做RL,压缩后的生成映射容易被破坏。Flow-DPO、DanceGRPO等方法还需把连续扩散轨迹改写成MDP,并估计轨迹概率,训练成本和不稳定性都很高。

本文提出Sample-Guided Distribution Matching,并实现DM-Align。它让DMD负责把4步生成器保持在真实教师分布附近,同时从偏好样本中提取互补的score方向。DM-PairLoss使用DPO式正样本与当前生成结果;DM-GroupLoss对同一提示词采样K=8个视频,以奖励最高的前4个均值作为偏好锚点。两种梯度共享fake denoiser和潜空间,以Ltotal=λDMD LDMD+λalign Lalign联合更新。

实验显示,Wan 2.1 T2V-1.3B在4 NFE下,Pair版本VBench平均分82.78,Group版本84.40,均超过独立蒸馏及“RL后蒸馏”流程;Group动态程度达到80.19,而DanceGRPO蒸馏后从75.78跌至60.85。人类评测最高带来48%净偏好提升。局限是奖励模型错误和视频规模覆盖仍有限,但该研究证明,分布匹配可以成为连接速度、质量与偏好的统一接口。

深度分析

研究背景

扩散模型和Flow Matching推动了视频生成;DMD2等分布蒸馏把约100 NFE压缩到4 NFE,Flow-DPO、DanceGRPO则借助偏好或奖励进行对齐。问题在于前者重速度,后者重偏好,二者通常串行,导致成本高或蒸馏后退化。

核心问题

视频RL需要20—40步采样、反向SDE转换、轨迹概率和高显存计算。RL先于蒸馏成本过高;RL晚于蒸馏又会破坏压缩模型的连续生成结构,造成伪影、动态质量下降和模型崩溃。

核心创新

  • ��提出DM-Align,将偏好对齐写成score-space分布匹配梯度。
  • ��DM-PairLoss直接利用ConsistID正样本模拟DPO。
  • ��DM-GroupLoss从K=8生成结果中选择top-4均值,模拟GRPO但不建立MDP。
  • ��与DMD梯度联合更新,避免传统两阶段冲突。

方法详解

  • ��初始化真实模型μreal、生成器Gθ和fake模型μfake。
  • ��Gθ按T={1000,750,500,250}进行4步采样,得到x。
  • ��用Ldenoise=||μfake(xt,t)-x0||²训练fake模型,使其估计当前分布score。
  • ��DMD梯度使用sreal−sfake,缩小教师与生成器分布差异。
  • ��Pair梯度比较偏好样本x+与当前样本;Group梯度按优势Ai比较各样本与top-4均值。
  • ��最终以λDMD=λalign=0.5联合更新;生成器每5步更新一次。

实验设计

主模型为Wan 2.1 T2V-1.3B,生成5秒、16 FPS、832×480视频;Pair使用约6K ConsistID样本,Group使用VidProM的20K提示词。基线包括raw、DMD2、Flow-DPO、DanceGRPO及RL+DMD2。使用VBench和640样本GSB人评;训练采用32张H100、AdamW,生成器学习率2e-6、fake模型4e-7,Group的K=8、top-4。

结果分析

Pair达到VBench 82.78,超过Flow-DPO 81.54和Flow-DPO+DMD2 79.89;其动态程度66.25、美学质量60.89。Group达到84.40,动态程度80.19,超过DanceGRPO 82.76;DanceGRPO+DMD2仅80.54且动态程度60.85。TA分数1.65,高于DanceGRPO+DMD2的1.40。

应用场景

该框架适合短视频生成服务、广告与电商内容、社交媒体素材和交互式创作:模型可保持4 NFE低延迟,同时增强动作、文本一致性和审美质量。部署前仍需稳定奖励模型、显存支持及针对领域的视频偏好数据。

局限与展望

Group方法并未完全消除奖励计算,因为仍需生成多个候选并评分;VideoAlign对噪声和闪烁的误判会引发风险。实验主要覆盖短视频、两个基础模型和有限测试集,长视频一致性、复杂叙事、真实人类反馈及大模型可扩展性尚未充分验证。

通俗解读 非专业人士也能看懂

把视频模型想成一家电影工厂。原始教师模型像经验丰富的总导演,能拍出好片,但每个镜头都要反复调整,速度很慢;蒸馏模型像经过培训的快速摄制组,只用4次调整就能完成影片,却可能丢掉细节。偏好对齐则像观众投票:告诉摄制组哪些画面更自然、更符合要求。

传统做法是先让观众投票,再把流程压缩,或先压缩再投票,两个部门互相破坏。本文让它们在同一条流水线上工作:快速摄制组拍片,教师检查画面质量,fake模型充当实时质检员;同时,好的样片告诉系统应该朝哪个方向改。Pair版本使用现成好片,Group版本让系统拍8个候选并选前4个的平均风格。

最终,模型不必反复模拟复杂的拍摄过程,也能同时学会“拍得快”“拍得清楚”和“拍得讨人喜欢”。在实验中,4步视频的综合评分达到82.78或84.40,说明这不是单纯追求速度,而是在速度与质量之间取得更好的平衡。

简单解释 像给14岁少年讲一样

想象你在做一个视频游戏里的自动剪辑器。原版程序每次要检查很多次,画面很漂亮但慢得像蜗牛;压缩版只检查4次,速度飞快,可有时人物不动、背景不对。研究者想让它既快又更像大家喜欢的短视频。

他们设计了一个“老师、学生、裁判”小组。老师模型知道什么画面清楚,学生模型负责快速生成,裁判模型观察哪些样片更符合文字要求。Pair模式给学生一张大家喜欢的好片;Group模式让学生一次做8个版本,再挑最好的4个当学习目标。

关键是,这些小组不是先后排队,而是同时工作。学生每次生成视频时,老师提醒它别丢掉画质,裁判提醒它动作和内容要更讨喜。这样就避免了“改快之后又改坏”的问题。

结果很亮眼:只用4次处理,Pair评分82.78,Group评分84.40;Group的动作分达到80.19,而传统方法压缩后掉到60.85。简单说,这个方法像让一个会拍片的学生边练速度、边听老师和观众意见,最后拍得又快又好!

术语表

Distribution Matching(分布匹配)

让生成模型产生的整体样本分布接近目标分布,而非逐个复制样本。论文用score差异近似KL散度梯度。

统一DMD蒸馏与DM-Align偏好优化。

DMD / Distribution Matching Distillation(分布匹配蒸馏)

用真实教师与fake模型的分数差训练少步生成器。其目标是将高步数模型压缩为4 NFE。

提供基础质量与稳定性梯度。

DM-Align

在分布匹配空间中使用偏好样本构造对齐梯度的方法。它不把扩散过程改写为传统RL的MDP。

论文核心框架,包含Pair和Group两种实现。

DM-PairLoss

利用偏好正样本与当前生成样本形成对比方向的损失。它受DPO启发,但在score空间计算。

用于ConsistID配对式训练。

DM-GroupLoss

对同一提示词生成K个结果,按奖励和优势把样本推向top-k均值。它对应GRPO式组内探索。

VidProM实验中K=8、top-4。

NFE(函数评估次数)

生成过程中模型被调用的次数,越少通常速度越快。论文将100 NFE压缩为4 NFE。

比较蒸馏效率的主要指标。

开放问题 这项研究留下的未解疑问

  • 1 奖励模型若误把闪烁或白噪声评为高运动质量,DM-GroupLoss会学习错误方向;未来需要更可靠的时空、多维奖励。
  • 2 目前主要验证5秒视频和少量模型,长时一致性、复杂动作因果性及大规模人类偏好是否仍保持梯度兼容,尚无充分答案。

应用场景

近期应用

低延迟广告视频

广告平台可用Wan 2.1等基础模型训练DM-Align,在4 NFE下快速生成多版本商品视频。配合领域偏好样本或奖励模型,可同时改善文本遵循、动作表现和审美质量。

交互式创作工具

社交媒体或设计软件可让用户即时生成视频,并用Pair数据或组内评分持续优化。较低采样步数有助于降低等待时间,但仍需控制奖励偏差和内容安全。

远期愿景

个性化视频生成

未来可将不同用户的选择、审美和品牌规范转成偏好分布,使同一基础模型快速适配个人化内容;关键障碍是隐私保护、偏好漂移和长期视频一致性。

原文摘要

Aligning video generative models to human preferences heavily relies on Reinforcement Learning (RL), which suffers from extensive computational overhead. Existing workflows typically treat RL and distillation as disconnected stages: applying RL before distillation incurs prohibitive computational costs, whereas applying RL after distillation frequently leads to model collapse. To overcome these limitations, we propose a unified, single-stage optimization framework grounded in Distribution Matching (DM). In the standard DM framework, distillation updates the model via a gradient direction that minimizes the gap between the real and fake models, guiding generations toward clarity and high fidelity. Building upon this, we introduce DM-Align, which derives a complementary gradient direction to guide the model toward human-preferred samples. Inspired by DPO and GRPO, our method leverages the distributional gap -- formulated from either preference pairs or intra-group exploration -- to directly construct this preference-guided gradient. By synergizing these two gradient directions, our approach eliminates the need for multi-step reward evaluation and complex ODE-SDE conversions inherent in traditional RL. Comprehensive experiments across multiple foundational video models demonstrate that this sample-guided framework robustly enhances both distillation quality and preference alignment, consistently outperforming both standalone variants and sequential two-stage pipelines.

cs.CV