Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

TL;DR

RVM以速度场直接做奖励微调,较低成本达到或超过轨迹策略梯度方法;论文未报告具体数值。

cs.CV 🔴 高级 2026-08-25 18 次浏览
Jaemoo Choi Wei Guo Yuchen Zhu Arash Vahdat Molei Tao Julius Berner Yongxin Chen
扩散模型 强化学习 速度匹配 奖励微调 视频生成

核心发现

方法论

论文提出奖励式速度匹配(Reward-based Velocity Matching, RVM)。它不构造随机去噪轨迹似然,也不使用端点证据下界,而是直接更新扩散模型的速度场。高奖励样本强化对应方向,低奖励样本抑制对应方向,并可加入参考速度锚定项控制模型漂移。RVM还能统一解释RAM与DiffusionNFT。

关键结果

  • 在多类大规模扩散模型奖励微调任务中,RVM在显著降低训练成本的情况下,表现达到或超过基于轨迹的策略梯度方法;摘要未提供具体分数、提升百分比或算力数字。
  • 视频实验显示,常规偏好奖励可能偏爱画面干净但几乎静止的视频。论文引入动态跟踪奖励,在改善运动的同时提升总体VBench表现,但正文摘要未给出具体VBench数值。
  • 消融结论是:当速度更新被简化后,具体损失变体的重要性低于奖励设计与锚定设计;这说明目标函数形式并非主要性能瓶颈。

研究意义

RVM将扩散模型奖励微调从似然优化重新表述为原生速度表示上的监督式匹配,避开了扩散模型样本似然不可直接计算这一长期难题。它减少轨迹构造、概率比率估计和额外计算,为图像与视频模型的大规模偏好适配提供更简单的工程路径,也提醒研究者重新审视从自回归语言模型移植策略梯度是否必要。

技术贡献

核心技术贡献包括:提出无轨迹的RVM速度更新;以奖励加权的方向强化和抑制替代轨迹似然比;引入可选参考速度锚定项控制分布漂移;证明RAM与DiffusionNFT可作为统一框架的特殊情形。论文还把视频奖励设计纳入方法论,指出动态跟踪信号可修正静态视觉质量奖励造成的偏置。

新颖性

新颖性不在于再造一个复杂策略梯度估计器,而在于改变优化对象:从生成轨迹的概率转向扩散过程本身的速度场。相较依赖随机转移似然或ELBO近似的RAM、DiffusionNFT相关路线,RVM直接、无轨迹且更易扩展。

局限性

  • 给定材料没有披露数据集规模、训练步数、显存、具体VBench分数或相对提升,因此无法独立核验“更低成本”与“超过基线”的幅度。
  • RVM依赖奖励函数质量;奖励若偏好静态、审美或可见性,模型仍可能优化错误目标,锚定项也只能限制漂移而不能修复奖励语义。

未来方向

后续应系统比较不同奖励、锚定强度和速度参数化,公开完整算力与统计显著性;同时研究奖励冲突、多目标偏好、长视频时序一致性和自适应锚定。更广泛的方向是建立速度场更新的稳定性理论,并探索少步采样与在线人类反馈。

AI 总览摘要

扩散模型已经能够生成高质量图像和视频,但把它们进一步调成“更符合人类偏好”并不简单。现有方法通常借鉴大语言模型的策略梯度:要么把随机去噪步骤拼成轨迹并估计似然,要么用证据下界近似最终样本似然。由于扩散模型缺少易计算的样本似然,这些方案带来额外计算、复杂实现和可扩展性压力。

Choi等人提出奖励式速度匹配(RVM),直接在扩散模型的速度场上更新。高奖励生成对应的速度方向被强化,低奖励方向被压制;可选的参考速度锚定项则控制模型偏离原始模型的程度。该框架还能把RAM和DiffusionNFT解释为特殊情形,因此不是孤立的新损失,而是一种统一视角。其核心判断是:奖励微调未必需要先恢复生成轨迹的概率。

论文报告,在多种大规模扩散模型任务中,RVM以显著较低训练成本达到或超过轨迹策略梯度基线;但所给材料没有具体分数和百分比。视频实验进一步发现,普通偏好奖励可能鼓励“清晰但不动”的视频,动态跟踪奖励则改善运动并提升VBench。总体而言,研究把扩散奖励优化拉回速度表示,同时也强调奖励与锚定设计比损失变体更关键。

深度分析

研究背景

扩散模型通过逐步去噪或连续时间动力系统生成样本。近年来,RAM、DiffusionNFT等方法尝试用奖励或人类偏好进行微调,但通常继承策略梯度和似然比思想。自回归模型能直接计算token概率,扩散模型却难以获得可 tractable 的端点似然,因此需要轨迹转移或ELBO近似。

核心问题

核心问题是:如何在不构造完整去噪轨迹、不过度增加采样和似然估计成本的情况下,让扩散模型偏向高奖励样本?困难还包括奖励噪声、模型分布漂移,以及视频中“视觉干净”与“运动丰富”目标不一致。

核心创新

RVM把优化对象从轨迹概率改为速度场。其一,采用高奖励样本的速度方向作为强化信号;其二,对低奖励方向进行抑制;其三,以参考速度加入锚定,控制保真度与适应性的平衡。该框架统一覆盖RAM和DiffusionNFT,并将动态跟踪奖励纳入视频微调。

方法详解

  • �� 输入:参考扩散模型、带奖励的生成样本及其时间状态。
  • �� 速度匹配:在时间条件下预测速度场,并按样本奖励调整匹配方向;高奖励样本提高权重,低奖励样本降低权重。
  • �� 锚定:加入参考速度项,限制更新远离原模型,缓解奖励黑客和灾难性漂移。
  • �� 统一性:改变损失权重或锚定形式可恢复RAM、DiffusionNFT等方法。
  • �� 视频扩展:在常规偏好奖励外加入动态跟踪奖励,使优化目标覆盖运动质量。

实验设计

实验覆盖多种大规模扩散模型奖励微调任务,并将RVM与轨迹策略梯度方法比较。视频部分使用VBench进行总体评估,并比较普通偏好奖励与动态跟踪奖励。论文还考察不同速度更新损失、奖励设计和锚定设计。给定材料未列出具体数据集、模型规模、超参数或训练预算。

结果分析

RVM在降低训练成本的同时,整体上与轨迹方法竞争或更优。简化速度更新后,损失变体差异小于奖励和锚定选择。视频结果表明,动态跟踪奖励能缓解模型生成近乎静止视频的倾向,并改善运动与总体VBench表现;具体数值未在提供文本中出现。

应用场景

该方法可用于文本到图像、图像编辑和文本到视频模型的偏好适配,例如审美、遵循指令、运动质量或任务成功率优化。实际部署需要可靠奖励模型、参考模型及可控采样预算;其无轨迹特性尤其适合大规模训练和快速实验迭代。

局限与展望

论文摘要没有给出完整实验表,因此无法判断不同模型、奖励和数据规模下的稳定性边界。RVM仍可能继承奖励模型偏差,并且锚定强度需要调节:过强会限制改进,过弱会导致生成质量或多样性下降。未来需补充理论分析、多目标奖励和长时视频评测。

通俗解读 非专业人士也能看懂

把扩散模型想成一位从半成品逐步完成画作的画家。每一笔都不是最终答案,而是在当前阶段决定“下一步往哪里画”。传统方法会记录画家从头到尾的每一个动作,再计算整条过程像不像高分作品;这既费时,也很难准确统计。RVM换了一个办法:只看每一步的方向,并告诉画家哪些方向最后得到好评、哪些方向导致差评。好方向被加强,坏方向被减弱。

参考速度就像原画家的基本风格。锚定项提醒新画家不要为了追求某个评分,突然把所有作品画成完全不同的样子。这样既能适应新要求,又能保留原模型的稳定质量。对于视频,普通评价可能只喜欢“清楚的截图”,于是画家画出几乎不动的场景;动态跟踪奖励则明确表扬物体真的在移动。

简单解释 像给14岁少年讲一样

想象你在游戏里训练一个会画画和做动画的AI队友。它每次从一团模糊图开始,分很多步把画面变清楚。以前的训练方法像录像每一步操作,再计算整段录像的概率,过程很麻烦,因为这类AI不像聊天机器人那样容易说出“这张图的概率是多少”。

RVM不再检查整段录像,而是观察每一步的“前进方向”。如果最后得到高分,就把当时的方向记下来;如果得分低,就少走那条路。它还可以保留一个“原版AI”的参考,防止新AI为了刷分变得奇怪。

视频尤其有趣:普通评分可能喜欢画面清晰,于是AI生成一辆看起来很漂亮、却几乎不动的车。论文加入动态跟踪奖励,相当于告诉AI:“清楚很重要,但运动也要自然!”结果运动变好,VBench总体表现也提高了。

这项工作最酷的地方是把复杂的概率计算换成更直接的方向调整。不过奖励规则仍然很关键:如果评分标准有问题,AI就会认真地优化错误目标。

术语表

Reward-based Velocity Matching(奖励式速度匹配)

直接在扩散模型速度场上按奖励调整学习方向的方法。它避免显式构造去噪轨迹似然。

论文提出的核心算法。

Velocity field(速度场)

描述每个时间状态应向何处演化的函数。它是连续扩散生成过程的原生表示。

RVM直接优化的对象。

Trajectory-free(无轨迹)

不需要记录并评估完整随机去噪路径。该设计减少采样和似然估计开销。

RVM相对策略梯度方法的主要特点。

Anchor term(锚定项)

约束新速度场接近参考速度场的正则化项。它用于控制模型漂移。

RVM中的可选组件。

RAM

论文讨论的近期扩散奖励微调方法之一。其更新可在RVM统一框架下解释。

作为特殊情形进行比较。

DiffusionNFT

另一种扩散模型奖励微调方法。它同样被RVM视为统一框架中的特殊形式。

主要相关基线与理论联系。

VBench

用于评估视频生成质量的基准体系,覆盖多种视觉与时序维度。

视频实验的总体评价指标。

开放问题 这项研究留下的未解疑问

  • 1 材料未报告具体分数、成本和显著性,RVM相对不同基线的优势幅度仍无法核验。
  • 2 奖励、锚定强度与速度参数化如何共同决定稳定性,尚缺少统一理论。
  • 3 动态奖励在更长视频、多主体交互和真实人类偏好中的泛化能力仍待研究。

应用场景

近期应用

视频运动质量微调

视频模型开发者可在已有偏好奖励之外加入动态跟踪奖励,再用RVM更新速度场。前提是拥有参考模型、可计算奖励和VBench等评估工具,预期能减少静态视频倾向。

低成本图像偏好适配

图像生成服务可用审美、指令遵循或任务奖励进行RVM微调,避免构造完整去噪轨迹。适合需要快速迭代风格、质量和安全偏好的团队。

远期愿景

统一的扩散偏好优化平台

RVM可能成为跨图像、视频和3D生成的共同优化接口,将不同奖励直接映射到速度场更新。实现这一愿景仍需统一理论、标准化奖励和可靠的多目标控制。

原文摘要

Reward fine-tuning is becoming an important tool for adapting diffusion models to human preferences and task-specific objectives, but existing methods largely inherit policy-gradient machinery from large language models. Unlike autoregressive models, diffusion models do not provide tractable likelihoods for generated samples. As a result, current approaches either construct trajectory likelihoods from stochastic denoising transitions or approximate endpoint likelihoods with evidence lower bound, introducing additional computation and algorithmic complexity. We demonstrate that this likelihood-based machinery is not necessary for effective diffusion reward fine-tuning. We propose reward-based velocity matching (RVM), a simple trajectory-free update that acts directly on the velocity field. RVM reinforces directions associated with high-reward generations, suppresses those with low reward, and involves an optional anchor term controlling drift from a reference velocity. Notably, it provides a general framework that recovers recent fine-tuning methods, including RAM and DiffusionNFT, as special cases. Across various large-scale diffusion models reward fine-tuning tasks, RVM is competitive with or outperforms trajectory-based policy-gradient methods under substantially reduced training cost. We further find that, once the velocity update is simplified, the particular loss variant matters less than reward and anchor design. For video generation, standard preference rewards can favor visually clean but nearly static outputs; introducing a new dynamic-tracking reward that substantially improve motions while improving overall VBench performance. These results suggest that scalable reward fine-tuning for diffusion models is better posed in the native velocity representation than as likelihood-based policy optimization.

cs.CV cs.LG