核心发现
方法论
本文提出LC-GRPO框架,结合流模型的推理路径与Langevin校正,通过在每个采样步骤先执行推理一致的欧拉步,然后利用Langevin动力学校正目标边缘分布。无需额外的评分模型,校正步骤直接由流速度导出,保持转移为等方差高斯分布。理论上证明,单次Langevin校正可降低Wasserstein距离,且在匹配随机性水平下优于Euler–Maruyama离散化。实验证明在SD3.5-Medium、FLUX.1-Dev和混元视频任务中,显著提升奖励,缩小训练-推理差距。
关键结果
- 在文本到图像和视频生成任务中,LC-GRPO在奖励指标上优于标准SDE采样方法,Reward提升约3-5%,且样本清晰度增强,训练-测试奖励差距缩小50%以上。
- 在SD3.5-Medium模型上,Reward指标从0.28提升至0.36,生成质量保持优异,且训练与评估奖励差异显著减小。
- 理论分析表明,Langevin校正在保持边缘分布一致性同时,减少采样误差,尤其在高探索噪声水平下效果更明显。
研究意义
该研究突破了流模型强化学习中的训练-推理不一致问题,为高质量样本生成与策略优化提供新途径。通过结合推理路径与校正机制,有效缓解采样模糊和奖励偏差,推动视觉生成、视频合成等领域的RL应用发展,具有重要理论与实践意义。
技术贡献
提出结合推理路径的欧拉步与Langevin校正的采样策略,理论上证明单步校正可减小Wasserstein误差,提供了无须额外评分模型的高效校正方案。该方法在保持生成质量的同时,增强了探索能力,为流模型的强化学习应用开辟新方向。
新颖性
首次将Langevin校正引入流模型的强化学习采样中,解决训练-推理差异带来的样本偏差问题。不同于传统的SDE离散化,提出的 predictor–corrector 结构实现了更精确的边缘分布采样,具有理论保证和实证优势。
局限性
- 在极端高噪声或强非凸边缘分布条件下,校正效果可能减弱,需进一步优化参数调节策略。
- 当前方法主要在连续时间模型中验证,离散时间实际应用中仍需考虑数值稳定性与计算成本。
- 对复杂多模态分布的适应性尚待验证,未来需扩展到更复杂场景。
未来方向
未来将探索多次Langevin校正的效果,结合自适应步长调节机制,提升在复杂边缘分布中的表现。同时,考虑引入多尺度校正策略,结合不同模型结构,推动流模型在RL中的广泛应用。
AI 总览摘要
流模型在视觉生成中以其高效的路径传输能力广受关注,但在强化学习中存在训练-推理差距,限制了其探索能力和奖励优化效果。传统方法在训练时引入随机性(SDE)以增强探索,但在推理时采用确定性ODE,导致样本模糊与奖励偏差,影响策略性能。本文提出LC-GRPO框架,通过在每个采样步骤先执行推理一致的欧拉步,然后引入Langevin校正,保持边缘分布的一致性,同时引入必要的随机性以改善探索。该方法无需额外评分模型,利用流速度直接导出梯度,简洁高效。理论分析证明,单次Langevin校正能严格降低Wasserstein距离,优于传统Euler–Maruyama离散化。在多个视觉任务中,实验证明LC-GRPO显著提升奖励,缩小训练-推理差距,保持生成质量,为流模型在强化学习中的应用提供新思路。这一创新不仅解决了现有方法的模糊和偏差问题,也为未来多尺度、多次校正策略提供了理论基础,推动视觉和视频生成领域的RL技术发展。
深度分析
研究背景
流模型因其路径传输的高效性在图像和视频生成中表现优异,但在强化学习中面临训练-推理不一致的问题。传统方法采用确定性ODE进行推理,但在训练中引入SDE以增强探索,导致样本模糊和奖励偏差,限制策略优化效果。近年来,研究者尝试结合SDE与ODE,改善采样质量,但仍未根本解决采样偏差问题。流模型的潜力在于其高效路径传输,但在RL中的应用受限于采样一致性和样本质量。本文从理论和实践两个层面,旨在缓解这一矛盾,推动流模型在强化学习中的广泛应用。
核心问题
核心问题在于训练时引入的随机性(SDE)与推理时的确定性(ODE)之间存在差异,导致训练奖励与测试奖励不一致,影响策略优化效果。SDE采样虽能增强探索,但会引入模糊样本,降低生成质量。而纯粹的ODE采样则偏向确定性,缺乏探索能力。如何在保持样本质量的同时引入适度随机性,成为亟待解决的难题。此外,现有离散化方法(Euler–Maruyama)在高噪声水平下误差较大,进一步加剧训练-推理差距。
核心创新
本文创新点在于引入Langevin校正机制,将推理路径的欧拉步与校正步骤结合,形成predictor–corrector结构。通过在每个采样步骤先执行推理一致的欧拉步,再利用Langevin动力学校正目标边缘分布,显著减少采样误差。无需额外评分模型,直接利用流速度导出梯度,简化流程。理论上证明单次校正能严格减小Wasserstein距离,优于传统Euler–Maruyama方法。实验证明,该方法在保持生成质量的同时,增强探索能力,有效缩小训练-推理差距。
方法详解
- �� 采用流模型的逆向路径,先用欧拉步进行推理一致的采样。• 计算目标边缘分布的梯度(score)直接由流速度导出,避免额外模型。• 在欧拉步基础上引入Langevin动力学,利用目标边缘分布的score进行校正,加入噪声以保持随机性。• 通过理论分析,证明单次校正能减少Wasserstein距离,确保采样的边缘分布更接近目标。• 校正步骤的噪声水平由参数调节,控制探索与样本质量的平衡。• 在多任务视觉生成中,结合不同奖励指标,验证方法的有效性。
实验设计
在SD3.5-Medium、FLUX.1-Dev和混元视频任务中,采用不同的奖励指标(如Reward、CLIP、HPS-v2.1),比较标准SDE采样、纯ODE采样与LC-GRPO。训练过程中,调节噪声参数,观察奖励变化和样本清晰度。评估指标包括奖励值、样本质量和训练-测试奖励差距。通过ablation研究验证校正步骤的贡献,分析不同噪声水平下的采样效果。实验证明,LC-GRPO在奖励提升和样本清晰度方面优于对比方法,训练-推理差距明显缩小。
结果分析
在图像生成任务中,Reward指标从0.28提升至0.36,样本清晰度增强,奖励差异缩小50%以上。在视频任务中,Aesthetic Score提升,训练与评估奖励差距减半。理论分析与实验证明,单次Langevin校正在保持样本质量的同时,显著减少采样误差,尤其在高噪声环境下效果更佳。这验证了校正机制在实际应用中的有效性。
应用场景
该方法适用于需要策略探索与高质量样本生成的视觉任务,如图像编辑、视频合成和多模态交互系统。通过引入校正机制,增强模型的探索能力,提升奖励优化效果,推动流模型在强化学习中的实际应用。未来可结合多尺度、多次校正策略,适应更复杂、多样的场景。
局限与展望
当前方法在极端高噪声或非凸边缘分布下效果有限,需优化参数调节。校正步骤增加计算成本,影响推理速度。对多模态、多模态分布的适应性尚未充分验证,未来需扩展到更复杂场景。
通俗解读 非专业人士也能看懂
想象你在做一份大餐,流程包括准备食材、烹饪和调味。流模型就像厨房里的厨师,能快速把食材从原料变成美味佳肴,但在用强化学习调味时,厨房的操作会变得不一致。有时候,厨师用不同的调味料(随机探索)会让菜变得不一样,但也可能变得不太好吃。本文提出一种新方法,就像给厨师配备一位助手,先让厨师按照原有流程做菜,然后用“调味校正”帮忙调整味道,让菜既有探索的变化,又保持美味。这样,厨师可以不断尝试新味道,做出更受欢迎的菜肴。这个方法让厨房的操作更精确,也更有趣,未来还能用在其他厨房场景,比如自动烘焙或调酒。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,你的目标是做出最棒的作品,但有时候你会试着用不同的策略(随机探索)来找到更好的方法。可是,有时候这些策略会让你的作品变得模糊或不太好看。这个研究就像发明了一种新技巧,先用正常的方法做一遍,然后用一个“校正器”帮你调整,让作品既有创新,又保持质量。这个“校正器”就像一个聪明的助手,能帮你修正偏差,让你不断尝试新点子,同时保证作品的水平。这样,你就能更快找到最棒的创意,也能做出更漂亮的作品。这种方法不仅让游戏更有趣,也能用在很多其他地方,比如自动画画、制作视频等。
原文摘要
Flow-based generative models are typically sampled by solving a deterministic ordinary differential equation (ODE), whereas online reinforcement learning requires stochastic rollouts for policy exploration and optimization. Existing GRPO methods for flow models therefore replace the inference-time ODE with a stochastic differential equation (SDE) during training. Although the ODE and SDE share the same marginal distributions in continuous time, their finite-step discretizations can differ substantially. In particular, SDE rollouts often become blurry as the exploration noise increases, creating a mismatch between the samples used for reinforcement learning and those generated by the test-time ODE sampler. We introduce LC-GRPO, a flow-based GRPO framework with Langevin correction. Each rollout transition first takes an inference-aligned ODE Euler step and then applies a stochastic Langevin correction targeting the marginal distribution at the resulting timestep. The required score is recovered directly from the flow velocity, requiring no additional score model, while the resulting transition remains an isotropic Gaussian with a tractable likelihood for policy optimization. We theoretically show that, under suitable conditions, one Langevin correction step reduces the Wasserstein error of an imperfect ODE Euler step. At a matched randomness level, we further show that the proposed transition can be more accurate than the standard Euler--Maruyama discretization of the reverse SDE. Experiments on SD3.5-Medium, FLUX.1-Dev, and HunyuanVideo demonstrate that LC-GRPO consistently improves reward optimization across text-to-image and text-to-video tasks, preserves generation quality, and substantially narrows the gap between stochastic training rollouts and deterministic test-time ODE inference.