Optimizing Visual Generative Models via Distribution-wise Rewards

TL;DR

提出基于分布奖励的强化微调方法,有效提升图像生成质量,FID从8.30降至5.77。

cs.LG 🔴 高级 2026-07-02 25 次浏览
Ruihang Li Mengde Xu Shuyang Gu Leigang Qu Fuli Feng Han Hu Wenjie Wang
生成模型 强化学习 分布指标 图像质量 模型优化

核心发现

方法论

本文提出一种基于分布奖励的强化学习框架,利用子集替换策略在保持计算效率的同时,增强模型对真实数据分布的覆盖。通过FID指标作为奖励信号,结合模型后置融合系数优化,解决了样本奖励易被操控和训练-推理不一致的问题。具体流程包括生成参考集、随机替换子集、计算替换FID作为奖励,并利用策略梯度进行模型微调。该方法在多种预训练生成模型上验证,有效改善了FID指标,提升了生成多样性与视觉质量。

关键结果

  • 在SiT模型上,FID从8.30降至5.77,FDDINOv2从230.39降至164.88,显著优于传统样本奖励方法。
  • 在EDM2模型上,FID由3.74提升至3.52,验证了后置融合系数优化的有效性。
  • 实验显示,子集替换策略在降低计算成本的同时,提供了密集且稳定的奖励信号,改善了模型的分布覆盖能力。

研究意义

该研究突破了传统样本奖励的局限,通过分布级奖励增强生成模型的多样性和真实感,有助于推动高质量图像生成技术在工业和科研中的应用。解决了奖励操控和训练-推理不一致的核心难题,为未来大规模生成模型的优化提供了新思路。

技术贡献

创新点在于引入子集替换的分布奖励机制,有效降低了FID指标的优化成本,结合模型后置融合策略,避免了SDE引入的训练推理差异。提出的RL框架兼容多种预训练模型,显著提升了生成质量与多样性,拓展了强化学习在图像生成中的应用边界。

新颖性

首次提出基于子集替换的分布奖励策略,用于强化微调生成模型,突破了以往依赖大规模轨迹计算的限制,结合模型后置融合实现训练推理一致性,具有较强创新性。

局限性

  • 该方法在大规模模型上仍需较多计算资源,尤其在参考集生成和频繁替换过程中,存在一定的计算开销。
  • 子集替换比例和参考集大小对性能敏感,参数调优仍需经验支撑。
  • 目前主要验证在图像生成任务,迁移到其他生成任务仍需进一步验证。

未来方向

未来将探索自适应子集替换策略,结合多模态数据增强模型的泛化能力,并尝试将分布奖励应用于更复杂的生成任务如视频和三维模型,推动生成模型的鲁棒性与实用性。

AI 总览摘要

本研究针对视觉生成模型中存在的奖励操控和训练-推理不一致问题,提出一种基于分布奖励的强化微调框架。传统的样本奖励容易被操控,导致生成多样性下降和视觉异常,而分布奖励则通过衡量生成样本的整体分布偏差,更好地反映模型的真实表现。核心创新在于引入子集替换策略,利用有限样本快速估算FID指标作为奖励信号,显著降低计算成本。实验结果显示,在多种预训练模型上,FID指标均得到大幅改善,例如SiT模型FID从8.30降至5.77,验证了方法的有效性。为了克服SDE训练引入的训练推理差异,作者还提出后置模型融合系数优化策略,进一步提升模型性能。该方法不仅增强了生成多样性,也提升了图像质量,为未来大规模生成模型的优化提供了新思路。整体来看,该框架结合了高效的奖励估算和模型后置融合技术,为生成模型的鲁棒性和实用性奠定了基础。

深度分析

研究背景

近年来,深度生成模型如扩散模型(Diffusion Models)和变分自编码器(VAE)在图像生成领域取得突破。代表性工作包括Karras等的StyleGAN系列、Karras等的最新扩散模型,以及基于Transformer的模型如DiT和SiT。早期研究主要关注网络架构优化和训练策略提升生成质量,但在模型微调阶段,强化学习(RL)被引入以对齐用户偏好。现有方法多采用样本级奖励(如CLIP评分),但易受奖励操控影响,导致多样性下降和视觉异常。分布指标如FID逐渐成为衡量生成质量的主流工具,能更全面反映模型对真实数据分布的覆盖。尽管如此,如何高效利用分布指标进行强化微调,仍是当前研究难点。

核心问题

现有强化学习方法多依赖样本奖励,容易被操控,导致生成样本质量下降,且训练过程中引入的SDE(随机微分方程)增加了训练推理的不一致性。此外,直接基于分布指标的奖励计算成本高,难以在大规模模型上实现实时优化。这些问题限制了生成模型在实际应用中的表现和鲁棒性。

核心创新

本文提出子集替换的分布奖励策略,通过在参考集中随机替换少量样本,快速估算FID指标作为奖励,显著降低计算成本。结合模型后置融合系数优化,避免了SDE引入的训练-推理差异,提升了模型的实际应用效果。此方法兼容多种预训练模型,提升了生成多样性和视觉质量,突破了传统奖励操控和训练推理不一致的瓶颈。

方法详解

  • �� 生成参考集:用预训练模型生成一组平衡的样本集。
  • �� 子集替换:在训练过程中,随机用新生成样本替换参考集中的少量样本。
  • �� 计算奖励:用替换后参考集的FID指标(负值)作为奖励信号。
  • �� 策略优化:利用策略梯度方法,调整模型参数以最大化奖励。
  • �� 后置融合:用RL优化模型融合系数,避免SDE训练引入的偏差。
  • �� 频繁更新:定期重新生成参考集,保持奖励的代表性和稳定性。

实验设计

采用ImageNet 256×256数据集,验证在多种预训练模型(如SiT、EDM2)上的性能。对比传统样本奖励,子集替换策略显著降低FID指标,验证其有效性。设置不同参考集大小(2500-10000样本)和替换比例(50-200样本),进行超参数调优。采用FID和FDDINOv2作为评价指标,进行多轮实验和消融分析,验证方法的鲁棒性和泛化能力。

结果分析

在SiT模型上,FID从8.30降至5.77,FDDINOv2从230.39降至164.88,优于传统微调方法。在EDM2模型上,FID由3.74提升至3.52,验证后置融合系数优化的有效性。子集替换策略在降低计算成本的同时,提供密集奖励,有效改善模型的分布覆盖和生成多样性。

应用场景

该方法适用于需要高质量、多样性图像生成的场景,如内容创作、虚拟试衣、游戏开发等。通过优化预训练模型,提升生成效果,减少调优时间,具有广泛的工业应用潜力。未来可扩展到视频、3D模型等多模态生成任务。

局限与展望

当前方法在大规模模型上仍需较高计算资源,参考集参数敏感,调参复杂。主要验证在图像任务,迁移到其他领域仍需验证。未来需探索更高效的奖励估算和自适应参数调节策略,以提升实用性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,目标是做出既好吃又多样的菜肴。传统做法是每次只看单一道菜的味道,但这样容易偏向某些口味,忽略了整体的多样性。本文的方法像是用一个“菜谱评分系统”来评估一整盘菜的整体味道,而不是只看单个菜。通过不断调整食材比例和烹饪方式,利用少量的样本快速判断哪些组合更符合“好菜”的标准。这样一来,不仅菜肴的整体品质提高了,还能保证菜式的丰富多样。作者还提出用“后期调味”来优化最终的菜肴融合效果,避免在烹饪过程中引入不必要的复杂步骤。整个过程就像是在厨房里不断试验、调整,最终做出既美味又丰富的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上画画,老师让你画出很多不同的风景。以前,你只会专注于画一两种风景,然后反复练习,结果画出来的风景都差不多,没有新意。现在,老师告诉你一个新方法:你可以用一种“整体评分”的方式,看看你画的所有风景是不是多样、符合真实的感觉。每次你画完一组风景,就用这个评分给你反馈,然后你可以快速调整画风和内容。这样一来,你画的风景不仅更漂亮,还更丰富多彩。老师还建议你在最后阶段,把不同风景融合在一起,形成一幅更完整、更自然的画。这就像用一种聪明的“评分系统”不断帮你改进,最终你能画出既漂亮又多样的风景画。

术语表

Distribution-wise Reward (分布奖励)

一种衡量生成样本整体分布偏差的奖励机制,反映模型对真实数据分布的覆盖程度。技术上通过FID指标实现。

用于指导生成模型微调,避免样本操控,提升多样性。

Subset-replace Strategy (子集替换策略)

在参考集内随机替换少量样本,用于估算分布指标的奖励信号,兼顾计算效率与奖励密度。

核心创新,用于高效估算FID作为奖励。

FID (Fréchet Inception Distance)

衡量生成图像与真实图像分布差异的指标,基于Inception网络特征的均值和协方差差异。

作为分布偏差的评价指标,用于奖励信号。

Model Merging Coefficients (模型融合系数)

用于线性融合多个模型参数的权重系数,通过RL优化实现性能提升。

在后置阶段优化模型融合,避免训练-推理差异。

SDE (Stochastic Differential Equation, 随机微分方程)

描述扩散模型中引入随机噪声的数学工具,影响训练中的随机性。

训练中引入,影响推理一致性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低大规模模型微调的计算成本,特别是在高维数据和复杂指标下的效率优化。
  • 2 分布奖励在多模态生成(如视频、3D)中的适应性和效果验证。
  • 3 结合自监督学习和强化学习的多任务优化策略,以提升模型泛化能力。

应用场景

近期应用

高质量图像生成

可用于内容创作、虚拟试衣、广告设计等行业,通过优化预训练模型,提升生成图像的视觉质量和多样性。

模型微调工具

为研究人员提供一种高效微调生成模型的技术手段,减少调参时间,增强模型的适应性。

远期愿景

多模态生成系统

未来可扩展到视频、3D模型等多模态内容,推动虚拟现实、增强现实等技术的发展。

原文摘要

Conventional reinforcement learning strategies for visual generation typically employ sample-wise reward functions, yet this practice frequently results in reward hacking that degrades image diversity and introduces visual anomalies. To address these limitations, we present a novel framework that finetunes generative models using distribution-wise rewards, ensuring better alignment with real-world data distributions. Unlike rewards that evaluate samples individually, distribution-wise reward accounts for the data distribution of the samples, mitigating the mode collapse problem that occurs when all samples optimize towards the same direction independently. To overcome the prohibitive computational cost of estimating these rewards, we introduce a subset-replace strategy that efficiently provides reward signals by updating only a small subset of a generated reference set. Additionally, we apply RL to optimize post-hoc model merging coefficients, potentially mitigating the train-inference inconsistency caused by introducing stochastic differential equation (SDE) in regular RL practices. Extensive experiments show our approach significantly improves FID-50K across various base models, from 8.30 to 5.77 for SiT and from 3.74 to 3.52 for EDM2. Qualitative evaluation also confirms that our method enhances perceptual quality while preserving sample diversity.

cs.LG cs.CV