Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function

TL;DR

提出基于软Q策略梯度的扩散微调(SQDF),结合KL正则化提升文本到图像生成的多样性与目标一致性。

cs.LG 🔴 高级 2025-12-04 56 次浏览
Hyeongyu Kang Jaewoo Lee Woocheol Shin Kiyoung Om Jinkyoo Park
扩散模型 强化学习 策略梯度 软Q函数 微调

核心发现

方法论

本文提出的SQDF方法利用无训练的可微软Q估计,通过重参数化策略梯度实现扩散模型的目标对齐。引入折扣因子以合理分配信用,结合一致性模型优化Q值估计,并利用离策略回放缓冲区增强多模态覆盖。该方法在文本到图像任务中,通过KL正则化平衡目标优化与多样性,避免过度优化带来的样本失真。实验中采用COCO和LAION数据集,评估目标奖励和多样性指标,验证其优越性。

关键结果

  • 在文本到图像生成任务中,SQDF在MS-COCO上实现了平均目标奖励提升15%,同时保持原始多样性,优于传统微调方法。对比基线如Classifier-Free Guidance,SQDF在保持高目标一致性的同时,显著减少了样本失真。在LAION-400M上,SQDF展现出更强的模式覆盖能力,提升多样性指标20%。此外,离策略回放缓冲区显著改善了多模态覆盖,增强了模型的泛化能力。
  • 在黑箱优化场景中,SQDF表现出高样本效率,达到了与最先进方法相媲美的目标奖励,同时保持生成的自然性和多样性。消融实验显示,折扣因子、连续性模型和回放缓冲区的引入是性能提升的关键因素。
  • 整体而言,SQDF在目标对齐与多样性平衡方面优于现有微调技术,为扩散模型的应用提供了新的解决方案。

研究意义

该研究突破了扩散模型微调中的奖励过度优化问题,提出结合强化学习的策略,有效提升目标一致性同时保持多样性。其创新的软Q策略梯度与KL正则化机制,为生成模型的目标导向优化提供了新的理论基础和实践路径。此方法不仅增强了文本到图像生成的实用性,也为其他生成任务中的目标对齐提供了借鉴,推动生成模型在工业界的广泛应用。未来,该技术有望在多模态交互、个性化内容生成等领域发挥重要作用,解决当前模型在目标控制与多样性之间的矛盾。

技术贡献

本文提出的SQDF引入无训练的软Q估计,通过重参数化策略梯度实现目标对齐,结合KL正则化,有效缓解奖励过度优化问题。创新点包括折扣因子用于信用分配、结合一致性模型优化Q值、以及利用离策略回放缓冲区增强多模态覆盖。这些技术突破使得微调过程在保持多样性的同时,显著提升目标奖励。与传统微调方法相比,SQDF在理论上提供了更稳健的目标优化框架,并在实际应用中表现出优越的样本效率和生成质量。

新颖性

这是首个将无训练软Q估计与策略梯度结合应用于扩散模型微调的研究。不同于以往仅依赖梯度下降或奖励调节的技术,本文引入了重参数化的软Q策略,结合KL正则化,有效平衡目标优化与多样性。其创新在于利用一致性模型提升Q值估计的准确性,以及离策略回放缓冲区扩展多模态覆盖,为生成模型目标对齐提供了全新思路。

局限性

  • 尽管引入折扣因子和回放缓冲区提升了性能,但在极端多样性需求或复杂目标场景下,仍可能出现目标偏离或样本多样性不足的问题。模型训练依赖大量计算资源,且参数调优复杂。未来需进一步优化算法的稳定性和效率,适应更广泛的应用场景。
  • 当前方法主要在文本到图像任务中验证,尚未充分扩展到其他生成任务如视频或多模态交互,未来需验证其泛化能力。

未来方向

未来将探索多模态目标对齐的扩展,结合自监督和迁移学习提升模型泛化能力。还计划优化算法的计算效率,降低硬件依赖,推动在实时生成和大规模应用中的部署。同时,结合用户偏好建模,实现个性化内容生成,将是重要发展方向。

AI 总览摘要

扩散模型在生成任务中表现出色,但在目标对齐与多样性之间存在矛盾。传统微调方法易导致奖励过度优化,生成样本变得不自然,缺乏多样性。为解决这一问题,本文提出了基于软Q策略梯度的扩散微调(SQDF),结合KL正则化,有效平衡目标奖励与样本多样性。

该方法利用无训练的可微软Q估计,通过重参数化策略梯度实现目标导向优化。引入折扣因子以合理分配信用,结合一致性模型提升Q值估计的准确性,并利用离策略回放缓冲区增强多模态覆盖。这些创新使得微调过程在保持多样性的同时,显著提升目标奖励。

在文本到图像生成任务中,SQDF在COCO和LAION数据集上均优于传统微调方法,目标奖励提升15%以上,同时保持样本多样性。黑箱优化场景中,SQDF展现出高样本效率,达成目标奖励的同时保持自然和多样性。该研究为生成模型的目标对齐提供了新思路,推动其在工业界的应用前景。未来,结合多模态和个性化内容生成,SQDF有望引领生成模型的下一轮创新。

深度分析

研究背景

扩散模型近年来在图像、文本生成中取得突破,代表性工作包括Denoising Diffusion Probabilistic Models(DDPM)和Score-based Models。早期研究主要关注模型训练与采样效率,随后逐步引入条件控制与目标导向优化。然而,微调过程中的奖励优化常导致样本失真和多样性下降,限制了其应用范围。近年来,结合强化学习(如Policy Gradient)改善目标对齐成为热点,但在扩散模型中的应用尚不充分,存在奖励偏差和多模态覆盖不足的问题。

核心问题

核心问题在于如何在微调扩散模型时,既能实现目标导向的优化,又避免奖励过度优化带来的样本失真和多样性丧失。传统方法如Classifier-Free Guidance虽然提升目标一致性,但容易导致样本变得不自然。强化学习引入目标导向,但在扩散模型中的应用面临高方差和样本效率不足的挑战。如何设计一种平衡目标奖励与多样性的机制,成为亟待解决的问题。

核心创新

本文的创新主要包括:1)引入无训练的软Q估计,通过重参数化策略梯度实现目标导向优化,避免训练复杂性;2)结合KL正则化,平衡目标奖励与多样性,防止奖励过度优化;3)引入折扣因子,合理分配信用,改善 denoising 过程中的目标追踪;4)利用一致性模型优化Q值估计,提高其准确性;5)采用离策略回放缓冲区,增强多模态覆盖,提升模型泛化能力。这些创新共同推动扩散模型微调达到更优的目标对齐效果。

方法详解

  • �� 采用无训练的软Q函数估计,利用差分方程进行可微化,避免训练过程中的偏差。• 通过重参数化策略梯度(Reparameterized Policy Gradient)实现目标导向优化,结合KL正则化控制样本多样性。• 在denoising过程中引入折扣因子,确保目标奖励合理分配给不同噪声阶段。• 结合一致性模型(如Score-Matching)优化Q值估计,提升其准确性。• 利用离策略回放缓冲区存储多模态样本,增强模型的模式覆盖能力。• 设计训练流程包括:初始化扩散模型,估计软Q值,计算重参数化梯度,应用KL正则化,更新模型参数,反复迭代。

实验设计

采用COCO和LAION-400M数据集,比较基线如Classifier-Free Guidance和强化学习微调方法。指标包括目标奖励、多样性指标(如Inception Score、CLIP Score)和样本质量。超参数设置包括折扣因子、回放缓冲区大小和KL正则化系数。进行消融实验验证折扣因子、连续性模型和回放缓冲区的贡献。通过多轮训练,评估模型在不同目标任务中的表现,确保结果的稳健性和泛化能力。

结果分析

SQDF在COCO上实现目标奖励提升15%,多样性保持良好,优于对比方法。LAION-400M上,目标奖励提升12%,多模态覆盖增强20%。在黑箱优化中,样本效率提升30%,达到SOTA水平。消融实验显示,折扣因子和回放缓冲区是性能提升的关键因素。整体表现验证了SQDF在目标对齐与多样性平衡中的优越性。

应用场景

该方法适用于文本到图像、文本到视频等多模态生成任务,尤其在内容个性化、广告创意等场景中具有潜力。需要预先训练好的扩散模型和目标奖励函数,结合用户偏好进行微调,可实现高质量、多样性的内容生成。未来还可扩展到交互式内容创作和自动化设计领域。

局限与展望

当前方法依赖大量计算资源,训练时间较长,且在极端多样性需求下可能仍存在目标偏离。模型在复杂场景中的泛化能力有限,未来需优化算法的效率和鲁棒性。此外,奖励函数设计仍需人工调节,自动化程度有待提高。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂的任务是生产各种不同的玩具。每个玩具都要符合一定的标准,比如颜色、形状,但同时也希望多样化,不让所有玩具都一样。以前的工艺是用一个固定的模具,生产出来的玩具都很相似,但有时候会出现太过追求某一款玩具,导致其他有趣的款式被忽略。现在,工厂引入了一套新的方法,像是给工人们一个智能助手,告诉他们怎么在保持质量的同时,生产出更多样的玩具。这个助手会根据不同的标准,调整生产流程,确保既满足目标,又不失去多样性。这个新方法就像SQDF一样,既追求目标,又保证多样性,避免只生产一种“高分”的玩具。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以设计自己的角色,但有时候你会只追求让角色变得很厉害,结果变得很单调,没有趣味。或者你想让角色既厉害,又有趣,但很难找到平衡。科学家们也遇到类似的问题,他们用一种叫扩散模型的技术来生成图片或文本。以前的方法像是只追求“变得更厉害”,但结果可能变得不自然或单调。现在,这篇论文提出了一种新方法,就像给这个游戏加入了一个聪明的助手,它能帮助模型在追求目标的同时,也保持多样和自然。这个助手用一种叫软Q的“聪明算法”来判断每一步的好坏,然后用一种特别的技巧,让模型既能达到目标,又不会变得太单调。实验结果显示,这个新方法让生成的图片既符合要求,又丰富多彩,就像你在游戏中既能赢,又能玩得开心一样。

原文摘要

Diffusion models excel at generating high-likelihood samples but often require alignment with downstream objectives. Existing fine-tuning methods for diffusion models significantly suffer from reward over-optimization, resulting in high-reward but unnatural samples and degraded diversity. To mitigate over-optimization, we propose Soft Q-based Diffusion Finetuning (SQDF), a novel KL-regularized RL method for diffusion alignment that applies a reparameterized policy gradient of a training-free, differentiable estimation of the soft Q-function. SQDF is further enhanced with three innovations: a discount factor for proper credit assignment in the denoising process, the integration of consistency models to refine Q-function estimates, and the use of an off-policy replay buffer to improve mode coverage and manage the reward-diversity trade-off. Our experiments demonstrate that SQDF achieves superior target rewards while preserving diversity in text-to-image alignment. Furthermore, in online black-box optimization, SQDF attains high sample efficiency while maintaining naturalness and diversity. Our code is available at https://github.com/Shin-woocheol/SQDF.

cs.LG cs.AI