Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

TL;DR

提出基于JS散度的GRPO后训练方法,在LlamaGen和Janus-7B上平衡性能与多样性。

cs.AI 🔴 高级 2026-06-19 35 次浏览
Yuanhao Chiang Hongbo Duan Chunru Yang Jiahua Pei Yi Liu Xueqian Wang
文本生成 图像生成 强化学习 JS散度 GRPO

核心发现

方法论

研究将GRPO框架中的参考策略散度从固定KL扩展到f-散度家族,包括正向KL、反向KL和JS散度。通过理论分析和实验验证,JS散度在平衡性能与生成多样性方面表现最佳。

关键结果

  • 在LlamaGen和Janus-7B上,JS散度在CLIPScore、HPS-v2.1等指标上表现最好,例如Janus-7B的HPS-v2.1达到0.2881。
  • JS散度在生成多样性评估中表现均衡,例如在Janus-7B的1D熵上达到7.5081。
  • 实验显示JS散度有效抑制过度偏离参考策略,同时避免模式崩塌。

研究意义

该研究解决了文本到图像生成中性能与多样性难以兼顾的问题,为GRPO框架提供了新的优化视角。其方法适用于多种生成任务,推动了强化学习与生成模型的结合。

技术贡献

提出了基于f-散度的统一优化框架,分析了不同散度对梯度更新的影响,首次在GRPO中系统比较了JS散度与其他散度的性能。

新颖性

首次将JS散度引入GRPO框架,并通过理论和实验验证其在生成任务中的优势,填补了现有研究中对散度选择的系统性分析空白。

局限性

  • 方法依赖于高质量的参考策略,若参考策略质量较低,可能影响优化效果。
  • 实验主要集中在LlamaGen和Janus-7B,未验证更大规模模型的适用性。
  • 对不同任务的泛化能力尚需进一步研究。

未来方向

未来可探索JS散度在更大规模模型和多模态任务中的应用,研究如何动态调整散度参数以适应不同训练阶段。

AI 总览摘要

近年来,文本到图像生成(T2I)技术取得了显著进展,但生成结果与人类偏好的对齐仍是挑战。现有的GRPO强化学习框架虽然有效,但通常固定使用KL散度作为参考策略约束,忽略了其他可能的散度选择。

本文提出了一种基于f-散度的统一优化框架,系统研究了正向KL、反向KL和JS散度在GRPO中的表现。理论分析表明,JS散度在抑制过度偏离参考策略的同时,能够有效平衡性能与生成多样性。实验在LlamaGen和Janus-7B上验证了这一结论,JS散度在CLIPScore、HPS-v2.1等指标上表现最佳,同时保持了较高的生成多样性。

这一研究为文本到图像生成任务提供了新的优化视角,尤其是在强化学习框架中选择合适的散度形式。未来工作可进一步探索其在更大规模模型和多模态任务中的应用潜力。

深度分析

研究背景

文本到图像生成近年来成为生成式AI的重要方向,尤其是自回归模型因其离散化的视觉标记生成方式受到关注。现有研究多集中于扩散模型的优化,而自回归模型的偏好对齐问题研究较少。

核心问题

现有GRPO方法通常固定采用KL散度作为参考策略约束,忽略了散度选择对优化动态的影响。这导致生成结果可能偏离人类偏好或缺乏多样性。

核心创新

本文首次将f-散度引入GRPO框架,系统分析了正向KL、反向KL和JS散度对优化动态的影响。JS散度通过调整梯度更新,平衡了性能与多样性。

方法详解

  • �� 提出基于f-散度的统一优化框架。
  • �� 理论分析不同散度对梯度更新的影响。
  • �� 在LlamaGen和Janus-7B上进行实验验证,比较不同散度的性能。

实验设计

实验在LlamaGen和Janus-7B上进行,使用HPS-v2.1作为奖励模型,评估指标包括CLIPScore、HPS-v2.1等,同时分析生成多样性。

结果分析

JS散度在CLIPScore和HPS-v2.1等指标上表现最佳,例如Janus-7B的HPS-v2.1达到0.2881,同时保持了较高的生成多样性。

应用场景

该方法可用于文本到图像生成任务中优化生成结果与人类偏好的对齐,适用于广告设计、内容创作等场景。

局限与展望

方法依赖于高质量的参考策略,实验范围较小,未来需验证其在更大规模模型和多模态任务中的适用性。

通俗解读 非专业人士也能看懂

可以将本文的方法比作一个厨师在做菜时参考食谱。参考策略就像食谱,散度决定了厨师可以偏离食谱的程度。JS散度就像一个灵活的指导,既允许厨师创新,又不会偏离太多,保证菜品的质量和多样性。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,AI帮你画画。现有的方法就像一个严格的老师,只允许你按照规定画。本文的方法更像一个友好的教练,既让你自由发挥,又能帮你画得更好!

术语表

GRPO (群体相对偏好优化)

一种强化学习方法,通过群体采样和相对奖励优化生成模型。

用于优化文本到图像生成的偏好对齐。

JS散度 (Jensen-Shannon散度)

一种衡量两个分布相似性的指标,介于正向KL和反向KL之间。

在本文中用于平衡性能与多样性。

CLIPScore

用于评估生成图像与文本描述匹配程度的指标。

作为主要性能评估指标之一。

HPS-v2.1

一种奖励模型,用于衡量生成结果的人类偏好对齐程度。

作为强化学习的奖励信号。

自回归生成

逐步生成离散标记的生成方式,每一步依赖前一步的输出。

本文研究的主要生成框架。

开放问题 这项研究留下的未解疑问

  • 1 如何动态调整散度参数以适应不同训练阶段?
  • 2 JS散度在更大规模模型中的表现如何?
  • 3 是否可以扩展到其他生成任务,如文本生成?

应用场景

近期应用

广告设计

优化生成广告图像的质量和多样性,满足不同用户需求。

内容创作

为创作者提供高质量且多样化的图像生成工具。

远期愿景

多模态生成

将方法扩展到多模态生成任务,如文本与音频的联合生成。

原文摘要

Autoregressive text-to-image (T2I) generation has recently advanced rapidly, yet aligning generated images with human preferences remains challenging. GRPO-style online reinforcement learning provides an effective framework; however, existing methods typically treat reference-policy divergence as fixed, despite its direct impact on policy optimization. We study this overlooked factor within a unified f-divergence framework, encompassing forward KL, reverse KL, and JS divergence, for GRPO-style autoregressive T2I alignment. Our systematic theoretical analysis reveals that different divergences reshape token-level updates in distinct ways. In particular, under the sampled-token shaping form used, JS regularization achieves a favorable trade-off by mitigating uniform bias relative to the reference policy while still discouraging large deviations. Extensive experiments on LlamaGen and Janus-7B show that JS divergence achieves the strongest or highly competitive optimization performance on most evaluation metrics while maintaining favorable generation diversity. The code is available at https://github.com/tuoyou-hao/BPD-GRPO.

cs.AI cs.LG