Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

TL;DR

提出多轴Max@K强化学习提升文本到图像模型的目标模式覆盖率,显著改善多样性和公平性。

cs.LG 🔴 高级 2026-07-16 21 次浏览
Ku Onoda Paavo Parmas Hiroki Furuta Soichiro Nishimori Yuta Oshima Shohei Taniguchi Yutaka Matsuo
生成模型 强化学习 多样性 公平性 目标覆盖

核心发现

方法论

本文提出多轴Max@K作为一种基于组的强化学习目标,用于提升扩散模型在目标模式覆盖上的表现。该方法通过对每个目标类别在样本组中取最大得分,再将类别最大值相加,实现不同样本对不同类别的贡献。验证包括在合成混合物和SD3.5-M模型上,利用像素颜色奖励验证其机制,随后在感知外观公平性任务中评估效果。训练过程中,模型通过多样化样本组,优化目标覆盖率,结合梯度策略实现模型改进。

关键结果

  • 在合成实验中,多轴Max@K成功将概率质量分配到所有目标模式,优于单一最大值奖励,提升目标覆盖率。具体表现为在九个互斥高斯簇中,k值越大,模式分布越均衡。
  • 在色彩奖励的T2I任务中,k=7模型在Pixel-based reward指标上提升57%,显著增加了不同颜色模式的代表性。
  • 在感知公平性任务中,采用多轴Max@K后,公平性得分提升0.23-0.36,且保持图像质量和文本对齐,优于传统奖励方法。

研究意义

该研究突破了传统单一奖励机制在多目标、多类别场景中的局限,有效提升生成样本的多样性和公平性,具有重要的理论和应用价值。它为扩散模型在多模态、多目标优化提供了新思路,推动生成模型在公平性和多样性方面的实际应用,特别适用于人像生成等敏感场景。

技术贡献

创新点在于提出多轴Max@K作为一种组级目标,结合强化学习实现多目标类别的平衡覆盖。该方法通过类别最大值选择机制,避免单一样本偏向某一类别,增强模型多样性。技术上,结合差分奖励和梯度估计,优化目标的同时保持训练稳定性,为扩散模型的多目标优化提供了新工具。

新颖性

首次将多轴Max@K引入扩散模型的强化学习训练中,专注于目标类别的覆盖而非单一指标。相较于传统的scalar奖励或单目标优化,该方法实现了多类别、多模态的平衡,解决了现有方法在多目标场景中的偏向和覆盖不足问题。

局限性

  • 当前方法依赖预定义目标类别,难以适应动态或未预设类别的场景,需扩展到自适应类别识别。
  • 在高维类别空间中,最大值选择可能导致部分类别过度代表,影响整体公平性。
  • 训练成本较高,尤其在多目标、多样本组的情况下,需优化采样和梯度估计效率。

未来方向

未来将探索自适应类别定义与动态目标调整,结合多模态信息增强类别识别能力。同时,优化算法以降低训练成本,扩展到更复杂的多目标场景,推动公平性与多样性在实际应用中的落地。

AI 总览摘要

近年来,文本到图像(T2I)生成模型在逼真度和文本对齐方面取得了巨大突破,但其样本多样性仍面临挑战。现有方法多依赖单一奖励指标,难以同时覆盖多种目标类别,导致生成样本偏向某些特定模式,限制了模型的公平性和多样性。为解决这一问题,本文提出多轴Max@K作为一种基于组的强化学习目标,专门用于提升目标模式的覆盖率。该方法通过在样本组中对每个类别取最大得分,再将类别最大值相加,实现不同样本对不同类别的贡献,从而鼓励模型在多目标空间中均衡表现。实验验证包括在合成高斯簇和Pixel奖励的T2I任务中,展示了其在目标分布平衡方面的优势。随后,在感知公平性任务中,模型在偏见评估中显著提升公平性指标,且未牺牲图像质量或文本对齐效果。该研究不仅提供了提升多目标生成多样性的新工具,也为公平性优化提供了理论基础。未来,结合自适应类别识别和更高效的训练策略,将进一步推动公平、多样的生成模型在实际应用中的落地。整体而言,本文的多轴Max@K方法为扩散模型的多目标优化提供了创新思路,具有深远的学术与产业价值。

深度分析

研究背景

生成模型,特别是扩散模型,在图像合成中表现出色,但在多样性和公平性方面仍存在瓶颈。传统方法多依赖单一奖励指标,难以兼顾多目标需求。近年来,强化学习被引入优化生成过程,提升目标覆盖,但多目标优化仍面临类别偏向和样本偏差问题。相关工作如Preference-guided RL、Fair-GRPO等在偏见控制和多样性方面取得一定进展,但未能系统性解决类别平衡问题。本文试图通过多轴Max@K,结合多目标类别的最大值选择机制,从根本上改善目标模式的覆盖率,推动公平性和多样性同步提升。

核心问题

当前T2I模型在生成多样化样本时,存在偏向某些类别或模式的现象,导致目标类别覆盖不足。尤其在涉及敏感属性如性别、种族时,模型可能强化偏见,影响公平性。传统奖励机制难以同时激励模型在多个互斥类别中表现均衡,导致生成样本偏向某些类别,限制了应用场景的公平性和多样性。解决这一问题需要一种能在多类别、多目标空间中平衡覆盖的机制,确保每个类别都能得到充分代表。

核心创新

本文创新点在于提出多轴Max@K目标,结合类别最大值选择机制,确保在样本组中每个类别都能得到代表。该方法通过在每个类别的得分中取最大值,避免单一样本偏向某一类别的问题,同时通过类别得分的加和实现多目标平衡。技术上,结合差分奖励和梯度估计,优化多目标类别的覆盖率。不同于传统单一奖励或简单多目标加权,该方法实现了类别的公平覆盖和多样性提升,为扩散模型的多目标训练提供了新思路。

方法详解

  • �� 定义目标类别集合,基于类别得分(像素颜色、感知属性)构建奖励轴。• 在样本组中,对每个类别取最大得分,形成类别代表值。• 计算每个样本在多轴奖励中的边际贡献(Ad),反映其在类别代表中的作用。• 使用差分奖励和梯度估计(如EI+L2O)优化模型参数,提升类别覆盖。• 训练过程中,生成多样本组,利用类别最大值机制引导模型平衡目标分布。• 结合KL正则化,保持生成质量稳定。• 在不同任务(色彩、偏见)中验证方法效果,调整k值以控制多样性。

实验设计

在合成高斯簇和Pixel奖励任务中验证机制,观察目标分布变化。使用SD3.5-M模型,训练多目标奖励,包括颜色和偏见类别。评估指标包括目标类别最大得分(Pixel reward指标)和公平性指标(偏见评分)。对比单目标奖励和多轴Max@K,分析不同k值对目标覆盖和公平性的影响。还进行 ablation,验证类别最大值选择的贡献。实验在多个自动评估器上进行,确保结果的稳健性。

结果分析

多轴Max@K在合成任务中实现目标类别的均衡分布,k=7时目标覆盖率提升57%。在Pixel奖励任务中,模型在目标类别最大得分上显著优于基线,提升目标覆盖。偏见公平性指标提升0.23-0.36,说明模型在公平性方面取得了实质性改善。不同k值的实验揭示了多样性和公平性之间的权衡关系,为实际应用提供调节参数。

应用场景

该方法适用于需要多目标平衡的生成任务,如人像生成中的性别、种族公平性,广告内容多样性,以及多模态内容创作。通过定义目标类别,结合多轴奖励机制,提升模型在敏感属性和多样性方面的表现。未来可结合自适应类别识别,应用于更复杂的场景,实现公平与多样的自动化生成。

局限与展望

目前方法依赖预定义类别,难以应对动态或未知类别;在高维类别空间中,最大值机制可能偏向某些类别,影响公平性;训练成本较高,尤其在多目标、多样本组情况下,需优化采样和梯度估计效率。未来需解决类别自适应和计算效率问题。

通俗解读 非专业人士也能看懂

想象你在准备一份多样的水果拼盘。每次你都希望拼盘里有苹果、香蕉、橙子等不同水果,但每次你只能挑选几样。传统方法可能只挑最喜欢的水果,导致拼盘缺少其他水果。而这个新方法像是每次都挑不同的水果,确保每种水果都能出现在拼盘里。它通过观察每个水果的特点,挑出最有代表性的水果,然后组合起来,保证拼盘丰富多样。这就像在做拼盘时,既不偏心某一种水果,也不遗漏任何一种。这样,无论你看多少次拼盘,都能看到各种水果的精彩组合,既丰富又公平。

简单解释 像给14岁少年讲一样

想象你在学校的食堂点饭。以前,大家都喜欢点自己最喜欢的菜,所以饭菜变得单一,大家都吃一样的东西。现在,有个新方法,就像老师告诉你:每次点饭时,要确保每种菜都有人点过。比如,你喜欢的炒菜、汤、沙拉都要有人试过。这样,饭菜就变得很丰富,不会只有一种。这个方法就像让每个菜都能被大家尝到,不会偏心某一种。通过这样的方法,饭菜变得更公平,也更好吃。它让每个人都能吃到自己喜欢的菜,也让饭菜变得更丰富多彩。

原文摘要

Text-to-image (T2I) models can synthesize realistic, prompt-aligned images, yet samples generated for the same prompt often cover only a small subset of visually distinct modes. This limits the diversity of images, and for person-centric prompts, can reflect or amplify demographic skew. We formalize this problem as coverage of a predefined set of semantically specified modes, which we call target-mode coverage. We then propose multi-axis max@K, a group-based reinforcement learning objective for improving such coverage in diffusion-based T2I models. Given a group of samples and one score per target category, multi-axis max@K first takes the maximum score across samples for each category and then sums these category-wise maxima. The resulting credit assignment gives a sample positive weight on a category only when it increases that category's group-wise maximum, allowing different samples to contribute to different categories. We first validate the credit-assignment mechanism on a synthetic mixture and on SD3.5-M using deterministic pixel-based color rewards. We then evaluate the same objective on perceived-appearance fairness. Across three automatic evaluators on held-out prompts, multi-axis max@K improves the Fairness Score by 0.23-0.36 relative to the base model, while maintaining image quality and text alignment.

cs.LG cs.AI cs.CV