When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

TL;DR

提出感知熵以解决流模型RLHF中的多样性崩溃,提升质量与多样性(PEC score 0.734)

cs.CV 🔴 高级 2026-05-12 44 次浏览
Xiaofeng Tan Jun Liu Bin-Bin Gao Yuanting Fan Xi Jiang Chengjie Wang Hongsong Wang Feng Zheng
强化学习 生成模型 信息熵 流模型 多样性保持

核心发现

方法论

本文分析流模型RLHF中政策熵恒定但多样性崩溃的根源,提出感知熵概念,结合两种正则化策略(感知熵约束与生成空间约束)以增强多样性。通过理论推导和实证验证,揭示固定噪声调度导致政策熵不变,而模式追求导致多样性下降。采用PickScore、DINO、CLIP等多空间编码器,在FLUX.dev和SD3.5-M数据集上验证新策略的有效性。实验指标包括质量、多样性Vendi Score,PEC在整体得分0.734及多样性0.989上优于基线。

关键结果

  • 感知熵与奖励呈指数关系(R=−a exp(Hperc)+b),验证其作为多样性指标的有效性。引入感知熵正则化策略后,质量指标提升显著(整体得分由0.366提升至0.734),多样性指标也大幅改善(平均多样性由0.047提升至0.989)。
  • 在两个基础模型(神经奖励与规则奖励)及三种感知空间中,均实现了性能提升,表明策略具有良好的泛化能力。PEC策略在保持高质量的同时,有效缓解了多样性崩溃问题。
  • 对比传统策略(如基于政策熵正则化)显示,感知熵策略能更准确反映感知空间中的多样性变化,避免模型陷入单一高奖励模式,从而实现多样性与质量的平衡。

研究意义

该研究突破了流模型RLHF中政策熵无法反映多样性崩溃的瓶颈,为多模态生成模型提供了新的正则化思路。感知熵的引入不仅理论创新,还在实际应用中显著改善了生成内容的多样性与质量,为未来多样性保持技术提供了理论基础和实践路径。此方法对推动AI生成模型在艺术、设计、内容创作等领域的广泛应用具有重要意义,有望引领行业标准的变革。

技术贡献

本文提出感知熵概念,突破传统政策熵的局限,结合VAE与感知编码器实现多空间多样性测度。设计了两种正则化策略(PEC与感知空间约束),在理论上证明其能缓解模式崩溃,提升多样性。通过实证验证,建立了感知熵与奖励的指数关系,为流模型RLHF提供了新的优化框架。技术创新在于结合信息论与感知空间,提出多模态多样性保持新思路,丰富了强化学习在生成模型中的应用。

新颖性

首次在流模型RLHF中引入感知熵,有效解决政策熵恒定导致的多样性崩溃问题。不同于传统基于政策熵的正则化方法,感知熵直接反映感知空间中的多样性变化,结合VAE和多空间编码实现多模态感知一致性。这一创新为生成模型多样性保持提供了全新理论工具,填补了流模型多样性控制的空白。

局限性

  • 感知熵的计算依赖于预训练的感知编码器(如DINO、CLIP),在不同任务或编码器选择上可能存在适应性问题。模型在极端高奖励区域可能仍存在多样性不足的风险,需进一步优化感知空间的表达能力。
  • 正则化策略的超参数(λ)调优较为敏感,可能影响训练稳定性和最终性能。计算成本较高,尤其在大规模模型和多空间编码时,存在效率瓶颈。
  • 当前方法主要在图像生成任务中验证,迁移到其他模态(如文本、音频)仍需验证其泛化能力。未来需结合更高效的感知编码和多模态信息融合技术。

未来方向

未来将探索多模态感知编码的联合优化,提升感知熵的表达能力。结合强化学习中的探索机制,设计更鲁棒的多样性保持策略。还计划将该方法应用于更复杂的场景,如视频生成和交互式内容创作,推动多模态生成模型的多样性与质量同步提升。

AI 总览摘要

流模型在文本到图像生成中展现出强大能力,但在RLHF微调后常出现多样性崩溃的问题。传统观点认为政策熵与多样性正相关,因而采用熵正则化策略。然而,本文揭示在流模型中,政策熵保持恒定,无法反映多样性变化,原因在于噪声调度固定和模式追求的优化目标。为解决这一矛盾,作者引入感知熵,基于感知空间的多样性测度,设计了两种正则化策略:感知熵约束(PEC)和生成空间约束(PCVAE)。这些方法在多个感知空间和奖励机制下,显著提升了生成内容的多样性和质量,整体得分由0.366提升至0.734,平均多样性由0.047跃升至0.989。实验结果验证了感知熵作为多样性指标的有效性,展示了其在实际应用中的潜力。该研究不仅丰富了强化学习在生成模型中的理论体系,也为未来多模态内容生成提供了新的技术路径。尽管如此,感知熵的计算依赖预训练编码器,模型在极端场景下的表现仍需优化。未来,结合多模态感知和更高效的算法,将进一步推动多样性保持技术的发展。

深度解读

原文摘要

RLHF is widely used to align flow-matching text-to-image models with human preferences, but often leads to severe diversity collapse after fine-tuning. In RL, diversity is often assumed to correlate with policy entropy, motivating entropy regularization. However, we show this intuition breaks in flow models: policy entropy remains constant, even while perceptual diversity collapses. We explain this mismatch both theoretically and empirically: the constant entropy arises from the fixed, pre-defined noise schedule, while the diversity collapse is driven by the mode-seeking nature of policy gradients. As a result, policy entropy fails to prevent the model from converging to a narrow high-reward region in the perceptual space. To this end, we introduce perceptual entropy that captures diversity in a perceptual space and maintains the property of standard entropy. Building upon this insight, we propose two entropy-regularized strategies, Perceptual Entropy Constraint and Perceptual Constraints on Generation Space, to preserve perceptual diversity and improve the quality. Experiments across two base models, neural and rule-based rewards, and three perceptual spaces demonstrate consistent gains in the quality-diversity trade-off; PEC achieves the best overall score of 0.734 (vs. baseline's 0.366); a complementary setting of PEC further reaches a diversity average of 0.989 (vs. baseline's 0.047). Our project page (https://xiaofeng-tan.github.io/projects/PEC) is publicly available.

cs.CV