Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

TL;DR

Co-GRPO通过联合优化模型和推理计划,提升了MDM的生成质量。

cs.LG 🔴 高级 2025-12-25 39 次浏览
Renping Zhou Zanlin Ni Tianyi Chen Zeyu Liu Yang Yue Yulin Wang Yuxuan Wang Jingshu Liu Gao Huang
机器学习 强化学习 图像生成 推理优化 马尔可夫决策过程

核心发现

方法论

Co-GRPO将掩码扩散模型的生成过程重新定义为一个统一的马尔可夫决策过程(MDP),通过在轨迹层面应用群体相对策略优化,协同优化模型参数和计划参数。该方法不需要通过多步生成过程进行昂贵的反向传播,从而更彻底地将训练与推理对齐。

关键结果

  • 在ImageReward基准上,Co-GRPO将得分从0.942提高到1.122,显示出显著的性能提升。
  • 在HPSv2基准上,得分从28.83提高到29.37,超越了Naive GRPO基线方法。
  • 在GenEval和DPG-Bench基准上,Co-GRPO在零样本情况下也表现出强大的泛化能力。

研究意义

Co-GRPO通过优化模型和推理计划的协作,显著提升了MDM的生成质量。这一方法解决了训练和推理之间的基本不匹配问题,具有重要的学术和工业应用价值,尤其是在需要高效生成高质量图像的领域。

技术贡献

Co-GRPO在现有的SOTA方法基础上,提供了一个新的理论框架,将模型和推理计划视为合作策略,利用轨迹层面的策略梯度进行优化。这种方法不仅提高了生成质量,还开辟了新的工程可能性。

新颖性

Co-GRPO首次将MDM的生成过程视为一个统一的MDP,创新性地将推理计划作为可训练的动作,而不是固定的超参数。这与现有方法形成鲜明对比,尤其是在推理计划优化方面。

局限性

  • Co-GRPO在某些复杂场景下可能需要更长的训练时间,以达到最佳性能。
  • 推理计划的优化可能在某些情况下导致过拟合。

未来方向

未来的研究可以探索如何在更大规模的数据集上应用Co-GRPO,以及如何进一步优化推理计划以提高模型的鲁棒性。

AI 总览摘要

掩码扩散模型(MDM)在视觉、语言和跨模态生成中显示出巨大潜力,但其训练和推理过程之间存在显著差异。MDM的推理是一个多步迭代过程,而训练通常使用简化的单步目标。这种差异导致推理计划在训练中未被优化,影响了生成质量。

Co-GRPO通过将MDM的生成过程重新定义为一个统一的马尔可夫决策过程(MDP),解决了这一问题。该方法在轨迹层面应用群体相对策略优化,协同优化模型参数和推理计划参数,避免了昂贵的多步反向传播。

实验结果表明,Co-GRPO在多个基准上显著提升了生成质量,尤其是在ImageReward和HPSv2基准上。该方法不仅提高了生成效率,还展示了强大的泛化能力,为MDM的未来研究提供了新的方向。

深度分析

研究背景

掩码扩散模型(MDM)近年来在图像生成领域取得了显著进展。与自回归模型相比,MDM在生成效率上具有明显优势,能够在较少的迭代步骤中生成高质量图像。然而,MDM的训练和推理过程之间存在显著差异,影响了其生成质量。

核心问题

MDM的推理过程是一个多步迭代过程,而训练通常使用简化的单步目标。这种差异导致推理计划在训练中未被优化,影响了生成质量。解决这一问题对于提高MDM的生成质量至关重要。

核心创新

Co-GRPO通过将MDM的生成过程重新定义为一个统一的马尔可夫决策过程(MDP),创新性地将推理计划作为可训练的动作,而不是固定的超参数。这种方法在轨迹层面应用群体相对策略优化,协同优化模型参数和推理计划参数。

方法详解

  • �� 将MDM生成过程视为统一的MDP。
  • �� 在轨迹层面应用群体相对策略优化。
  • �� 协同优化模型参数和推理计划参数。
  • �� 避免昂贵的多步反向传播。

实验设计

实验在ImageReward、HPSv2、GenEval和DPG-Bench四个基准上进行。使用固定的48步推理步骤,评估模型在不同基准上的性能。实验结果表明,Co-GRPO在多个基准上显著提升了生成质量。

结果分析

在ImageReward基准上,Co-GRPO将得分从0.942提高到1.122。在HPSv2基准上,得分从28.83提高到29.37。Co-GRPO在GenEval和DPG-Bench基准上也表现出强大的泛化能力。

应用场景

Co-GRPO可用于需要高效生成高质量图像的领域,如自动驾驶、虚拟现实和增强现实等。其优化的推理计划可以显著提高生成效率和质量。

局限与展望

Co-GRPO在某些复杂场景下可能需要更长的训练时间,以达到最佳性能。推理计划的优化可能在某些情况下导致过拟合。未来的研究可以探索如何在更大规模的数据集上应用Co-GRPO。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统的MDM就像你有一个食谱,但每次只能做一步,然后停下来看看结果。Co-GRPO就像你有一个助手,他不仅知道食谱,还能根据每一步的结果调整接下来的步骤。这种方法让你在做饭时更高效,最终的菜肴也更美味。

简单解释 像给14岁少年讲一样

想象你在玩一个需要解谜的游戏。传统的MDM就像每次只能尝试一个答案,然后等待结果。Co-GRPO就像你有一个聪明的助手,他能根据你的每次尝试调整策略,让你更快解开谜题。这种方法让游戏更有趣,你也能更快获胜!

术语表

马尔可夫决策过程 (MDP)

一种数学模型,用于描述决策过程中的状态、动作和奖励。

Co-GRPO将MDM生成过程视为一个MDP。

群体相对策略优化 (GRPO)

一种优化策略,通过比较不同策略的表现来优化模型。

Co-GRPO在轨迹层面应用GRPO。

掩码扩散模型 (MDM)

一种图像生成模型,通过逐步去噪生成图像。

MDM在视觉、语言和跨模态生成中有广泛应用。

推理计划

在生成过程中决定每一步解码多少token的计划。

Co-GRPO将推理计划作为可训练的动作。

ImageReward

一种用于评估图像生成质量的基准。

实验结果表明,Co-GRPO在ImageReward上表现优异。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上应用Co-GRPO?
  • 2 推理计划的优化是否会导致过拟合?
  • 3 如何进一步提高模型的鲁棒性?

应用场景

近期应用

自动驾驶

通过优化图像生成,提高自动驾驶系统的环境感知能力。

虚拟现实

在虚拟现实中生成高质量图像,提升用户体验。

远期愿景

增强现实

在增强现实中应用Co-GRPO,提供更逼真的视觉效果。

原文摘要

Recently, Masked Diffusion Models (MDMs) have shown promising potential across vision, language, and cross-modal generation. However, a notable discrepancy exists between their training and inference procedures. In particular, MDM inference is a multi-step, iterative process governed not only by the model itself but also by various schedules that dictate the token-decoding trajectory (e.g., how many tokens to decode at each step). In contrast, MDMs are typically trained using a simplified, single-step BERT-style objective that masks a subset of tokens and predicts all of them simultaneously. This step-level simplification fundamentally disconnects the training paradigm from the trajectory-level nature of inference, leaving the inference schedules never optimized during training. In this paper, we introduce Co-GRPO, which reformulates MDM generation as a unified Markov Decision Process (MDP) that jointly incorporates both the model and the inference schedule. By applying Group Relative Policy Optimization at the trajectory level, Co-GRPO cooperatively optimizes model parameters and schedule parameters under a shared reward, without requiring costly backpropagation through the multi-step generation process. This holistic optimization aligns training with inference more thoroughly and substantially improves generation quality. Empirical results across four benchmarks-ImageReward, HPS, GenEval, and DPG-Bench-demonstrate the effectiveness of our approach. For more details, please refer to our project page: https://co-grpo.github.io/ .

cs.LG cs.AI cs.CV