AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
AlphaGRPO enhances UMMs' multimodal generation via Decompositional Verifiable Reward, significantly improving benchmarks like GenEval.
Runhui Huang, Jie Wu, Rui Yang et al.