Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
Reinforcement learning enhances reasoning in multimodal large language models using value-model-free and value-model-based methods.
Guanghao Zhou, Panjia Qiu, Cen Chen et al.