LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

TL;DR

LMM-R1采用两阶段规则RL,显著提升3B多模模型推理能力,平均提升4.83%。

cs.CL 🔴 高级 2025-03-11 24 次浏览
Yingzhe Peng Gongrui Zhang Miaosen Zhang Zhiyuan You Jie Liu Qipeng Zhu Kai Yang Xingzhong Xu Xin Geng Xu Yang
多模态模型 强化学习 推理增强 规则驱动 少参数模型

核心发现

方法论

LMM-R1通过两个阶段实现推理能力提升:第一阶段为基础推理增强(FRE),利用文本数据采用规则强化学习(Rule-based RL)强化模型的逻辑推理能力;第二阶段为多模泛化训练(MGT),在有限的多模任务上继续训练,将推理能力迁移到多模态场景。FRE阶段重点利用高质量的文本推理数据(如DeepScaler-Preview-Dataset)进行训练,建立坚实的推理基础;MGT阶段则在几何、感知推理及代理任务(如Sokoban、足球)中持续训练,拓展模型的多模态推理能力。该框架有效规避了多模态数据稀缺和基础推理退化的问题。实验在Qwen2.5-VL-Instruct-3B模型上验证,平均提升4.83%(多模态)和4.5%(文本)性能,复杂足球任务提升3.63%。

关键结果

  • 在多模态任务中,MGT-Geo模型相较基线提升3.21%,在几何推理任务中表现优异,达到了41.80%的准确率。FRE-Text在纯文本推理任务(如MATH500)中提升2%,在GPQA中提升6.57%,显示出强大的基础推理能力。直接用多模态数据训练(Direct-RL)反而导致推理性能下降,验证了基础推理的重要性。模型在视觉问答、科学推理等多模态任务中表现出显著改善,平均提升4.83%。
  • 结果显示,文本推理增强(FRE-Text)在保持推理能力的同时,显著改善多模态视觉任务表现;而多模态训练(FRE-Multi)则增强视觉理解,但牺牲部分推理能力。这表明,先强化文本推理基础,再迁移到多模态,是提升模型整体能力的有效策略。
  • 在代理任务中,模型在Sokoban和足球任务中表现出色,能进行复杂的路径规划和目标决策,验证了方法在实际应用中的潜力。整体来看,LMM-R1通过两阶段训练策略,实现了少参数模型的推理能力突破,为多模态AI的发展提供了新思路。

研究意义

该研究突破了少参数多模模型推理能力的瓶颈,提出高效的两阶段训练框架,显著提升模型在复杂推理和多模态理解中的表现。通过只利用文本推理数据实现迁移,减少了对昂贵多模态高质量数据的依赖,为实际应用中的模型训练提供了新途径。这不仅推动了多模态AI的研究前沿,也为智能系统在教育、机器人、自动驾驶等领域的部署提供了理论基础和技术支撑。该方法的普适性和数据效率,为未来多模态模型的设计与优化提供了宝贵经验。

技术贡献

本文提出的LMM-R1框架创新性地将规则强化学习应用于多模态推理,通过两个阶段系统性增强模型能力。第一阶段利用文本数据进行推理基础训练,建立坚实的逻辑推理能力;第二阶段在有限多模任务上持续训练,迁移推理能力到多模态场景。该策略突破了多模态数据稀缺和模型容量限制的瓶颈,显著优于直接多模训练的方法。算法层面,结合Proximal Policy Optimization(PPO)和符号验证的奖励机制,确保推理过程的结构化和正确性。技术上,创新在于利用文本推理数据的迁移能力,结合规则RL实现少样本、多场景泛化,为小参数模型推理能力提升提供新思路。

新颖性

本研究首次系统性提出两阶段规则RL训练框架,专为少参数多模模型设计,突破了多模态推理数据稀缺的难题。相较于传统的端到端训练或纯监督学习,采用文本推理数据作为基础,显著降低了数据成本,同时实现多模态推理能力的迁移。创新点在于将符号验证与规则RL结合,确保推理的结构化和正确性。这一策略在模型参数极少(3B)情况下,仍能实现4.83%的性能提升,展示了方法的前沿性和实用性。

局限性

  • 模型在极端复杂推理任务中仍存在性能瓶颈,尤其是在多模态数据不足或推理链较长时表现不佳,原因在于训练数据有限和推理链依赖较强。
  • 训练过程依赖符号验证,计算成本较高,且在某些场景下符号解析可能出现误差,影响奖励信号的准确性。
  • 当前方法主要在特定任务和数据集上验证,泛化到其他多模态任务和更大模型仍需进一步验证和优化。

未来方向

未来将探索多模态数据增强策略,结合自监督学习提升推理泛化能力;同时考虑引入更高效的符号验证机制,降低训练成本。还计划将该框架推广至更大规模模型和多任务场景,验证其在实际复杂环境中的应用潜力。此外,结合知识图谱和外部推理模块,进一步增强模型的推理深度和广度。

AI 总览摘要

在人工智能领域,提升多模态模型的推理能力一直是核心挑战之一。现有方法多依赖大量高质量的多模态数据,成本高昂且难以普及。针对这一难题,Yingzhe Peng等提出了LMM-R1,一种创新的两阶段规则强化学习框架,专为参数有限(3B)的小型多模态模型设计。该方法首先利用丰富的文本推理数据,通过规则RL强化模型的基础推理能力,建立坚实的逻辑基础。随后,在有限的多模态任务上继续训练,将推理能力迁移到视觉和感知场景中。实验结果显示,模型在Qwen2.5-VL-Instruct-3B基础上,平均性能提升4.83%,在复杂足球任务中提升3.63%。这一突破性进展表明,文本推理能力的迁移不仅能增强多模态理解,还能显著减少对昂贵多模态数据的依赖。该研究为少参数模型的推理能力提升提供了新思路,推动多模态AI向更高效、更普适的方向发展。未来,结合知识图谱和自监督技术,有望实现更大规模、更复杂场景的智能推理系统,开启多模态人工智能的新纪元。

深度分析

研究背景

多模态模型近年来取得快速发展,代表性工作包括Flamingo、BLIP-2、LLaVA、MiniGPT-4等,主要通过视觉与语言的结合实现视觉问答、描述生成等任务。尽管如此,这些模型普遍缺乏深层次推理能力,尤其在参数有限(如3B参数)的小型模型中表现尤为不足。传统训练依赖大量标注的多模态数据,成本高昂且难以规模化。近年来,强化学习(RL)在提升模型推理能力方面展现潜力,特别是基于人类反馈的RLHF,但在多模态场景中仍面临数据稀缺和推理链长等挑战。本文通过引入规则RL,结合符号验证机制,探索少参数模型的推理增强路径,填补了该领域的空白。

核心问题

当前多模态模型在推理能力方面存在明显短板,尤其是在参数受限的情况下,模型难以进行复杂逻辑推理。大量高质量多模态推理数据难以获取,导致训练成本高昂,且模型易出现推理退化。此外,模型在迁移到多模态任务时,推理能力不足,影响实际应用效果。如何在数据有限的条件下,提升模型的推理深度和广度,成为亟待解决的核心问题。这不仅关系到模型的智能水平,也影响其在教育、机器人等行业的应用潜力。

核心创新

本文提出两阶段规则RL训练框架,创新点在于:1)利用丰富的文本推理数据(如DeepScaler-Preview-Dataset)进行基础推理能力训练,建立坚实的逻辑基础,2)在有限多模态任务中持续训练,将推理能力迁移到视觉和感知场景,3)结合符号验证机制,确保推理过程的结构化和正确性。这种策略突破了传统端到端训练对大量多模态数据的依赖,有效缓解数据稀缺问题。不同于现有的端到端深度学习方法,强调推理链的结构化和符号验证,提升模型的推理可靠性。该方法在参数极少(3B)模型中实现了显著性能提升,展示了其创新性和实用性。

方法详解

  • �� 采用Proximal Policy Optimization(PPO)算法,结合符号验证奖励机制,训练模型。
  • �� 第一步,FRE阶段,利用DeepScaler-Preview-Dataset中的40k数学推理题和VerMulti-65K多模数据,采用规则RL强化模型的逻辑推理能力。
  • �� 通过结构化格式(<think></think>标签)引导模型输出推理链,符号验证确保答案正确性。
  • �� 第二步,MGT阶段,在几何(VerMulti-Geo)、感知推理(PerceReason)和代理任务(Sokoban、足球)中继续训练,迁移推理能力到多模态场景。
  • �� 训练过程中,结合符号验证和奖励机制,优化模型的推理链质量和多模态理解能力。
  • �� 采用多任务训练策略,平衡推理和视觉理解能力,避免性能退化。

实验设计

  • �� 使用Qwen2.5-VL-Instruct-3B作为基础模型,首先在文本推理数据(DeepScaler-Preview-Dataset)上训练,获得FRE-Text模型。
  • �� 在多模态任务(Geo、PerceReason、Sokoban、足球)中继续训练,获得MGT模型。
  • �� 设计对比实验,包括直接用多模态数据训练(Direct-RL)和不同阶段模型。
  • �� 评估指标包括多模态和文本推理的准确率、复杂任务中的性能提升(如足球任务3.63%提升)以及符号验证的正确率。
  • �� 实验还包括不同任务的消融分析,验证各阶段贡献。

结果分析

  • �� 在多模态任务中,MGT-Geo模型比基线提升3.21%,在几何推理任务中达41.80%的准确率。
  • �� 在纯文本推理任务(MATH500)中,FRE-Text提升2%,GPQA提升6.57%,验证基础推理能力的增强。
  • �� 直接用多模态数据(Direct-RL)训练反而导致推理性能下降,强调基础推理的重要性。
  • �� 在视觉问答和科学推理任务中,模型平均提升4.83%,显示出优越的迁移能力。
  • �� 结果表明,先强化文本推理,再迁移到多模态,是提升少参数模型能力的有效策略。

应用场景

  • �� 该方法可应用于智能教育、机器人导航、自动驾驶等场景,提升系统的推理和感知能力。
  • �� 只需利用文本推理数据,减少对昂贵多模态数据的依赖,降低训练成本。
  • �� 未来可结合知识图谱和自监督学习,构建更强大的多模态推理系统,推动智能系统自主决策。

局限与展望

  • �� 当前模型在极端复杂的推理任务中仍表现有限,尤其在推理链较长或多模态数据不足时效果不佳。
  • �� 符号验证机制计算成本较高,可能限制大规模应用。
  • �� 方法主要在特定任务和数据集上验证,泛化到更复杂场景仍需优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的机器,每台机器都能做不同的事情。有时候,工厂需要解决复杂的问题,比如如何安排机器的工作顺序,确保每个产品都能按时完成。传统的方法是让每台机器都学会所有的技能,但这需要很多时间和资源。现在,工程师们想出一个聪明的办法:先教一部分机器一些基本的推理技能,比如理解问题、找出关键点,然后再让它们在不同的任务中应用这些技能。这样,工厂的效率就大大提高了。LMM-R1就像这个工厂的智能调度系统,先用文本数据训练推理能力,再用有限的多模数据扩展到视觉和感知任务,最终让整个工厂变得更聪明、更高效。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏。刚开始,你只知道一些基本的拼图规则,比如怎么拼边、怎么拼角。你用这些规则,慢慢学会了拼一些简单的图片。后来,你的朋友告诉你一些特别的技巧,比如如何用颜色和形状判断拼图的正确位置。你学会了这些技巧后,就能拼出更复杂、更漂亮的图片了。这个过程就像LMM-R1的训练:一开始用文本中的逻辑规则教会模型基本推理能力,然后再用有限的视觉任务让它学会在实际场景中应用这些能力。最终,模型变得既能理解文字,也能看懂图片,解决复杂的问题,就像你变成了拼图大师一样!

原文摘要

Enhancing reasoning in Large Multimodal Models (LMMs) faces unique challenges from the complex interplay between visual perception and logical reasoning, particularly in compact 3B-parameter architectures where architectural constraints limit reasoning capacity and modality alignment. While rule-based reinforcement learning (RL) excels in text-only domains, its multimodal extension confronts two critical barriers: (1) data limitations due to ambiguous answers and scarce complex reasoning examples, and (2) degraded foundational reasoning induced by multimodal pretraining. To address these challenges, we propose \textbf{LMM-R1}, a two-stage framework adapting rule-based RL for multimodal reasoning through \textbf{Foundational Reasoning Enhancement (FRE)} followed by \textbf{Multimodal Generalization Training (MGT)}. The FRE stage first strengthens reasoning abilities using text-only data with rule-based RL, then the MGT stage generalizes these reasoning capabilities to multimodal domains. Experiments on Qwen2.5-VL-Instruct-3B demonstrate that LMM-R1 achieves 4.83\% and 4.5\% average improvements over baselines in multimodal and text-only benchmarks, respectively, with a 3.63\% gain in complex Football Game tasks. These results validate that text-based reasoning enhancement enables effective multimodal generalization, offering a data-efficient paradigm that bypasses costly high-quality multimodal training data.

cs.CL cs.AI