PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning

TL;DR

提出PeRL,通过序列置换和多阶段策略提升多图推理的强化学习性能,显著优于基线。

cs.CV 🔴 高级 2025-06-18 23 次浏览
Yizhen Zhang Yang Ding Shuoshuo Zhang Xinchen Zhang Haoling Li Zhong-zhi Li Peijie Wang Jie Wu Lei Ji Yelong Shen Yujiu Yang Yeyun Gong
多模态推理 强化学习 序列置换 多图理解 模型优化

核心发现

方法论

本文提出的PeRL框架结合序列置换和滚动过滤机制,利用GRPO算法优化多模态推理策略。通过对图像序列进行随机置换,模拟多样空间关系,增强模型的泛化能力。采用多阶段数据筛选和文本重述,平衡样本难度,提升训练效率。利用优势估计和动态重采样,有效缓解位置偏差,增强模型对复杂多图关系的理解。模型在五个多图和三个单图基准上均表现优异,超越多项SOTA方法。

关键结果

  • 在多图自然场景理解任务中,PeRL在Mantis-Eval上达到了76.39的最高准确率,超越所有对比模型,提升5.59个百分点,展现出极强的多模态推理能力。
  • 在单图数学推理任务中,PeRL在MathVista和MathVerse分别取得73.00和49.56的优异成绩,与专门的数学模型相当,验证其跨场景泛化能力。
  • 消融实验显示,序列置换显著提升模型在复杂关系推理中的表现,滚动过滤机制有效稳定训练过程,整体训练效率提升明显。

研究意义

本研究突破了多图推理中位置偏差和空间关系理解的瓶颈,提出的PeRL框架为多模态强化学习提供新思路。其在多个公开基准上的优异表现,彰显了其在实际场景中处理复杂多模态关系的潜力,为未来多图理解和推理模型的设计提供了理论基础和技术方案,有望推动智能系统在视觉问答、场景理解等领域的应用发展。

技术贡献

技术创新主要体现在引入序列置换增强空间关系探索,结合多阶段数据筛选和重述机制,优化样本难度分布。利用GRPO算法实现多响应、多样化优势估计,有效缓解位置偏差问题。提出的滚动过滤机制提升训练稳定性和效率,整体架构简洁高效,兼顾多模态推理的复杂性与泛化能力。该方法在多图和单图任务中均展现出优越性能,推动了强化学习在多模态理解中的应用边界。

新颖性

本研究首次将序列置换策略引入多模态强化学习,系统性解决多图空间关系和位置偏差问题。不同于以往仅在单图或静态数据上优化的模型,PeRL通过动态置换和多阶段筛选实现样本多样性与难度平衡,显著提升模型泛化能力。这一创新在多模态推理领域具有开创性意义,为未来多图复杂关系建模提供了新思路。

局限性

  • 模型在极端复杂场景下仍可能受到样本多样性不足的限制,尤其是在超大规模多图环境中训练成本较高。
  • 序列置换虽然增强空间关系,但对某些语义敏感任务可能引入干扰,影响推理准确性。
  • 当前方法主要依赖预训练模型和规则筛选,未来需探索端到端学习和更高效的样本生成机制。

未来方向

未来将结合自监督学习和更丰富的多模态数据,进一步提升模型对复杂空间和语义关系的理解能力。探索多任务联合训练策略,增强模型的适应性和泛化能力。同时,考虑引入多模态因果推理和知识图谱,丰富推理逻辑,推动多图推理在实际场景中的应用落地。

AI 总览摘要

在当今多模态人工智能的发展中,理解和推理多张图片中的复杂关系一直是核心挑战。现有模型多集中于单图空间推理,面对多图场景时表现出明显偏差和泛化不足。为应对这一难题,本文提出了PeRL(Permutation-Enhanced Reinforcement Learning)框架,结合序列置换和多阶段数据筛选策略,有效提升模型在复杂多图推理中的表现。

PeRL的核心思想是通过随机置换图像序列,模拟多样空间关系,促使模型学习更稳健的空间理解能力。同时,采用滚动过滤机制筛选出最具信息量的训练轨迹,提升训练效率和稳定性。在算法实现上,结合GRPO(Group Relative Policy Optimization)算法,利用多响应优势估计,缓解位置偏差问题,增强模型对空间和语义关系的捕捉能力。

大量实验证明,PeRL在五个多图和三个单图基准上均优于现有最优模型。在多图自然场景理解任务中,最高达76.39%的准确率,超越对比模型5.59个百分点。在单图数学推理任务中,也取得了优异的表现,验证了其跨场景的泛化能力。这些成果表明,PeRL不仅在多模态推理中具有突破性意义,也为未来多图理解提供了新的技术路径。

整体而言,本文的创新点在于引入序列置换增强空间关系探索,结合多阶段筛选机制,有效缓解偏差问题,显著提升模型性能。未来,结合更丰富的多模态数据和自监督技术,有望推动多图推理向更高层次发展,应用于智能问答、场景理解等多个领域,具有广阔的应用前景。

深度分析

研究背景

多模态推理技术近年来快速发展,代表性工作包括VisualBERT、LXMERT、VL-BERT等,主要解决单图空间关系理解问题。随着多图场景的出现,研究逐渐转向多图关系建模,如Flamingo、LLaVA-Interleave、Migician等,强调多图间的空间和语义关联。然而,这些模型在复杂空间关系和位置偏差方面仍存在不足,尤其是在需要空间排序和关系推理的任务中表现不佳。强化学习被引入以提升模型推理能力,但多图场景中的偏差和泛化仍未得到根本解决。

核心问题

多图推理面临两个主要难题:一是空间关系的复杂性,涉及多图中对象的相对位置和关系理解;二是位置偏差,模型对图像顺序敏感,导致推理不一致。这些问题限制了模型在实际复杂场景中的应用,尤其是在需要跨图空间推理和关系推断的任务中表现不足。现有方法多依赖静态训练,难以适应多样空间配置,亟需一种能增强空间理解和偏差鲁棒性的策略。

核心创新

本研究提出的核心创新包括:1)引入序列置换策略,通过随机交换图像顺序模拟多样空间关系,增强模型空间推理能力;2)设计多阶段数据筛选,平衡样本难度,提高训练效率;3)结合滚动过滤机制,筛选出信息丰富的训练轨迹,稳定训练过程;4)利用GRPO算法实现多响应优势估计,有效缓解位置偏差。这些创新共同推动多图推理模型在复杂场景中的表现,突破了以往静态训练的局限。

方法详解

  • �� 构建多阶段数据筛选流程,包括规则过滤、文本重述、滚动过滤和语义变异检测,确保训练样本质量。• 采用GPT-4o进行文本重述,保持语义一致性。• 通过随机置换图像序列,模拟多样空间关系,增强模型空间推理能力。• 利用GRPO算法,结合多响应优势估计,优化策略,缓解位置偏差。• 在训练中引入线性衰减的置换概率,确保模型逐步适应多样空间配置。• 设计动态重采样机制,集中训练最具信息量的样本,提高效率。• 最终目标是通过多样化样本和优化策略,提升模型在复杂多图推理中的表现。

实验设计

采用Mantis-Eval、BLINK、MMIU等五个多图基准,以及MathVista、MathVerse、MathVision等三个单图基准进行评估。训练数据包括从Mantis-Instruct筛选的22K多图指令样本和36K单图数学样本。模型初始化为Qwen2.5-VL-7B,训练采用RL(GRPO)框架,设置置换次数为1,生成6个响应,训练轮次为2,学习率1e-6,批次大小256。对比不同样本筛选策略,验证模型在多场景下的泛化能力。通过消融实验分析序列置换和滚动过滤的贡献。

结果分析

PeRL在多图自然场景理解任务中,最高达76.39%的准确率,超越所有对比模型,提升5.59个百分点。在单图数学推理任务中,MathVista和MathVerse分别获得73.00和49.56的优异成绩,表现不逊于专门模型。消融实验显示,序列置换显著提升空间关系理解,滚动过滤增强训练稳定性。模型在多场景中表现出优越的泛化能力,验证了方法的有效性和实用性。

应用场景

该模型可应用于多模态问答、场景理解、自动驾驶、智能监控等领域,尤其适合需要跨图空间关系推理的任务。其鲁棒性和泛化能力使其在实际复杂环境中表现优异。未来结合知识图谱和自监督技术,有望实现更高层次的多模态推理,推动智能系统的智能化升级。

局限与展望

模型在极端复杂或超大规模多图场景中,训练成本较高,样本多样性不足可能影响泛化。序列置换可能引入语义干扰,影响部分任务的准确性。当前方法依赖预训练模型和规则筛选,未来需探索端到端学习和更高效的数据生成策略。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,厨房里有很多不同的食材和工具。每次你换不同的食材顺序,虽然菜的基本味道没变,但不同的摆放方式会影响你做菜的过程。这个研究就像是让AI学会在不同的厨房布局中都能做出好菜。它通过随机改变图片的顺序,让AI学会理解每个图片的关系,而不是只记住固定的顺序。这样,AI就能更聪明地理解复杂的场景,就像你在厨房里能灵活应对不同的食材组合一样。这个方法帮助AI变得更强大,能在各种复杂的任务中表现出色。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,有很多图片拼在一起。每次你换拼图的顺序,虽然拼图内容没变,但你要重新理解每块拼图的位置。这个研究就像教AI也能这样做,让它学会在不同拼图顺序下都能找到正确的拼法。它用一种特别的方法,把拼图随机换位置,然后让AI练习理解每个拼图的关系。这样,AI就能更聪明地理解复杂的场景,就像你在拼图游戏中变得更厉害一样。这个方法让AI在处理很多图片时,更加稳健和聪明,能帮我们解决很多实际问题,比如自动问答和场景分析。

术语表

Permutation (置换)

一种随机改变图片或序列顺序的方法,帮助模型学习空间关系。

在本文中用来模拟多图空间关系的多样性。

GRPO (Group Relative Policy Optimization)

一种强化学习算法,用于优化策略,考虑多响应的优势估计。

用于训练多模态推理模型,缓解位置偏差。

Rollout Filtering (滚动过滤)

筛选训练轨迹,集中学习最具信息量的样本。

提升训练效率和模型稳定性。

Multimodal Reasoning (多模态推理)

结合视觉和文本信息进行理解和推理的能力。

本文的核心任务目标。

Positional Bias (位置偏差)

模型对输入顺序敏感,导致推理不一致的问题。

多图推理中的主要挑战之一。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低多图推理中的计算成本,特别是在超大规模场景中实现高效训练。
  • 2 模型在极端复杂空间关系中的表现和鲁棒性仍需深入研究。
  • 3 如何结合知识图谱和自监督学习,提升多模态推理的深度理解能力。

应用场景

近期应用

多模态问答系统

在智能助手或搜索引擎中,理解多张图片中的信息,提供准确答案,提升用户体验。

场景理解与监控

应用于自动驾驶和安防监控,识别复杂场景中的空间关系,增强系统安全性。

远期愿景

智能场景分析

实现全自动、多模态的场景理解,支持智慧城市、无人机导航等应用,推动智能化升级。

原文摘要

Inspired by the impressive reasoning capabilities demonstrated by reinforcement learning approaches like DeepSeek-R1, recent emerging research has begun exploring the use of reinforcement learning (RL) to enhance vision-language models (VLMs) for multimodal reasoning tasks. However, most existing multimodal reinforcement learning approaches remain limited to spatial reasoning within single-image contexts, yet still struggle to generalize to more complex and real-world scenarios involving multi-image positional reasoning, where understanding the relationships across images is crucial. To address this challenge, we propose a general reinforcement learning approach PeRL tailored for interleaved multimodal tasks, and a multi-stage strategy designed to enhance the exploration-exploitation trade-off, thereby improving learning efficiency and task performance. Specifically, we introduce permutation of image sequences to simulate varied positional relationships to explore more spatial and positional diversity. Furthermore, we design a rollout filtering mechanism for resampling to focus on trajectories that contribute most to learning optimal behaviors to exploit learned policies effectively. We evaluate our model on 5 widely-used multi-image benchmarks and 3 single-image benchmarks. Our experiments confirm that PeRL trained model consistently surpasses R1-related and interleaved VLM baselines by a large margin, achieving state-of-the-art performance on multi-image benchmarks, while preserving comparable performance on single-image tasks.

cs.CV cs.AI