SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

TL;DR

SynthRL通过自动合成难度递增且可验证的训练数据,提升视觉推理模型性能。

cs.LG 🔴 高级 2025-06-03 28 次浏览
Zijian Wu Jinjie Ni Xiangyan Liu Zichen Liu Hang Yan Michael Qizhe Shieh
视觉推理 数据合成 强化学习 模型扩展 验证机制

核心发现

方法论

SynthRL采用三阶段流程:首先基于蒙特卡洛滚动分析筛选难度适中的种子问题;其次利用强大视觉语言模型(如Gemini-2.5)生成更具挑战性的问题变体,保持答案一致;最后通过严格的验证机制,确保合成问题的正确性和难度提升。该流程实现了对8K种子样本的扩展,生成超过3.3K验证合格的难题,有效增强模型的推理能力。

关键结果

  • 在MMK12数据集上,使用SynthRL合成数据后,模型在五个域外视觉数学推理基准测试中表现显著提升。例如,MathVerse的准确率从51.6%提升至53.5%,WeMath从70.6%提升至72.6%,整体平均提升约1-2个百分点,且在最具挑战的样本上效果更为明显。
  • 不同数据规模(2K、4K、8K)下,合成数据的效果逐步增强,8K规模时性能提升最大,平均提升达1.0%。此外,合成样本的推理步骤数增加33%,表明问题复杂度得到显著提升。
  • 详细分析显示,合成数据在中高难度样本中的性能提升更为突出,验证了SynthRL在深层推理和复杂推断中的优势。

研究意义

该研究突破了传统数据扩展的局限,通过自动合成高质量、难度递增且可验证的训练样本,有效推动视觉推理模型在复杂任务中的泛化能力。尤其在数据稀缺和偏差明显的场景中,为模型提供了丰富的学习资源,具有重要的学术和工业应用价值。其创新的验证机制确保了数据的正确性,为未来大规模自动化数据生成树立了标杆。

技术贡献

提出基于蒙特卡洛滚动的难度评估与筛选策略,结合强大视觉语言模型(如Gemini-2.5)实现问题变体的自动合成。引入严格的验证机制,确保合成样本的答案一致性和难度提升,提供了理论上的保证。该流程实现了数据的高效扩展,显著改善了模型在复杂推理任务中的表现,突破了现有方法在数据质量和规模上的限制。

新颖性

首次提出结合难度评估、自动合成与严格验证的全流程,系统性解决视觉推理中训练数据稀缺与偏差问题。区别于传统的人工标注或简单数据增强,SynthRL实现了全自动、可验证的高难度样本生成,为推理模型的深层理解提供了新的数据支撑。

局限性

  • 该方法依赖于高性能视觉语言模型的准确性,若模型在特定任务上表现不佳,可能影响合成样本的质量和难度提升效果。
  • 在极端复杂或多模态信息丰富的场景中,验证机制可能面临挑战,难以完全保证样本的正确性。
  • 当前流程计算成本较高,尤其在大规模数据生成和验证阶段,未来需优化效率以适应工业应用。

未来方向

未来将探索多模态信息融合的更深层次合成策略,提升样本多样性和复杂度。同时,结合强化学习优化生成策略,增强模型在实际复杂场景中的适应性。此外,计划引入多目标验证机制,进一步提升样本的质量和多样性,推动大规模自动化数据生成的工业化落地。

AI 总览摘要

在人工智能快速发展的背景下,视觉语言模型(VLMs)在推理能力方面取得了显著突破,但训练数据的规模和质量仍是制约其性能的关键因素。传统的数据扩展方法多依赖人工标注或简单的增强技术,难以满足复杂推理任务对数据多样性和难度的需求。为此,本文提出SynthRL,一种基于自动合成的高效数据扩展框架,旨在通过生成更具挑战性且可验证的样本,提升模型的推理能力。

SynthRL的核心思想是结合蒙特卡洛滚动分析对现有样本进行难度评估,筛选出适合合成的“中等难度”问题,然后利用强大的视觉语言模型(如Gemini-2.5)自动生成更具挑战性的问题变体,保持答案一致。最后,通过严格的验证机制,确保合成样本的正确性和难度递增。这一流程实现了对约8K样本的扩展,生成超过3.3K高质量难题,有效增强了模型的推理深度。

在多个视觉数学推理基准测试中,基于SynthRL合成数据的模型表现优于仅用原始数据训练的模型。例如,在MathVerse和WeMath上,准确率分别提升1.9%和2.0%。更重要的是,合成样本在中高难度样本中的表现提升更为明显,验证了该方法在复杂推理中的优势。实验结果表明,随着数据规模的增加,SynthRL的效果逐步增强,8K规模时性能提升最大,平均达1.0%。

该研究不仅推动了自动化高质量数据生成技术的发展,也为视觉推理模型在实际应用中的泛化能力提供了新的解决方案。未来,结合多模态信息融合和强化学习优化,将进一步拓展SynthRL的应用潜力,推动智能系统在复杂环境中的表现提升。

深度分析

研究背景

视觉语言模型(VLMs)近年来经历了从基础的多模态融合到复杂推理能力的快速演进。代表性工作如Alayrac等(2022)提出的基础融合技术,Li等(2023b)优化的视觉指令调优,以及Shi等(2024)提出的数学推理模型,推动了模型在视觉理解和推理方面的突破。然而,尽管如GPT-4o(Hurst等,2024)和Gemini(2023)等模型展现出强大的视觉理解能力,但在复杂推理任务中仍存在性能瓶颈,尤其是在多步骤推理和深层推断方面。强化学习(RL)逐渐被引入以增强模型推理深度,特别是在几何、计数等子领域取得一定成功,但整体数据不足和训练样本有限仍是限制因素。

核心问题

当前视觉推理模型在面对复杂、多步骤问题时表现不足,主要源于训练数据的局限性。传统数据集规模有限,难以覆盖推理的多样性和深度,导致模型在实际应用中泛化能力不足。此外,人工标注成本高昂,难以大规模生成高质量、多样化的训练样本。如何在保证答案正确的前提下,自动生成具有挑战性和多样性的训练数据,成为亟待解决的问题。现有方法多依赖人工设计或简单增强,缺乏系统性和可验证性,限制了模型推理能力的提升。

核心创新

本研究的创新点在于提出一套完整的自动合成流程:首先利用蒙特卡洛滚动分析评估样本难度,筛选出适合合成的中等难度问题;其次采用强大视觉语言模型(如Gemini-2.5)自动生成更具挑战性的问题变体,保持答案一致;最后引入严格的验证机制,确保合成样本的正确性和难度递增。该流程实现了高效、可验证的自动数据扩展,突破了传统人工标注的瓶颈,为模型在复杂推理任务中的泛化提供了丰富的训练资源。与现有方法相比,SynthRL在保证答案正确的基础上,显著提升了样本的难度和多样性,为深层推理模型的训练提供了新的技术路径。

方法详解

  • �� 样本筛选:基于蒙特卡洛滚动(N=16)分析模型对样本的预测一致性,计算每个问题的通过次数,筛选出中等难度(pass≥12)的问题作为合成对象。
  • �� 样本合成:利用Gemini-2.5模型,输入原始图片和问题,生成更具挑战性的问题变体,保持原答案不变。采用特定提示模板引导模型生成深层推理问题。
  • �� 验证机制:对合成问题再次进行蒙特卡洛滚动,确保答案一致(pass≥4),同时验证难度提升(pass数减少至少∆hard=2),保证样本的正确性和难度递增。
  • �� 数据扩展:将验证通过的样本加入训练集,形成扩展数据集(如A-MMK12),提升模型推理能力。
  • �� 实验验证:在五个视觉数学推理基准上测试模型性能,比较原始数据与合成数据的效果差异。

实验设计

采用MMK12作为种子数据集,经过筛选和合成后,得到A-MMK12扩展集。训练模型基于Qwen2.5-VL-7B,采用EasyR1框架,设置合理的超参数(学习率1e-6,批量128等)。在五个基准(MathVerse、MathVision等)上评估模型性能,比较仅用种子数据和结合合成数据的模型表现。通过不同规模(2K、4K、8K)训练,分析性能变化和难度适应性。还进行了消融实验,验证验证机制的重要性。

结果分析

合成数据显著提升模型在五个基准的平均准确率,8K规模时从57.0%提升至58.0%。在MathVerse和WeMath等关键任务上,分别提升1.9%和2.0%。合成样本的推理步骤数增加33%,表明问题复杂度提升。中高难度样本的性能改善尤为明显,验证了合成策略在深层推理中的有效性。随着数据规模扩大,效果逐步增强,显示出合成方法与传统数据扩展的互补优势。

应用场景

该方法可广泛应用于需要深层推理能力的视觉问答、自动化教育、智能辅导等场景。通过自动生成高难度样本,降低人工成本,提升模型在复杂环境下的表现。未来结合多模态信息融合和强化学习优化,将推动智能系统在实际复杂任务中的应用落地。

局限与展望

依赖高性能视觉语言模型的准确性,模型偏差可能影响合成样本质量。验证机制在极端复杂场景下可能不足,存在误判风险。计算成本较高,需优化效率以适应大规模应用。未来需增强多模态融合能力,提升样本多样性和难度控制的精度。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂的任务是生产各种不同的产品。以前,工厂只用固定的模具和原材料,生产的产品样式和难度都差不多。现在,工厂引入了一台智能机器人,可以根据指令自动设计出更复杂、更难做的产品,同时还能保证这些产品的质量。这个机器人会先分析已有的产品,判断哪些比较简单,然后用自己的技术设计出更难的版本,但仍然保证它们符合质量标准。最后,工厂会检查这些新产品,确保它们既符合要求,又比原来更复杂。这样,工厂就能不断生产出更丰富、更难的产品,帮助工人学习和提升技能。这个过程就像SynthRL一样,自动生成更难的问题,确保答案正确,帮助模型变得更聪明。

简单解释 像给14岁少年讲一样

想象你在学校里学数学题,老师给你一些简单的题目让你练习。可是,有时候题太简单,你学不到更多东西。于是,你的老师决定用一台神奇的机器帮你出更难的题,但这些题还是能用你学过的知识解决。这个机器会先看你以前做过的题,判断哪些题你能轻松做对,然后用它的“魔法”把这些题变得更复杂,但答案还是一样。最后,老师会检查这些新题,确保它们既难又正确。这样,你就可以不断挑战自己,学到更深的知识。这就像SynthRL,它自动帮模型出更难的问题,让它变得更聪明、更会推理。

原文摘要

Vision-language models (VLMs) trained via reinforcement learning with verifiable reward (RLVR) have shown notable progress in scaling test-time compute effectively. In this work, we investigate how synthesized RL data can further improve RLVR. To this end, we propose \textbf{SynthRL}-a scalable and guaranteed pipeline for automatic data scaling in reasoning-oriented RL training. SynthRL comprises three key stages: (1) selecting seed questions with appropriate distribution, (2) augmenting them into more challenging variants while preserving the original answers, and (3) a guaranteed verification stage that ensures near-perfect correctness and difficulty enhancement. Our empirical experiments demonstrate SynthRL's scalability and effectiveness. When applied to the MMK12 dataset, SynthRL synthesizes over 3.3K additional verifiable, challenging questions from approximately 8K seed samples. Models trained with our synthesized data achieve consistent gains across five out-of-domain visual math reasoning benchmarks, with a significant improvement over baseline models trained on seed data alone. Notably, detailed analysis reveals that the gains are more pronounced on the most challenging evaluation samples, highlighting SynthRL's effectiveness in eliciting deeper and more complex reasoning patterns.

cs.LG cs.CL cs.CV