Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical Reasoning

TL;DR

Math-PUMA以692K对齐样本和三阶段训练缩小数学图文推理差距。

cs.CL 🔴 高级 2024-08-16 26 次浏览
Wenwen Zhuang Xin Huang Xiantao Zhang Jin Zeng
多模态大模型 数学推理 模态对齐 KL散度 视觉几何

核心发现

方法论

Math-PUMA采用“渐进式向上多模态对齐”三阶段框架:先用20万条文本数学题增强LLM推理,再以692K个信息等价但模态分布不同的数据对,通过前向与反向KL散度对齐text-rich和vision-rich输入的下一词分布,最后用996K条高质量多模态指令数据训练。核心损失为L=λKL(αLFKL+(1−α)LRKL)τ²+(1−λ)Lhard。

关键结果

  • 在MATHVERSE上,Math-PUMA-Qwen2-7B总体准确率33.6%,明显超过Math-LLaVA的22.9%;视觉纯题达到26.0%,表明模型在视觉信息占主导时仍保持较强能力。
  • 在MATHVISTA上,7B模型GPS、ALG、GEO、SCI分别为48.1%、47.7%、47.3%、42.6%;相较同规模InternLM-XComposer2-VL,分别提升16.4、15.7、16.8和4.9个百分点。
  • 消融显示第二阶段是缩小模态差距的关键;移除第三阶段会显著损害对话能力,交换第二、三阶段顺序也导致性能下降,说明训练顺序具有结构性作用。

研究意义

该研究针对MLLM在数学图表上普遍存在的“文字越少、视觉越多,性能越差”问题,提出可规模化的数据与训练方案。它把数学能力学习和视觉文本对齐分离,再重新组合,证明小于多数商业或超大规模模型的7B系统也能在MATHVERSE、MATHVISTA和WE-MATH上取得竞争力,为教育辅导、科学问答和图形化推理提供了更可控的技术路线。

技术贡献

技术上,论文不是简单增加图文问答,而是构造同题异模态的数据对,并把强层级输入的logits作为弱层级输入的软监督。数据由平面几何、立体几何和函数自动生成120K对,另经公开数据增强得到572K对;训练中结合KL蒸馏与真实答案的hard loss,αKL=0.2、τ=1、λKL=0.1。这种逐层对齐机制区别于仅扩充问题文本或单纯视觉指令微调。

新颖性

核心新意是将数学多模态能力视为从text-only到vision-only的层级金字塔,并沿“由强到弱、由底向上”进行分阶段对齐。相较Geo170K、MathV360K等主要扩充图像问题的方法,Math-PUMA显式约束不同表达形式的预测分布一致性,因此直接优化模态不变的解题能力。

局限性

  • 训练数据中的图形主要来自预定义绘图工具,可能覆盖不足,复杂、模糊或真实手绘图中的视觉误读仍未被充分验证。
  • 实验主要报告准确率及WE-MATH的平均/RM分数,尚未系统分析推理链真实性、错误类型、校准度和跨语言泛化。
  • 阶段二依赖text-rich输入提供可靠logits;若文本解答本身错误,蒸馏可能传播偏差。

未来方向

后续可扩展到更复杂的动态图、手写图和科学图表,引入可验证定理证明、程序执行与视觉定位反馈;同时研究自适应模态难度、跨语言数据和更严格的过程评测。降低692K对齐数据及32张A100 GPU带来的成本,也将决定该方法能否广泛部署。

AI 总览摘要

多模态大语言模型已经能较好处理文字数学题,却常在几何图、函数图像和科学示意图面前失灵。问题不只是“看不清”,而是模型没有学会把图中信息与文字推理统一起来。论文展示了这一反常现象:对人类有帮助的视觉信息,反而会使现有MLLM性能下降。传统方法如Geo170K、MathV360K主要增加图文样本,却没有直接约束同一问题在不同表达形式下应得到一致答案。

Math-PUMA提出三阶段方案。第一阶段用20万条文本数学题强化基础语言模型;第二阶段构造692K个text-rich与vision-rich数据对,以前向、反向KL散度匹配两种输入的下一词预测分布,并加入真实答案的hard loss;第三阶段用996K条带详细推理过程的多模态数据进行指令微调。数据包括自动生成的120K对,以及公开数据增强得到的572K对。其关键思想类似先教会模型“会解题”,再教它无论题目写在纸上还是画在图里,都应采取相同推理路径。

结果显示,Math-PUMA-Qwen2-7B在MATHVERSE达到33.6%,较Math-LLaVA的22.9%提高约10.7个百分点;在MATHVISTA的GPS、ALG、GEO、SCI类别分别达到48.1%、47.7%、47.3%、42.6%。在WE-MATH上,该7B模型超过若干20B以上开源模型。消融实验确认阶段二负责缩小模态差距,阶段三维持对话能力。不过,方法仍受合成图形、数据成本和答案蒸馏可靠性的限制;真实手绘图、复杂科学视觉推理和过程正确性仍需进一步研究。

深度分析

研究背景

LLM在文本数学推理上受益于Chain-of-Thought和大规模数学语料;LLaVA、Qwen-VL、DeepSeek-VL等MLLM则通过视觉编码器和投影器处理图像。但训练图像多为自然场景,数学图形的符号、几何关系和抽象布局形成明显领域差距。Geo170K、MathV360K和GeoGPT4V改善了数据规模,却主要增加问题或图像,未解决同题跨模态表示不一致。

核心问题

同一数学事实可由完整文字、文字加图、图主导或纯图表达。现有模型通常在text-only上较强,转向vision-only便显著退化,说明视觉编码与语言推理空间没有对齐。难点在于既要保持数学答案和推理能力,又要让不同模态的预测分布一致,同时避免错误教师信号和模态偏置。

核心创新

第一,提出PUMA,将能力按text-only、text-dominant、vision-dominant、vision-only组织成层级金字塔。第二,构造同解数据对,而非仅生成更多独立样本。第三,用双向KL散度对齐强、弱模态的token分布,并用hard loss稳定训练。第四,将文本数学强化、模态对齐、多模态指令微调按固定顺序组合,形成Math-PUMA-1M。

方法详解

  • �� 阶段1:从多种数学数据集中抽取200K文本题,增强初始化模型的数学能力。
  • �� 数据构造:四代理流程包含Question Designer、Plotter、Solver和Pair Constructor;自动生成平面几何、立体几何、函数各40K对。
  • �� 数据增强:80K公开题经改写、缩放、拉伸和gamma变换扩展至310K,并加入262K VisualWebInstruct,形成572K对。
  • �� 阶段2:对强输入和弱输入分别得到logits z;用softmax(z/τ)计算LFKL与LRKL,结合Lhard训练视觉路径。
  • �� 阶段3:整合阶段二数据与MathV360K,将几何子集从40K扩至120K,组成996K条多模态指令数据。

实验设计

模型包括Math-PUMA-Qwen2-1.5B、Qwen2-7B和DeepSeek-Math-7B;Qwen系列使用SigLIP-so400m-patch14-384视觉编码器。评测为MATHVERSE、MATHVISTA和WE-MATH;前两者用GPT-4o-mini抽取并核验答案,WE-MATH报告平均分和Rote Memorization。训练使用AdamW,学习率分别为3e-5、5e-5、3e-5,batch size为256、512、256,单epoch,32张A100 80GB。

结果分析

MATHVERSE上,1.5B、7B和DeepSeek-7B模型总体为29.6%、33.6%、31.8%,7B模型视觉纯题为26.0%。MATHVISTA上,Qwen2-7B总体47.9%,并在GPS、ALG、GEO、SCI取得48.1%、47.7%、47.3%、42.6%。论文称其超过多数开源模型,并接近GPT-4V;移除阶段二会扩大文本—视觉差距,移除阶段三则显著损害交互能力。

应用场景

在教育场景中,系统可读取几何图和题干,生成统一、可追踪的解题步骤;在科学问答中,它可处理函数图、实验示意图和基础工程图。部署前需要高质量图形解析、答案验证及领域安全评估。对低成本模型而言,7B结果显示模态对齐可能减少对超大模型的依赖。

局限与展望

方法依赖自动绘图器、GPT-4o-mini解释和文本教师分布,合成数据的风格可能限制真实世界泛化。KL对齐保证的是token预测接近,不等价于几何关系真正被理解;错误解答也可能被蒸馏。训练规模为692K对和996K指令数据,计算使用32张A100,成本较高。未来应加入真实手绘与复杂图表、程序验证、过程级指标和跨语言测试。

通俗解读 非专业人士也能看懂

把模型想成一名正在学几何的学生。第一步,老师先给他大量“只用文字写出的题”,让他练会计算、证明和找规律。第二步,老师把同一道题准备成几种版本:完整文字版、文字配图版、主要靠图版和几乎只有图版,然后要求学生无论看到哪一种,都应想出相同答案。这里的“对齐”就像核对学生在不同试卷上的思路:不只看最后填了什么,还比较他每一步接下来最可能写出的内容。

第三步,老师再让学生练习真实的图文对话题。这样做比直接把图片丢给学生更有效,因为学生已经先学会数学,再学会从图里搬运信息。实验表明,7B模型在MATHVERSE总体达到33.6%,纯视觉题达到26.0%;在MATHVISTA多个类别也达到约42.6%至48.1%。不过,这名“学生”主要练的是电脑生成的图,遇到模糊手绘图或教师本身讲错题时,仍可能学错。

简单解释 像给14岁少年讲一样

想象你在玩一个数学解谜游戏。游戏有两种出题方式:一种把所有线索写在文字里,另一种把线索藏在地图、角度和图形中。很多AI在文字模式像学霸,可一换成图片就突然迷路,因为它以前看过的大多是猫、汽车和风景,不是几何图。

Math-PUMA像一套分级训练营。第一关先刷20万道文字数学题,练好基本功;第二关把同一题做成文字版、图文版和图片版,让AI知道“换了包装,答案不能换”。它用KL散度比较AI在两种版本下接下来会说什么,再用正确答案纠正它。第三关再进行996K条图文题的对话训练。

结果很有意思:Math-PUMA-Qwen2-7B在MATHVERSE拿到33.6%,比Math-LLaVA的22.9%高很多;在MATHVISTA的几何和代数任务上也达到约47%。这就像一个原本只会读题的同学,终于学会看图解题。

但它还不是无敌玩家。电脑画出的标准图比较容易,真实照片、潦草手绘图和特别复杂的科学图可能让它犯错。未来如果加入更多真实题目、自动检查证明的工具,AI数学辅导员会更可靠。

术语表

Progressive Upward Multimodal Alignment(渐进式向上多模态对齐)

让模型从较强的文本数学能力出发,逐级适应视觉信息增加的输入。目标是保持同题在不同模态下的解题能力一致。

Math-PUMA第二阶段的核心训练策略。

KL Divergence(KL散度)

衡量两个概率分布差异的指标,前向KL和反向KL关注方向不同。论文用它比较强、弱模态的下一词预测分布。

用于视觉文本蒸馏和模态对齐。

Text-rich / Vision-rich(文本富集/视觉富集)

前者把更多问题信息放在文字中,后者把更多信息放在图像中。二者应表达同一数学事实和答案。

构造692K数据对及训练阶段二。

Hard Loss(硬标签损失)

直接用标准答案监督模型生成正确token的损失,通常是交叉熵。它提供明确目标,防止软分布对齐不稳定。

与双向KL共同组成总损失。

MATHVERSE

评估多模态数学推理的基准,包含从文本主导到视觉纯题的五种条件。它特别适合测量模态转换造成的性能落差。

论文主要比较和消融实验的数据集。

开放问题 这项研究留下的未解疑问

  • 1 KL分布接近是否真的代表模型理解了图形关系,而非学会表面措辞?需要过程级证明、视觉定位和反事实图形测试。
  • 2 合成图训练出的能力能否迁移到手绘、低清、遮挡和跨文化数学符号?现有实验尚未给出系统答案。
  • 3 错误的文本教师会不会把偏差传给视觉分支?需要可验证求解器、置信度筛选和教师集成机制。

应用场景

近期应用

多模态数学辅导

教育平台可将题干、几何图和学生草稿同时输入7B级模型,生成步骤化解释并指出图中关键关系。上线前需配置答案校验和人工复核,以避免合成数据偏差造成错误教学。

科学图表问答

研究助理可用模型读取基础函数图、实验示意图和工程草图,再结合文字描述回答定量问题。适用范围应先限定在有标准答案、可程序验证的领域,并记录模型不确定性。

远期愿景

可验证视觉推理系统

未来可把视觉定位、符号计算、定理证明和语言解释连接起来,使模型不仅给出答案,还能指出依据的线段、角度或公式,并由程序自动检查每一步。

原文摘要

Multimodal Large Language Models (MLLMs) excel in solving text-based mathematical problems, but they struggle with mathematical diagrams since they are primarily trained on natural scene images. For humans, visual aids generally enhance problem-solving, but MLLMs perform worse as information shifts from textual to visual modality. This decline is mainly due to their shortcomings in aligning images and text. To tackle aforementioned challenges, we propose Math-PUMA, a methodology focused on Progressive Upward Multimodal Alignment. This approach is designed to improve the mathematical reasoning skills of MLLMs through a three-stage training process, with the second stage being the critical alignment stage. We first enhance the language model's mathematical reasoning capabilities with extensive set of textual mathematical problems. We then construct a multimodal dataset with varying degrees of textual and visual information, creating data pairs by presenting each problem in at least two forms. By leveraging the Kullback-Leibler (KL) divergence of next-token prediction distributions to align visual and textual modalities, consistent problem-solving abilities are ensured. Finally, we utilize multimodal instruction tuning for MLLMs with high-quality multimodal data. Experimental results on multiple mathematical reasoning benchmarks demonstrate that the MLLMs trained with Math-PUMA surpass most open-source MLLMs. Our approach effectively narrows the performance gap for problems presented in different modalities. The code and data are available at: \url{https://github.com/wwzhuang01/Math-PUMA}.

cs.CL