MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision

TL;DR

MM-PRM以MCTS生成70万级步骤监督,使多模态数学准确率最高提升12.06个百分点。

cs.AI 🔴 高级 2025-05-20 23 次浏览
Lingxiao Du Fanqing Meng Zongkai Liu Zhixiang Zhou Ping Luo Qiaosheng Zhang Wenqi Shao
多模态数学推理 过程奖励模型 蒙特卡洛树搜索 测试时扩展 过程监督

核心发现

方法论

论文提出三阶段框架:先用超过400万条结构化数学数据训练MM-Policy;再以MM-K12的1万道题为种子,利用OmegaPRM式MCTS、分层rollout和二分搜索定位首个错误步骤,自动生成约747,000条步骤标注;最后将连续MC成功概率作为软标签训练MM-PRM,并在Best-of-N中重排16条候选路径。

关键结果

  • MM-Policy在MM-K12测试集上由33.92%提升至42.80%,在OlympiadBench上由15.41%升至24.00%,在MathVista上由62.93%升至67.60%,说明步骤级筛选能显著减少局部逻辑错误。
  • 方法具有跨模型泛化性:InternVL2.5-8B在MM-K12由27.01%升至37.80%;InternVL2.5-78B在MathVerse由50.18%升至54.47%,表明PRM并不局限于其生成数据的策略模型。
  • 训练分析显示,小学习率和软标签更稳定;最佳PRM学习率为4e-6。软标签保留MC估计中的难度与不确定性,优于简单二值阈值化。

研究意义

MM-PRM把多模态数学推理从只检查最终答案推进到检查整条推理链。它缓解了“过程错误但答案偶然正确”的高误报问题,也为无需人工逐步标注的测试时扩展提供了可复用方案。对研究而言,该工作连接了视觉理解、过程监督与搜索;对工业系统而言,它能在不重新训练大型生成模型的情况下,通过候选生成与重排提升可靠性。

技术贡献

核心技术包括多模态OmegaPRM适配、保持图像与文本上下文的MCTS状态树、基于下游答案成功率的步骤价值估计,以及<prm>标记驱动的逐步分类器。对第i步,模型用“Yes/No”logits计算p(i),并最小化软交叉熵:−[ŷlogp+(1−ŷ)log(1−p)]。该设计将可扩展自动标注、细粒度评分和BoN推理连接起来。

新颖性

相较PRM800K的人工作业、MathShepherd的独立蒙特卡洛采样及面向文本的OmegaPRM,MM-PRM首次在本文设定下将MCTS过程监督系统化迁移到视觉数学任务,并证明仅用1万道K-12种子题即可生成70万级标注,同时跨数据集、模型规模保持收益。

局限性

  • 监督来源主要是K-12题目和MM-Policy生成轨迹,因此对大学级证明、极长链条或分布外视觉概念的覆盖仍有限。
  • BoN效果依赖候选路径质量与多样性;生成16条路径带来显著推理成本,且PRM只能从已有候选中选择,无法修复所有错误。
  • MC标签反映策略模型分布,不等同于形式化逻辑真值,可能继承生成模型偏差。

未来方向

未来可扩大高难度、跨语言和证明型数据,结合形式化验证器、工具调用与强化学习;还应研究更高效的搜索、动态候选数和校准指标,并测试PRM在更强及完全不同架构模型上的迁移性。

AI 总览摘要

多模态大模型已经能看图并回答数学题,却常在中间步骤犯错:它可能得到正确答案,也可能因偶然性掩盖错误。传统结果奖励模型只检查最终答案,无法判断哪一步破坏了逻辑;人工逐步标注又昂贵且难以扩展。MM-PRM针对这一缺口,试图让模型像审阅者一样检查整条推理链。

研究者先整合R-CoT、MAVIS、MathV360K、NuminaMath和DART-Math等数据,训练InternVL2.5-8B基础上的MM-Policy。随后,他们构建含5,000道填空题和5,000道选择题的MM-K12,并采用OmegaPRM式Monte Carlo Tree Search:从部分推理继续采样,依据最终答案是否正确估计步骤价值,以二分搜索定位最早错误,最终自动产生约747,000条步骤监督。MM-PRM在每步后插入<prm>标记,以软概率标签训练Yes/No分类器。

在Best-of-N测试中,模型从16条候选路径中选择PRM总分最高者。MM-Policy在MM-K12由33.92%升至42.80%,OlympiadBench由15.41%升至24.00%,MathVista由62.93%升至67.60%;InternVL2.5-8B在MM-K12也由27.01%升至37.80%。结果表明,自动过程监督不仅提高准确率,也能识别局部错误。其代价是搜索与多次采样增加推理成本,且训练数据和策略模型可能限制泛化。

深度分析

研究背景

CoT和Self-Consistency提升了语言模型的数学能力,但多模态模型仍会产生断裂逻辑。PRM800K依赖人工逐步标注,MathShepherd以多次rollout估计步骤质量,OmegaPRM则用MCTS提高效率。本文将这一思想扩展到视觉数学,并关注可扩展性、软标签及跨模型泛化。

核心问题

最终答案监督无法区分可靠推理与偶然猜中;步骤错误还会导致高误报和不可解释性。多模态任务同时包含图像、文本和长链推理,人工标注成本高,简单蒙特卡洛估计方差大,因此需要保持视觉上下文的稳定自动标注机制。

核心创新

第一,构建含1万种子题和500测试题的MM-K12。第二,将OmegaPRM的divide-and-conquer MCTS适配多模态输入,生成约747,000条步骤标注。第三,使用连续MC分数而非硬标签。第四,以<prm>位置输出步骤置信度,并通过BoN实现无需再训练生成器的测试时扩展。

方法详解

  • �� 数据与策略:清洗超过400万条数学样本,用Qwen2.5-72B-Instruct重排为<step>与<answer>格式,微调InternVL2.5-8B得到MM-Policy。
  • �� 搜索标注:对MM-K12题目生成多条轨迹;MCTS保存状态、动作和MC统计,分层rollout并二分定位首错。
  • �� PRM训练:在每步后插入<prm>,由Yes/No logits计算p(i),以MC(x<t)∈[0,1]为软目标训练交叉熵。
  • �� 推理选择:采样N=16条路径,以Min、Average、SumLog等聚合函数评分并选最高者。

实验设计

评测包括MM-K12测试集、OlympiadBench的OE_MM_maths_en_COMP、MathVista testmini、MathVerse testmini和MathVision test。策略模型训练1 epoch、batch 128、学习率4e-5;PRM训练1 epoch、batch 512、学习率4e-6。MCTS使用temperature 1.0、top-k 50、top-p 0.9、c_puct 0.125,最多200次搜索或1,000次rollout。

结果分析

MM-Policy配合PRM在五个基准上的提升分别为+8.88、+8.59、+4.67、+3.28和+5.37个百分点。InternVL2.5-38B在MM-K12由40.34%升至52.40%;78B模型在MathVerse由50.18%升至54.47%。定性案例中,前两步得分0.83、0.68,而错误第三步仅0.02,显示定位能力。

应用场景

可用于图表题、几何题、教育辅导和视觉问答中的答案重排。部署者需具备候选生成模型、可验证答案或部分验证器,并承担16次采样和PRM评分成本。教育系统可据此提示具体错误步骤,而不仅反馈对错。

局限与展望

方法依赖可验证最终答案和策略模型产生足够多样的候选;开放式证明、模糊图像及无唯一答案任务更难标注。MCTS和BoN增加延迟与算力,软MC标签也可能继承策略偏差。后续应结合形式化证明、工具调用、动态搜索预算和强化学习,并评估更广泛的模型与难度分布。

通俗解读 非专业人士也能看懂

把MM-PRM想成一位检查数学作业的老师。学生先写出16份解题草稿,这相当于模型生成候选答案。老师不只看最后写了什么,而是逐行检查:这一行是否能支持下一行?如果从某一步继续往下,大多数草稿都走不到正确答案,老师就给它较低分。

论文用一种自动“反复试做”的办法完成检查。系统从某一步出发,尝试许多后续路线;走到正确答案的比例,就是这一步的可靠程度。它还会像查找坏掉的电路一样,用搜索迅速找到最早出错的位置。因此,只有1万道题,也能生成约74.7万条逐步评价。

最后,模型选择最可信的草稿,而不是盲信第一份答案。MM-Policy在MM-K12上的正确率从33.92%升到42.80%。但这位老师仍受学生草稿质量影响:如果16份都错了,它无法凭空创造第17份。多次检查也需要更多时间和计算资源。

简单解释 像给14岁少年讲一样

想象你在玩一个数学闯关游戏。普通机器人只看你有没有到终点:到了就算赢,没到就算输。问题是,你可能一路走错,却刚好猜中终点;也可能只在第三关犯错,后面全被带偏。这样评分很不公平。

MM-PRM像一个会检查每一关的队友。它让机器人先独立写出16套解法,再逐步检查每套方案。它会问:“从这里继续走,最后答对的机会有多大?”如果某一步之后经常失败,就给低分;如果经常成功,就给高分。系统还会用搜索快速找到最早的错误关卡。

研究者用1万道带图片的数学题训练这个检查员,自动做出约74.7万条步骤记录。结果很惊人:MM-Policy在一套测试题上的正确率从33.92%升到42.80%,就像从“十题三对”进步到“十题四对多”。在更难的OlympiadBench上,也从15.41%升到24.00%。

不过它不是魔法。它只能从机器人已经写出的16份答案里挑最好的一份;如果所有答案都错,检查员也很难救场。而且反复尝试会花更多时间。未来可以让它使用计算器、画图工具,或者自己修改错误步骤。

术语表

Process Reward Model(过程奖励模型)

逐步评价推理质量,而非只评价最终答案的模型。它输出每个中间步骤正确的概率。

MM-PRM在<prm>标记处预测步骤分数。

Monte Carlo Tree Search(蒙特卡洛树搜索)

通过反复模拟未来路径并更新树节点统计量来选择更有希望的搜索路线。

用于定位最早错误并生成步骤标签。

Best-of-N

先生成N个候选回答,再依据评分器选择最优者。

论文固定生成16条路径。

Soft label(软标签)

用0到1之间的连续概率监督模型,而不是只用正确或错误两类标签。

标签等于MC估计的成功概率。

MM-K12

论文构建的多模态K-12数学数据集,含1万道种子题和500道测试题。

用于MCTS标注与分布内评测。

Outcome Reward Model(结果奖励模型)

只根据最终答案提供单一奖励的模型。它无法直接识别中间推理中的局部错误。

论文将其与PRM进行对比。

开放问题 这项研究留下的未解疑问

  • 1 自动MC标签是否真正代表逻辑正确性仍未完全解决;它可能反映策略模型的偏好和采样能力,而不是数学真值,需要形式化验证器和人工审计。
  • 2 当题目没有唯一可验证答案、图像质量很差或需要长证明时,MCTS的成功率估计是否稳定,仍缺少系统实验。
  • 3 更大候选数能否持续提升收益尚不明确;需要研究搜索成本、延迟与准确率之间的最优平衡。

应用场景

近期应用

教育作业诊断

在线辅导系统可让模型生成多套解法,再用MM-PRM指出最可能出错的步骤,为学生提供针对性提示。部署前需要可验证答案、图像输入能力和额外采样预算。

视觉数学问答重排

在图表、几何和考试题系统中,PRM可对多个候选答案进行步骤级排序,减少逻辑断裂和偶然猜中。它可作为现有多模态模型的外接评分器,无需重训主模型。

远期愿景

可验证的数学智能体

结合定理证明器、计算器和绘图工具后,PRM可能成为智能体的过程审计层,持续检查计划、计算和证据链。主要障碍是工具调用成本、错误恢复和跨领域泛化。

原文摘要

While Multimodal Large Language Models (MLLMs) have achieved impressive progress in vision-language understanding, they still struggle with complex multi-step reasoning, often producing logically inconsistent or partially correct solutions. A key limitation lies in the lack of fine-grained supervision over intermediate reasoning steps. To address this, we propose MM-PRM, a process reward model trained within a fully automated, scalable framework. We first build MM-Policy, a strong multimodal model trained on diverse mathematical reasoning data. Then, we construct MM-K12, a curated dataset of 10,000 multimodal math problems with verifiable answers, which serves as seed data. Leveraging a Monte Carlo Tree Search (MCTS)-based pipeline, we generate over 700k step-level annotations without human labeling. The resulting PRM is used to score candidate reasoning paths in the Best-of-N inference setup and achieves significant improvements across both in-domain (MM-K12 test set) and out-of-domain (OlympiadBench, MathVista, etc.) benchmarks. Further analysis confirms the effectiveness of soft labels, smaller learning rates, and path diversity in optimizing PRM performance. MM-PRM demonstrates that process supervision is a powerful tool for enhancing the logical robustness of multimodal reasoning systems. We release all our codes and data at https://github.com/ModalMinds/MM-PRM.

cs.AI cs.CV