Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
EVPV以视觉前提可靠性门控PRM,在VisualProcessBench达67.46 Macro-F1,显著提升Best-of-8重排。
核心发现
方法论
EVPV(Explicit Visual Premise Verification)将视觉感知与推理判断解耦:策略模型为每一步生成视觉检查清单,约束提取器一次性从图像和问题生成结构化事实C,再通过类型感知匹配得到支持度p_j,并以平滑几何均值计算可靠性r。对视觉依赖步骤使用α(r)=σ(β(r−τ))门控基础奖励,低可靠性时将奖励收缩至中性。
关键结果
- 在VisualProcessBench五个子集上,EVPV-PRM总体Macro-F1为67.46%,高于VisualPRM的62.00%、TIM-PRM的61.70%和QWEN-VL-PRM-7B的58.60%。
- 在InternVL2.5三种规模的Best-of-8重排中,EVPV-PRM总体准确率分别为41.67%、46.75%和55.22%,相对Pass@1提升8.83、9.52和9.78个百分点,并超过VisualPRM。
- 消融显示,去除结构化事实后总体Macro-F1降至63.38%;打乱事实结构降至59.82%;删除事实降至62.11%;drop-facts严重扰动仅35.77%,说明约束保真度具有因果作用。
研究意义
论文解决了多模态PRM中长期存在的评分歧义:低分究竟代表推理错误,还是图像理解错误。EVPV使验证器能够分别处理视觉前提可靠性与逻辑正确性,减少“奖励幻觉前提”和“惩罚正确陈述”两类错误。由于约束只需每个实例提取一次,它适合Best-of-N、搜索解码和实际部署,也能作为GPT、Gemini等黑盒评审器的推理时插件。
技术贡献
核心贡献是一个与评审器无关的校准接口,而非重新设计PRM结构。论文定义了视觉依赖指标ν_t、约束集合C、声明支持度p_j、几何均值可靠性r及可靠性门控奖励R_t。EVPV-PRM以Qwen2.5-VL-Instruct-7B为基础输出概率奖励,外部评审器也可直接接入。约束抽取器采用统一JSON模式覆盖数值、关系和组合结构,并在所有候选轨迹间复用,降低了逐步工具调用成本。
新颖性
相较VisualPRM、ATHENA和TIM-PRM主要增强训练数据、评审推理或外部工具查询,EVPV首次在本文框架中把“步骤依赖的视觉前提”显式化,并用独立结构化约束进行一次性验证。其新意不是更强的视觉识别器,而是把视觉证据可靠性转化为可解释、可复用的奖励门控信号。
局限性
- 清单由策略模型自行报告,可能遗漏真实视觉依赖或过度声明;论文仅在人工核验子集审计完整性,未证明所有任务类型都稳定。
- 约束提取器由Qwen3-VL-235B-A22B-Instruct蒸馏而来,错误或偏差会直接影响r;复杂开放世界图像、细粒度OCR和非几何任务的泛化仍不充分。
- 结构化约束、匹配容差及β、τ需要校准;错误的高置信约束可能使门控保留错误奖励。
未来方向
未来可研究联合训练策略与约束抽取器、自动发现视觉依赖、任务自适应的匹配容差和门控参数,并扩展到VLRMBench等更广泛评测。还应比较多图、视频、开放世界场景及工具增强系统,建立更严格的校准指标和不确定性理论。
AI 总览摘要
视觉语言模型能够解释图表、几何图形和数学题,却常把看错图像后的错误前提继续推导得十分流畅。传统视觉过程奖励模型(VL-PRM)只给每一步一个分数,因而无法区分“推理错了”和“看图错了”:它可能奖励不存在的圆柱孔,也可能惩罚真实的视觉陈述。这种混淆会削弱Best-of-N重排和错误定位。
Wang等人提出Explicit Visual Premise Verification(EVPV)。策略模型为每一步列出视觉检查清单;独立的约束提取器从图像和问题生成数值、几何关系及组合结构等JSON事实。系统将清单声明与事实匹配,计算视觉可靠性r,再用α(r)=σ(β(r−τ))调节视觉依赖步骤的奖励。约束只提取一次,并在所有候选解中复用,因此无需逐步调用工具。作者还训练了基于Qwen2.5-VL-Instruct-7B的EVPV-PRM。
结果显示,EVPV-PRM在VisualProcessBench取得67.46%总体Macro-F1,高于VisualPRM的62.00%。在InternVL2.5-8B、26B、38B上的Best-of-8总体准确率分别为41.67%、46.75%和55.22%,相对Pass@1提升8.83、9.52和9.78个百分点。结构化事实被打乱时Macro-F1降至59.82%,严重删除事实时仅35.77%,支持“约束保真度驱动收益”的因果解释。EVPV也改善了Gemini 2.5 Pro等外部评审器,显示其可作为通用推理时校准层。
深度分析
研究背景
测试时扩展依赖Best-of-N、搜索解码和过程监督。VisualPRM400K与VisualProcessBench证明多模态PRM有价值,ATHENA进一步提高数据效率;TIM-PRM则通过逐步工具查询减少确认偏差。但视觉感知、OCR、计数和几何关系仍易出错,单一步骤分数混合了感知与逻辑误差。
核心问题
给定图像I、问题q和步骤序列S,系统需判断每个步骤是否正确并可靠重排候选。标准PRM直接计算R_t,无法知道步骤是否依赖不可靠视觉事实。因此会出现视觉幻觉被奖励、正确陈述被拒绝,以及错误定位失真的问题;逐步调用工具虽可缓解,却在长轨迹和大规模Best-of-N中成本过高。
核心创新
EVPV包含三项创新:一是让策略显式输出每步视觉声明d_t,形成可核验清单;二是用一次性约束提取器E_φ生成数值、关系和组合结构事实;三是将清单—约束一致性转成r,并通过可靠性门控调整奖励。它不替换外部评审器,而是提供可插拔校准层,区别于TIM-PRM的逐步工具调用。
方法详解
- �� 策略生成步骤s_t及声明d_t;ν_t=I[d_t≠null],非空声明组成V。
- �� 约束提取器计算C=E_φ(I,q),统一JSON覆盖长度、角度、表项、平行、垂直、包含和连接关系。
- �� 类型感知匹配得到p_j=m(v_j,C),并计算r=exp((1/M)Σlog(ε+p_j))。
- �� 评审器输出R_t^base;EVPV-PRM用u_t=P_θ(y_t=1|I,q,s≤t),并令R_t^base=2u_t−1。
- �� 视觉步骤使用R_t=α(r)R_t^base,非视觉步骤保持原值;候选以正值映射后的几何均值Score(S)重排。
- �� E_φ在26,454个图像—问题对上SFT,并在5,832个实例上DPO;V_θ用19,490条带步骤标签轨迹训练。
实验设计
步骤验证使用VisualProcessBench,指标为Macro-F1和准确率;重排使用LogicVista、MMMU、MathVerse-VO、MathVision、MathVista和WeMath。候选由InternVL2.5-8B/26B/38B生成,评估BoN@8、Pass@1及增益。基线包括VisualPRM、TIM-PRM、QWEN-VL-PRM-7B和GPT、Gemini、Qwen评审器。消融移除结构化事实、约束、视觉输入、JSON并注入事实扰动。
结果分析
EVPV-PRM在DynaMath、MMMU、MathVerse、MathVision和WeMath上的Macro-F1为69.57、68.86、67.09、65.27和69.11,总体67.46%。InternVL2.5-38B上,EVPV-PRM的BoN@8为55.22%,高于VisualPRM的50.70%。Qwen3-VL-235B作为外部评审器接入EVPV后总体由58.51%升至65.45%。删除JSON与视觉输入后总体仅48.23%,证明显式证据不可替代。
应用场景
EVPV适合数学图形、表格问答、图表分析和教育辅导中的候选答案筛选。部署者可复用一次提取的约束,为多个候选解提供廉价一致的视觉证据。它也适合黑盒GPT、Gemini或企业内部VLM,不必重新训练评审器即可改善错误定位与重排。
局限与展望
系统依赖策略模型完整报告视觉前提,也依赖约束提取器的准确性;二者任一失误都会扭曲r。当前训练集中几何和表格任务占主导,开放世界、多图、视频和复杂OCR泛化尚未验证。约束提取本身仍有推理成本,且匹配容差、阈值τ和锐度β需要调参。未来应发展联合校准、自动依赖发现、概率约束及更广泛基准。
通俗解读 非专业人士也能看懂
把模型想成检查数学作业的老师。学生先写出解题步骤,但其中可能偷偷用到“图中有三个苹果”“这条线垂直于那条线”等看图事实。普通老师只看推导是否顺口:如果学生把不存在的苹果写得很流畅,也可能给高分。EVPV要求学生先列一张“我看到了什么”的清单。
另一位独立老师只检查原图,并把可确认的事实写进清单:数量、数字、位置、连接方式等。系统逐项比较两张清单。如果学生声称的关键事实没有被原图支持,整体可信度就下降;如果事实都能对上,可信度就提高。这里采用几何平均,是因为一个关键事实错了,整道题可能都会被带偏。
最后,EVPV不会直接说整份答案一定错,而是降低那些依赖图像的步骤的影响;纯计算步骤仍按原规则评分。这样既不会因为看图不确定而过度惩罚,也不会让视觉幻觉主导候选答案排序。它还只需检查一次原图,就能服务多个答案,像给所有学生发同一份可靠的题目事实表。
简单解释 像给14岁少年讲一样
想象你在玩一款解谜游戏,屏幕上有地图、数字和机关。你写攻略时说:“右边有三个按钮,所以先按中间那个。”但如果你其实看错了,后面的步骤即使很聪明,也会建立在错误地图上。普通评分员只看攻略写得像不像,可能被流畅文字骗过。
EVPV像一个更谨慎的队友。它先让你标出每一步依赖的画面信息,比如按钮数量、方向或两条线的关系。然后另一个队友独立检查截图,把确认过的事实整理出来。两边对不上时,系统不会马上判定你的整个攻略失败,而是降低这一步的分量;对得上时,才放心使用评分。
这有什么用?如果你生成八份攻略,系统要挑最好的一份,错误地图的攻略就不容易因为“说得很自信”而胜出。实验中,EVPV-PRM在VisualProcessBench达到67.46% Macro-F1;在不同大小的InternVL2.5上,Best-of-8相对单次答案提升8.83到9.78个百分点。
当然,它也不是魔法。如果独立队友自己看错截图,或者你忘了报告某个重要事实,判断仍会出问题。好消息是,论文通过打乱或删除事实发现性能明显下降,说明真正重要的是事实是否准确,而不是简单换了一个提示词。
术语表
Vision-Language Process Reward Model(视觉语言过程奖励模型)
逐步评估多模态推理轨迹的模型,而非只判断最终答案。它为每个中间步骤生成正确性奖励。
论文用EVPV校准VL-PRM,减少视觉误读造成的评分错误。
Explicit Visual Premise Verification(显式视觉前提验证)
把步骤依赖的视觉事实明确列出,并与独立提取的图像约束核对。其输出是视觉可靠性信号。
EVPV是本文的核心框架。
Structured Constraints(结构化约束)
以统一JSON表示的可验证视觉事实,包括数值、空间关系和组合结构。它比自由文本描述更易匹配。
约束提取器一次生成C,并供所有候选复用。
Reliability Gating(可靠性门控)
依据视觉可靠性缩放视觉依赖步骤的奖励。低可靠性时奖励趋向中性,高可靠性时保留基础奖励。
公式为α(r)=σ(β(r−τ))。
Best-of-N
先生成N个候选解,再由评分器选择最优者的测试时扩展方法。它把候选质量与选择质量结合起来。
论文重点报告Best-of-8重排。
开放问题 这项研究留下的未解疑问
- 1 如何让模型稳定发现所有视觉依赖仍未解决;漏报会绕过门控,过报则可能过度削弱奖励,需要更强的监督或联合学习。
- 2 结构化约束在开放世界、多图、视频和复杂OCR中的可靠性未知;未来需要概率约束、校准评测与更广泛数据。
- 3 固定β、τ及匹配容差未必适合所有任务;自动、任务自适应的门控策略仍待研究。
应用场景
近期应用
多模态数学与图表答案重排
教育平台可让VLM生成多个解答,由EVPV一次提取图形或表格事实,再对视觉依赖步骤进行门控。无需为每一步调用工具,适合批量筛选,并能标出疑似看图错误。
黑盒视觉评审器校准
企业可将EVPV作为GPT、Gemini或内部VLM的推理时插件。只需提供结构化约束和候选步骤,即可降低幻觉视觉前提对评分的影响,不必重新训练原评审器。
远期愿景
可靠的多模态搜索与智能代理
未来代理可把视觉证据作为共享状态,在长程规划、机器人操作和视频推理中复用。关键前提是约束抽取具备跨帧一致性,并能表达不确定性和证据来源。
原文摘要
Vision-language process reward models (VL-PRMs) are increasingly used to score intermediate reasoning steps and rerank candidates under test-time scaling. However, they often function as black-box judges: a low step score may reflect a genuine reasoning mistake or simply the verifier's misperception of the image. This entanglement between perception and reasoning leads to systematic false positives (rewarding hallucinated visual premises) and false negatives (penalizing correct grounded statements), undermining both reranking and error localization. We introduce Explicit Visual Premise Verification (EVPV), a lightweight verification interface that conditions step scoring on the reliability of the visual premises a step depends on. The policy is prompted to produce a step-wise visual checklist that makes required visual facts explicit, while a constraint extractor independently derives structured visual constraints from the input image. EVPV matches checklist claims against these constraints to compute a scalar visual reliability signal, and calibrates PRM step rewards via reliability gating: rewards for visually dependent steps are attenuated when reliability is low and preserved when reliability is high. This decouples perceptual uncertainty from logical evaluation without per-step tool calls. Experiments on VisualProcessBench and six multimodal reasoning benchmarks show that EVPV improves step-level verification and consistently boosts Best-of-N reranking accuracy over strong baselines. Furthermore, injecting controlled corruption into the extracted constraints produces monotonic performance degradation, providing causal evidence that the gains arise from constraint fidelity and explicit premise verification rather than incidental prompt effects. Code is available at: https://github.com/Qwen-Applications/EVPV-PRM