Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning

TL;DR

FWS以6个VQA数据集构建FaithfulQA,60K监督使VLM的RL更准、更稳、更忠实。

cs.AI 🔴 高级 2026-06-29 14 次浏览
Peng Lee Yin Zhang Yanglin Zhang Haonan Wu Zishan Liu Ruoxi Zang Xin Zhu Jiayin Zheng Jian Yao Zefeng Ji Fei Ma
视觉语言模型 强化学习 视觉忠实性 因果干预 多模态推理

核心发现

方法论

论文提出Faithful Warm-Start(FWS):从AI2D、TextbookQA、PlotQA、ScienceQA、ChartQA和Geo3K筛选样本,构造包含Visual Grounding、Question Requirement、Intermediate Inference和Final Prediction的推理轨迹。模型先经SFT学习视觉—语言因果模式,再接受稀疏答案奖励下的RL。Qwen3VL-8B-Thinking负责评审与净化。

关键结果

  • 在不使用RL时,20K-SFT平均准确率为79.00%,相对Base model的70.91%提升8.09个百分点;AI2D、PlotQA和ScienceQA分别达到68.94%、70.77%和86.56%。
  • 加入RL后,20K-SFT-RL平均达到79.51%,高于Base model-RL的71.07%;60K-SFT-RL在AI2D、TQA、PlotQA、SciQA和ChartQA上分别为69.36%、75.28%、67.97%、87.90%和96.60%。
  • 奖励曲线显示,直接RL早期缓慢上升并在较低平台波动;60K-SFT-RL虽有适应期,却随后快速上升并稳定收敛,说明忠实初始化改善了优化轨迹。

研究意义

研究把视觉语言RL的关键瓶颈从单纯奖励设计扩展到策略初始化。它解释了为什么答案正确并不等于视觉依据正确:稀疏奖励可能鼓励语言先验、数据偏差和事后合理化。FWS为VLM提供先学习“看见什么、问题要求什么、如何推断”的路径,降低模型在训练中忽略图像的风险,对可解释视觉问答、机器人感知和安全多模态系统具有意义。

技术贡献

技术上,FWS将结构化推理单元、逐单元因果干预和VLM评审结合起来。对含N个单元的正确轨迹,逐一删除单元并重新回答,以num_correct_to_wrong衡量该单元的必要性;随后要求visual_grounding、unit_causality、non_contradiction和faithfulness四项评分均为2,且因果指标大于0。相比只优化最终答案的RL,该流程显式筛选“因正确依据而正确”的轨迹。

新颖性

核心新意不是提出新的RL目标,而是把FaithfulQA作为RL前的因果忠实预训练阶段。既有工作多改进奖励函数或直接进行Visual-RFT;本文强调初始策略状态是优化前提,并以删除单元后的答案翻转提供可操作的因果证据。

局限性

  • 因果性通过重新调用VLM并删除文本单元近似衡量,仍可能受模型自身偏差、提示格式和随机性影响,不能等同于人类意义上的真实认知因果。
  • 实验主要使用Qwen3-VL-2B-Instruct及其Qwen3VL-8B-Thinking评审器,且六个基准以静态VQA为主;对开放式图像、视频、真实机器人场景的外推尚未验证。
  • 论文报告的核心对比集中于准确率和奖励曲线,缺少统一的视觉忠实性数值基准及更完整的计算成本分析。

未来方向

作者计划把SFT阶段获得的推理动态纳入RL奖励模型,加入过程级奖励,直接鼓励视觉依据、因果连贯性和逻辑一致性。后续还应测试更大模型、视频与交互式任务,并研究更低成本的干预评估、跨模型评审和抗评审器偏差机制。

AI 总览摘要

视觉语言模型正在从“看图回答”走向多步推理,但强化学习直接优化最终答案时,可能奖励语言套路而非视觉证据。模型可以说得流畅、答案也偶尔正确,却没有真正使用图像;这种答案级奖励与过程忠实性之间的错位,是多模态RL不稳定的重要来源。

Peng等人提出Faithful Warm-Start(FWS)。研究者从六个VQA基准收集137,568个样本,先生成并拆分为视觉依据、问题要求、中间推断和最终预测四类单元;经过正确性筛选、逐单元删除干预,以及Qwen3VL-8B-Thinking的四维评审,最终得到60K FaithfulQA样本。Qwen3-VL-2B-Instruct先用这些轨迹进行SFT,再在另20K样本上接受RL,从而先进入视觉忠实的策略区域。

结果显示,20K-SFT平均准确率为79.00%,高于基础模型的70.91%;加入RL后为79.51%,而直接Base model-RL为71.07%。60K-SFT-RL在ChartQA达到96.60%,ScienceQA达到87.90%。奖励曲线还显示,直接RL较早陷入低位波动平台,而忠实SFT初始化虽有短暂适应期,却快速达到更高、更稳定的平台。该工作表明,RL前的监督初始化可能与奖励设计同样关键;但其因果检验仍依赖VLM重答,且尚未覆盖视频和真实交互环境。

深度分析

研究背景

VLM已在VQA、图表、科学和几何推理中取得进展,Qwen3-VL等模型也开始结合SFT与RL提升推理。Visual-RFT及答案级RL证明了奖励优化的潜力,但稀疏奖励只检查最终答案,无法保证模型使用图像。于是,语言先验和数据偏差可能产生“正确但不忠实”的解释。

核心问题

给定图像、问题和候选答案,模型应依据可观察证据完成推理;然而直接RL只优化最终回报,模型可能忽略视觉内容、套用常识或生成事后解释。弱初始化还会把策略推向错误的优化区域,导致奖励平台低、波动大,且难以判断推理单元是否真正影响决策。

核心创新

FWS包含三项关键创新:第一,构建FaithfulQA,把轨迹拆为四类功能单元;第二,用unit-level causal intervention删除单元,计算num_correct_to_wrong,筛除冗余叙述;第三,以Qwen3VL-8B-Thinking进行visual grounding、unit causality、non-contradiction和faithfulness四维严格评审。它不是仅增加数据,而是把因果依赖作为暖启动数据的准入条件。

方法详解

  • �� 数据输入:六个基准共137,568个图像—问题样本,覆盖图表、图示、科学和几何。
  • �� 轨迹生成:VLM在<think>中推理、在<answer>中作答,并标注Visual Grounding、Question Requirement、Intermediate Inference、Final Prediction。
  • �� 初筛:只保留答案正确的121,866条轨迹。
  • �� 因果检查:对含N个单元的轨迹逐个删除,重新输入原图和问题;若删除导致正确变错误,则num_correct_to_wrong大于0。
  • �� 评审净化:四项评分均须为2,且因果指标大于0;重复样本保留因果证据最强者。
  • �� 训练:60K样本用于SFT,另20K非重叠样本仅用于RL,原始基准保留用于评测。

实验设计

骨干模型为Qwen3-VL-2B-Instruct;评审器为Qwen3VL-8B-Thinking。实验比较Base model、20K/40K/60K-SFT,以及相应的RL版本,覆盖AI2D、TQA、PlotQA、ScienceQA和ChartQA。主要指标是各数据集准确率、平均准确率和RL奖励动态;训练设置与奖励设计保持一致,以隔离初始化因素。

结果分析

无RL时,Base model平均70.91%,20K、40K、60K-SFT分别为79.00%、78.57%和78.93%。有RL时,Base model-RL为71.07%,20K、40K、60K-SFT-RL分别为79.51%、79.24%和79.42%。60K版本在ChartQA达到96.60%、SciQA达到87.90%;收益在20K时已明显,继续扩大规模后多数任务趋于饱和。

应用场景

该方法适合需要证据可追溯的视觉问答、教育图表分析、科学辅导和几何解题。部署前可用领域图像生成忠实轨迹,再进行SFT与RL。对机器人和工业检测而言,必须进一步加入视频、动作反馈及真实传感器验证,才能把静态VQA收益转化为可靠决策能力。

局限与展望

FWS依赖多次VLM调用,逐单元干预的计算成本随轨迹长度增加;删除文字也可能改变上下文,而非纯粹移除因果信息。评审器与被训练模型存在同源偏差,四项满分阈值可能牺牲数据规模。实验只覆盖静态基准和Qwen体系,尚未证明对开放式回答、视频推理、不同语言或真实环境的普适性。

通俗解读 非专业人士也能看懂

把模型想成一名看图做题的学生。直接让他参加“答对就得分”的比赛,他可能背题型、猜老师习惯,甚至答对后再编一个听起来合理的解释。FWS先安排一套更严格的训练:学生必须指出图上真正看到的内容,再说明题目要求什么,接着写出中间推理,最后给答案。

老师还会做一个小实验:删掉推理中的某一句,再让学生重新答题。如果删掉后答案从对变错,说明这句话确实有用;如果完全没有影响,它可能只是装饰。之后另一位会看图的评审老师检查:解释是否来自图片、各步是否必要、有没有自相矛盾、答案是否真的被解释支持。只有四项都满分的答案才能进入训练集。

这样,模型不是先学会“怎样拿分”,而是先学会“怎样根据证据拿分”。实验中,20K条这种高质量示范就把平均成绩从70.91%提高到79.00%;再进行强化学习后达到79.51%,明显高于直接强化学习的71.07%。

简单解释 像给14岁少年讲一样

想象你在玩看图答题游戏。游戏只看最后答案对不对,却不管你有没有认真看图。你可能记住常见套路,靠猜也能偶尔得分;但题目一变化,就容易翻车。论文研究的就是怎样让AI别只会猜,而是真的用图片。

研究者给AI准备了六类题目,包括图表、科学图、几何图和课本问题。AI回答时必须分四步:先说看到了什么,再说题目要什么,然后进行推理,最后给答案。接着把其中一句话删掉重新测试。如果删掉后答案错了,这句话就像解题中的关键线索;如果删掉也没影响,可能只是漂亮话。

还有一个更强的AI当裁判,检查解释是否来自图片、步骤是否有用、前后是否矛盾。筛出的60K样本先教模型,再让它玩强化学习。结果很酷:基础模型平均70.91分,20K示范后升到79.00;强化学习直接开始只有71.07,但先接受这种训练后达到79.51。

不过这不代表问题全解决了。检查每句话需要多次调用AI,比较费计算;而且实验主要是静态图片,不是视频或机器人。下一步就是让AI在更真实、更复杂的环境里证明自己真的“看懂了”,而不是只学会写出像懂了一样的答案。

术语表

Faithful Warm-Start(忠实暖启动)

在强化学习前,先用视觉依据充分的推理轨迹监督模型。它的目标是把策略置于视觉忠实、较稳定的初始区域。

论文的核心训练策略。

FaithfulQA(忠实问答集)

由六个VQA基准筛选出的高质量图像—问题—推理数据集。每条轨迹包含视觉观察、问题要求、中间推断和答案。

用于SFT,不用于最终评测。

Unit-level Causal Intervention(单元级因果干预)

逐一删除推理单元,再观察答案是否由正确变错误。它用行为变化近似衡量该单元对决策的必要性。

计算num_correct_to_wrong。

Visual Grounding(视觉扎根)

推理明确依赖图像中可观察的对象、文字、位置或关系。它区别于仅凭语言先验作答。

四类推理单元之一,也是评审维度。

Sparse Answer-level Reward(稀疏答案级奖励)

只根据最终答案正确性提供奖励,中间推理通常没有直接反馈。它可能鼓励捷径和事后合理化。

论文分析直接RL不稳定的原因。

num_correct_to_wrong

删除一个推理单元后,模型预测从正确变为错误的次数。数值大于0被视为该单元具有因果证据。

FaithfulQA的筛选条件。

开放问题 这项研究留下的未解疑问

  • 1 如何在不进行大量重答的情况下可靠评估视觉因果性?未来需要更便宜的干预、外部证据标注或可验证程序。
  • 2 FWS对视频、开放式问答、跨语言任务和真实机器人决策是否同样有效?静态六基准无法回答这些问题。
  • 3 VLM评审器可能复制被评模型的偏差;如何建立独立、可校准且抵抗奖励投机的过程级评价仍待研究。

应用场景

近期应用

教育图表与科学辅导

教育平台可用AI2D、ScienceQA、ChartQA风格数据生成视觉扎根轨迹,先进行SFT再做答案级RL。系统不仅给出答案,还能指出图中证据与推理步骤,降低幻觉并便于教师复核。

工业视觉问答

质检系统可把缺陷位置、形态和检测规则组织成四阶段轨迹,再用因果干预筛除无关描述。部署前需建立领域图像规范和人工抽检流程,预期提升报警解释性与故障追踪能力。

远期愿景

可信多模态智能体

将FWS扩展到视频、传感器和动作反馈,使机器人在执行前说明所依据的视觉证据。主要障碍是实时计算、连续状态因果性及过程奖励的可靠设计。

原文摘要

Reinforcement Learning (RL) is an important paradigm for improving the reasoning capabilities of Vision-Language Models (VLMs). However, directly applying RL to rollout multimodal reasoning can lead to instability, due to the exploitation of language priors, the neglect of visual evidence, and the generation of reasoning traces that are fluent yet not visually grounded. The question arises: Can initially steer the policy toward visually faithful reasoning regime before applying reinforcement learning? To this end, we propose a Faithful Warm-Start (FWS) strategy that first curates samples with explicit vision-language causal relationships from six general VQA benchmarks to construct the FaithfulQA dataset, where each of the image-question pairs gains a certain degree of visual observations, question requirements, commonsense knowledge, domain knowledge, and the final answer. Subsequently, a VLM-based judge is employed to further purify the dataset, ensuring strong causal consistency and visual faithfulness. This warm-start stage equips the model with the capability to understand causally grounded vision-language patterns before subsequent RL optimization under sparse answer-level rewards. Experimental results show that such faithful supervision improves answer accuracy, stabilizes RL training, and reduces visually unsupported reasoning.

cs.AI