核心发现
方法论
本研究系统分析LVLMs在长序列推理中的视觉遗忘现象,发现早期注意力衰退和Sink Token的过度集中是主要原因。提出LASER框架,通过引入视觉基础奖励(Visual Grounding Reward)和Sink抑制奖励(Sink Suppression Reward),在训练过程中调控注意力轨迹与分布。采用GRPO算法优化,结合特定的奖励机制,调节模型在推理中的视觉注意力动态。实验证明该方法在8个基准数据集上均优于现有方法,显著提升推理准确率。
关键结果
- 在MMStar等长序列推理任务中,LASER提升准确率达1.9%,在视觉感知任务中提升5.7%,优于现有最优方法。通过注意力轨迹分析,验证模型在推理全过程中保持了更稳定的视觉基础,减少了注意力向无关区域的偏移。
- 在不同数据集上,LASER均表现出优越的性能,尤其在复杂的数学推理和多模态理解任务中,效果明显优于未调控模型。 Ablation实验显示,视觉基础奖励和Sink抑制奖励的结合是性能提升的关键。
- 通过控制推理中不同阶段的注意力分布,验证早期注意力保持对推理结果的影响,强调了早期视觉基础的重要性。
研究意义
本研究突破了LVLM长序列推理中视觉遗忘的根源,提出的注意力调控机制为多模态模型的稳健性提供新思路。通过系统调节注意力轨迹,有望改善模型在复杂推理任务中的表现,推动AI在自动推理、机器人感知等领域的应用。该方法为未来多模态模型的训练提供了理论基础和实践路径,有助于实现更具解释性和可靠性的智能系统。
技术贡献
技术上,LASER引入双重奖励机制,结合GRPO优化算法,有效调控视觉注意力的时间动态与空间分布。创新性在于将注意力保持与Sink抑制结合,形成动态调节策略,解决长序列推理中的注意力崩溃问题。该方法在训练后期无需额外标注,具有良好的迁移性和扩展性,为多模态模型的注意力机制研究提供新范式。
新颖性
本研究首次系统性揭示LVLMs在长推理中早期注意力衰退与Sink Token过度集中的机制,提出结合时间和空间调控的注意力奖励体系。相较于传统的后处理或 heuristic 方法,LASER在训练过程中实现动态调节,具有更强的理论支撑和实证效果。这种多维度的注意力调控策略为多模态模型的稳健性提供了新思路。
局限性
- 当前方法依赖于预训练模型的基础架构,可能在不同模型或任务中表现不一致,需进一步验证泛化能力。
- 奖励机制的参数调节仍需手工调整,可能影响训练效率和效果的稳定性。
- 在极端复杂或多样化的场景下,模型仍可能出现注意力偏差或遗漏,未来需结合更丰富的特征引导机制。
未来方向
未来将探索自适应奖励参数调节策略,结合多模态特征增强注意力调控的鲁棒性。同时,考虑引入多任务训练,提升模型在多样场景中的泛化能力。还计划将LASER应用于实际机器人感知和交互系统,验证其在真实环境中的表现,推动多模态AI的实际落地。
AI 总览摘要
随着大规模视觉-语言模型(LVLMs)在推理能力上的不断突破,长序列推理中的视觉遗忘问题逐渐成为制约其性能的关键瓶颈。传统方法多通过后处理或启发式提醒试图缓解这一现象,但未能根本解决早期注意力衰退和Sink Token过度集中的问题。本文提出LASER框架,系统调控模型在推理过程中的视觉注意力轨迹与分布,显著改善了模型的推理稳定性和准确性。
LASER通过引入视觉基础奖励(Visual Grounding Reward)和Sink抑制奖励(Sink Suppression Reward),在训练中实现对注意力动态的精细调节。具体而言,前者确保模型在推理全过程中持续关注语义关键的视觉区域,后者抑制模型对无关Sink Token的过度关注。这一机制在8个基准数据集上经过验证,表现出优于现有最优方法的性能提升,尤其在复杂数学推理和多模态理解任务中效果显著。
实验结果显示,LASER不仅提升了推理准确率,还增强了模型的可解释性和鲁棒性。通过分析注意力轨迹,验证了早期注意力保持对推理结果的关键作用,强调了动态调控的重要性。该方法为多模态模型的训练提供了新思路,有望推动AI在自动推理、机器人感知等实际应用中的发展。未来,作者计划结合自适应奖励调节和多任务学习,进一步提升模型的泛化能力与实用性。
深度分析
研究背景
多模态大模型(LVLMs)近年来在视觉理解和推理任务中取得突破,代表性工作如Florence、LLaVA等实现了视觉信息与文本生成的融合。早期研究主要依赖大规模预训练和监督微调,强调多模态特征的融合与表达能力。随着模型规模扩大,推理复杂度提升,长序列推理中的注意力退化逐渐显现,导致模型在长推理中表现不佳。近年来,强化学习(RL)方法如DeepSeek、VL-Rethinker等被引入,试图通过奖励机制优化推理路径,增强模型的推理能力。然而,注意力的时间动态和空间分布调控仍是未充分解决的问题,特别是在长序列推理中视觉遗忘现象严重,影响模型的可靠性和解释性。
核心问题
核心问题在于LVLMs在长推理过程中,视觉注意力逐渐减弱,导致视觉信息的基础作用被削弱,影响推理的准确性和稳定性。具体表现为早期注意力衰退,造成关键视觉证据的丧失,以及Sink Token的过度集中,使模型偏离重要视觉区域。这两个问题相互作用,形成视觉遗忘的双重机制,严重制约模型在复杂任务中的表现。解决这一问题的难点在于如何在训练中实现对注意力轨迹的动态调控,既保持早期视觉基础,又避免注意力偏移到无关区域。
核心创新
本研究的创新点在于提出LASER框架,结合两类奖励机制:视觉基础奖励(Rvis)确保模型在推理全过程中持续关注语义关键的视觉区域,Sink抑制奖励(Rsupp)则抑制模型对Sink Token的过度关注。通过在训练中引入这两个奖励,模型在保持视觉基础的同时,避免注意力崩溃到无关区域。核心创新还在于利用GRPO算法,将注意力调控融入强化学习框架,实现时间和空间的双重调节。这一策略不同于传统后处理或启发式方法,具有更强的理论支撑和实证效果,为多模态模型的注意力机制研究提供新路径。
方法详解
- �� 构建基于GRPO的训练框架,结合奖励机制调节注意力。
- �� 设计视觉基础奖励(Rvis),通过监控非Sink区域的注意力比例,保持早期视觉证据的关注。
- �� 设计Sink抑制奖励(Rsupp),通过识别Sink Token,惩罚其过度关注,防止注意力集中。
- �� 利用隐藏状态的激活特征,自动识别Sink Token,确保奖励机制的自适应。
- �� 在训练过程中,动态调整奖励参数,平衡视觉基础和Sink抑制。
- �� 结合模型输出与奖励反馈,优化注意力轨迹,提升推理性能。
实验设计
采用Qwen-2.5-VL-7B模型,训练45K RL样本,覆盖数学推理、逻辑推理和视觉感知任务。对比基线包括GPT5、Gemini-2.5-Pro等,评估指标为准确率和注意力稳定性。通过在不同任务和数据集上的测试,验证LASER的有效性。还设计了消融实验,单独评估Rvis和Rsupp的贡献。模型在8个公开基准上均优于对比方法,尤其在复杂推理任务中表现突出。参数调优通过验证集完成,确保训练稳定。
结果分析
LASER在MMStar推理任务中准确率提升1.9%,在视觉感知任务中提升5.7%,显著优于未调控模型。注意力轨迹分析显示,模型在推理全过程中保持了更高的视觉基础,减少了无关区域的注意力偏移。消融实验表明,Rvis和Rsupp的结合带来最大性能提升,单独使用效果较差。控制不同推理阶段的注意力分布,验证早期注意力保持对最终结果的关键作用。这些结果充分证明了方法的有效性和实用性。
应用场景
该方法可广泛应用于自动驾驶、机器人感知、多模态问答等场景,提升模型在复杂环境中的推理稳定性和解释性。实现条件包括预训练模型基础,结合强化学习训练框架,适用于多模态数据丰富的应用场景。未来还可结合多任务学习,增强模型的泛化能力,推动多模态AI在实际工业、科研中的落地。
局限与展望
目前LASER依赖大量训练样本和调参,计算成本较高,模型在极端复杂场景下仍可能出现注意力偏差。奖励机制参数调整具有一定的人工调节空间,影响训练效率。未来需探索自适应参数调节和更高效的训练策略,以提升模型的泛化能力和实用性。
通俗解读 非专业人士也能看懂
想象你在做一道复杂的菜,需要按照步骤逐步添加不同的调料和食材。刚开始,你会仔细看每个食材,确保放对地方,之后逐渐变得粗心,可能会忘记一些重要的步骤,或者把调料放到不相关的地方。LVLMs也是如此,它们在长时间“做菜”时,最开始会关注重要的视觉信息,但随着时间推移,注意力会逐渐偏离关键证据,变得散乱。LASER就像一个聪明的厨师助手,能在每个步骤提醒你关注重要的食材,避免你把注意力放在无关的调料上,从而做出更美味、更准确的菜肴。这种调节机制让模型在长推理中保持专注,避免“走神”,最终做出更合理的判断。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,一开始你会仔细观察每一块拼图,找出关键的线索,把拼图拼得更快更准。但如果你玩得太久,可能会开始忽略重要的线索,只盯着一些无关的碎片,导致拼图变得乱七八糟。LVLMs也是一样,它们在长时间推理时,刚开始会专注于重要的视觉信息,但时间长了,注意力会变散,偏离了关键证据。LASER就像一个聪明的教练,能在你拼图的每个阶段提醒你关注最重要的部分,避免你被无关的碎片迷惑。这样,拼图就能更快更好地完成,模型的推理也会更准确、更可靠。它让AI在长时间的推理中保持专注,不会“走神”,最终做出更聪明的判断。
术语表
视觉基础奖励 (Visual Grounding Reward)
一种激励机制,促使模型在推理过程中持续关注语义关键的视觉区域;技术上通过监控非Sink区域的注意力比例实现。
用于调节模型在推理中的视觉注意力轨迹,确保关注重要证据。
Sink Token (Sink标记)
指在注意力分布中持续吸收过多注意力、但对推理无实质贡献的视觉标记;通过激活特征识别。
模型在训练中通过抑制Sink Token的注意力,避免偏离关键区域。
GRPO (Group Relative Policy Optimization)
一种强化学习优化算法,通过比较不同响应组的奖励,优化模型策略;在多模态训练中应用。
用于训练中调节模型的注意力动态,结合奖励机制实现目标。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂、多模态场景中自动调节奖励参数以适应不同任务需求,仍需深入研究。
- 2 模型在极端长序列推理中的表现机制及其注意力崩溃的根本原因,尚未完全理解。
原文摘要
Large vision-language models (LVLMs) exhibit strong reasoning ability but suffer from visual forgetting during long-horizon decoding, where attention progressively drifts away from visual evidence. Existing methods largely treat this issue as a late-stage attention decay problem or attempt to mitigate it through heuristic reminders or post-hoc attention lifting. Through systematic empirical analysis, we find that performance degradation under visual forgetting is largely driven by two overlooked factors: early-stage attention decay disrupts evidence acquisition, and attention concentration on a subset of task-irrelevant visual sink tokens. Motivated by these insights, we propose LASER, a post-training framework that regulates both the visual attention trajectory and intra-visual token attention distribution during reasoning. Technically, LASER introduces two complementary rewards: a Visual Grounding Reward, which encourages the model to maintain attention on semantically salient visual tokens throughout decoding, and a Sink Suppression Reward, which penalizes excessive attention concentration on visual sink tokens. Together, these rewards preserve early-stage grounding while preventing attention collapse onto uninformative regions. Extensive experiments on eight benchmark datasets demonstrate that LASER consistently outperforms strong baselines, validating attention-aware training as an effective remedy for visual forgetting.