Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

TL;DR

SCALe方法通过动态权重调整提升视觉语言模型的推理和答案准确性。

cs.AI 🔴 高级 2026-03-19 3 次浏览
Shaked Perek Ben Wiesel Avihu Dekel Nimrod Shabtay Eli Schwartz
视觉语言模型 多模态推理 监督微调 强化学习 自适应损失

核心发现

方法论

SCALe方法通过动态调整<think>和<answer>段的权重,优化视觉语言模型的推理和答案生成。使用余弦调度策略逐步从推理段转向答案段,确保模型在训练过程中逐步关注答案的准确性。

关键结果

  • SCALe在ScienceQA和IconQA数据集上提升了模型的准确性,分别提高了3%和5%。
  • 与标准SFT相比,SCALe减少了训练时间至七分之一,同时在不使用GRPO的情况下也能达到相似效果。
  • SCALe结合GRPO时,表现最佳,进一步提升了模型的整体性能。

研究意义

SCALe方法显著提升了视觉语言模型在多模态推理任务中的表现,减少了冗长推理对答案准确性的影响,提供了一种轻量级的训练替代方案,适用于资源有限的环境。

技术贡献

SCALe通过引入动态权重调整机制,解决了传统SFT中推理和答案段不平衡的问题,提供了一种新的训练框架,减少了对GRPO的依赖。

新颖性

SCALe首次在视觉语言模型的训练中引入了动态权重调整策略,区别于传统方法,其创新在于通过自适应损失调度实现推理和答案的平衡。

局限性

  • SCALe在处理极长推理段时可能仍存在一定的性能下降。
  • 该方法在某些特定任务上可能需要额外的调参。

未来方向

未来可以探索SCALe在其他多模态任务中的应用,以及进一步优化其在不同模型架构中的适应性。

AI 总览摘要

视觉语言模型在多模态推理中通常依赖于监督微调和强化学习两个阶段。然而,标准的监督微调往往忽视了推理数据中固有的令牌不平衡问题,导致冗长的推理段掩盖了关键的答案段。SCALe方法通过动态调整推理和答案段的权重,显著提升了模型的准确性和训练效率。

SCALe使用余弦调度策略,在训练过程中逐步从推理段转向答案段,确保模型在训练过程中逐步关注答案的准确性。实验结果表明,SCALe在多个基准测试中表现优异,不仅提高了模型的准确性,还减少了训练时间。

SCALe方法的引入为视觉语言模型的训练提供了一种轻量级的替代方案,尤其适用于资源有限的环境。未来的研究可以进一步探索SCALe在其他多模态任务中的应用,以及在不同模型架构中的适应性。

深度分析

研究背景

近年来,视觉语言模型在多模态推理任务中取得了显著进展,通常采用两阶段的训练范式:首先在标注数据上进行监督微调,然后通过强化学习进行任务特定的对齐。然而,传统的监督微调方法往往忽视了推理数据中推理段和答案段的不平衡问题,导致模型生成冗长的推理而忽视答案的准确性。

核心问题

视觉语言模型在多模态推理任务中面临的核心问题是如何在推理段和答案段之间实现平衡。传统的监督微调方法对所有令牌赋予相同的权重,忽视了推理段和答案段在功能上的不对称性,导致模型生成冗长的推理而忽视答案的准确性。

核心创新

SCALe方法通过引入动态权重调整机制,解决了传统SFT中推理和答案段不平衡的问题。其创新之处在于使用余弦调度策略逐步从推理段转向答案段,确保模型在训练过程中逐步关注答案的准确性。

方法详解

  • �� SCALe方法通过动态调整<think>和<answer>段的权重,优化视觉语言模型的推理和答案生成。
  • �� 使用余弦调度策略逐步从推理段转向答案段,确保模型在训练过程中逐步关注答案的准确性。
  • �� 在训练初期,给予推理段更高的权重以鼓励模型学习结构化的推理模式,随着训练的进行,逐步减少推理段的权重,增加答案段的权重。

实验设计

实验在ScienceQA和IconQA数据集上进行,使用Vision-R1框架的标准两阶段管道。与标准SFT相比,SCALe减少了训练时间至七分之一,同时在不使用GRPO的情况下也能达到相似效果。实验结果表明,SCALe在多个基准测试中表现优异,不仅提高了模型的准确性,还减少了训练时间。

结果分析

SCALe在ScienceQA和IconQA数据集上提升了模型的准确性,分别提高了3%和5%。与标准SFT相比,SCALe减少了训练时间至七分之一,同时在不使用GRPO的情况下也能达到相似效果。SCALe结合GRPO时,表现最佳,进一步提升了模型的整体性能。

应用场景

SCALe方法适用于需要高效训练的多模态推理任务,尤其是在资源有限的环境中。其动态权重调整机制可以在不依赖于强化学习的情况下,显著提升模型的推理和答案生成能力。

局限与展望

SCALe在处理极长推理段时可能仍存在一定的性能下降。该方法在某些特定任务上可能需要额外的调参。未来可以探索SCALe在其他多模态任务中的应用,以及进一步优化其在不同模型架构中的适应性。

通俗解读 非专业人士也能看懂

想象一下你在厨房里做饭。传统的方法就像是用同样的火力来煮所有的菜,不管是需要慢炖的汤还是快炒的青菜。SCALe方法就像是一种智能炉灶,它会根据不同菜肴的需求自动调整火力大小。这样一来,汤不会煮得过头,青菜也不会炒得太生。通过这种方式,SCALe确保每道菜都能达到最佳的烹饪效果。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要同时管理多个任务。传统的方法就像是给每个任务分配相同的时间,不管任务的重要性。SCALe就像是一个聪明的助手,它会根据任务的优先级自动调整时间分配。这样,你就能在有限的时间内完成所有重要的任务,取得更高的分数!这就是SCALe在视觉语言模型中所做的事情,让模型更聪明地分配注意力,取得更好的结果。

术语表

SCALe (调度课程自适应损失)

一种通过动态调整推理和答案段权重来优化模型训练的方法。

用于解决推理段和答案段不平衡的问题。

SFT (监督微调)

一种在标注数据上进行的模型微调方法。

用于建立模型的推理先验。

GRPO (群体相对策略优化)

一种强化学习方法,通过奖励答案准确性和偏好响应风格来优化模型。

用于强化模型的推理行为。

Vision-R1

一种用于多模态推理的框架,包含200K样本。

用于评估SCALe方法的有效性。

余弦调度策略

一种动态调整权重的策略,确保训练过程的平稳过渡。

用于逐步从推理段转向答案段。

开放问题 这项研究留下的未解疑问

  • 1 如何在极长推理段中保持SCALe的性能?
  • 2 SCALe在其他多模态任务中的适应性如何?
  • 3 如何进一步优化SCALe在不同模型架构中的表现?

应用场景

近期应用

多模态推理任务

SCALe适用于需要高效训练的多模态推理任务,尤其是在资源有限的环境中。

远期愿景

智能视觉语言模型

SCALe有望推动智能视觉语言模型的发展,提升其在实际应用中的表现。

原文摘要

Multimodal reasoning in vision-language models (VLMs) typically relies on a two-stage process: supervised fine-tuning (SFT) and reinforcement learning (RL). In standard SFT, all tokens contribute equally to the loss, even though reasoning data are inherently token-imbalanced. Long <think> traces overshadow short but task-critical <answer> segments, leading to verbose reasoning and inaccurate answers. We propose SCALe (Scheduled Curriculum Adaptive Loss), which explicitly separates supervision over reasoning and answer segments using dynamic, length-independent weighting. Unlike vanilla SFT, which overweights the <think> segment, SCALe-SFT gradually shifts the focus from <think> to <answer> throughout training via a cosine scheduling policy, encouraging concise and well-grounded reasoning. We evaluate SCALe across diverse benchmarks and architectures. Results show that SCALe consistently improves accuracy over vanilla SFT and matches the performance of the full two-phase SFT + GRPO pipeline while requiring only about one-seventh of the training time, making it a lightweight yet effective alternative. When combined with GRPO, SCALe achieves the best overall performance, highlighting its value both as a standalone method and as a strong foundation for reinforcement refinement.

cs.AI