Spurious Advantage Hidden in GRPO

TL;DR

提出SIGNBALANCE,解决GRPO中猜测带来的虚假优势,提升数学和搜索任务表现。

cs.AI 🔴 高级 2026-09-04 23 次浏览
Jiamian Wang Samyadeep Basu Koustava Goswami Tong Yu Zhiqiang Tao
强化学习 策略优化 优势估计 任务结构 模型泛化

核心发现

方法论

本文分析了GRPO优势估计器中的虚假优势现象,发现其在有限答案集、隐藏有限子集的开放答案任务以及多轮搜索中易被误导。提出SIGNBALANCE,通过保持验证符号、引入全局尺度和逐类停止梯度重标,消除依赖于组内组成的偏差。该方法无需外部模型,参数自由,兼容PPO框架。实验证明在数学推理和搜索任务中,SIGNBALANCE在不同模型规模上均优于传统GRPO,特别是在有限答案和搜索路径多样性场景中表现显著提升。

关键结果

  • 在数学推理任务中,SIGNBALANCE在SAT-Math和AQuA上分别提升6.26%和5.90%的准确率,超越GRPO。多轮搜索任务中,SIGNBALANCE在6个QA基准中平均提升1.2个百分点,表现稳定。不同模型规模(0.5B至3B)均实现性能增长,验证了其泛化能力。
  • 实验证明,虚假优势在有限答案和猜测场景中尤为明显,SIGNBALANCE通过抑制组内偏差,有效减少了猜测行为的引导作用,提升了推理质量和模型稳定性。
  • 消融分析显示,逐类停止梯度和全局尺度调整是关键技术,显著改善了优势估计的偏差问题,增强了模型对真实推理的学习能力。

研究意义

该研究揭示了强化学习中优势估计器的潜在偏差,特别是在结构复杂、答案有限的任务中。提出的SIGNBALANCE为提升模型推理能力提供了新的技术路径,具有重要的理论价值和实际应用潜力,有望推动大规模语言模型在数学推理和搜索任务中的性能突破,解决现有方法中因猜测引入的误导问题。

技术贡献

技术创新在于设计了不依赖组内组成的优势估计器,结合符号保持、全局尺度和逐类停止梯度机制,有效抑制虚假优势。该方法兼容PPO框架,无需外部模型,参数自由,提升了优势估计的鲁棒性和泛化能力。理论分析和实证验证共同证明其在有限答案和多路径搜索中的优越性,为强化学习中的优势估计提供了新思路。

新颖性

本研究首次系统性揭示了GRPO优势估计中的虚假优势问题,提出了结构无关的SIGNBALANCE方法,突破了传统基于组内组成的限制。相较于以往仅关注奖励归一化或采样策略的研究,创新在于从根本上解决偏差问题,提升推理质量和模型稳定性。

局限性

  • SIGNBALANCE在极端多路径搜索或极端不平衡组内分布中可能仍存在偏差,需进一步优化。其在超大规模模型和复杂任务中的表现仍需验证,可能面临计算成本和调参难题。
  • 方法假设验证符号准确,若验证器不可靠,效果可能受影响。未来需结合更鲁棒的验证机制,增强适应性。
  • 当前未考虑动态任务结构变化,未来应研究自适应调整策略以应对不同任务场景。

未来方向

未来将探索SIGNBALANCE在更复杂、多模态任务中的适应性,结合自监督信号进一步提升优势估计的鲁棒性。同时,计划结合强化学习与推理模型,优化多路径搜索中的偏差控制,推动大规模模型在推理任务中的应用突破。

AI 总览摘要

本研究深入分析了Group Relative Policy Optimization(GRPO)在强化学习中的优势估计偏差问题,特别是虚假优势现象。传统的GRPO优势估计器在有限答案集、隐藏有限子集的开放答案任务以及多轮搜索中,容易被猜测行为误导,赋予错误的高奖励,从而引导模型偏离有效推理路径。为解决这一问题,作者提出了SIGNBALANCE,一种结构无关的优势估计方法,通过保持验证符号、引入全局尺度和逐类停止梯度机制,有效抑制了组内组成对优势估计的依赖。实验证明,SIGNBALANCE在数学推理和搜索任务中,显著优于传统GRPO,尤其在有限答案和多路径搜索场景中表现出更强的鲁棒性和泛化能力。该方法无需外部模型,参数自由,兼容现有强化学习框架,为大规模语言模型的推理能力提升提供了新思路。研究不仅揭示了偏差的根源,也为未来强化学习中的优势估计提供了理论基础和工程实践方案,具有重要的学术价值和应用前景。未来工作将聚焦于多模态任务和动态场景,进一步优化偏差控制机制,推动模型在复杂推理中的应用突破。

深度分析

研究背景

近年来,强化学习在大规模语言模型中的应用不断深化,特别是在推理任务中,优势估计器成为关键技术之一。GRPO作为一种高效的策略优化方法,通过组内奖励标准化,提升了模型在数学推理和问答任务中的表现。代表性工作如Shao等(2024)提出的GRPO在开放式数学推理中取得了显著成功,但其优势估计器存在潜在偏差,尤其在有限答案集和多路径搜索中,模型容易被猜测行为误导。这一问题的根源在于优势估计器依赖于组内组成,导致偶然猜测的高奖励被放大,影响模型的推理质量。尽管已有多种改进策略,但偏差问题仍未得到根本解决,限制了模型在复杂任务中的表现。理解和解决这一偏差,成为推动强化学习在推理任务中实现更高性能的关键。

核心问题

核心问题在于GRPO优势估计器中的虚假优势,尤其在有限答案和多路径搜索场景中,模型可能通过猜测获得高奖励,误导学习方向。这种偏差源于优势估计器对组内组成的依赖,导致偶然猜测的奖励被放大,影响模型的推理能力和稳定性。该问题在实际应用中表现为模型在有限答案任务中偏向猜测行为,难以学习到真正的推理策略,限制了模型的泛化和鲁棒性。解决这一偏差,成为提升模型推理能力和稳定性的关键。

核心创新

创新在于提出SIGNBALANCE,一种结构无关的优势估计方法,核心在于:• 保持验证符号,确保奖励方向一致;• 引入全局尺度,消除组内组成依赖;• 采用逐类停止梯度,平衡正负类的力量。该方法无需外部模型或复杂调参,直接替换传统优势估计器,有效抑制虚假优势。其设计理念突破了以往依赖组内统计的限制,为强化学习中的优势估计提供了新思路。实验证明,在数学推理和搜索任务中,SIGNBALANCE显著改善模型表现,特别是在有限答案和多路径搜索中,表现出更强的鲁棒性和泛化能力。

方法详解

  • �� 以GRPO为基础,分析优势估计器的偏差机制。• 发现组内组成(n+, n−)对优势估计的影响,尤其在有限答案和多路径搜索中。• 设计SIGNBALANCE:• 逐类归一化,消除组内组成偏差;• 转换为符号尺度,抑制组内偏差影响;• 采用逐类停止梯度,平衡正负类力量。• 该方法在保持PPO框架的同时,避免了偏差引入,参数自由。• 通过在数学推理和搜索任务中的广泛实验验证其有效性。• 实验中采用G=16的组数,比较不同模型(0.5B至3B)在多个基准上的表现,验证其泛化能力和鲁棒性。

实验设计

  • �� 采用Qwen2.5-0.5B和3B模型,训练在MATH数据集(约7500题),包括开答和有限答案任务。• 评估指标为准确率,比较GRPO、变体和SIGNBALANCE。• 在数学推理(GSM8K、MATH-500)和搜索问答(NQ、TriviaQA)上进行测试。• 实验设置保持一致,确保公平对比。• 通过消融实验验证逐类停止梯度和全局尺度的重要性。• 在不同模型规模和任务类型中,验证方法的稳定性和泛化能力。

结果分析

  • �� SIGNBALANCE在有限答案任务中提升显著,例如SAT-Math提升6.26%,AQuA提升5.90%。• 在多轮搜索任务中,平均提升1.2个百分点,表现稳定。• 在不同模型规模(0.5B到3B)上,均实现性能增长,验证其泛化能力。• 实验显示虚假优势在有限答案和猜测场景中尤为明显,SIGNBALANCE有效抑制偏差,提升推理质量。• 消融分析确认,逐类停止梯度和全局尺度是关键技术,显著改善优势估计偏差。

应用场景

  • �� 立即应用于数学推理、问答系统和搜索引擎,提升模型在有限答案和多路径搜索中的表现。• 未来可结合多模态任务,增强模型在复杂场景中的推理能力。• 该技术可用于提升大规模语言模型的推理稳定性和泛化能力,推动AI在教育、科研等领域的应用。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们需要判断每个产品是否合格。传统的方法是根据每个工人的判断来决定,但有时候,工人可能只是猜测,没有真正检查。这就像GRPO的优势估计器,有时候会把猜测得到的“好”产品当成是真的,误导工厂的决策。作者发现这个问题后,设计了一个新方法,像是让每个工人都用相同的标准,不再依赖他们的猜测,而是用一种公平的衡量方式。这样,工厂的判断就更准确了,不会被偶然的猜测误导。这个新方法让工厂能更好地筛选出真正合格的产品,也能更快找到问题所在。它的核心思想就是让每个判断都用统一的尺度,避免偏差,确保决策的公正和可靠。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个猜谜游戏,老师给你很多题目,但你可以随便猜答案。以前的系统就像是老师会奖励你猜得越快越多的答案,不管你是不是真正理解了题目。有时候,你可能只是随便猜对了,但系统还是会给你高分,让你觉得自己很厉害。可是,这样一来,你就会开始依赖猜测,而不是学会真正的思考。现在,科学家们发现了这个问题,并设计了一个新方法,就像是老师告诉你:每次猜答案时,要用一样的标准,不管你猜对了还是错的,都要用同样的尺度来衡量。这样,你就不会被偶然猜对的答案误导,反而会真正学会推理和思考。这个新方法帮助模型更聪明,不再被随机猜测蒙蔽,能更好地理解问题,做出正确的答案。

术语表

优势估计器 (Advantage Estimator)

在强化学习中,用于衡量某个行为相对于平均水平的优劣程度。技术上,它计算奖励与基准的差值,用以指导策略优化。

本文分析了GRPO中的优势估计器偏差问题,提出了结构无关的SIGNBALANCE方法。

虚假优势 (Spurious Advantage)

指模型在没有真正推理的情况下,通过猜测获得的高奖励,误导学习方向。它是优势估计中的偏差源之一。

论文揭示虚假优势在有限答案和搜索路径多样性中尤为突出。

组内组成 (Within-group Composition)

指在优势估计中,某一组(如一批推理路径)中正确与错误行为的比例。传统方法依赖此比例进行奖励归一化。

SIGNBALANCE通过消除对组内组成的依赖,抑制虚假优势。

逐类停止梯度 (Stop-gradient per-class)

在训练中,将某些变量的梯度阻断,避免其影响参数更新,从而控制偏差。

SIGNBALANCE采用此技术平衡正负类的力量,减少偏差。

全局尺度 (Global Scale)

在优势估计中引入的统一尺度参数,用于替代组内统计,确保奖励不依赖于组内组成。

此机制是SIGNBALANCE的重要创新点。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端多路径或极端不平衡的任务中进一步抑制虚假优势,仍需深入研究。当前方法在复杂场景下的适应性和鲁棒性有待验证,特别是在超大模型和多模态任务中,偏差控制机制的效果尚未充分评估。
  • 2 验证器的符号准确性对优势估计的影响较大,若验证器不可靠,SIGNBALANCE的效果可能受限。未来需设计更鲁棒的验证机制,确保偏差抑制的有效性。
  • 3 动态任务结构变化和环境适应性问题未被充分考虑,未来应研究自适应调整策略,以应对不同任务场景的需求。

应用场景

近期应用

数学推理模型优化

可直接应用于数学推理模型,提升模型在有限答案和多路径搜索中的推理准确性,减少猜测偏差,增强模型稳定性。

问答系统改进

在问答系统中引入SIGNBALANCE,有助于提升模型在复杂、多轮搜索中的表现,特别是在有限答案空间和多路径探索场景。

远期愿景

大规模推理模型的鲁棒性提升

未来结合多模态信息和自监督信号,打造更鲁棒的推理模型,突破偏差限制,实现更高水平的自动推理和决策能力。

原文摘要

Group Relative Policy Optimization (GRPO) is widely studied for reinforcement learning with verifiable rewards, where its advantage estimator assigns each rollout a magnitude from within-group reward statistics. In the common case, this magnitude rewards rollouts that reach the correct answer through reasoning. Yet, an overlooked case shares the same surface: a rollout may land on it by guessing, and the formula still assigns a high magnitude, which we identify as the spurious advantage. This arises in three cases: bounded-answer tasks with a small candidate set; open-answer sets hosting bounded sub-cases; and search agents whose budget opens many paths to the same answer. In all three, this misleads the policy toward guess-like behaviors. We propose SIGNBALANCE, whose magnitude is composition-free: it keeps the verifier sign, uses a global scale, and restores zero-mean balance via a stop-gradient per-class rescaling. Across math and search agent benchmarks at different scales, SIGNBALANCE matches GRPO on open-answer math and improves on bounded-answer math and search agents. Code will be released.

cs.AI