Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

TL;DR

VIGOR通过奖励方差引导,提升RLVR训练效率,减少2.3×采样量。

cs.AI 🔴 高级 2026-07-24 44 次浏览
Heyang Jiang Henry Liu Baharan Mirzasoleiman
强化学习 大规模模型 样本选择 效率提升 奖励方差

核心发现

方法论

VIGOR采用奖励方差作为提示样本的优先级指标,动态调整生成轮次。通过在每轮中计算样本的奖励方差,选择最高方差的样本进行额外采样,逐步集中计算资源于最具信息量的样本。该方法基于奖励方差控制梯度幅度的理论分析,结合Pareto分布模型,推导出算法的加速比。具体实现包括:初始化少量轮次,逐轮筛选高方差样本,扩展轮次预算,最终在不增加总采样数的情况下提高训练效率。

关键结果

  • 在数学推理任务中,VIGOR用更少的轮次(最高2.3×)达到目标准确率,显著优于GRPO和其他基线。在代码任务中,VIGOR以1.49×的轮次减少达成GRPO的最终全通过率,平均测试通过率提升3.4点,验证了其在实际应用中的效率和效果。
  • 在六个数学基准测试中,VIGOR平均得分优于对比方法,尤其在Qwen2.5-3B模型上表现出最高的采样效率和性能提升。

研究意义

该研究突破了强化学习中样本采样的瓶颈,提出奖励方差引导的动态分配策略,有效缩短训练时间,提升模型性能。特别是在早期训练阶段,资源集中于最具信息的样本,极大改善了训练效率,为大规模模型的高效训练提供了理论和实践基础。这一方法不仅适用于数学推理和编码任务,也为未来大规模RL训练中的样本管理提供了新思路,推动AI系统更快、更稳地达到预期性能。

技术贡献

VIGOR引入奖励方差作为样本优先级指标,结合理论分析证明其梯度控制作用,推导出加速比公式。算法实现上,采用逐步筛选高方差样本、动态扩展轮次预算的策略,避免了传统过滤方法的额外计算负担,显著提升训练效率。该方法在理论上证明了其在Pareto分布下的指数级加速潜力,为强化学习样本调度提供了新范式。

新颖性

首次提出基于奖励方差的在线样本分配策略,结合理论分析和实际验证,超越传统静态或历史信号过滤方法。区别于以往依赖预定义难度或静态采样的技术,VIGOR动态利用训练过程中自然出现的奖励方差信号,有效集中计算资源于最具信息的样本,显著提升训练效率和模型性能。

局限性

  • 该方法依赖奖励方差的有效估计,在奖励信号噪声较大或分布偏离Pareto模型时,可能影响样本选择效果。
  • 在极端不平衡或稀疏奖励场景下,奖励方差可能不足以反映样本难度,限制算法适用性。
  • 算法在大规模模型和复杂任务中的实际效果仍需进一步验证,尤其在多任务、多模态场景下的适应性。

未来方向

未来将探索奖励方差与其他不确定性指标的结合,提升样本筛选的鲁棒性;同时,研究多任务、多模态环境下的动态样本调度策略,推动算法在更复杂场景中的应用。此外,结合元学习和自适应机制,进一步优化轮次扩展策略,实现更高效的训练流程。

AI 总览摘要

近年来,随着大规模预训练模型的广泛应用,提升其推理能力成为研究重点。强化学习与可验证奖励(RLVR)框架在此背景下崭露头角,尤其是Group Relative Policy Optimization(GRPO)算法,通过多样化采样提升训练效率。然而,GRPO依赖大量轮次生成长链推理样本,导致计算成本高昂且不稳定。本文提出VIGOR,一种基于奖励方差的动态样本分配策略,显著改善了训练效率。VIGOR在每轮中根据样本奖励的方差选择性地扩展轮次,集中资源于最具信息量的样本。理论分析表明,奖励方差控制梯度幅度,算法的加速比随着训练轮次的增加呈指数增长。实验证明,VIGOR在数学推理和编码任务中,分别以最高2.3×和1.49×的轮次节省达成目标性能,且在多个基准测试中优于现有方法。这一策略不仅降低了训练成本,也为大规模强化学习提供了新思路。未来,结合多指标和多任务场景,VIGOR有望推动AI模型的高效训练与应用普及。

深度分析

研究背景

大规模预训练模型在自然语言处理中的成功激发了对推理能力的持续追求。强化学习结合链式推理(Chain-of-Thought)技术逐步提升模型推理深度,尤其是RLVR框架,通过自动化奖励信号优化模型行为。GRPO作为一种高效的策略优化算法,通过分组相对奖励提升训练效率,但其依赖大量样本生成,带来计算瓶颈。近年来,样本筛选与动态调度策略成为研究热点,旨在减少无效样本,提升训练效率,尤其在早期训练阶段的资源配置尤为关键。

核心问题

现有的强化学习样本采样策略普遍面临样本效率低、训练成本高的问题。GRPO虽有效,但其长链推理样本生成量巨大,导致训练时间长、成本高,且在早期阶段资源分配不足时,模型难以快速收敛。如何在保证模型性能的同时,减少无效样本的生成,成为提升大规模模型训练效率的核心难题。这不仅关系到计算资源的节约,也影响模型的实际应用推广。

核心创新

VIGOR的核心创新在于:1)引入奖励方差作为样本优先级指标,动态调节轮次分配,避免无效采样;2)结合理论分析,证明奖励方差控制梯度幅度,提供指数级加速保证;3)采用逐步筛选高方差样本、扩展轮次预算的策略,有效集中计算资源。不同于传统静态采样或基于历史信号的方法,VIGOR在训练过程中实时利用奖励方差信号,提升样本利用率和训练效率。其创新点在于:理论基础扎实、算法简单高效、适应性强。

方法详解

  • �� 初始化:每个样本少量轮次,建立空轮次集。
  • �� 生成:在每轮中,针对当前样本集,采样轮次并合并奖励。
  • �� 计算:计算每个样本的奖励方差,作为信息量指标。
  • �� 筛选:保留最高方差的样本子集,扩展其轮次预算。
  • �� 迭代:重复上述步骤,逐步集中资源于最具信息的样本,直到预算用尽。
  • �� 最终:利用所有采样样本进行GRPO更新,提升训练效率。

实验设计

在数学推理和编码任务中,采用Qwen系列模型(2.5-1.5B、3B、7B)及Phi-4-Mini-Instruct,基于Hendrycks的MATH数据集和LiveCodeBench v6。对比基线包括GRPO、GRESO和RL-ZVP,评估指标为目标准确率、全通过率和平均测试通过率。超参数设定:T=4轮,初始轮次m0=2,扩展比γ=2,筛选比例α=0.5。实验验证VIGOR在不同模型规模下显著降低轮次需求,提升训练效率。

结果分析

VIGOR在数学任务中,用最高2.3×轮次节省达成目标,且在Qwen2.5-3B模型上表现出最优效率。在编码任务中,达到GRPO最终全通过率的同时,轮次减少1.49×,平均测试点提升3.4点。多项基准测试显示,VIGOR不仅节省计算资源,还提升了模型最终性能,验证其在实际训练中的优越性。

应用场景

该方法适用于大规模推理模型训练,尤其在资源有限或追求高效率的场景。可应用于自动化推理、代码生成、数学问题解决等领域,帮助研究者和企业降低成本,加快模型开发速度。未来,结合多模态数据和多任务学习,VIGOR有望推动AI系统的普及和智能化水平提升。

局限与展望

VIGOR依赖奖励方差的准确估计,在奖励信号噪声大或分布偏离假设时效果可能下降。算法在极端稀疏奖励或不平衡场景下表现有限,且在超大模型和复杂任务中的适应性仍需验证。未来需结合多指标、多任务策略,增强鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,每次准备食材都要花时间。传统做法是每次都准备很多食材,浪费很多时间和材料。而VIGOR就像厨师根据每次尝试的结果,判断哪些食材最有用,只准备那些最能提升菜肴味道的部分。它通过观察每次尝试的变化,逐步集中在最重要的食材上,节省了时间和资源。这样,厨房里的厨师可以更快做出美味的菜肴,而不用浪费在无用的步骤上。这个策略在训练AI模型时也一样,VIGOR通过奖励的变化来判断哪些训练样本最有价值,集中资源学习,从而更快更好地提升模型能力。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,每次你都试不同的策略来赢得比赛。传统的方法是每次都试很多不同的策略,不管它们是否有效,这样既花时间又浪费精力。VIGOR就像一个聪明的朋友,他会观察每次尝试的结果,发现哪些策略最容易带来胜利,然后专注于那些策略,反复练习。这样,你就能用更少的时间学会赢得比赛。用在AI训练上,VIGOR也是这样,它会观察每个训练样本带来的奖励变化,优先学习那些能带来最大提升的样本。这样,模型可以更快变得聪明,花更少的时间就能达到目标,就像你变成游戏高手一样!

原文摘要

Reinforcement learning with verifiable rewards (RLVR) has emerged as a highly effective framework for improving LLM reasoning, with methods such as GRPO among its most successful instantiations. However, GRPO relies on repeated generation of long chain-of-thought rollouts. Training time scales with the number of rollouts, a large fraction of which are uninformative. Thus, GRPO is computationally expensive and unstable. To mitigate this, existing approaches either generate a larger pool of rollouts and filter the most informative prompts, or leverage historical signals for filtering at later stages of training. These strategies offer modest performance gains, but slow down the overall process. To address this, we propose VarIance Guided Online Rollout allocation (VIGOR) which instead of allocating a fixed rollout budget per example, begins with a small number of rollouts for all examples in a batch and iteratively allocates additional rollouts to those with the highest group reward variance until a fixed total rollout budget is reached. Theoretically, we show that under RLVR, reward variance controls the gradient magnitude, and derive VIGOR's closed-form speedup ratio over GRPO, which grows with refinement rounds under Pareto-distributed reward variance. Experiments on mathematical reasoning and coding tasks show that VIGOR reaches target accuracy with up to 2.3$\times$ fewer rollouts on math, reaches GRPO's final coding full pass rate with 1.49$\times$ fewer rollouts, and improves the coding average test pass rate by 3.4 points.

cs.AI