核心发现
方法论
论文提出正负提示配对与Weighted GRPO(WGRPO)。每次更新选择难但可解的q+和易但脆弱的q−,分别制造稀有成功与稀有失败。对每个提示采样G=8条回答,将正确结果赋值+1、错误结果赋值−λneg,再按组均值和标准差归一化优势,从而放大两类尾部事件。
关键结果
- 在Qwen2.5-Math-7B上,WGRPO仅用两个提示,AIME 2025 Pass@8从高方差GRPO基线的16.8提高到22.2,AMC23 Pass@64从94.0提高到97.0。
- 方法在MATH500、AIME 2025和AMC23上总体稳定,并接近使用DeepScaleR-sub的1209提示训练;在AMC23较大k值下甚至超过大规模GRPO。
- 消融显示,单独替换提示选择或单独使用WGRPO都不如二者结合,说明提示难度配对与优势重加权存在互补作用。
研究意义
研究把极低数据RLVR中的提示选择从经验性方差排序推进到机制层面:一次更新同时提供“应该做什么”和“不要做什么”的信号。它降低了随机采样造成的梯度方向不稳定,为小规模、低成本数学推理训练提供了可解释方案,也提示二元验证奖励并非只能依赖大量提示或人工标注。
技术贡献
WGRPO将二元结果映射为加权有符号结果,并进行组内标准化。若成功率p=k/G,则正确与错误优势近似分别为A+=(1−p)/√p(1−p)和A−=−p/√p(1−p),因此p≈1/G时放大成功,p≈1−1/G时放大失败。配对选择则以在线探测率匹配两种互补梯度。
新颖性
新颖性不在于首次使用GRPO或负反馈,而在于首次明确把“稀有成功”和“稀有失败”构造成同一更新中的双向教学单元。相较历史准确率方差启发式,方法直接优化信号的方向性与信息密度。
局限性
- 实验主要覆盖Qwen2.5-Math-7B及其Instruct版本和数学数据,尚不能证明对开放式生成、非确定性奖励或更大模型同样有效。
- 提示配对依赖一次在线探测及候选池;若当前策略估计偏差大、候选题过难或过易,可能出现全错或全对组,导致标准差退化。
未来方向
未来可研究动态重选q+、q−,使配对随策略变化;推广到多任务、代码验证和工具使用;同时分析λneg、G、探测预算及KL系数的理论关系,并评估更大规模模型和真实部署成本。
AI 总览摘要
可验证奖励强化学习(RLVR)让语言模型通过自动判题器学习数学推理,但在训练提示极少时,提示怎么选仍是关键难题。以往方法常按历史准确率方差挑选提示;高方差虽意味着模型表现摇摆,却不保证每次更新都包含清晰、稳定的学习方向,容易使训练受抽样噪声支配。
Pang等人提出正负提示配对和Weighted GRPO(WGRPO)。每次更新只使用两个提示:难但可解的q+,让少量正确答案成为强“应该这样做”信号;易但不完美的q−,让少量错误答案成为强“不要这样做”信号。WGRPO对每个提示采样8次,并用组归一化优势放大稀有事件:成功率为1/8时突出成功,成功率为7/8时突出失败。候选题分别来自AIME 2025和DeepScaleR-sub,通过轻量探测匹配目标成功率。
在Qwen2.5-Math-7B上,两个提示的WGRPO将AIME 2025 Pass@8从高方差GRPO的16.8提升至22.2,将AMC23 Pass@64从94.0提升至97.0,并在MATH500上保持总体优势;效果在Qwen2.5-Math-7B-Instruct上也重复出现。该结果表明,RLVR的关键不只是奖励数量,而是每个更新是否同时包含可靠正证据和稀有负证据。不过,研究规模仍集中在数学、二元验证奖励和两种7B模型,动态提示重选、跨任务泛化及探测误差影响仍待检验。
深度分析
研究背景
RLVR使用精确答案检查等确定性验证器,避免人类偏好标注和独立奖励模型。GRPO、PPO式方法改善了优势估计与优化,但极低数据场景仍依赖提示选择。LIMR证明提示集可压缩,单提示RLVR也显示方差启发式有效,却未解释哪些反馈真正驱动迁移。
核心问题
当每次只训练少量提示时,二元奖励中的有效事件很稀疏。难题可能偶尔成功,易题可能偶尔失败;若一个批次未采到这些事件,梯度方向便不稳定。历史方差只能描述波动,不能区分高价值正信号与负警告。
核心创新
- �� 正负配对:q+提供稀有成功,q−提供稀有失败。
- �� WGRPO:对二元结果加权并组归一化,自动放大尾部事件。
- �� 轻量探测:从AIME 2025和DeepScaleR-sub估计成功率,目标为1/8与7/8。
- �� 极简训练:固定两个提示,仍可接近1209提示的RLVR。
方法详解
- �� 对提示q采样G=8条回答,得到成功数k和p=k/G。
- �� 将结果映射为yi=+1(成功)或−λneg(失败)。
- �� 计算μq、σq,并令AWGRPO=(yi−μq)/(σq+εstd)乘EOS掩码。
- �� 将优势代入剪切GRPO目标,并加入βKL(πθ||πref)。
- �� 选q+使p≈1/8,选q−使p≈7/8;前者强化罕见正确轨迹,后者惩罚罕见错误轨迹。
实验设计
模型为Qwen2.5-Math-7B和Qwen2.5-Math-7B-Instruct。训练源包括AIME 2025与含1209题的DeepScaleR-sub;每步B=2、每题G=8,最多500步。基线为1209题GRPO及两个历史高方差提示GRPO。评测使用AIME 2025、AMC23、MATH500,温度0.6、最大生成3072 token,并报告Pass@k,k为1至64。
结果分析
WGRPO加易难配对稳定超过两个高方差提示的GRPO:AIME 2025 Pass@8为22.2对16.8,AMC23 Pass@64为97.0对94.0。它接近大规模1209题训练,并在AMC23大k值上超过后者。消融表明,WGRPO与配对选择需要协同,单独替换任一部分收益较弱。
应用场景
该方法适合数学解题、代码单元测试、形式证明和可执行规划等具有确定验证器的任务。工程上只需少量候选题和一次探测,适用于算力有限的模型后训练;但需保证奖励可靠、候选提示覆盖目标能力,并监控全对或全错组。
局限与展望
研究只验证了两种7B数学模型、固定两提示和二元结果。成功率随训练变化时,预先固定的q+、q−可能失配;探测预算和λneg、G、εstd也会影响稳定性。未来应进行动态配对、跨领域测试,并比较更大模型、软奖励和长期训练中的遗忘与迁移。
通俗解读 非专业人士也能看懂
把模型训练想成教学生做题。过去老师专挑“学生最不稳定”的题,但这不一定告诉学生具体该改什么。新方法每轮固定安排两道题:一道很难但偶尔能做对,学生一旦答对,老师就把这次成功当作清晰范例;另一道很简单但偶尔会做错,老师就特别指出这个错误,提醒学生以后别再犯。
每道题让学生尝试8次。难题中少数正确答案被放大,告诉学生“这条思路值得保留”;简单题中少数错误答案也被放大,告诉学生“这个漏洞必须避免”。这样一轮课同时有表扬和纠错,而不是只有模糊的分数波动。
实验中,这种方法只用两道训练题,却让Qwen2.5-Math-7B在AIME 2025的8次尝试成功率指标从16.8提高到22.2,在AMC23的64次指标从94.0升到97.0。核心不是题目越多越好,而是每轮都选到能提供清楚教训的题。
简单解释 像给14岁少年讲一样
想象你在玩数学闯关游戏。老师想让AI变强,但手里只有两张练习卡。第一张特别难,不过AI偶尔能过关;第二张很简单,但AI偶尔会翻车。新方法不把这些偶然情况忽略,反而把它们当成最有价值的提示:难题答对时,告诉AI“记住这条路线”;简单题答错时,告诉AI“这个坑千万别踩”。
每张卡让AI尝试8次,再比较同一张卡上的结果。如果难题只有1次答对,这次成功就会得到特别强的鼓励;如果简单题有7次答对、1次答错,那次失败就会受到特别强的提醒。这样训练既教“怎么做”,也教“别怎么做”。
论文把这个算法叫Weighted GRPO,意思是给不同结果加上合适的重量,再更新模型。它只用两个提示,却让Qwen2.5-Math-7B的AIME 2025 Pass@8从16.8升到22.2,AMC23 Pass@64从94.0升到97.0!当然,它目前主要在数学题上测试,未来还要看看代码和其他任务是否一样有效。
术语表
RLVR(Reinforcement Learning with Verifiable Rewards)
利用自动验证器提供奖励的强化学习。数学题中通常按最终答案是否正确给出0/1奖励。
论文的整体训练范式。
GRPO(Group Relative Policy Optimization)
对同一提示生成一组回答,并用组内相对奖励构造优势的策略优化算法。
WGRPO所改进的基础算法。
WGRPO(Weighted GRPO)
先把成功和失败映射为加权有符号结果,再进行组归一化的GRPO。它能放大稀有成功或失败。
论文提出的核心优化方法。
正负提示配对
同时选择难但可解的正提示和易但脆弱的负提示。前者提供正向范例,后者提供负向警告。
每次更新的提示选择策略。
Pass@k
从k次生成中至少得到一个正确答案的概率估计。k越大,越能衡量模型探索潜在解的能力。
AIME、AMC23和MATH500的评测指标。
开放问题 这项研究留下的未解疑问
- 1 动态配对仍未解决:固定提示在策略变强后可能不再处于1/8或7/8成功率区间,需要在线重选机制。
- 2 跨任务泛化未知:代码、证明或软验证器的奖励结构可能不同,稀有事件优势是否仍保持同样的解析形式尚待研究。
应用场景
近期应用
数学推理后训练
模型团队可从难题和易题池中进行一次探测,选出成功率约1/8与7/8的提示,再用G=8的WGRPO训练。它适合低算力实验,并可用Pass@k直接验证收益。
可验证代码生成
将单元测试通过视为成功、失败视为负反馈,构造复杂但偶尔通过和简单但偶尔失败的代码任务。前提是测试可靠,且错误轨迹能被安全识别。
远期愿景
自适应能力课程
未来模型可持续监测提示成功率,动态替换正负提示,形成随能力变化的自动课程学习系统,减少大规模标注数据,同时保持探索与纠错平衡。
原文摘要
Reinforcement learning with verifiable rewards (RLVR) is effective for training large language models on deterministic outcome reasoning tasks. Prior work shows RLVR works with few prompts, but prompt selection is often based only on training-accuracy variance, leading to unstable optimization directions and weaker transfer. We revisit prompt selection from a mechanism-level view and argue that an effective minibatch should provide both (i) a reliable positive anchor and (ii) explicit negative learning signals from rare failures. Based on this principle, we propose \emph{positive--negative pairing}: at each update, we sample a hard-but-solvable $q^{+}$ and an easy-but-brittle prompt $q^{-}$(high success rate but not perfect), characterized by low and high empirical success rates under multiple rollouts. We further introduce Weighted GRPO, which reweights binary outcomes at the pair level and uses group-normalized advantages to amplify rare successes on $q^{+}$ into sharp positive guidance while turning rare failures on $q^{-}$ into strong negative penalties. This bidirectional signal provides informative learning feedback for both successes and failures, improving sample efficiency without suppressing exploration. On Qwen2.5-Math-7B, a single paired minibatch per update consistently outperforms a GRPO baseline that selects two prompts via commonly used variance-based selection heuristics: AIME~2025 Pass@8 improves from 16.8 to 22.2, and AMC23 Pass@64 from 94.0 to 97.0, while remaining competitive with large-scale RLVR trained from a pool of 1209 training prompts. Similar gains are observed on Qwen2.5-Math-7B-Instruct.