Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
PNPO通过前缀归一化替代累积比率,有效缓解大模型RL中的偏离问题。
核心发现
方法论
本文提出前缀归一化策略优化(PNPO),通过替换累积重要性比率为沿前缀的几何平均,保持因果前缀依赖同时压缩log权重范围。采用长上下文数学推理实验,比较1和4轮策略更新,验证PNPO在偏离更严重时的优势。PNPO结合位置依赖门控和响应级平均,优化偏离校正效果,特别在多轮更新中表现优越。
关键结果
- 在长上下文数学推理任务中,四轮策略更新下,PNPO在三个基准测试中的平均准确率(Avg@32)达50.24%,比GSPO高3个百分点,显示出偏离补偿的显著优势。在有限更新预算下,150轮后,PNPO达到49.66%的宏平均准确率,接近600轮单轮的49.56%,验证其高效的滚动利用能力。
- 实验表明,PNPO在偏离更严重的训练环境中,能持续保持性能优势,特别是在多轮策略更新场景中表现优异。
- 与传统GSPO和GRPO相比,PNPO在训练时间和样本利用率方面表现更优,显著提升大模型RL训练的效率和效果。
研究意义
该研究突破了大规模语言模型强化学习中的偏离校正瓶颈,为多轮策略更新提供了理论基础和实证支持。PNPO通过前缀归一化,有效缓解偏离引起的梯度偏差,推动RL在复杂推理任务中的应用。其创新机制为未来大模型的高效训练和偏离缓冲策略提供新思路,有望在自动化推理、对话系统等领域实现更优性能。
技术贡献
技术上,PNPO引入前缀归一化的策略权重,将累积log比率压缩至可控范围,结合位置门控机制,兼顾偏离校正与数值稳定。方法在保持因果依赖的同时,避免累积比率带来的动态范围爆炸,为偏离缓冲提供了新颖的偏离校正工具。实验验证其在多轮偏离环境中的优越性,显著优于现有GSPO和GRPO方法。
新颖性
PNPO首次提出利用前缀几何平均替代累积比率,创新性地在保持因果前缀依赖的基础上,压缩偏离校正的数值范围。这一机制区别于传统的响应级或逐步比率,提供了偏离缓冲的全新视角,解决了偏离越深越难校正的问题,具有重要理论和实践价值。
局限性
- 实验仅在1.5B参数模型和数学推理任务上验证,泛化到更大模型或其他任务仍需验证。
- 偏离校正机制依赖特定的门控参数,可能在不同任务或模型架构中表现差异。
- 未充分探索异步采样、离线数据和训练推理不一致带来的偏离问题,未来需扩展研究范围。
未来方向
未来将探索PNPO在异步采样、经验回放和离线RL中的适应性,结合多任务、多模态场景,验证其在实际工业应用中的效果。同时,优化门控参数和归一化策略,提升偏离缓冲的鲁棒性和泛化能力。
AI 总览摘要
在大规模语言模型的强化学习训练中,自动回滚生成(rollout)是核心的计算瓶颈。传统方法通过多轮利用同一批数据,虽然降低了成本,但导致策略偏离行为政策,影响训练效果。本文提出PNPO(Prefix-Normalized Policy Optimization),通过将累积重要性比率替换为沿前缀的几何平均,有效压缩偏离校正的数值范围,保持因果前缀依赖,改善偏离补偿效果。
在长上下文数学推理任务中,作者设计了两种偏离环境(1轮和4轮策略更新),实验证明,四轮更新下,PNPO在三个基准测试中的平均准确率达50.24%,比GSPO高出3个百分点,展现出其在偏离更严重场景中的优势。进一步的实验显示,PNPO在有限的更新预算内,能以更少的样本达到接近传统方法的性能,验证了其高效的滚动利用能力。
该研究的创新点在于引入前缀归一化机制,有效缓解偏离引起的梯度偏差,为大模型RL训练提供了新工具。其潜在应用包括自动推理、对话系统等,未来可结合异步采样和经验回放,拓展到更复杂的场景,推动大模型训练的效率与效果提升。
深度分析
研究背景
近年来,随着大规模预训练模型的兴起,强化学习(RL)在提升模型对任务的适应性和生成质量方面发挥重要作用。早期工作如PPO、TRPO等通过策略梯度优化实现了较好的性能,但在大模型中,回滚生成(rollout)成本高昂,导致训练效率受限。为缓解这一问题,研究者提出多轮重用数据(如多次epoch训练),但偏离行为政策逐渐加剧,影响梯度估计的准确性。近年来,偏离校正技术如GSPO、GRPO等应运而生,试图在保持偏离校正的同时控制数值范围。尽管如此,累积比率的动态范围爆炸仍是难题,限制了偏离缓冲的效果。本文在此背景下,提出了前缀归一化策略,旨在通过压缩偏离校正的尺度,改善多轮偏离环境下的训练效果。
核心问题
核心问题在于多轮策略更新导致的偏离行为政策,造成梯度偏差和训练不稳定。传统偏离校正方法如GSPO在偏离深时效果减弱,累积比率的数值范围难以控制,影响偏离缓冲的稳定性。如何在保持因果前缀依赖的同时,有效压缩偏离校正的尺度,成为提升大模型RL训练效率的关键。解决这一问题对于实现更高效、更稳定的偏离缓冲机制具有重要意义,尤其在复杂推理任务和长上下文环境中。
核心创新
PNPO的创新在于引入前缀归一化机制,将累积比率的对数值通过几何平均进行压缩,保持因果前缀依赖的同时,控制偏离校正的数值范围。具体而言,利用位置依赖门控和响应级平均,避免累积比率的指数爆炸问题,增强偏离缓冲的稳定性。该机制区别于传统的响应级比率或全响应比率,提供了偏离校正的全新视角,有效应对多轮偏离环境中的性能退化问题。实验验证其在数学推理任务中的优越表现,彰显其理论创新和实用价值。
方法详解
- �� 以标准自回归生成模型为基础,定义状态为前缀,动作为当前生成的Token。• 引入局部比率ρt,校正当前Token的策略偏差。• 计算累积比率Ct,反映整个前缀的偏离程度。• 提出前缀归一化权重wPNt,将log Ct除以前缀长度t的倒数,压缩尺度。• 设计门控机制,根据wPNt动态调整采样接受范围。• 结合偏离优势和响应级平均,优化偏离缓冲效果。• 在长上下文数学推理任务中,采用多轮策略更新,验证PNPO在偏离环境中的表现。
实验设计
采用DeepSeek-R1-Distill-Qwen-1.5B模型,训练在DAPO-Math-17k数据集上,评估AMC 2023、AIME 2024和AIME 2025。实验设置包括每轮采样256个提示,每提示8个响应,总2048响应,最大长度分别为1024和15360。训练采用学习率10^-6,批次64,4次优化更新。比较方法包括GSPO、GRPO和PNPO,重点在于偏离环境下的性能差异。通过不同策略更新轮次(1轮和4轮)验证PNPO的效果。
通俗解读 非专业人士也能看懂
想象你在做一道复杂的数学题,每次你都用不同的方法尝试解答。有时候,你会用一种方法,得到的结果还不错,但如果你反复用同一份资料,可能会逐渐偏离正确答案。传统的方法就像每次都用同一份资料,容易偏离真实情况。而PNPO就像在每次用资料前,先把资料的内容进行调整,让偏离的程度变得更小,不会因为反复使用而偏离太远。这种调整让你在多次尝试后,仍然能找到更接近正确的答案。它的核心思想是用一种聪明的方式,压缩偏离的范围,让模型在不断学习中变得更稳健、更准确,就像用一种特殊的放大镜,让偏差变得不那么明显,从而更容易找到正确的解答。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,每次你都要做很多决定。有时候,你用的策略会偏离最好的路线,因为你不断调整。以前的方法就像每次都用同样的地图,结果偏离了正确的路线太远。PNPO就像给你一副特殊的眼镜,让你每次看地图时都能自动调整偏差,把偏离变得更小一些。这样,你每次走的路都更接近正确的方向,不会因为反复试错而偏离太远。它用一种聪明的数学方法,把偏差压缩到一个合理的范围,让你在不断尝试中变得更厉害、更准确。就像你用放大镜看东西,能看得更清楚,走得更稳,最终找到最好的路线。
术语表
Importance Sampling(重要性采样)
一种估算偏离行为策略的技术,通过调整样本权重实现偏离校正。技术上,利用比率校正策略偏差,确保梯度估计的无偏性。
本文中用于校正偏离行为策略的偏差,确保训练的稳定性。
Cumulative Importance Ratio(累积重要性比率)
沿前缀连续乘积的偏离校正因子,反映从行为策略到目标策略的整体偏离程度。
用于计算偏离校正的核心指标,但数值范围难以控制。
Prefix-Normalized Policy(前缀归一化策略)
将累积比率的对数平均化,压缩偏离尺度,同时保持因果前缀依赖。
本文提出的核心机制,用于缓解偏离校正中的数值爆炸问题。
Geometric Mean(几何平均)
一组数的乘积的n次方根,用于压缩偏离比率的尺度。
PNPO中用以替代累积比率,保持偏离校正的因果关系。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模模型(如百亿参数)中保持偏离校正的稳定性仍需验证。
- 2 多任务、多模态环境下PNPO的适应性和效果尚未充分探索。
- 3 异步采样和离线数据引入的偏离机制与PNPO的结合方式仍是未来研究方向。
应用场景
近期应用
自动推理系统
利用PNPO提升长上下文推理任务中的模型准确性,减少偏离引起的训练不稳定。
远期愿景
高效大模型训练
结合偏离缓冲和多轮策略优化,推动大模型在多任务、多场景中的快速适应和部署。
原文摘要
Autoregressive rollout generation is a major computational cost in reinforcement learning for large language models. Reusing each rollout batch for additional learner updates amortizes this cost, but later updates become increasingly off-policy as the learner departs from the behavior policy. At a token position, exact off-policy correction must account for both the current action and the probability of reaching its prefix. The cumulative importance ratio provides this correction, but its product form can produce an unwieldy dynamic range. We study Prefix-Normalized Policy Optimization (PNPO), which replaces the cumulative ratio with the geometric mean of likelihood ratios along each causal prefix, preserving causal-prefix dependence at each position while compressing the log-weight scale. In controlled long-context mathematical reasoning experiments, we induce two off-policy regimes by using one or four policy-update epochs per rollout batch. PNPO does not consistently outperform GSPO with one epoch. With four epochs, it attains the highest observed Avg@32 on each benchmark; the unweighted mean of the three independently selected benchmark peaks is 50.24, 3.00 percentage points above GSPO. Under a matched 2,400-update budget, four-epoch PNPO reaches a final macro Avg@32 of 49.66 after 150 rollout batches, comparable to the 49.56 reached after 600 batches with one epoch. These results provide preliminary evidence that PNPO can be advantageous as training moves further off-policy.