RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

TL;DR

提出RRPO,利用分层条件滚动构建对比优势,提升无验证任务的策略优化效果。

cs.LG 🔴 高级 2026-07-21 43 次浏览
Yuxin Xiong Xunyi Jiang Rohan Surana Xintong Li Sheldon Yu Nikki Lijing Kuang Ryan A. Rossi Jingbo Shang Tong Yu Julian McAuley Junda Wu
强化学习 策略优化 对比学习 弱监督 自然语言处理

核心发现

方法论

RRPO通过分层条件滚动生成正负锚点集,利用离线训练的度量投影头进行对比学习,构建参考相对的对比优势。核心在于用弱任务条件引导锚点,训练集对比损失,冻结投影头后,将对比得分标准化作为策略优势,实现无需明确验证器的策略优化。该方法结合了组内归一化、对比学习和策略梯度,适用于多任务、多模态场景。实验中,RRPO在数学推理、开放式生成和微调后表现优异,优于传统的伪目标和纯监督方法。

关键结果

  • 在GSM8K数学推理任务中,RRPO在Qwen3-1.7B模型上,Pass@1从0.746提升至0.768,超越基于验证器的Dr.GRPO的0.765,表现出与验证器方法相当甚至更优的效果。
  • 在开放式生成任务ELI5和SAMSum中,RRPO在ROUGE、BLEU等指标上优于伪目标微调,提升幅度达2-3点,显示其在无验证器环境下的稳定性和有效性。
  • 微调后,RRPO在SFT基础上继续提升,平均ROUGE指标增加1-2点,验证其作为补充策略的潜力。

研究意义

该研究突破了传统依赖验证器的限制,为策略优化提供了无需明确正确性标注的弱监督方案。其创新的对比优势构建机制,极大拓展了强化学习在复杂、多样任务中的应用范围,尤其适合自然语言生成、对话系统等领域。方法兼容多模态、多任务场景,具有广泛的实用价值,有望推动自主学习和人机交互的深度发展。

技术贡献

RRPO创新性地引入分层条件滚动生成锚点,结合离线训练的对比学习模型,构建了无需验证器的相对优势指标。其核心在于利用集对比损失训练度量投影头,冻结后在策略优化中使用标准化得分作为优势。该方法融合了组内归一化、对比学习和策略梯度,提供了理论上对比优势的稳定性保证,并在多个任务中验证了其优越性。相比传统基于验证器的强化学习方法,RRPO显著降低了对标注的依赖,提高了泛化能力。

新颖性

首次提出利用弱任务条件生成锚点,通过集对比学习构建参考相对优势,突破了无验证器环境下的策略优化瓶颈。区别于以往仅依赖任务成功/失败信号的强化学习方法,RRPO引入了基于对比的优势估计,增强了模型在多样化任务中的适应性和鲁棒性。

局限性

  • 当前方法依赖锚点生成的质量,弱条件可能导致锚点偏差,影响优势估计的准确性。
  • 对比学习模型的训练成本较高,尤其在大规模数据和多模态场景中,可能带来计算瓶颈。
  • 在极端复杂或高噪声环境中,参考相对优势可能不稳定,需进一步优化锚点构建策略。

未来方向

未来将探索自适应锚点生成机制,提高锚点的代表性和稳定性;结合多模态信息增强对比学习效果;扩展到更复杂的任务场景,如多轮对话和长文本生成,提升模型的泛化能力和鲁棒性。

AI 总览摘要

随着自然语言处理和强化学习的发展,策略优化面临着如何在缺乏明确验证信号的环境中实现有效学习的挑战。传统方法依赖于任务成功的二元标注,限制了模型在开放式任务中的应用。本文提出的RRPO方法,通过引入分层条件滚动生成锚点,结合离线训练的对比学习模型,构建了无需验证器的参考相对优势指标。该机制利用弱任务条件引导锚点,训练集对比损失确保模型在策略优化中关注相对表现。实验结果显示,RRPO在数学推理、对话总结和微调后任务中均优于传统方法,尤其在无验证器环境下表现出极强的稳健性。其创新点在于用对比优势替代绝对标注,极大拓宽了强化学习的应用场景,为未来自主学习和人机交互提供了新思路。该方法不仅在学术上具有理论创新,也为工业界提供了高效、稳健的策略优化工具,推动智能系统的自主能力提升。

深度分析

研究背景

近年来,强化学习在自然语言处理中的应用不断扩大,尤其是在策略优化方面。传统方法如REINFORCE和PPO依赖明确的奖励信号,限制了其在复杂、多样任务中的表现。Group Relative Policy Optimization(GRPO)通过在组内归一化奖励,实现了在可验证任务中的有效优化,但在开放式任务中效果有限。随着对无验证器环境的需求增加,研究者开始探索基于偏好、相对比较的强化学习方法,如RLHF和偏好学习,但仍面临如何构建稳定的优势估计的问题。现有方法多依赖于明确的成功标记或稀疏奖励,难以应对多样化、模糊的任务目标。本文在此背景下提出RRPO,旨在突破验证器依赖,利用对比学习构建相对优势,拓展策略优化的适用范围。

核心问题

核心问题在于如何在没有明确验证器或标注的情况下,实现有效的策略优化。传统方法在缺乏明确奖励信号时表现不佳,尤其在开放式任务如长文本生成、对话总结中,成功与否难以用单一标志衡量。现有偏好学习虽提供一定解决方案,但对比优势的构建仍依赖于人工标注或稀疏奖励,容易引入偏差。如何设计一种无需明确标注、能在多样任务中稳定提供优化信号的方法,成为研究难点。RRPO试图通过弱任务条件引导锚点,结合对比学习,构建一种新颖的优势估计机制,解决这一瓶颈。

核心创新

RRPO的创新点在于引入分层条件滚动生成锚点,利用弱任务条件引导生成正负样本集,避免了对标注的依赖。其核心在于离线训练的集对比模型,通过对比学习优化一个度量空间,使得模型在策略优化中可以用相对优势指标替代绝对奖励。该优势由冻结的投影头输出的对比得分标准化得到,确保了优势的稳定性和泛化能力。相比传统方法,RRPO在无验证器环境下依然能提供有效的优化信号,显著提升了多任务、多模态场景中的适应性。

方法详解

  • �� 生成锚点:利用弱任务条件,使用固定的锚点生成策略,从基础模型中采样正负滚动集。• 离线训练:用集对比损失训练投影头,使其能区分正负锚点。• 构建优势:在策略训练中冻结投影头,计算滚动与锚点的对比得分,标准化后作为优势。• 优化目标:采用类似PPO的剪切目标,利用优势调整策略参数。• 训练流程:先离线训练对比模型,再进行策略优化,确保优势的稳定性和有效性。

实验设计

在GSM8K数学推理、ELI5、SAMSum等任务上验证。使用不同模型规模(Qwen2.5-1.5B、Qwen3-1.7B、Qwen3-4B),比较基线、伪目标微调和RRPO。指标包括Pass@k、ROUGE、BLEU等。采用多轮滚动采样,锚点由弱条件生成,离线训练对比模型,策略优化中冻结投影头。通过 ablation 研究验证锚点质量、对比损失参数对性能影响。

结果分析

RRPO在GSM8K上,Qwen3-1.7B模型的Pass@1由0.746提升至0.768,优于基于验证器的Dr.GRPO(0.765);在ELI5和SAMSum中,指标提升2-3点,显示其在无验证器环境中的优势。微调后,性能持续提升,验证了优势的稳定性和有效性。

应用场景

该方法适用于多任务、多模态场景,尤其在缺乏明确验证器或标注的情况下,如长文本生成、对话系统、偏好学习等。可用于提升大规模语言模型的自主学习能力,减少对人工标注的依赖,加快模型的部署和优化速度。

局限与展望

锚点生成依赖弱条件的质量,可能引入偏差;对比模型训练成本较高,难以在超大规模数据中快速扩展;在高噪声或极端复杂任务中,优势估计可能不稳定,需进一步优化锚点策略和模型结构。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,很多菜谱都需要你按照步骤来做,但有时候你不知道哪个步骤最重要。传统的方法就像是告诉你:只要做对了就行,但如果你不知道“对”是什么意思,就很难判断。现在,有个聪明的厨师,他会观察你做菜的过程,找到一些“好”的做法和“差”的做法,然后用这些“好”和“差”作为参考。每次你做菜,他会帮你比较,告诉你哪个更接近“好”的标准。这样,即使没有明确的菜谱,也能不断改进。RRPO就像这个厨师,用弱条件生成“好”和“差”的参考,然后通过比较,帮你学会做得更好,不用依赖严格的菜谱或评分。这种方法让你在没有明确标准的情况下,也能不断提升厨艺,变得越来越厉害。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,但没有明确的得分规则。你想变得更厉害,但不知道怎么练。于是,你的哥哥告诉你:观察高手的动作,学习他们的优点,避开他们的缺点。每次你玩完后,他会帮你比较:哪个动作更像高手的表现,哪个动作还差一点。这样,你就能慢慢学会哪些行为更好,而不用依赖具体的得分。RRPO就像这个哥哥,用“高手的动作”作为参考,帮你不断改进。它不用告诉你“你赢了”或“你输了”,而是通过比较,找到更接近“高手”的行为,逐步提升你的水平。这种学习方式特别适合那些难以用简单对错判断的任务,比如写长文章、聊天对话等。

术语表

对比学习 (Contrastive Learning)

一种通过比较样本相似性或差异性,学习样本间关系的机器学习方法。技术上通过最大化正样本对的相似度、最小化负样本对的相似度实现。

RRPO中用来训练度量投影头,构建相对优势。

锚点 (Anchor)

在对比学习中用作参考的样本,用于与其他样本进行相似性比较。

RRPO中由弱任务条件生成的正负锚点集。

集对比损失 (Set-Contrastive Loss)

一种对一组样本进行对比的损失函数,鼓励正样本集比负样本集更相似。

训练投影头时使用,确保模型区分正负锚点。

策略优势 (Policy Advantage)

在强化学习中,用于衡量某个动作或轨迹相对于基准的优劣程度。

RRPO中用对比得分标准化后作为优势。

分层条件滚动 (Stratified Conditional Rollouts)

根据弱任务条件生成不同类别的轨迹,用于构建锚点集。

RRPO中用于生成正负锚点。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提高锚点生成的多样性和代表性,确保对比优势的稳定性和泛化能力。
  • 2 在极端复杂或高噪声环境中,参考相对优势的鲁棒性和适应性如何提升。

原文摘要

Group Relative Policy Optimization (GRPO) has shown strong effectiveness in reinforcement learning from verifiable feedback, where sampled rollouts can be compared within a group using task-provided correctness signals. However, extending group-relative optimization beyond verifiable settings is challenging because success in many tasks is not captured by a single correctness criterion. We propose \textbf{Reference-Relative Policy Optimization (RRPO)}, which generalizes GRPO by replacing direct correctness-based advantage construction with reference-relative contrastive comparisons. RRPO first uses \emph{stratified conditional rollouts} to construct positive and negative anchor sets, and then trains a metric projection head with a set-contrastive objective to compare candidate rollouts against these anchors. The resulting alignment scores directly define contrastive advantages: during policy optimization, the projection head is frozen, and the scores are centered within each rollout group in a standard group-relative objective. We evaluate RRPO using anchor-based contrastive advantages throughout policy optimization, without relying on task ground-truth verifiers. Across verifiable reasoning, open-ended generation, and post-SFT settings, RRPO remains competitive with verifier-based optimization, improves over weakly supervised baselines, and provides additional gains after supervised fine-tuning.

cs.LG cs.AI