On-policy Distillation with Verifiable Reward

TL;DR

OPDVR方法结合OPD和RLVR,在六个推理基准上表现优异。

cs.LG 🔴 高级 2026-08-25 2 次浏览
Wenze Lin Jiale Zhao Xitai Jiang Songde Rao Yining Li Shenzhi Wang Bingxiang He Gao Huang
强化学习 蒸馏 奖励验证 推理 机器学习

核心发现

方法论

OPDVR通过ReLU门控机制将OPD和RLVR无缝结合。首先,重新定义采样令牌OPD的隐式奖励,基于轨迹正确性应用ReLU门控机制,确保正确轨迹获得非负奖励,错误轨迹获得非正奖励,从而将蒸馏信号与任务成功对齐,同时保留教师的分布指导。此外,这一修改将采样令牌OPD转化为一种适当的RLVR方法,使其可以与任何策略梯度算法结合,如GRPO。

关键结果

  • 在六个推理基准上,OPDVR的平均准确率为49.1,超过了标准OPD的47.8。
  • 在AIME24基准上,OPDVR的准确率为36.9,超过了教师模型的36.0。
  • 在跨架构设置中,OPDVR在AMC基准上的得分为30.3,高于RLSD的28.7。

研究意义

OPDVR方法在学术界和工业界具有重要意义。它解决了RLVR和OPD各自的局限性,通过结合两者的优势,提供了更可靠的任务级正确性监督和密集的令牌级分布指导。这种方法不仅提高了推理任务的性能,还为后续研究提供了新的方向。

技术贡献

OPDVR的技术贡献在于其无缝结合了OPD和RLVR,消除了现有方法中需要权重组合或启发式切换的额外超参数。通过ReLU门控机制,OPDVR将采样令牌OPD转化为一种适当的RLVR方法,支持与现有RL算法的无缝集成,如GRPO。

新颖性

OPDVR首次将ReLU门控机制应用于OPD和RLVR的结合,解决了采样令牌OPD的奖励符号与轨迹正确性不一致的问题。与现有方法相比,OPDVR不需要额外的超参数,简化了模型训练。

局限性

  • OPDVR在某些复杂任务中可能仍面临奖励稀疏的问题,影响训练效果。
  • 在不同架构之间的迁移性能可能有所下降。

未来方向

未来的研究方向包括探索OPDVR在更大规模数据集上的表现,以及与其他RL算法的结合效果。此外,进一步优化ReLU门控机制以提高模型的泛化能力也是一个重要方向。

AI 总览摘要

在强化学习领域,RLVR和OPD是两种常用的后训练范式。RLVR提供基于任务结果的稀疏奖励,而OPD则提供密集的令牌级指导,但忽略了轨迹正确性。现有方法通常依赖于权重组合或启发式切换,增加了额外的超参数和权衡。

OPDVR通过ReLU门控机制无缝结合了OPD和RLVR,消除了额外的超参数。该方法首先基于轨迹正确性重新定义采样令牌OPD的隐式奖励,然后应用ReLU门控机制,确保正确轨迹获得非负奖励,错误轨迹获得非正奖励,从而将蒸馏信号与任务成功对齐,同时保留教师的分布指导。

实验结果表明,OPDVR在六个推理基准上表现优异,平均准确率超过了标准OPD,并在某些基准上甚至超过了教师模型。这表明OPDVR不仅提高了模型的性能,还为后续研究提供了新的方向。

深度分析

研究背景

近年来,强化学习在解决复杂推理任务方面取得了显著进展。RLVR和OPD是两种常用的后训练范式。RLVR通过基于任务结果的奖励信号直接优化模型,但奖励稀疏性导致中间步骤监督不足。OPD通过教师模型提供密集的令牌级指导,但忽略了生成响应的正确性,限制了学生模型的性能。

核心问题

RLVR和OPD各自的局限性限制了模型的性能。RLVR的奖励稀疏性导致信用分配困难,而OPD忽略了轨迹正确性,限制了学生模型的性能。如何结合两者的优势,提供可靠的任务级正确性监督和密集的令牌级分布指导,是一个亟待解决的问题。

核心创新

OPDVR通过ReLU门控机制无缝结合了OPD和RLVR。首先,基于轨迹正确性重新定义采样令牌OPD的隐式奖励,然后应用ReLU门控机制,确保正确轨迹获得非负奖励,错误轨迹获得非正奖励,从而将蒸馏信号与任务成功对齐。

方法详解

  • �� 重新定义采样令牌OPD的隐式奖励,基于轨迹正确性应用ReLU门控机制。
  • �� 确保正确轨迹获得非负奖励,错误轨迹获得非正奖励。
  • �� 将采样令牌OPD转化为一种适当的RLVR方法,支持与任何策略梯度算法结合。

实验设计

实验在六个推理基准上进行,包括AIME24、AIME25、AMC、MATH500、Minerva和OlympiadBench。使用Qwen3-4B和Qwen3-1.7B模型进行同架构和跨架构蒸馏训练,评估OPDVR与其他基线方法的性能差异。

结果分析

OPDVR在六个推理基准上表现优异,平均准确率为49.1,超过了标准OPD的47.8。在AIME24基准上,OPDVR的准确率为36.9,超过了教师模型的36.0。在跨架构设置中,OPDVR在AMC基准上的得分为30.3,高于RLSD的28.7。

应用场景

OPDVR可用于需要高精度推理的场景,如数学题解答、代码生成等。其结合OPD和RLVR的优势,提供了更可靠的任务级正确性监督和密集的令牌级分布指导。

局限与展望

OPDVR在某些复杂任务中可能仍面临奖励稀疏的问题,影响训练效果。在不同架构之间的迁移性能可能有所下降。此外,ReLU门控机制的优化空间仍需进一步探索。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。RLVR就像是根据最终菜品的味道来判断你做得好不好,但中间过程没有指导;而OPD就像是有个厨师在旁边指导你每一步,但不管你做的菜好不好吃。OPDVR结合了两者的优点,就像是厨师不仅指导你每一步,还会根据最终菜品的味道给出反馈,确保你做出的菜既好看又好吃。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,RLVR就像是你只在通关时得到分数,而OPD就像是你每一步都有提示,但不管你通没通关。OPDVR结合了两者的优点,就像是你每一步都有提示,而且通关时还有额外奖励,这样你就能更快更好地通关啦!

术语表

ReLU门控机制

一种用于确保奖励符号与轨迹正确性一致的机制。

在OPDVR中用于调整采样令牌OPD的奖励符号。

OPD

一种通过教师模型提供密集令牌级指导的蒸馏方法。

在论文中用于提供学生模型的分布指导。

RLVR

一种基于任务结果的奖励信号优化模型的方法。

在论文中用于提供任务级正确性监督。

GRPO

一种用于稳定奖励信号的策略优化方法。

在论文中与OPDVR结合使用。

采样令牌OPD

一种通过采样单个令牌来近似反向KL梯度的OPD变体。

在论文中用于与RLVR结合。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模数据集上优化OPDVR的性能?
  • 2 如何进一步提高OPDVR在不同架构之间的迁移性能?

应用场景

近期应用

数学题解答

OPDVR可用于提高数学题解答的准确性,特别是在复杂推理任务中。

远期愿景

通用人工智能

OPDVR的结合方法为实现更高效的通用人工智能提供了可能。

原文摘要

Reinforcement Learning with Verifiable Rewards (RLVR) and on-policy distillation (OPD) have become two widely adopted paradigms for post-training large language models. However, RLVR suffers from sparse task-level feedback, while OPD provides dense token-level guidance but ignores trajectory correctness, limiting its performance to that of the teacher. Combining them is a promising direction: OPD supplies dense supervisory signals, while RLVR provides task-level correctness. Nevertheless, existing integrations often rely on weighted combination or heuristic switching, introducing extra hyperparameters and trade-offs. We propose On-policy Distillation with Verifiable Reward (OPDVR), a simple yet effective method that seamlessly combines OPD and RLVR without adding any hyperparameters. We first reformulate the implicit reward of sampled-token OPD based on trajectory correctness, then apply a ReLU gating mechanism to ensure that correct trajectories receive non-negative rewards and incorrect ones receive non-positive rewards---thereby aligning the distillation signal with task success while preserving the teacher's distributional guidance. Furthermore, our modification transforms sampled-token OPD into a proper RLVR method, making it readily combinable with any policy gradient algorithm, such as GRPO. Experiments on six reasoning benchmarks show that OPDVR consistently outperforms standard OPD. Our code is available at https://github.com/LeapLabTHU/OPDVR.

cs.LG cs.AI