核心发现
方法论
本文将标准的on-policy蒸馏框架重塑为一种强化学习(policy optimization)形式,利用teacher-student的对数似然比作为token奖励。基于此,提出REOPOLD框架,通过奖励剪裁、熵导向的动态采样和多阶段训练策略,缓解训练中的不稳定性。具体机制包括:利用混合分布奖励剪裁抑制极端负奖励,采用token级别的熵阈值进行信息密度采样,以及探索-精炼的多阶段训练流程。模型在数学、视觉和工具推理任务中表现优越,显著提升样本效率和推理速度。
关键结果
- REOPOLD在AIME-25数学推理任务中实现了6.7倍的样本效率提升,训练样本数明显少于传统方法。其在视觉推理任务中,7B学生模型能匹配32B教师模型性能,推理速度提升3.32倍,超越现有RL方法的性能。实验还显示,REOPOLD在训练稳定性方面优于vanilla RKL,减少梯度方差,避免负迁移问题。
- 在多种推理基准测试中,REOPOLD均优于SFT和标准蒸馏,特别是在数学和视觉任务中,准确率提升了5-10个百分点。奖励剪裁有效抑制了极端负奖励的影响,动态采样增强了高信息密度区域的学习信号,多阶段训练确保模型在探索与收敛之间取得平衡。
- 消融实验表明,奖励剪裁和熵导向采样是提升性能的关键因素,未采用多阶段训练时模型易陷入entropy collapse。整体来看,REOPOLD在保持模型多样性和稳定性的同时,大幅提高了推理能力的迁移效率。
研究意义
该研究突破了传统蒸馏在推理任务中的不稳定性瓶颈,为小模型高效学习复杂推理能力提供了新途径。通过引入强化学习的优化思想,显著提升了样本利用率和模型推理速度,为未来大规模推理模型的轻量化和高效部署奠定基础。这不仅推动了AI在数学、视觉和工具推理等领域的应用,也为模型训练中的稳定性和可扩展性提供了理论支撑,具有深远的学术和工业意义。
技术贡献
本文将标准on-policy蒸馏形式化为一种强化学习框架,利用stop-gradient机制实现奖励的固定化,降低梯度方差。提出奖励剪裁策略,有效缓解极端负奖励带来的梯度爆炸问题。引入熵导向的token采样机制,提升高信息密度区域的学习效率。多阶段训练策略平衡探索与收敛,确保模型在推理能力迁移中的稳定性。整体方法实现了样本效率的显著提升和推理速度的加快,超越了现有RL和蒸馏技术。
新颖性
首次将on-policy蒸馏系统性地与强化学习优化技术结合,提出奖励剪裁和动态采样机制,有效缓解训练中的不稳定性。不同于传统蒸馏只关注模仿,本文引入奖励机制调控学习信号,创新性地实现模型的稳定训练和高效迁移。这是将RL优化思想深度融入模型蒸馏的首次尝试,开启了推理模型训练的新思路。
局限性
- 当前方法依赖于预设的奖励剪裁阈值和熵阈值,参数敏感性可能影响泛化效果。对于极端分布或复杂任务,奖励剪裁可能抑制部分有价值的学习信号,导致模型偏差。
- 多阶段训练策略增加了训练复杂度和调参难度,实际应用中需要精细设计切换条件。模型在高噪声或极端任务中仍可能面临稳定性挑战。
- 实验主要集中在特定推理任务,泛化到其他任务和模型架构仍需验证。未来需探索自适应参数调节机制以增强鲁棒性。
未来方向
未来将结合自适应奖励调节和多任务训练,进一步提升模型的泛化能力。探索更复杂的奖励机制和多模态推理任务的适应性,推动轻量化推理模型在实际场景中的部署。还计划结合元学习策略,优化参数调节过程,减少人工调参负担,提升训练效率。
AI 总览摘要
在深度学习的推理模型训练中,如何在保证模型能力的同时实现高效稳定的训练一直是难题。传统的蒸馏方法在推理任务中常遇到不稳定和负迁移的问题,尤其是在模型容量有限的情况下。本文提出的REOPOLD框架,通过将标准的on-policy蒸馏转化为一种强化学习策略,利用log-likelihood比作为token奖励,有效缓解了训练中的不稳定性。核心机制包括奖励剪裁,抑制极端负奖励带来的梯度爆炸;熵导向的动态采样,聚焦于高信息密度区域;以及多阶段训练策略,平衡探索与收敛。这些创新使得模型在数学、视觉和工具推理任务中表现出色,不仅提高了样本效率,还实现了推理速度的显著提升。实验结果显示,REOPOLD在AIME-25数学推理任务中达到了6.7倍的样本效率提升,7B学生模型能匹配32B教师模型的性能,推理速度提升3.32倍。该方法为轻量化推理模型的高效训练提供了新思路,具有广泛的学术和工业应用潜力。未来,结合自适应参数调节和多任务训练,将进一步推动推理模型的稳定性和泛化能力。
深度解读
原文摘要
On-policy distillation is pivotal for transferring reasoning capabilities to capacity-constrained models, yet remains prone to instability and negative transfer. We show that on-policy distillation can be interpreted, both theoretically and empirically, as a form of policy optimization, where the teacher-student log-likelihood ratio acts as a token reward. From this insight, we introduce REOPOLD (Relaxed On-Policy Distillation) a framework that stabilizes optimization by relaxing the strict imitation constraints of standard on-policy distillation. Specifically, REOPOLD temperately and selectively leverages rewards from the teacher through mixture-based reward clipping, entropy-based token-level dynamic sampling, and a unified exploration-to-refinement training strategy. Empirically, REOPOLD surpasses its baselines with superior sample efficiency during training and enhanced test-time scaling at inference, across mathematical, visual, and agentic tool-use reasoning tasks. Specifically, REOPOLD outperforms recent RL approaches achieving 6.7~12x greater sample efficiency and enables a 7B student to match a 32B teacher in visual reasoning with a ~3.32x inference speedup.