Score Centering Stabilizes Off-policy Reinforcement Learning

TL;DR

得分中心化稳定了离策略强化学习,显著减少训练-推理偏差。

cs.LG 🔴 高级 2026-09-18 12 次浏览
Martin Marek Max Ryabinin
强化学习 得分中心化 训练-推理偏差 大语言模型 重要性采样

核心发现

方法论

本文提出了一种名为得分中心化的方法,通过取消训练和推理引擎之间的漂移来稳定强化学习。该方法通过在每个前缀处减去采样器的期望得分来实现得分中心化。

关键结果

  • 在Qwen3-30B-A3B-Base模型上进行的实验表明,得分中心化在严重量化条件下优于重要性采样,训练准确率提高到58%。
  • 在INTELLECT-2数据集上,得分中心化结合重要性采样在陈旧性实验中表现优于纯重要性采样基线。
  • 在合成权重噪声实验中,得分中心化在最严重的噪声下仍能稳定训练。

研究意义

该研究通过引入得分中心化方法,有效解决了强化学习中由于训练-推理偏差导致的不稳定性问题,尤其是在大规模语言模型训练中具有重要意义。它为学术界和工业界提供了一种新的稳定训练方法,减少了计算资源的浪费。

技术贡献

得分中心化提供了一种新的偏差校正方法,与现有的基于重要性采样的方法相比,它是一个确定性的加法校正项,不依赖于采样的稀有标记,从而减少了梯度方差。

新颖性

得分中心化是首次提出的偏差校正方法,与传统的基于重要性采样的方法不同,它不依赖于重要性比率,提供了一种新的偏差校正机制。

局限性

  • 得分中心化在极端陈旧性条件下的表现可能不如与重要性采样结合的版本。
  • 在某些量化设置下,得分中心化可能需要与其他校正方法结合使用以获得最佳效果。

未来方向

未来的研究方向包括探索得分中心化与其他校正方法的组合效果,以及在不同模型和数据集上的适用性。

AI 总览摘要

强化学习在大语言模型训练中至关重要,但训练和推理引擎之间的微小差异常导致不稳定性。现有方法难以完全消除这种差异,而得分中心化通过取消漂移来稳定训练。实验表明,该方法在量化和陈旧性条件下优于重要性采样,尤其是在大规模模型上表现突出。得分中心化为学术界和工业界提供了一种新的稳定训练方法,减少了计算资源的浪费。然而,该方法在极端陈旧性条件下的表现可能不如与重要性采样结合的版本,未来研究将探索其在不同模型和数据集上的适用性。

深度分析

研究背景

随着大语言模型的兴起,强化学习成为训练的重要步骤。然而,训练和推理引擎之间的微小差异,即训练-推理偏差,常导致不稳定性。现有方法如重要性采样虽能校正偏差,但增加了梯度方差。

核心问题

训练-推理偏差是由于训练和推理引擎的数值差异导致的,尤其在量化和陈旧性条件下更为严重。这种偏差会导致训练不稳定甚至奖励崩溃。

核心创新

得分中心化通过在每个前缀处减去采样器的期望得分来取消漂移,从而稳定训练。这种方法不依赖于重要性比率,减少了梯度方差。

方法详解

  • �� 计算采样器的期望得分
  • �� 在每个前缀处减去期望得分实现得分中心化
  • �� 使用得分中心化结合重要性采样进一步提高稳定性

实验设计

在Qwen3-30B-A3B-Base模型上进行实验,测试了得分中心化在量化和陈旧性条件下的表现。使用INTELLECT-2数据集进行训练,比较了不同校正方法的效果。

结果分析

得分中心化在严重量化条件下优于重要性采样,训练准确率提高到58%。在陈旧性实验中,得分中心化结合重要性采样表现优于纯重要性采样基线。

应用场景

得分中心化可用于大规模语言模型的稳定训练,减少计算资源浪费,提高训练效率。

局限与展望

得分中心化在极端陈旧性条件下的表现可能不如与重要性采样结合的版本,未来研究将探索其在不同模型和数据集上的适用性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,得分中心化就像是确保每道菜的味道一致。训练和推理引擎之间的差异就像是不同厨师的手法差异,得分中心化通过调整每道菜的调料来确保味道一致。

简单解释 像给14岁少年讲一样

想象你在玩游戏,得分中心化就像是确保每次攻击都能准确命中目标。训练和推理引擎之间的差异就像是不同武器的精准度差异,得分中心化通过调整瞄准来确保命中率。

术语表

训练-推理偏差 (Training-Inference Mismatch)

指训练和推理引擎之间的数值差异导致的偏差。

本文中,该偏差导致了强化学习的不稳定性。

得分中心化 (Score Centering)

一种通过减去采样器的期望得分来取消漂移的校正方法。

用于稳定强化学习训练。

重要性采样 (Importance Sampling)

一种通过乘以重要性比率来校正偏差的方法。

本文中,与得分中心化结合使用以提高稳定性。

量化 (Quantization)

指将模型参数和计算精度降低以减少计算资源的过程。

本文中,量化是训练-推理偏差的来源之一。

陈旧性 (Staleness)

指推理引擎更新不及时导致的偏差。

本文中,极端陈旧性条件下得分中心化结合重要性采样表现更好。

开放问题 这项研究留下的未解疑问

  • 1 得分中心化在极端陈旧性条件下的表现如何优化?
  • 2 如何在不同模型和数据集上应用得分中心化?

应用场景

近期应用

大规模语言模型训练

得分中心化可用于稳定大规模语言模型的训练,减少计算资源浪费。

远期愿景

智能系统优化

得分中心化可用于优化智能系统的训练过程,提高效率和稳定性。

原文摘要

Reinforcement learning (RL) of large language models is notoriously sensitive to small differences between training and inference engines, often referred to as the training-inference mismatch (TIM). However, completely eliminating TIM is impractical, as it would come at a major cost to rollout efficiency. In this paper, we show that the instability of RL under TIM is primarily caused by drift: a persistent bias between training and inference engines that accumulates with every training step. We derive an additive "score centering" correction term that stabilizes RL under TIM by canceling drift. When training models from 0.6B to 30B parameters, score centering alone matches or outperforms methods based on importance sampling under quantization, with the gap growing as the mismatch becomes more severe. Because the correction is additive, score centering also composes with importance sampling -- their composition outperforms pure importance-sampling baselines in our staleness experiments.

cs.LG