Blockwise Policy-Drift Gating for On-Policy Distillation

TL;DR

引入块级策略漂移门控,提升OPD在数学推理任务的通过率。

cs.LG 🔴 高级 2026-06-23 1 次浏览
Liwen Zheng Haiyun Jiang
策略漂移 知识蒸馏 数学推理 机器学习 深度学习

核心发现

方法论

本文提出了一种轻量级的学生策略漂移控制器,称为块级策略漂移门控。该方法通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块或跨度上,并使用结果的均值归一化门控来重新加权OPD位置损失。此方法不改变教师目标、教师支持或回滚策略。

关键结果

  • 在固定64-token块门控下,OPD的平均通过率从0.4978提高到0.5160,涵盖AIME24、AIME25、MATH500和AMC23。
  • 在Teacher-TopK/LSM上,Block64在四个基准测试中获得了最佳的平均通过率。
  • 实验表明,局部旧-当前策略漂移是一个实用的控制信号。

研究意义

该研究通过引入块级策略漂移门控,解决了长推理任务中OPD的不稳定性问题。通过在学生策略中引入漂移控制信号,增强了OPD的鲁棒性,特别是在数学推理任务中表现突出。这一方法为解决长期以来的OPD训练信号脆弱性提供了新的思路。

技术贡献

技术上,本文提出了一种新的策略漂移控制方法,通过块级聚合对数概率变化来加权OPD损失。这种方法与现有的OPD方法不同,它不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重。

新颖性

本文首次将块级策略漂移应用于OPD,提出了一种不依赖教师信号的漂移控制方法。与现有的OPD方法相比,该方法通过学生策略的漂移来调整损失权重,提供了一种新的视角。

局限性

  • 该方法在AIME25上的样本数量较少,结果可能不稳定。
  • 未测试异步执行、样本缓冲或刷新策略。
  • 仅在数学推理任务中验证,其他领域的适用性未知。

未来方向

未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法。此外,可以引入异步训练系统和样本刷新策略,以提高方法的适用性和鲁棒性。

AI 总览摘要

在长推理任务中,现有的OPD方法容易出现不稳定性,尤其是在学生策略偏离教师支持区域时。本文提出了一种新的块级策略漂移门控方法,通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块上,并使用结果的均值归一化门控来重新加权OPD位置损失。

实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。这一方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重,为解决长期以来的OPD训练信号脆弱性提供了新的思路。

尽管该方法在数学推理任务中表现优异,但其在其他领域的适用性尚未验证。此外,未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法,以提高方法的适用性和鲁棒性。

深度分析

研究背景

在自然语言处理领域,知识蒸馏是一种常用的方法,用于将教师模型的行为传递给更小的学生模型。然而,传统的离线蒸馏方法存在训练和测试分布不一致的问题。OPD通过在学生自身采样的轨迹上计算教师信号,解决了这一问题。然而,在长推理任务中,OPD的训练信号容易变得脆弱,尤其是在学生策略偏离教师支持区域时。

核心问题

长推理任务中的OPD容易出现不稳定性,尤其是在学生策略偏离教师支持区域时。现有的方法主要依赖于教师信号的变化,但在学生策略发生漂移时,这些方法的效果有限。因此,需要一种新的方法来控制学生策略的漂移,从而提高OPD的鲁棒性。

核心创新

本文提出了一种新的块级策略漂移门控方法,通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块上,并使用结果的均值归一化门控来重新加权OPD位置损失。这种方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重。

方法详解

  • �� 计算行为学生与当前学生在采样路径上的对数概率变化。
  • �� 将这些变化聚合在固定块上。
  • �� 使用结果的均值归一化门控来重新加权OPD位置损失。
  • �� 不改变教师目标、教师支持或回滚策略。

实验设计

实验在Qwen3数学推理基准上进行,使用固定的200步训练预算。主要使用pass@8作为问题级解决率指标。实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。

结果分析

实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。这一方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重,为解决长期以来的OPD训练信号脆弱性提供了新的思路。

应用场景

该方法在数学推理任务中表现优异,适用于需要高鲁棒性和解决率的场景。未来可以扩展到其他领域,如自然语言生成和对话系统。

局限与展望

尽管该方法在数学推理任务中表现优异,但其在其他领域的适用性尚未验证。此外,未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法,以提高方法的适用性和鲁棒性。

通俗解读 非专业人士也能看懂

想象一下,你在厨房里做饭。你有一个食谱(教师信号),但你决定根据自己的口味调整一些步骤(学生策略)。有时候,你可能偏离了食谱,导致菜肴的味道不如预期。块级策略漂移门控就像是在每个步骤后停下来,尝一尝味道,并根据需要调整下一步的调料。这种方法帮助你在不完全依赖食谱的情况下,做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你有一个指南(教师信号),但你喜欢自己探索(学生策略)。有时候,你可能会偏离指南,导致游戏失败。块级策略漂移门控就像是在每个关卡后停下来,看看你走得多远,并根据需要调整下一步的策略。这种方法帮助你在不完全依赖指南的情况下,顺利通关游戏!

术语表

策略漂移 (Policy Drift)

指学生策略在训练过程中偏离教师信号的现象。

用于衡量学生策略与教师信号的偏离程度。

知识蒸馏 (Knowledge Distillation)

一种将教师模型的行为传递给学生模型的方法。

用于训练更小的学生模型以模仿教师模型的行为。

OPD (On-Policy Distillation)

一种在学生自身采样的轨迹上计算教师信号的蒸馏方法。

用于解决训练和测试分布不一致的问题。

块级门控 (Blockwise Gating)

一种通过固定块聚合对数概率变化来加权损失的方法。

用于调整OPD损失的权重。

数学推理 (Math Reasoning)

涉及数学问题的理解和解决的过程。

用于评估模型在数学任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在其他领域应用块级策略漂移门控?
  • 2 异步训练系统中如何有效控制策略漂移?

应用场景

近期应用

数学推理任务

提高数学推理任务中的解决率和鲁棒性,适用于教育领域。

远期愿景

自然语言生成

在自然语言生成任务中应用,提高生成文本的质量和一致性。

原文摘要

On-policy distillation (OPD) trains a student policy using teacher signals computed on trajectories sampled by the student itself. Recent work shows that sampled-token OPD can be fragile on long-horizon reasoning tasks and that local teacher-support matching is a simple and effective repair. This paper introduces blockwise policy-drift gating, a lightweight student-only old-current drift controller for OPD under rollout reuse. The method computes log-probability shifts between the behavior student and the current student on the sampled token path, aggregates these shifts over fixed blocks or spans, and uses the resulting detached, mean-normalized gates to reweight OPD position losses. It does not change teacher targets, teacher top-K supports, or the rollout policy. In a six-variant Qwen3 math reasoning benchmark with a uniform 200-step training budget for all trained variants, we use pass@8 as the primary problem-level solve-rate metric. Fixed 64-token block gating improves sampled-token OPD mean pass@8 from 0.4978 to 0.5160 across AIME24, AIME25, MATH500, and AMC23. On Teacher-TopK/LSM, Block64 gives the best four-benchmark mean pass@8 among trained students. The results identify local old-current policy drift as a practical control signal for reused OPD rollouts and motivate block-level gating as a simple default for improving solve-rate robustness.

cs.LG cs.AI cs.CL