核心发现
方法论
本文提出了一种轻量级的学生策略漂移控制器,称为块级策略漂移门控。该方法通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块或跨度上,并使用结果的均值归一化门控来重新加权OPD位置损失。此方法不改变教师目标、教师支持或回滚策略。
关键结果
- 在固定64-token块门控下,OPD的平均通过率从0.4978提高到0.5160,涵盖AIME24、AIME25、MATH500和AMC23。
- 在Teacher-TopK/LSM上,Block64在四个基准测试中获得了最佳的平均通过率。
- 实验表明,局部旧-当前策略漂移是一个实用的控制信号。
研究意义
该研究通过引入块级策略漂移门控,解决了长推理任务中OPD的不稳定性问题。通过在学生策略中引入漂移控制信号,增强了OPD的鲁棒性,特别是在数学推理任务中表现突出。这一方法为解决长期以来的OPD训练信号脆弱性提供了新的思路。
技术贡献
技术上,本文提出了一种新的策略漂移控制方法,通过块级聚合对数概率变化来加权OPD损失。这种方法与现有的OPD方法不同,它不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重。
新颖性
本文首次将块级策略漂移应用于OPD,提出了一种不依赖教师信号的漂移控制方法。与现有的OPD方法相比,该方法通过学生策略的漂移来调整损失权重,提供了一种新的视角。
局限性
- 该方法在AIME25上的样本数量较少,结果可能不稳定。
- 未测试异步执行、样本缓冲或刷新策略。
- 仅在数学推理任务中验证,其他领域的适用性未知。
未来方向
未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法。此外,可以引入异步训练系统和样本刷新策略,以提高方法的适用性和鲁棒性。
AI 总览摘要
在长推理任务中,现有的OPD方法容易出现不稳定性,尤其是在学生策略偏离教师支持区域时。本文提出了一种新的块级策略漂移门控方法,通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块上,并使用结果的均值归一化门控来重新加权OPD位置损失。
实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。这一方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重,为解决长期以来的OPD训练信号脆弱性提供了新的思路。
尽管该方法在数学推理任务中表现优异,但其在其他领域的适用性尚未验证。此外,未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法,以提高方法的适用性和鲁棒性。
深度分析
研究背景
在自然语言处理领域,知识蒸馏是一种常用的方法,用于将教师模型的行为传递给更小的学生模型。然而,传统的离线蒸馏方法存在训练和测试分布不一致的问题。OPD通过在学生自身采样的轨迹上计算教师信号,解决了这一问题。然而,在长推理任务中,OPD的训练信号容易变得脆弱,尤其是在学生策略偏离教师支持区域时。
核心问题
长推理任务中的OPD容易出现不稳定性,尤其是在学生策略偏离教师支持区域时。现有的方法主要依赖于教师信号的变化,但在学生策略发生漂移时,这些方法的效果有限。因此,需要一种新的方法来控制学生策略的漂移,从而提高OPD的鲁棒性。
核心创新
本文提出了一种新的块级策略漂移门控方法,通过计算行为学生与当前学生在采样路径上的对数概率变化,将这些变化聚合在固定块上,并使用结果的均值归一化门控来重新加权OPD位置损失。这种方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重。
方法详解
- �� 计算行为学生与当前学生在采样路径上的对数概率变化。
- �� 将这些变化聚合在固定块上。
- �� 使用结果的均值归一化门控来重新加权OPD位置损失。
- �� 不改变教师目标、教师支持或回滚策略。
实验设计
实验在Qwen3数学推理基准上进行,使用固定的200步训练预算。主要使用pass@8作为问题级解决率指标。实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。
结果分析
实验结果表明,固定64-token块门控显著提高了OPD的平均通过率,尤其是在数学推理任务中表现突出。这一方法不依赖于教师信号的变化,而是通过学生策略的漂移来调整损失权重,为解决长期以来的OPD训练信号脆弱性提供了新的思路。
应用场景
该方法在数学推理任务中表现优异,适用于需要高鲁棒性和解决率的场景。未来可以扩展到其他领域,如自然语言生成和对话系统。
局限与展望
尽管该方法在数学推理任务中表现优异,但其在其他领域的适用性尚未验证。此外,未来研究可以扩展到其他模型和数据集,测试不同的块大小和漂移统计方法,以提高方法的适用性和鲁棒性。
通俗解读 非专业人士也能看懂
想象一下,你在厨房里做饭。你有一个食谱(教师信号),但你决定根据自己的口味调整一些步骤(学生策略)。有时候,你可能偏离了食谱,导致菜肴的味道不如预期。块级策略漂移门控就像是在每个步骤后停下来,尝一尝味道,并根据需要调整下一步的调料。这种方法帮助你在不完全依赖食谱的情况下,做出美味的菜肴。
简单解释 像给14岁少年讲一样
想象一下你在玩一个游戏,你有一个指南(教师信号),但你喜欢自己探索(学生策略)。有时候,你可能会偏离指南,导致游戏失败。块级策略漂移门控就像是在每个关卡后停下来,看看你走得多远,并根据需要调整下一步的策略。这种方法帮助你在不完全依赖指南的情况下,顺利通关游戏!
术语表
策略漂移 (Policy Drift)
指学生策略在训练过程中偏离教师信号的现象。
用于衡量学生策略与教师信号的偏离程度。
知识蒸馏 (Knowledge Distillation)
一种将教师模型的行为传递给学生模型的方法。
用于训练更小的学生模型以模仿教师模型的行为。
OPD (On-Policy Distillation)
一种在学生自身采样的轨迹上计算教师信号的蒸馏方法。
用于解决训练和测试分布不一致的问题。
块级门控 (Blockwise Gating)
一种通过固定块聚合对数概率变化来加权损失的方法。
用于调整OPD损失的权重。
数学推理 (Math Reasoning)
涉及数学问题的理解和解决的过程。
用于评估模型在数学任务中的表现。
开放问题 这项研究留下的未解疑问
- 1 如何在其他领域应用块级策略漂移门控?
- 2 异步训练系统中如何有效控制策略漂移?
应用场景
近期应用
数学推理任务
提高数学推理任务中的解决率和鲁棒性,适用于教育领域。
远期愿景
自然语言生成
在自然语言生成任务中应用,提高生成文本的质量和一致性。
原文摘要
On-policy distillation (OPD) trains a student policy using teacher signals computed on trajectories sampled by the student itself. Recent work shows that sampled-token OPD can be fragile on long-horizon reasoning tasks and that local teacher-support matching is a simple and effective repair. This paper introduces blockwise policy-drift gating, a lightweight student-only old-current drift controller for OPD under rollout reuse. The method computes log-probability shifts between the behavior student and the current student on the sampled token path, aggregates these shifts over fixed blocks or spans, and uses the resulting detached, mean-normalized gates to reweight OPD position losses. It does not change teacher targets, teacher top-K supports, or the rollout policy. In a six-variant Qwen3 math reasoning benchmark with a uniform 200-step training budget for all trained variants, we use pass@8 as the primary problem-level solve-rate metric. Fixed 64-token block gating improves sampled-token OPD mean pass@8 from 0.4978 to 0.5160 across AIME24, AIME25, MATH500, and AMC23. On Teacher-TopK/LSM, Block64 gives the best four-benchmark mean pass@8 among trained students. The results identify local old-current policy drift as a practical control signal for reused OPD rollouts and motivate block-level gating as a simple default for improving solve-rate robustness.