Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

TL;DR

提出Token可教性指标,优化On-Policy蒸馏中的关键位置选择,显著提升性能。

cs.LG 🔴 高级 2026-05-26 19 引用 59 次浏览
Yuanyi Wang Su Lu Yanggan Gu Pengkai Wang Yifan Yang Zhaoyi Yan Congkai Xie Jianmin Wu Hongxia Yang
知识蒸馏 自然语言处理 模型压缩 自适应选择 深度学习

核心发现

方法论

本文引入固定上下文诊断,通过测量教师-学生KL在相同上下文中的变化,区分可学习的偏差与不兼容偏差。提出支持感知的可教性指标(Teachability),结合教师-学生分布的局部支持关系,筛选出具有高可教性的Token位置。实验中采用Qwen2.5、Qwen3等多模型对比,验证该指标在减少Token数量的同时保持甚至超越全Token蒸馏的效果。

关键结果

  • 在Qwen3-4B到1.7B的迁移中,使用5%的Token进行TA-OPD,平均性能提升从42.37%到44.89%,在AIME24、GPQA-Diamond等任务中优于Entropy和 divergence为基础的选择策略。
  • 在跨架构蒸馏(DeepSeek-R1到Qwen2.5)中,TA-OPD在仅保留5% Token的情况下,平均提升性能约2-3个百分点,显示其在噪声多、偏差大场景中的优越性。
  • 支持性指标(support mass)与性能提升高度相关,支持teachability的筛选能有效过滤掉不支持支持的Token,避免无效或有害信号干扰。

研究意义

该研究突破了传统基于不确定性或偏差的Token选择策略,强调局部支持关系的重要性,为模型蒸馏提供了更精细的 supervision 位置筛选机制。对于大规模预训练模型的高效微调具有重要意义,尤其在有限资源或对模型性能要求极高的场景中,能显著减少标注成本和计算负担。

技术贡献

提出支持感知的可教性指标(teachability),结合局部支持关系与KL变化,定义了局部可学习偏差(learnable disagreement)与不兼容偏差(incompatible disagreement)。设计了轻量级的Token位置筛选算法(TA-OPD),无需额外奖励模型或验证器即可实现高效筛选。实验证明,该方法在多个模型和任务中均优于传统的Salience或Entropy基础策略,验证了其理论和实用价值。

新颖性

首次系统性引入局部支持关系作为Token可教性的量化指标,突破了以往只关注不确定性或偏差的单一指标框架。提出支持感知的筛选机制,强调模型局部支持的可学习性,为蒸馏中的位置选择提供了新思路。这在模型微调和知识蒸馏领域具有创新意义。

局限性

  • 当前方法主要在大规模语言模型和数学推理任务中验证,泛化到多模态、多语言或对话场景仍需验证。
  • 支持关系的计算依赖模型的概率分布,可能在极端偏离或噪声较大时表现不佳。
  • 筛选机制未考虑Token之间的交互关系,未来可结合上下文信息进行优化。

未来方向

未来将探索支持关系在多模态、多任务环境中的适应性,结合上下文信息优化筛选策略。同时,结合强化学习或自监督信号,进一步提升筛选的鲁棒性和泛化能力。此外,研究支持关系在模型压缩、迁移学习中的潜在应用,推动高效微调技术的发展。

AI 总览摘要

在大规模预训练语言模型的微调中,如何高效利用教师模型的知识成为关键问题。传统的蒸馏方法常采用全Token supervision,导致计算成本高且信息冗余。近年来,基于不确定性和偏差的Token选择策略逐渐兴起,但其本质仍未解决信号的可学习性问题。本文提出了Token可教性指标(teachability),通过固定上下文诊断,区分支持关系中的可学习偏差与不兼容偏差。实验证明,该指标在多模型、多任务场景中,能显著提升蒸馏效率,减少Token数量的同时保持甚至超越全Token蒸馏的性能。特别是在Qwen系列模型中,使用仅5%的Token进行筛选,性能提升明显,验证了局部支持关系在模型微调中的重要作用。这一方法突破了以往只关注Token不确定性或偏差的局限,为模型压缩和高效微调提供了新思路。未来,支持关系的研究有望推动多模态、多任务环境中的知识迁移和模型优化,开启模型蒸馏的新篇章。

深度分析

研究背景

近年来,预训练语言模型(如GPT、BERT)在自然语言处理领域取得巨大成功,但其庞大规模带来计算和存储挑战。知识蒸馏作为模型压缩的重要手段,通过教师-学生框架实现模型行为迁移。早期工作如Hinton等提出的软目标蒸馏,已广泛应用于模型微调。随着模型规模不断扩大,研究逐渐关注如何在保证性能的前提下,减少监督信号的冗余。Off-policy和on-policy蒸馏成为主流,后者通过模型自身生成轨迹,减少分布偏差。近期,基于不确定性和偏差的Token选择策略(如Entropy、 divergence)被提出,提升了样本效率。然而,这些方法忽视了教师信号的可学习性,导致部分Token虽高偏差但难以被模型吸收,影响最终效果。

核心问题

核心问题在于,教师模型提供的Token级别信号并非全部都具有学习价值。传统策略多关注信号的显著性(如高不确定性或偏差),但未考虑模型是否能有效吸收这些信号。部分偏差源于模型支持之外的教师分布偏移,导致无效甚至有害的监督信号。如何区分支持关系中的可学习偏差与不兼容偏差,成为提升蒸馏效率的关键。解决这一问题,有助于在有限预算下最大化知识传递效率,尤其在模型微调、迁移学习等场景中具有重要意义。

核心创新

本文的创新点在于引入局部支持关系作为Token可教性的量化指标,突破了传统只关注偏差大小的局限。提出支持感知的筛选机制(teachability),结合教师-学生分布的支持关系,筛选出局部支持良好的Token位置。设计了轻量级的支持关系指标(support mass)和可教性得分(teachability score),无需额外验证器或奖励模型即可实现高效筛选。这一机制在多模型、多任务场景中均验证有效,显著提升了蒸馏效率,减少了Token数量,同时保持甚至超越全Token蒸馏的性能。

方法详解

  • �� 采用固定上下文诊断,测量教师-学生KL在相同上下文中的变化,区分支持关系中的可学习偏差与不兼容偏差。• 定义支持关系指标(support mass),衡量教师分布在学生支持范围内的重叠程度。• 计算局部偏差(learnable disagreement)和不兼容偏差(incompatible disagreement),通过支持关系支持的偏差更易被模型吸收。• 设计轻量级Token位置筛选算法(TA-OPD),利用教师-学生概率分布,筛选出高支持感知的Token位置。• 在训练中只对筛选出的Token位置应用蒸馏损失,显著减少无效信号干扰。

实验设计

采用Qwen系列模型(Qwen3-4B、8B、14B)及跨架构蒸馏(DeepSeek-R1到Qwen2.5)作为实验对象。数据集包括数学推理(GSM8K、MATH-500)、编码、问答等多任务。对比全Token蒸馏、Entropy、 divergence等策略,评估指标为任务准确率、平均性能提升。设置不同Token预算(5%、10%、30%、50%),验证筛选效果。采用多轮实验,确保结果稳健,分析支持关系指标与性能的相关性。

结果分析

在多模型、多任务场景中,TA-OPD在仅保留5%的Token时,平均性能提升达2-3个百分点,显著优于Entropy和 divergence基础策略。支持性指标(support mass)与性能提升高度相关,筛选出支持关系良好的Token位置,避免无效信号干扰。实验证明,该方法在迁移、微调、模型压缩等场景中具有广泛适用性,尤其在偏差大、噪声多的场景表现优异。

通俗解读 非专业人士也能看懂

想象你在教一个学生做手工活,老师(教师模型)会告诉你每一步该怎么做,但不是每个步骤都同样重要。有些步骤(Token)非常关键,能帮你做得更快更好;而有些步骤虽然老师说了,但你自己也能猜到,不用特别强调。这个研究发现,老师告诉你的信息中,有些是你能学会的,有些则是你难以吸收的。通过观察哪些步骤你能真正理解和掌握,老师可以只强调那些你能学会的部分,这样既省时间,又能学得更好。就像在做菜时,厨师会告诉你哪些调料是必须的,哪些可以省略,重点在于你能吸收的关键信息。这样一来,学习变得更高效,效果也更好。

简单解释 像给14岁少年讲一样

想象你在学校学新技能,老师会给你很多练习题。有些题你一看就懂,做起来很快;有些题虽然看起来难,但其实只要掌握了关键点就能做得很好。这个研究发现,不是所有的练习题都一样重要,有些题能帮你真正学会东西,有些只是浪费时间。科学家们用一种特别的方法,找出那些你能学会、又能帮你进步的题,然后只让你做这些题。这样,你学得更快,效果也更棒。就像在玩游戏,高手会告诉你哪些技巧最重要,专注练习这些,你就能变得更厉害。这种方法让学习变得更聪明、更高效,节省时间,还能学到更多东西。

原文摘要

On-policy distillation (OPD) trains a student on its own rollouts with token-level teacher supervision. Recent selective OPD methods exploit the non-uniformity of OPD signals by prioritizing high-entropy or high-disagreement tokens. We revisit this principle and ask: which token-level teacher signals are actually learnable? Using a fixed-context diagnostic that measures same-context teacher-student KL reduction, we show that raw KL disagreement is a coarse proxy for learning value. It conflates learnable disagreement, where the teacher assigns corrective mass to the student's top-K candidates, with incompatible disagreement, where the teacher places mass mostly off the student's current support. We formalize this local compatibility as token teachability and show that it better predicts fixed-context improvement than raw KL alone. Motivated by this finding, we propose Teachability-Aware OPD (TA-OPD), a lightweight token-position selection method that applies OPD loss to high-teachability positions without reward models or verifiers. Across Qwen2.5 and Qwen 3 teacher-student settings, TA-OPD often surpasses full-token OPD with only 5% retained tokens and improves over entropy- and divergence-based baselines. Our results reframe selective OPD as selecting learnable teacher signals rather than merely salient tokens.

cs.LG

参考文献 (20)

TIP: Token Importance in On-Policy Distillation

Yuanda Xu, Hejian Sang, Zhengze Zhou 等

2026 62 引用 ⭐ 高影响力 查看解读 →

InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion

Yuanyi Wang, Zhao-Yi Yan, Yiming Zhang 等

2025 9 引用 ⭐ 高影响力 查看解读 →

Model Merging Scaling Laws in Large Language Models

Yuanyi Wang, Yanggan Gu, Yiming Zhang 等

2025 8 引用 ⭐ 高影响力 查看解读 →

LLM-Oriented Token-Adaptive Knowledge Distillation

Xurong Xie, Zhucun Xue, Jiafu Wu 等

2025 12 引用 查看解读 →

Distilling the Knowledge in a Neural Network

Geoffrey E. Hinton, O. Vinyals, J. Dean

2015 26069 引用 查看解读 →

Measuring Mathematical Problem Solving With the MATH Dataset

Dan Hendrycks, Collin Burns, Saurav Kadavath 等

2021 6390 引用 查看解读 →

On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等

2023 761 引用 查看解读 →

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

David Rein, Betty Li Hou, Asa Cooper Stickland 等

2023 3316 引用 查看解读 →

MiniPLM: Knowledge Distillation for Pre-Training Language Models

Yu-Xian Gu, Hao Zhou, Fandong Meng 等

2024 35 引用 查看解读 →

AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation

Songming Zhang, Xue Zhang, Tong Zhang 等

2025 15 引用 查看解读 →

Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

Shenzhi Wang, Le Yu, Chang Gao 等

2025 551 引用 查看解读 →

Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning

Yi-Ju Guo, Wenkai Yang, Zexu Sun 等

2025 11 引用 查看解读 →

E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring

Wenjun Wang, Yanggan Gu, Shuo Cai 等

2026 2 引用 查看解读 →

MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging

Yuanyi Wang, Yanggan Gu, Zihao Wang 等

2026 4 引用 查看解读 →

On-Policy Context Distillation for Language Models

Tianzhu Ye, Li Dong, Xun Wu 等

2026 133 引用 查看解读 →

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

Wenkai Yang, Weijie Liu, Ruobing Xie 等

2026 123 引用 查看解读 →

Entropy-Aware On-Policy Distillation of Language Models

Woogyeol Jin, Taywon Min, Yongjin Yang 等

2026 110 引用 查看解读 →

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

Yaxuan Li, Yu-Xin Zuo, Bingxiang He 等

2026 193 引用 查看解读 →

OPSDL: On-Policy Self-Distillation for Long-Context Language Models

Xin-Sen Zhang, Zhe Ding, Tian Pan 等

2026 23 引用 查看解读 →

FeatCal: Feature Calibration for Post-Merging Models

Yanggan Gu, Shuo Cai, Zihao Wang 等

2026 2 引用 查看解读 →

被引用 (19)

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

2026 ⭐ 高影响力 查看解读 →

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

2026 ⭐ 高影响力 查看解读 →

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

2026 1 引用 ⭐ 高影响力 查看解读 →

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging

Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

2026 6 引用 查看解读 →

DOPD: Dual On-policy Distillation

2026 4 引用 查看解读 →

TREK: Distill to Explore, Reinforce to Refine

From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

2026 1 引用 查看解读 →

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

2026 3 引用 查看解读 →

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

2026 1 引用 查看解读 →

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

2026 1 引用 查看解读 →

CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

2026 1 引用 查看解读 →

Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

2026 1 引用 查看解读 →

What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection

2026 1 引用 查看解读 →