Mismatch Matters: On-Policy Distillation Beyond Token Agreement

TL;DR

提出TIDE方法,通过偏离匹配修正学生-教师错配,显著提升大模型蒸馏效果,Avg@8从6.9%提升至20.3%。

cs.AI 🔴 高级 2026-08-11 93 次浏览
Zichao Yu Chengzhi Yu Shengze Xu Yujin Han Bingqing Jiang Xu Wang Difan Zou
深度学习 模型蒸馏 大语言模型 错配修正 算法创新

核心发现

方法论

本文提出TIDE(Token-level Independent Deficit–Excess correction)方法,旨在解决在on-policy蒸馏中出现的“退化一致性”问题。研究发现,学生模型在生成过程中会出现两类错配:学生过剩(student-excess)和学生不足(student-deficit)错配。TIDE通过引入有界的Hellinger变换抑制学生过剩的极端偏差,并利用解析的teacher top-K注入机制,补充学生模型中缺失的教师偏好概率,从而实现更稳定和高效的蒸馏训练。具体而言,方法包括:• 利用分位数筛选出学生过剩的极端样本,应用Hellinger形状变换进行有界抑制;• 通过分析教师的top-K支持集,识别学生未覆盖的关键候选项,并用解析的top-K注入机制补充其概率质量。实验在多个数学推理任务中,采用Qwen3作为教师-学生对,结果显示TIDE在平均@8指标上持续优于传统OPD和近期的token选择、奖励塑形方法,尤其在强错配场景下,提升幅度显著,Avg@8从6.9%提升至20.3%,响应长度缩短3.6倍,格式错误率大幅降低。

关键结果

  • 在多项数学推理基准测试中,TIDE在Qwen3-8B模型上实现了平均@8从6.9%提升到20.3%的显著改善,表现优于基线OPD和其他token筛选方法。实验还显示,TIDE在应对强错配场景时,响应长度平均缩短了3.6倍,有效避免了生成过程中的长度膨胀问题。此外,TIDE显著减少了格式错误和无关内容,提升了生成的质量和可靠性。
  • 在教师-学生错配分析中,TIDE成功识别出学生过剩和不足的错配类型,分别通过有界抑制和解析注入机制进行修正,验证了其在不同任务中的适应性和鲁棒性。 Ablation实验表明,单独使用Hellinger抑制或top-K补充都无法达到TIDE的整体效果,二者结合才实现了最优性能。
  • 在不同的推理任务和模型规模下,TIDE均表现出优越的适应性,尤其在应对教师-学生错配严重的场景中,提升幅度更为明显。其在数学推理、逻辑推断等复杂任务中的优异表现,验证了其在实际应用中的潜力和推广价值。

研究意义

该研究突破了传统模型蒸馏中只关注一致性的问题,提出错配方向的修正机制,有效缓解了“退化一致性”带来的训练瓶颈。TIDE的引入不仅提升了模型的推理能力和生成质量,还降低了训练过程中的不稳定性和格式错误率,为大规模语言模型的高效训练提供了新的技术路径。这一方法的成功应用,标志着模型蒸馏从单纯追求token一致性,向更深层次的错配理解和修正迈出了重要一步,具有重要的理论价值和实际意义。

技术贡献

本文的核心技术创新在于:• 提出基于Hellinger变换的有界抑制机制,有效控制学生过剩错配带来的梯度爆炸问题;• 设计解析的top-K注入策略,弥补学生模型在教师偏好概率上的不足,避免采样稀疏带来的信息缺失;• 结合错配的两个方向(过剩与不足),实现动态、局部的修正策略,提升蒸馏训练的稳定性和效果。方法在理论上证明了其在分支特异性修正中的合理性,确保了梯度的有界性和局部一致性。实验验证了该机制在多个数学推理任务中的优越表现,展示了其在复杂推理和长文本生成中的潜力。

新颖性

本研究首次系统性地将模型蒸馏中的错配分析引入到on-policy框架,突破了以往只关注token一致性的局限。提出的TIDE方法创新性地结合了有界的Hellinger变换和解析top-K注入机制,有效解决了学生过剩和不足两类错配问题,填补了当前模型蒸馏在错配修正方面的空白。这种错配方向的细粒度处理策略,为未来模型训练中的错配识别和修正提供了新的理论基础和实践路径,区别于传统的奖励塑形或token筛选技术。

局限性

  • TIDE在极端错配场景下仍可能面临修正不足的问题,尤其是在教师模型偏好极端稀疏或偏离实际推理逻辑时,其top-K注入策略可能无法完全覆盖所有关键候选项。
  • 该方法依赖于教师模型的top-K支持集,若教师模型本身存在偏差或不稳定,可能影响修正效果,限制其在某些复杂任务中的适用性。
  • 在大规模模型训练中,TIDE引入的额外计算开销和复杂性可能影响训练效率,尤其是在多轮迭代和大数据集上,需进一步优化算法效率。

未来方向

未来的研究方向包括:• 结合强化学习或自监督机制,进一步提升错配识别的准确性和修正的鲁棒性;• 探索多模态或跨任务的错配修正策略,扩展TIDE在多任务学习和多模态模型中的应用潜力;• 优化算法的计算效率,降低在大规模模型中的部署成本,推动其在工业界的实际应用。

AI 总览摘要

在当今人工智能快速发展的背景下,大型语言模型(LLMs)在自然语言处理、推理和生成任务中展现出巨大潜力。然而,模型训练中的蒸馏技术,尤其是on-policy distillation(OPD),虽然在提升模型性能方面发挥了重要作用,但也暴露出一些根本性的问题。传统的OPD方法过度依赖于模型在token级别的高一致性,容易导致“退化一致性”现象,即学生模型通过重复生成某些特定短语或模式,达到与教师模型的表面一致,却在整体推理能力和逻辑深度上严重不足。这种现象不仅限制了模型的泛化能力,还可能引发训练不稳定、响应膨胀和格式错误等问题。

为了应对这一挑战,本文提出了TIDE(Token-level Independent Deficit–Excess correction)方法,旨在深入分析和修正学生模型与教师模型之间的错配。研究发现,错配主要分为两类:学生过剩(excess)和学生不足(deficit)。学生过剩错配表现为学生生成的某些token概率远高于教师的估计,导致梯度爆炸和训练不稳定;而学生不足错配则表现为教师偏好的关键token在学生中被低估或未采样,阻碍了教师推理模式的有效传递。TIDE通过引入有界的Hellinger变换,有效抑制学生过剩的极端偏差,避免梯度不稳定;同时,利用解析的top-K注入机制,直接补充学生模型中遗漏的教师偏好概率,确保关键推理路径的传递。

在多个数学推理任务中,采用Qwen3作为教师-学生对进行评估,结果显示TIDE在平均@8指标上显著优于传统OPD和其他token筛选、奖励塑形方法。具体表现为:Avg@8从6.9%提升至20.3%,响应长度缩短3.6倍,格式错误率大幅降低。这些结果验证了TIDE在应对强错配场景、长文本生成和复杂推理中的优越性。该方法的核心创新在于:• 结合有界变换和解析支持的错配修正机制,确保训练的稳定性和效率;• 细粒度识别错配方向,动态调整修正策略,提升模型推理能力;• 理论上证明了其在分支特异性修正中的合理性,为未来模型蒸馏提供了新的技术路径。

总体而言,TIDE的提出不仅突破了传统模型蒸馏中只关注一致性的局限,更为深度理解和修正模型错配提供了系统性框架。其在数学推理、逻辑推断等复杂任务中的优异表现,彰显了其在学术研究和工业应用中的巨大潜力。未来,结合强化学习、多模态学习等技术,TIDE有望推动大模型训练的新时代,实现更智能、更稳健的人工智能系统。

深度解读

原文摘要

On-policy distillation (OPD) has emerged as a core component of modern LLM post-training pipelines, yet we reveal a failure mode: degenerate agreement, where students exploit repetitive loops to achieve near-perfect token agreement with the teacher despite globally flawed responses. We therefore shift our focus from agreement to teacher-student mismatch, and find that mismatch tokens can be mainly categorized into two types: student-excess tokens and student-deficit tokens. Student-excess tokens are generated by the student but assigned near-zero probability by the teacher; their log-ratio corrections grow unbounded and destabilize the update. Student-deficit tokens, in contrast, are preferred by the teacher but rarely sampled by the student; their absence blocks the transfer of the teacher's reasoning patterns. To tackle these mismatch directions, we propose TIDE (Token-level Independent Deficit-Excess correction), which applies bounded Hellinger shaping to suppress the most severe sampled excesses and an analytic teacher top-$K$ injection to restore deficient probability mass without requiring deficit tokens to be sampled. Across mathematical reasoning benchmarks with multiple Qwen3 teacher-student pairs, TIDE consistently outperforms standard OPD and recent token-selection and reward-shaping baselines. Moreover, the gains of TIDE are more pronounced under strong teacher-student mismatch, where it improves Avg@8 from 6.9% to 20.3%, reduces average response length by a factor of 3.6, and substantially reduces formatting failures. Code is available at https://github.com/yzc-666/TIDE

cs.AI cs.CL

参考文献 (20)

On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等

2023 662 引用 ⭐ 高影响力 查看解读 →

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

Nan Jia, Haojin Yang, Xingchen Ma 等

2026 11 引用 ⭐ 高影响力 查看解读 →

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

Anhao Zhao, Junlong Tong, Yingqi Fan 等

2026 3 引用 ⭐ 高影响力 查看解读 →

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang, Qihao Zhu 等

2024 8137 引用 ⭐ 高影响力 查看解读 →

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Adam Suma, Sam Dauncey

2025 4954 引用 ⭐ 高影响力

Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation

Yuying Li, Leqi Zheng, Yongzi Yu 等

2026 8 引用 ⭐ 高影响力 查看解读 →

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Qiying Yu, Zheng Zhang, Ruofei Zhu 等

2025 2361 引用 查看解读 →

Divergence measures and message passing

T. Minka

2005 667 引用

TIP: Token Importance in On-Policy Distillation

Yuanda Xu, Hejian Sang, Zhengze Zhou 等

2026 46 引用 查看解读 →

Rethinking On-Policy Self-Distillation for Thinking Models

Simran Kaur, Narutatsu Ri, Yinghui He 等

2026 7 引用 查看解读 →

Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence

Xinyu Liu, Kechen Jiao, Chunyang Xiao 等

2026 3 引用 查看解读 →

Fast and Effective On-policy Distillation from Reasoning Prefixes

Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani 等

2026 26 引用 查看解读 →

Qwen3 Technical Report

An Yang, Anfeng Li, Baosong Yang 等

2025 7149 引用 查看解读 →

Proximal Policy Optimization Algorithms

John Schulman, Filip Wolski, Prafulla Dhariwal 等

2017 30084 引用 查看解读 →

PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel

Yanli Zhao, A. Gu, R. Varma 等

2023 821 引用 查看解读 →

Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks

Samy Bengio, O. Vinyals, N. Jaitly 等

2015 2452 引用 查看解读 →

GLM-5: from Vibe Coding to Agentic Engineering

GLM-4.5 Team Aohan Zeng, Xin Lv, Zhenyu Hou 等

2026 315 引用 查看解读 →

Trust Region On-Policy Distillation

Xingrun Xing, Haoqing Wang, Boyan Gao 等

2026 4 引用 查看解读 →

Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models

Feng Luo, Yu-Neng Chuang, Guanchu Wang 等

2026 15 引用 查看解读 →

HybridFlow: A Flexible and Efficient RLHF Framework

Guangming Sheng, Chi Zhang, Zilingfeng Ye 等

2024 2116 引用 查看解读 →