核心发现
方法论
本文提出TIDE(Token-level Independent Deficit–Excess correction)方法,旨在解决在on-policy蒸馏中出现的“退化一致性”问题。研究发现,学生模型在生成过程中会出现两类错配:学生过剩(student-excess)和学生不足(student-deficit)错配。TIDE通过引入有界的Hellinger变换抑制学生过剩的极端偏差,并利用解析的teacher top-K注入机制,补充学生模型中缺失的教师偏好概率,从而实现更稳定和高效的蒸馏训练。具体而言,方法包括:• 利用分位数筛选出学生过剩的极端样本,应用Hellinger形状变换进行有界抑制;• 通过分析教师的top-K支持集,识别学生未覆盖的关键候选项,并用解析的top-K注入机制补充其概率质量。实验在多个数学推理任务中,采用Qwen3作为教师-学生对,结果显示TIDE在平均@8指标上持续优于传统OPD和近期的token选择、奖励塑形方法,尤其在强错配场景下,提升幅度显著,Avg@8从6.9%提升至20.3%,响应长度缩短3.6倍,格式错误率大幅降低。
关键结果
- 在多项数学推理基准测试中,TIDE在Qwen3-8B模型上实现了平均@8从6.9%提升到20.3%的显著改善,表现优于基线OPD和其他token筛选方法。实验还显示,TIDE在应对强错配场景时,响应长度平均缩短了3.6倍,有效避免了生成过程中的长度膨胀问题。此外,TIDE显著减少了格式错误和无关内容,提升了生成的质量和可靠性。
- 在教师-学生错配分析中,TIDE成功识别出学生过剩和不足的错配类型,分别通过有界抑制和解析注入机制进行修正,验证了其在不同任务中的适应性和鲁棒性。 Ablation实验表明,单独使用Hellinger抑制或top-K补充都无法达到TIDE的整体效果,二者结合才实现了最优性能。
- 在不同的推理任务和模型规模下,TIDE均表现出优越的适应性,尤其在应对教师-学生错配严重的场景中,提升幅度更为明显。其在数学推理、逻辑推断等复杂任务中的优异表现,验证了其在实际应用中的潜力和推广价值。
研究意义
该研究突破了传统模型蒸馏中只关注一致性的问题,提出错配方向的修正机制,有效缓解了“退化一致性”带来的训练瓶颈。TIDE的引入不仅提升了模型的推理能力和生成质量,还降低了训练过程中的不稳定性和格式错误率,为大规模语言模型的高效训练提供了新的技术路径。这一方法的成功应用,标志着模型蒸馏从单纯追求token一致性,向更深层次的错配理解和修正迈出了重要一步,具有重要的理论价值和实际意义。
技术贡献
本文的核心技术创新在于:• 提出基于Hellinger变换的有界抑制机制,有效控制学生过剩错配带来的梯度爆炸问题;• 设计解析的top-K注入策略,弥补学生模型在教师偏好概率上的不足,避免采样稀疏带来的信息缺失;• 结合错配的两个方向(过剩与不足),实现动态、局部的修正策略,提升蒸馏训练的稳定性和效果。方法在理论上证明了其在分支特异性修正中的合理性,确保了梯度的有界性和局部一致性。实验验证了该机制在多个数学推理任务中的优越表现,展示了其在复杂推理和长文本生成中的潜力。
新颖性
本研究首次系统性地将模型蒸馏中的错配分析引入到on-policy框架,突破了以往只关注token一致性的局限。提出的TIDE方法创新性地结合了有界的Hellinger变换和解析top-K注入机制,有效解决了学生过剩和不足两类错配问题,填补了当前模型蒸馏在错配修正方面的空白。这种错配方向的细粒度处理策略,为未来模型训练中的错配识别和修正提供了新的理论基础和实践路径,区别于传统的奖励塑形或token筛选技术。
局限性
- TIDE在极端错配场景下仍可能面临修正不足的问题,尤其是在教师模型偏好极端稀疏或偏离实际推理逻辑时,其top-K注入策略可能无法完全覆盖所有关键候选项。
- 该方法依赖于教师模型的top-K支持集,若教师模型本身存在偏差或不稳定,可能影响修正效果,限制其在某些复杂任务中的适用性。
- 在大规模模型训练中,TIDE引入的额外计算开销和复杂性可能影响训练效率,尤其是在多轮迭代和大数据集上,需进一步优化算法效率。
未来方向
未来的研究方向包括:• 结合强化学习或自监督机制,进一步提升错配识别的准确性和修正的鲁棒性;• 探索多模态或跨任务的错配修正策略,扩展TIDE在多任务学习和多模态模型中的应用潜力;• 优化算法的计算效率,降低在大规模模型中的部署成本,推动其在工业界的实际应用。
AI 总览摘要
在当今人工智能快速发展的背景下,大型语言模型(LLMs)在自然语言处理、推理和生成任务中展现出巨大潜力。然而,模型训练中的蒸馏技术,尤其是on-policy distillation(OPD),虽然在提升模型性能方面发挥了重要作用,但也暴露出一些根本性的问题。传统的OPD方法过度依赖于模型在token级别的高一致性,容易导致“退化一致性”现象,即学生模型通过重复生成某些特定短语或模式,达到与教师模型的表面一致,却在整体推理能力和逻辑深度上严重不足。这种现象不仅限制了模型的泛化能力,还可能引发训练不稳定、响应膨胀和格式错误等问题。
为了应对这一挑战,本文提出了TIDE(Token-level Independent Deficit–Excess correction)方法,旨在深入分析和修正学生模型与教师模型之间的错配。研究发现,错配主要分为两类:学生过剩(excess)和学生不足(deficit)。学生过剩错配表现为学生生成的某些token概率远高于教师的估计,导致梯度爆炸和训练不稳定;而学生不足错配则表现为教师偏好的关键token在学生中被低估或未采样,阻碍了教师推理模式的有效传递。TIDE通过引入有界的Hellinger变换,有效抑制学生过剩的极端偏差,避免梯度不稳定;同时,利用解析的top-K注入机制,直接补充学生模型中遗漏的教师偏好概率,确保关键推理路径的传递。
在多个数学推理任务中,采用Qwen3作为教师-学生对进行评估,结果显示TIDE在平均@8指标上显著优于传统OPD和其他token筛选、奖励塑形方法。具体表现为:Avg@8从6.9%提升至20.3%,响应长度缩短3.6倍,格式错误率大幅降低。这些结果验证了TIDE在应对强错配场景、长文本生成和复杂推理中的优越性。该方法的核心创新在于:• 结合有界变换和解析支持的错配修正机制,确保训练的稳定性和效率;• 细粒度识别错配方向,动态调整修正策略,提升模型推理能力;• 理论上证明了其在分支特异性修正中的合理性,为未来模型蒸馏提供了新的技术路径。
总体而言,TIDE的提出不仅突破了传统模型蒸馏中只关注一致性的局限,更为深度理解和修正模型错配提供了系统性框架。其在数学推理、逻辑推断等复杂任务中的优异表现,彰显了其在学术研究和工业应用中的巨大潜力。未来,结合强化学习、多模态学习等技术,TIDE有望推动大模型训练的新时代,实现更智能、更稳健的人工智能系统。
深度解读
原文摘要
On-policy distillation (OPD) has emerged as a core component of modern LLM post-training pipelines, yet we reveal a failure mode: degenerate agreement, where students exploit repetitive loops to achieve near-perfect token agreement with the teacher despite globally flawed responses. We therefore shift our focus from agreement to teacher-student mismatch, and find that mismatch tokens can be mainly categorized into two types: student-excess tokens and student-deficit tokens. Student-excess tokens are generated by the student but assigned near-zero probability by the teacher; their log-ratio corrections grow unbounded and destabilize the update. Student-deficit tokens, in contrast, are preferred by the teacher but rarely sampled by the student; their absence blocks the transfer of the teacher's reasoning patterns. To tackle these mismatch directions, we propose TIDE (Token-level Independent Deficit-Excess correction), which applies bounded Hellinger shaping to suppress the most severe sampled excesses and an analytic teacher top-$K$ injection to restore deficient probability mass without requiring deficit tokens to be sampled. Across mathematical reasoning benchmarks with multiple Qwen3 teacher-student pairs, TIDE consistently outperforms standard OPD and recent token-selection and reward-shaping baselines. Moreover, the gains of TIDE are more pronounced under strong teacher-student mismatch, where it improves Avg@8 from 6.9% to 20.3%, reduces average response length by a factor of 3.6, and substantially reduces formatting failures. Code is available at https://github.com/yzc-666/TIDE
参考文献 (20)
On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
Nan Jia, Haojin Yang, Xingchen Ma 等
PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation
Anhao Zhao, Junlong Tong, Yingqi Fan 等
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Zhihong Shao, Peiyi Wang, Qihao Zhu 等
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Adam Suma, Sam Dauncey
Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
Yuying Li, Leqi Zheng, Yongzi Yu 等
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Qiying Yu, Zheng Zhang, Ruofei Zhu 等
Divergence measures and message passing
T. Minka
TIP: Token Importance in On-Policy Distillation
Yuanda Xu, Hejian Sang, Zhengze Zhou 等
Rethinking On-Policy Self-Distillation for Thinking Models
Simran Kaur, Narutatsu Ri, Yinghui He 等
Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence
Xinyu Liu, Kechen Jiao, Chunyang Xiao 等
Fast and Effective On-policy Distillation from Reasoning Prefixes
Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani 等
Proximal Policy Optimization Algorithms
John Schulman, Filip Wolski, Prafulla Dhariwal 等
PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel
Yanli Zhao, A. Gu, R. Varma 等
Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks
Samy Bengio, O. Vinyals, N. Jaitly 等
GLM-5: from Vibe Coding to Agentic Engineering
GLM-4.5 Team Aohan Zeng, Xin Lv, Zhenyu Hou 等
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
Feng Luo, Yu-Neng Chuang, Guanchu Wang 等
HybridFlow: A Flexible and Efficient RLHF Framework
Guangming Sheng, Chi Zhang, Zilingfeng Ye 等