SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

TL;DR

SimpleOPD实现跨分词器长短上下文推理迁移,提升数学推理性能。

cs.CL 🔴 高级 2026-08-14 36 次浏览
Haonan He Haodi Lei Yun Luo Haoran Zhang Shunkai Zhang Yizhuo Li Shengji Tang Zhilin Wang Runzhe Zhan Lei Bai Ganqu Cui Fangchen Yu Yafu Li Peng Ye Ning Ding Yu Cheng
深度学习 模型蒸馏 长上下文 推理能力 多模型迁移

核心发现

方法论

本文提出SimpleOPD,在长短模型间实现无缝知识迁移。通过在共享文本空间中对齐相同文本跨度的Token,解决不同分词器引起的对齐难题。引入学生参考KL损失和终止Token屏蔽,稳定训练过程,防止响应长度爆炸。采用基于PPO的对齐目标,结合响应文本匹配机制,有效缓解教师-学生分布差异。实验证明,该方法在数学推理、科学基准上显著优于传统蒸馏,特别是在跨模型和跨分词器场景中表现优异。

关键结果

  • 在ProofBench上,Intern-S2-Preview模型通过SimpleOPD提升21.2分,达到55.2分,超越Gemini-2.5-Pro,表现出强大的推理迁移能力。
  • 在科学任务HLE和HiPhO上也获得明显提升,表明推理能力的迁移超越数学领域,具有广泛泛化能力。
  • 引入KL正则化和特殊终止Token屏蔽后,训练稳定性大幅改善,响应长度控制得当,训练过程更平稳。

研究意义

本研究突破了跨模型、跨分词器的长上下文推理迁移瓶颈,为大规模模型在复杂推理任务中的应用提供新路径。通过无监督的对齐策略,有效解决了传统方法中对齐困难和训练不稳定的问题,推动模型泛化能力的提升。该技术不仅适用于数学推理,还能推广到科学、自然语言理解等多个领域,具有重要的理论和实际意义。

技术贡献

提出基于共享文本空间的Token对齐机制,避免分词器差异带来的对齐难题。引入响应KL正则化,缓解教师-学生分布差异,提升训练稳定性。结合特殊终止Token屏蔽,有效控制响应长度爆炸。采用PPO优化框架,确保模型在迁移过程中保持稳定。实验验证该策略在多模型、多任务场景中的优越性,显著优于现有蒸馏方法。

新颖性

首次提出跨分词器的长上下文推理迁移方法,突破了传统对齐依赖分词器一致性的限制。引入响应文本匹配机制和KL正则化,有效缓解训练不稳定和响应长度膨胀问题。这些创新使得长短模型之间的知识迁移变得可行且高效,填补了该领域的空白。

局限性

  • 当前方法在极端长上下文或复杂推理场景下仍存在响应长度控制不足的问题,需进一步优化长度调节机制。
  • 对齐机制依赖于文本跨度匹配,可能在多模态或多语言场景中面临适应性挑战。
  • 训练成本较高,特别是在大模型和多模型迁移场景中,需优化训练效率。

未来方向

未来将探索多模态、多任务的跨模型迁移,结合更高效的对齐策略和自监督学习技术,提升模型的泛化能力和训练效率。同时,研究响应长度自适应调节和多语言支持,拓展应用场景。

AI 总览摘要

随着大规模预训练模型在自然语言处理中的广泛应用,长上下文推理能力成为关键瓶颈。传统蒸馏方法多依赖相同分词器和模型架构,限制了模型的迁移和泛化能力。本文提出SimpleOPD,一种跨分词器的长短模型推理迁移技术。通过在共享文本空间中对齐响应中的相同文本跨度,解决不同分词器带来的对齐难题。引入学生参考KL正则化和特殊终止Token屏蔽,有效控制响应长度膨胀,提升训练稳定性。实验在数学推理和科学任务中取得了显著效果,尤其是在ProofBench上,Intern-S2-Preview模型提升21.2分,超越部分强模型。这表明该方法不仅能迁移推理能力,还能实现跨模型、跨任务的泛化。研究成果为未来大模型在复杂推理任务中的应用提供了新思路,推动模型能力的持续提升。未来工作将聚焦多模态、多任务迁移和自适应长度调节,拓展技术的适用范围。

深度分析

研究背景

近年来,深度学习模型在自然语言处理中的表现不断突破,尤其是大型预训练模型(如GPT、BERT系列)在多任务、多领域展现出强大能力。模型蒸馏作为提升推理和生成能力的重要手段,已成为研究热点。传统蒸馏多依赖于相同分词器和模型架构,限制了跨模型迁移的效果。长上下文推理能力的提升,尤其在数学证明和科学推理中,仍面临分词器不一致、响应长度控制和训练稳定性等挑战。现有方法如Off-policy蒸馏在模型迁移中表现有限,难以应对复杂推理任务的需求。

核心问题

核心问题在于如何在不同分词器和模型架构间实现高效、稳定的长上下文推理迁移。具体表现为:分词器不一致导致Token对齐困难,模型容量差异引起分布偏差,长响应导致训练不稳定和响应爆炸。此外,终止Token的对齐和响应长度控制成为难点,影响迁移效果和模型泛化能力。这些问题限制了模型在复杂推理任务中的应用,亟需创新的解决方案。

核心创新

本研究提出三大创新:1)在共享文本空间中对齐响应文本跨度,解决不同分词器的对齐难题;2)引入学生参考KL正则化,稳定训练过程,防止响应长度爆炸;3)屏蔽特殊终止Token的优势,避免模型过度偏离初始策略。这些创新结合PPO优化框架,有效缓解教师-学生分布差异,提升迁移效率,显著优于现有方法。

方法详解

  • �� 构建共享文本空间,将教师和学生的响应在相同文本跨度上对齐。• 通过响应文本匹配机制,定义Token对应关系,解决不同分词器引起的对齐问题。• 采用基于PPO的对齐目标,只在匹配Token位置上进行监督,减少偏差。• 引入学生参考KL正则化,限制模型偏离初始策略,控制响应长度。• 屏蔽终止Token的优势,避免训练中响应无限膨胀。• 使用响应匹配的对齐策略,确保迁移过程中的稳定性和效果。

实验设计

在数学证明和科学任务中,采用SU-01作为教师模型,迁移到Qwen3、Qwen3.5、Intern-S2等多模型。训练数据包括OPC、AoPS、书籍和社区题库。采用PPO优化,训练100轮,批次64,响应长度上限32K。评估指标包括ProofBench、AnswerBench、AIME25等,采用多次评估取平均。对比传统蒸馏和本方法,验证稳定性和性能提升。

结果分析

在ProofBench上,Intern-S2-Preview模型由34.0提升至55.2,增长21.2分,超越Gemini-2.5-Pro。科学任务HLE和HiPhO也获得显著提升,验证推理能力迁移的有效性。引入KL正则化和终止Token屏蔽后,训练过程更稳定,响应长度受控,模型表现优异。多模型迁移实验显示,方法具有良好的泛化能力和适应性。

应用场景

该技术可应用于教育、科研、智能问答等场景,尤其适合需要长上下文推理的复杂任务。通过无监督对齐和稳定训练,降低模型迁移门槛,提升模型在实际应用中的表现。未来可结合多模态信息,拓展到多语言、多任务环境,推动智能系统的智能化升级。

局限与展望

目前方法在极端长上下文或多模态场景下仍存在响应长度控制不足的问题。训练成本较高,尤其在大模型迁移中,需优化效率。对齐机制依赖文本跨度匹配,可能在多语言或多模态场景中面临挑战。未来需探索更高效的长度调节和多模态适应策略。

通俗解读 非专业人士也能看懂

想象你在教一个学生做数学题。老师(模型)非常厉害,能解决复杂问题,但他用一种特殊的语言(分词器)表达答案。你(学生)用另一种语言,但你们都在看同一张题目纸。为了让你学会老师的解题方法,老师会用一种特殊的方式告诉你哪些部分是关键,哪些可以跳过。你们会一起对照答案的不同部分,找到对应的内容。通过不断练习,你逐渐学会了老师的思路,即使你用不同的语言表达,也能理解和解决问题。这就像本文的方法,让不同模型用不同“语言”也能学会长篇推理,变得更聪明、更稳定。

简单解释 像给14岁少年讲一样

想象你在学校里学习一门超级难的数学课。老师讲得很快,内容也很长,有时候你听不完就得停下来休息。以前的老师(模型)都用一样的语言和方法讲题,这样你们交流就很顺畅。但现在,有个新老师用不同的语言(分词器),你听不懂,怎么学会他的推理呢?这篇文章就像发明了一种新办法,让你用自己的语言理解老师的讲解,还能找到老师讲的重点。这样,不管老师用什么语言,你都能学会长篇复杂的推理,不再怕内容太长或表达不一样了。这让学习变得更容易,也让你变得更聪明!

原文摘要

On-policy distillation (OPD) offers a promising way to transfer reasoning capabilities from stronger teacher models, but applying it to long-context reasoning teachers and short-context students introduces practical challenges, including tokenizer mismatch, teacher-student distribution mismatch, response length explosion, and training instability. In this work, we study this setting by transferring proof-reasoning capabilities from the long-context reasoning model SU-01 to short-context student models. To handle tokenizer differences, we perform OPD in a shared text space and align only tokens that occupy identical text spans under the student and teacher tokenizers. To mitigate the problem of excessive generation length and frequent truncation, we introduce a student reference KL loss and mask the advantages of special termination tokens such as </think> and <|im_end|>. This strategy constrains the student from drifting excessively from its initial policy, thereby mitigating the teacher-student distribution mismatch problem and fostering steady length growth. Experiments on both same-family and different-family student models, including Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4, show consistent gains in mathematical reasoning, especially natural-language math proving. Notably, Intern-S2-Preview improves by 21.2 points on ProofBench, reaching 55.2 and surpassing Gemini-2.5-Pro. It also improves on science benchmarks such as HLE and HiPhO, suggesting that OPD transfers reasoning capabilities that generalize beyond the mathematical training domain.

cs.CL cs.AI