Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
提出Group-Calibrated On-Policy Distillation(GC-OPD),在长上下文推理中通过响应级验证器奖励校准偏差,提升五项基准平均分从29.08提升至40.47。
核心发现
方法论
本文提出的GC-OPD框架在传统的On-Policy Distillation(OPD)基础上,通过在每个rollout组内对验证器奖励和轨迹级OPD分数进行分组归一化,形成符号化的偏差残差。该残差反映教师偏好与验证器评价之间的差异。随后,采用相对优势的信用分配(RACA)机制,将轨迹残差在响应中的每个token上进行分配,依据每个token的相对OPD优势进行加权,从而在保留密集token级指导的同时,校正响应级偏差。实验证明,在五个长上下文任务中,GC-OPD显著优于vanilla OPD,提升五项基准的平均得分,从29.08提升至40.47(Qwen3-4B),从35.12提升至44.65(Qwen3-8B),且优于其他对比方法。
关键结果
- 在五个长上下文基准上,GC-OPD平均提升官方Qwen3-4B模型的得分从29.08到40.47,提升了约11.39点,Qwen3-8B模型从35.12到44.65,提升了9.53点。与vanilla OPD(分别为39.31和43.56)相比,GC-OPD在所有任务中均表现优越,尤其在结构化推理和证据聚合任务中表现出显著优势。
- 通过消融实验验证,符号化残差优于单纯加入额外OPD项或直接加入归一化验证器奖励,RACA机制在token分配中优于均匀分配策略,整体提升模型在长上下文推理中的表现稳定性和准确性。
- 在不同模型规模(Qwen3-4B和Qwen3-8B)上,GC-OPD均取得最优平均分,验证其方法的普适性和有效性。
研究意义
该研究突破了长上下文推理中教师偏好与验证器评价不一致的瓶颈,提出的校准机制有效融合了密集token级指导与响应级验证器奖励,为大规模语言模型在复杂推理任务中的应用提供了新的技术路径。它不仅提升了模型的推理准确性,还增强了模型在多任务、多场景下的适应能力,具有重要的学术和工业价值。
技术贡献
本文的核心技术创新在于引入组相对校准(Group-Relative Calibration)策略,通过在每个rollout组内进行奖励和OPD分数的归一化,有效捕捉教师偏好与验证器评价的偏差。结合相对优势的信用分配(RACA),实现了残差在token层的动态分配,兼顾密集指导和响应级校正。这一机制在不破坏原有OPD优势的基础上,显著改善了长上下文推理中的偏差校正效果。
新颖性
该方法首次提出将教师偏好与验证器奖励的偏差通过组相对校准进行动态调节,结合相对优势的token分配策略,有效解决了长上下文推理中响应偏差与密集指导之间的矛盾。这在现有的教师指导和验证器结合技术中尚属首次,突破了单一奖励或单纯校准的局限,为多任务长上下文模型训练提供了新思路。
局限性
- 该方法依赖于预先定义的任务验证器,其性能受验证器设计和标注质量影响较大,可能在某些复杂或模糊任务中表现不佳。
- 在极长上下文或极端偏差场景下,归一化操作可能引入噪声或不稳定性,影响模型训练的收敛性。
- 目前仅在五个长上下文基准上验证,尚未广泛测试在其他多样化任务中的泛化能力和适应性。
未来方向
未来可结合自监督或多模态验证机制,增强验证器的鲁棒性和多样性。同时,探索更细粒度的偏差校准策略,以及在多任务、多模态场景中的扩展应用,以进一步提升模型的推理能力和泛化性能。
AI 总览摘要
随着大规模语言模型在自然语言处理中的广泛应用,长上下文推理成为关键技术之一。传统的知识蒸馏方法如On-Policy Distillation(OPD)通过密集的token级指导,极大地提升了模型的生成能力,但在长上下文场景中,教师偏好与任务验证器的评价存在明显偏差。这种偏差导致模型在长输入中产生的响应,虽然在局部上看似合理,却可能遗漏关键证据或违反全局任务约束。为解决这一问题,本文提出了Group-Calibrated On-Policy Distillation(GC-OPD),一种结合响应级验证器奖励与密集token指导的校准机制。
GC-OPD的核心思想是,在每个rollout组内对验证器奖励和轨迹级OPD分数进行分组归一化,形成符号化的偏差残差,反映教师偏好与验证器评价之间的差异。通过引入相对优势的信用分配(RACA),将残差在响应中的每个token上进行动态分配,依据每个token的相对OPD优势进行加权。这一机制在保持密集token指导的同时,有效校正了响应级偏差。
在五个长上下文基准任务上,GC-OPD显著优于vanilla OPD,平均得分从29.08提升至40.47(Qwen3-4B),从35.12提升至44.65(Qwen3-8B),在结构化推理和证据聚合任务中表现尤为突出。消融实验验证了符号化残差和RACA机制的有效性,显示其在长上下文推理中的潜力。该方法为未来多任务、多场景的长上下文模型训练提供了新的技术路径,推动模型在复杂推理任务中的应用发展。
深度分析
研究背景
近年来,随着大规模预训练语言模型的快速发展,知识蒸馏技术成为提升模型效率和性能的重要手段。特别是在长上下文推理任务中,模型需要整合分散在长文本中的证据,满足全局任务约束。早期工作如Teacher-Student架构、Token-Level Distillation等,已在短文本任务中取得显著效果,但在长文本场景中面临偏差和偏好不一致的问题。现有方法如Outcome-Conditioned Calibration、Trajectory Filtering等尝试结合验证器反馈,改善响应质量,但仍难以平衡密集指导与响应级校准的矛盾。本文在此基础上,提出了结合组相对校准策略的长上下文知识蒸馏新框架。
核心问题
长上下文推理中的核心挑战在于教师偏好(通过密集token指导体现)与任务验证器(响应级评价)之间的偏差。教师偏好倾向于支持局部合理的响应,而验证器关注整体任务完成情况,二者在长文本中可能出现明显不一致。传统OPD在这种场景下容易偏向局部最优,忽略全局证据,导致响应偏差。如何在保持密集指导的同时,有效校正响应级偏差,成为亟待解决的问题。这一偏差不仅影响模型的推理准确性,还限制了模型在复杂多任务环境中的应用。
核心创新
本文的创新点主要包括:1)引入组相对校准(Group-Relative Calibration)策略,通过在每个rollout组内对验证器奖励和OPD分数进行归一化,有效捕捉偏差的方向和强度;2)设计符号化的偏差残差,专注于偏差的方向性校正,避免直接干扰密集指导;3)结合相对优势的token分配(RACA),将轨迹残差在响应中进行动态分配,依据每个token的相对OPD优势进行加权,从而在保证密集指导的基础上,校正响应偏差。这一机制突破了现有单一奖励或校准策略的局限,为长上下文推理中的偏差校正提供了新思路。
方法详解
- �� 组相对归一化:在每个rollout组内,对验证器奖励和轨迹级OPD分数分别进行均值-标准差归一化,形成组内标准化值。• 计算偏差残差:用验证器归一化奖励减去OPD归一化分数,得到符号化偏差残差,反映教师偏好与验证器评价的差异。• 设计RACA:对每个响应中的token,计算其相对OPD优势(归一化后偏离响应平均值的OPD值),并通过tanh映射为正值的token信用分。• 结合偏差:将偏差残差乘以token信用分,得到token级偏差校正项,加入原始OPD优势,形成新的token优势。• 优化目标:用校正后的优势替代原有优势,进行策略优化,确保偏差得到有效校正,同时保持密集指导。• 训练流程:在每次训练中,先进行组归一化,计算偏差残差,再通过RACA进行偏差分配,最终更新模型参数。
实验设计
实验采用五个长上下文基准任务,包括结构化推理、证据聚合等,使用Qwen3-4B和Qwen3-8B作为学生模型,Qwen3-30B作为教师模型。训练数据来自GoLongRL数据集,包含超过9500个长文本提示,长度最高达32K tokens。模型训练中,采用8个响应的rollout策略,最大响应长度10K tokens,训练步数为100步。对比方法包括vanilla OPD、ExOPD、Uni-OPD、FiRe-OPD和PowerOPD,均在相同硬件和超参数设置下进行。评估指标涵盖五个不同任务的得分(如准确率、F1、NDCG等),并计算平均值。通过在验证集上调节残差系数β,选取最佳参数,确保模型性能最优。
结果分析
GC-OPD在所有五个基准任务中均优于对比方法,平均提升幅度在10点左右。例如,在Qwen3-4B模型上,平均得分由29.08提升至40.47,提升了约11.39点;在Qwen3-8B模型上,从35.12到44.65,提升9.53点。结构化推理和证据聚合任务表现尤为突出,验证了偏差校正机制的有效性。消融实验显示,符号化残差和RACA机制的结合,显著优于单一策略,说明偏差的符号信息和动态分配在长上下文推理中具有重要作用。
应用场景
该技术适用于需要长文本理解和推理的应用场景,如法律文档分析、科研论文总结、多轮对话系统等。模型在这些场景中能更准确地整合分散信息,减少偏差,提高响应的全局一致性。未来,结合多模态验证器和自监督机制,有望进一步提升模型的鲁棒性和泛化能力,推动智能问答、自动摘要等行业应用的革新。
局限与展望
目前方法依赖于预设的验证器,其性能受验证器设计影响较大,可能在模糊或复杂任务中表现不足。此外,归一化操作在极长上下文中可能引入不稳定性,影响训练收敛。模型训练成本较高,尤其在多任务场景下,参数调优复杂。未来需探索更鲁棒的偏差校准机制和多模态验证方案,以增强模型的适应性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在准备一场大型派对。你有一个经验丰富的厨师(教师模型),他知道所有的菜谱和技巧,能帮你做出美味佳肴。你自己是厨师学徒(学生模型),但你还在学习如何搭配食材和掌握火候。每次你尝试做菜时,厨师会给你建议,比如用多少盐、火候多长时间,但这些建议主要是基于局部经验。与此同时,派对的组织者(验证器)会根据菜肴的整体味道和摆盘打分,告诉你哪些菜更合适。这时的问题是,你的厨师建议和组织者的评分可能不一致——厨师觉得某道菜很棒,但组织者觉得味道还差点。为了让你的厨艺更上一层楼,你需要一种方法,既能听取厨师的建议,又能根据组织者的评分调整做法。于是,你设计了一套“调味指南”,在每次做菜后,根据厨师建议和评分的差异,调整每个食材的用量。这个“调味指南”会根据每次的偏差,动态地告诉你哪个食材需要多放,哪个可以少放。经过多次尝试,你的菜肴变得越来越符合派对的要求,味道也更均衡。这就像GC-OPD一样,结合了老师的密集指导和验证器的全局评价,帮助模型在长篇推理中做出更合理、更符合任务要求的响应。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个写作文比赛。你的老师(教师模型)会给你很多建议,比如用词、句子结构,帮助你写得更好。而比赛的评委(验证器)会根据作文的整体内容、逻辑和主题打分。有时候,老师的建议可能偏重于句子漂亮,但忽略了作文是否完整表达了主题;而评委的评分则更关注内容是否符合题意。你想让自己的作文既有老师的指导,又能得到评委的认可,但两者有时候会出现矛盾。于是,你发明了一种方法:每次写完后,你会比较老师的建议和评委的评分,找出它们的差异,然后根据这个差异,调整你的写作重点。比如,如果老师觉得某个段落写得不错,但评委觉得内容不够完整,你就会多补充内容,确保作文既漂亮又完整。这种方法让你的作文变得更平衡,也更容易赢得比赛。这个过程就像论文中的GC-OPD,它通过比较老师的偏好和评委的评价,动态调整模型的回答,让它在长篇推理任务中表现得更好、更合理。
术语表
On-Policy Distillation (OPD)
一种知识蒸馏方法,通过让学生模型在自己的生成上学习教师模型的偏好,利用密集的token级优势进行优化。技术上是基于策略梯度和优势估计。
论文中用于提升模型生成能力,但在长上下文中存在偏差问题。
Verifier Reward (验证器奖励)
由任务特定验证器对模型响应进行评估后给予的分数,可以是二值(正确/错误)或连续的部分成功评分。用于指导模型响应的全局质量。
用来校正教师偏好与任务实际完成情况之间的偏差。
Group-Calibrated (组相对校准)
在每个rollout组内对奖励和优势进行归一化,形成偏差残差,反映偏好差异,从而实现偏差的动态校正。
GC-OPD的核心机制之一。
Relative-Advantage-based Credit Assignment (RACA)
一种在响应中根据每个token的相对优势,将轨迹残差动态分配到各个token的机制,增强偏差校正的粒度和效果。
提升偏差校正的精细度和效果。
Trajectory-level OPD Score
对一整个响应轨迹的优势值的平均,反映教师偏好支持的整体程度。
与验证器奖励结合,用于偏差校准。
Token Advantage (Token优势)
每个生成token相对于响应平均优势的偏差值,用于衡量该token的相对贡献。
在RACA中用于分配偏差残差。
Normalization (归一化)
将奖励和优势在每个组内减去均值并除以标准差,确保不同组间的尺度一致,便于比较。
实现偏差的组内对比。
Bias Correction (偏差校正)
通过偏差残差调整模型生成的响应,使其更符合任务的全局目标。
提升长上下文推理的准确性。
Ablation Study (消融实验)
逐步移除或替换模型中的某个组件,以验证其对整体性能的贡献。
论文中验证残差和RACA的有效性。
Long-Context Reasoning (长上下文推理)
模型在处理超长文本时,整合分散信息以完成复杂推理任务的能力。
是本文关注的核心应用场景。
开放问题 这项研究留下的未解疑问
- 1 虽然GC-OPD在五个长上下文任务中表现优异,但其在极端长文本(超出32K tokens)或多模态场景中的适应性尚未充分验证。未来研究应探索多模态验证器的集成,以及在更复杂、多样化任务中的泛化能力。
- 2 目前方法依赖于预定义的验证器,其性能受验证器设计和标注质量影响较大。如何自动学习或增强验证器的鲁棒性,仍是一个挑战。
- 3 偏差校正机制在训练过程中引入了额外的计算成本,尤其是在多任务、多模型联合训练中,效率和稳定性仍需优化。
- 4 长上下文推理中的偏差校正策略是否能在实际应用中持续保持效果,特别是在动态变化的任务环境中,仍需进一步验证。
- 5 未来可以结合自监督学习和多模态验证机制,提升偏差校正的自动化和适应性,推动模型在更广泛场景中的应用。
应用场景
近期应用
长文本问答系统
利用GC-OPD提升企业级长文本问答的准确性和一致性,特别适用于法律、科研等需要长篇证据整合的场景。
自动摘要与信息整合
在新闻、报告等长文本自动摘要中,增强模型对全局信息的把握能力,减少遗漏和偏差。
多轮对话系统
提升多轮对话中的信息连贯性和任务完成率,尤其在复杂场景中实现更合理的响应生成。
远期愿景
多模态长上下文推理
结合图像、视频等多模态信息,开发具有长上下文理解和推理能力的多模态模型,推动智能助手和自动分析的发展。
通用长文本推理平台
构建跨任务、跨领域的长上下文推理平台,实现多任务、多场景的智能推理与决策,推动AI在科研、法律、医疗等行业的深度应用。
原文摘要
On-policy distillation (OPD) trains a student on its own responses using dense token-level guidance from a stronger teacher. In long-context tasks, however, token-level teacher support can favor locally plausible responses that omit evidence distributed across the input or violate global task constraints. Task-specific verifiers, in contrast, evaluate task completion at the response level and may return graded rewards that reflect partial success. We diagnose this mismatch on fixed responses from two representative long-context evidence-aggregation tasks. Across longer input ranges, trajectory-level OPD scores become progressively less aligned with verifier rewards, indicating teacher-verifier disagreement. Motivated by this observation, we introduce Group-Calibrated On-Policy Distillation (GC-OPD). GC-OPD separately normalizes verifier rewards and trajectory-level OPD scores within each rollout group and uses their difference as a signed teacher-verifier disagreement residual. Relative-advantage-based credit assignment (RACA) distributes this trajectory-level residual across tokens according to their relative OPD advantages while preserving the original OPD signal. Across five long-context benchmarks, post-training with GC-OPD raises the five-benchmark averages of the official Qwen3-4B and Qwen3-8B checkpoints from 29.08 to 40.47 and from 35.12 to 44.65, respectively. Vanilla OPD reaches 39.31 and 43.56 under the same setup. Controlled ablations show that the signed residual is more effective than either an additional OPD-derived term or direct group-normalized verifier reward addition, while RACA further improves over uniform token allocation. Together, these results demonstrate that group-relative residual calibration can incorporate verifier outcomes without discarding dense token-level guidance. Code is available at https://github.com/SolereZhang/GC-OPD.
参考文献 (20)
PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation
Anhao Zhao, Junlong Tong, Yingqi Fan 等
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Zhihong Shao, Peiyi Wang, Qihao Zhu 等
On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
Fanqi Wan, Weizhou Shen, Shengyi Liao 等
Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries
Kiran Vodrahalli, Santiago Ontañón, Nilesh Tripuraneni 等
VinePPO: Refining Credit Assignment in RL Training of LLMs
Amirhossein Kazemnejad, Milad Aghajohari, Eva Portelance 等
RULER: What's the Real Context Size of Your Long-Context Language Models?
Cheng-Ping Hsieh, Simeng Sun, Samuel Kriman 等
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
Wenkai Yang, Weijie Liu, Ruobing Xie 等
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
Yushi Bai, Xin Lv, Jiajie Zhang 等
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
Wenjin Hou, Shangpin Peng, Weinong Wang 等
Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP
Omer Goldman, Alon Jacovi, Aviv Slobodkin 等
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
Minxuan Lv, Tiehua Mei, Tanlong Du 等
SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling
Haoran Xu, Hongyu Wang, Yifei Gao 等
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
Yilun Zhao, Yitao Long, Hongjun Liu 等
Explain in Your Own Words: Improving Reasoning via Token-Selective Dual Knowledge Distillation
Minsang Kim, S. Baek
LongAlign: A Recipe for Long Context Alignment of Large Language Models
Yushi Bai, Xin Lv, Jiajie Zhang 等
Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
Yuanyi Wang, Su Lu, Yanggan Gu 等
DistiLLM: Towards Streamlined Distillation for Large Language Models
Jongwoo Ko, Sungnyun Kim, Tianyi Chen 等