核心发现
方法论
本文引入多轮次策略蒸馏(MOPD),通过在同一问题实例中采样多条轨迹,将成功与失败轨迹作为同行信息,构建条件化教师信号。具体机制包括正向同行模仿和对比成功-失败条件化,利用轨迹组中的多样信息,增强对模型推理路径的指导。算法核心为基于逆KL或Jensen-Shannon散度的轨迹对比损失,结合轨迹成功与失败的结构化信息,优化学生模型的策略学习。实验中,MOPD在编程竞赛、数学推理、科学问答和工具使用任务中持续优于标准OPD基线,显著提升模型的推理能力与对抗误导路径的鲁棒性。分析显示,混合成功与失败的同行信息能更好地匹配验证器奖励,体现出更具适应性的监督信号。该方法突破了传统单轨迹独立蒸馏的局限,充分利用多轨迹的局部试错空间,推动策略蒸馏向更具实例适应性的方向发展。
关键结果
- 在数学推理任务AIME2024/2025上,MOPD相较于传统SDPO提升了平均正确率达20%以上,表现出优越的推理能力。
- 在科学问答和工具使用任务中,MOPD实现了平均性能提升约10-15%,在复杂推理和结构化输出任务中表现尤为突出。
- 对不同同行条件构建策略的消融实验表明,结合成功与失败轨迹的对比条件化显著优于仅使用成功轨迹,验证了结构化负证据的有效性。
研究意义
该研究突破了传统策略蒸馏在多轨迹信息利用上的限制,提出利用同行轨迹的对比信息进行条件化,显著提升模型推理能力和鲁棒性。其理论基础强调多试错行为的价值,为深度学习中的实例适应性监督提供新思路。实践中,该方法在复杂推理、编程和科学问答等多领域展现出强大潜力,有望推动大规模语言模型在高难度任务中的应用与优化。长远看,MOPD为智能系统的试错学习和自我诊断提供了新范式,促进模型更好地理解和应对多样化挑战。
技术贡献
本文提出的MOPD框架创新性地将多轨迹采样的局部结构引入策略蒸馏,通过同行成功与失败轨迹的对比,构建条件化教师信号,突破了单轨迹独立蒸馏的限制。算法核心采用逆KL和Jensen-Shannon散度,结合轨迹成功与失败的结构信息,增强了模型的推理指导能力。该方法实现了在多任务环境下的实例适应性监督,显著优于现有的基线模型,提供了理论上的新保证和工程上的新可能。其设计思想强调利用多试错空间中的局部信息,推动策略学习向更细粒度、更具针对性的方向发展。
新颖性
本研究首次系统性引入同行轨迹的对比信息到策略蒸馏中,提出正向同行模仿与对比成功-失败条件化两种策略,充分利用多轨迹的局部试错空间,显著提升推理任务中的模型性能。这一创新突破了以往只关注单一轨迹或全局奖励的局限,为多轨迹、多样性信息的融合提供了新范式,推动了深度学习中实例适应性监督的理论与实践前沿。
局限性
- 该方法在高复杂度任务中对轨迹采样数量和质量敏感,采样不足或偏差可能影响效果。
- 在极端稀疏奖励或极端多样化任务中,同行轨迹的结构信息可能不足以提供有效指导。
- 计算成本相较传统蒸馏略有增加,尤其在大规模多轨迹采样时对硬件资源要求较高。
未来方向
未来可探索多轨迹采样的自适应策略,提升轨迹质量与多样性,结合强化学习优化采样效率。同时,结合更丰富的结构化信息和多模态数据,扩展到更复杂的推理和决策场景,推动模型的实例适应性与泛化能力进一步提升。
AI 总览摘要
在深度学习领域,策略蒸馏作为提升模型推理能力的重要手段,长期面临如何充分利用多样化采样信息的挑战。传统方法多关注单一轨迹的知识迁移,忽视了多轨迹组中潜在的局部结构信息。本文提出的多轮次策略蒸馏(MOPD)创新性地利用同行成功与失败轨迹,构建条件化教师信号,从而实现更具针对性和适应性的模型指导。
MOPD的核心思想是通过在同一问题实例中采样多条轨迹,将成功轨迹作为正面证据,失败轨迹作为负面证据,进行对比学习。这一机制使得教师模型不仅关注全局奖励,更能识别局部推理路径中的关键差异。算法采用逆KL和Jensen-Shannon散度,结合轨迹的结构信息,有效增强模型在复杂推理任务中的表现。
在多个任务上,包括数学推理、科学问答、编程和工具使用,MOPD均优于传统的单轨迹蒸馏和基线方法,表现出显著的性能提升。例如,在AIME2024/2025数学竞赛题中,正确率提升超过20%。此外,分析显示混合成功与失败轨迹的对比条件化能更好地匹配验证器奖励,验证了其在实例适应性监督中的优势。
该研究不仅丰富了策略蒸馏的理论体系,也为深度学习中多试错学习提供了新范式。未来,结合更丰富的多模态信息和优化采样策略,有望推动模型在更复杂环境中的自主学习与推理能力,具有广泛的学术和工业应用潜力。
深度分析
研究背景
深度学习中的策略蒸馏技术经过多年发展,逐渐成为提升模型推理能力的关键手段。早期工作如Hinton等提出的知识蒸馏,主要关注模型输出的概率匹配,后续研究引入强化学习和自我蒸馏,增强模型的泛化和鲁棒性。近年来,基于轨迹采样的策略蒸馏(如AGARWAL等的OPD)逐步成为主流,强调在模型自身行为中进行学习,减少分布偏差。然而,现有方法多忽视多轨迹组的局部结构信息,未能充分利用同行轨迹中的正负证据。与此同时,强化学习中的多轮次采样与验证器引导的改进(如Shao等的多轮强化学习)虽在奖励密度上有所突破,但在知识迁移中仍未融合多轨迹对比信息,限制了模型的推理深度和鲁棒性。
核心问题
当前深度模型在复杂推理任务中表现有限,部分原因在于训练过程中未能充分利用多次采样的局部结构信息。单一轨迹的知识蒸馏忽略了同行轨迹中的正负证据,导致模型难以区分正确路径与误导路径。尤其在推理任务中,成功轨迹提供有效的解题策略,而失败轨迹揭示潜在的误区和错误模式。如何设计一种机制,将多轨迹的局部差异作为指导信号,提升模型的实例适应性和推理能力,成为亟待解决的问题。
核心创新
本文的核心创新在于引入同行轨迹的对比信息到策略蒸馏中,提出多轮次策略蒸馏(MOPD)。具体包括:1)利用成功轨迹作为正向同行证据,2)结合失败轨迹作为结构化负证据,3)设计基于逆KL和Jensen-Shannon散度的对比损失,4)构建多轨迹条件化教师信号,增强模型对局部推理路径的识别能力。这一机制突破了传统单轨迹蒸馏的局限,为模型提供了更丰富、更具针对性的监督信息,有效提升推理任务中的表现。
方法详解
- �� 采样多轨迹:在每个问题实例中,模型生成多条轨迹。
- �� 轨迹评价:利用验证器对轨迹进行评分,将其划分为成功与失败两组。
- �� 条件化教师:构建同行轨迹的上下文信息,包括成功与失败轨迹。
- �� 损失函数:采用逆KL或Jensen-Shannon散度,结合轨迹成功与失败信息,优化学生模型。
- �� 轨迹对比:在训练中,教师根据同行轨迹的结构差异,提供更细粒度的指导。
- �� 训练流程:采样、评分、构建条件、计算损失、模型更新,循环迭代。
实验设计
在数学、科学问答、编程和工具使用任务中,使用特定数据集(如AIME、SciKnowEval、LiveCodeBench、ToolAlpaca)进行训练。对比基线包括标准OPD、GRPO和SDPO,采用多样化指标(如平均正确率、pass@8)评估性能。实验中,采样轨迹数固定,验证器评分一致,进行消融分析验证同行轨迹的不同构建策略效果。模型参数、采样次数、奖励阈值等超参数保持一致,确保公平性。
结果分析
MOPD在所有任务中均优于对比方法,数学推理任务提升20%以上,科学问答和工具使用任务提升10-15%。对比成功与失败轨迹的条件化显著优于仅用成功轨迹,验证了结构化负证据的有效性。分析显示,混合轨迹条件化能更好匹配验证器奖励,模型在复杂推理中表现更鲁棒,训练收敛更快。
应用场景
该方法适用于需要多步推理、结构化输出和复杂决策的场景,如自动编程、科学研究、智能问答和机器人控制。通过引入同行轨迹对比,模型能更好地识别潜在错误,提升自主学习能力。未来,结合多模态信息和强化采样策略,有望在更复杂环境中实现自主推理与决策。
局限与展望
当前方法对轨迹采样数量敏感,采样不足或偏差会影响效果。高复杂度任务中计算成本较高,尤其在大规模多轨迹采样时对硬件要求较大。稀疏奖励环境下,同行轨迹的结构信息可能不足以提供有效指导。未来需优化采样效率和结构信息利用策略,以应对更复杂的应用场景。
通俗解读 非专业人士也能看懂
想象你在学习做菜,你尝试了几次不同的方法。有时候你做得很好,味道很棒;有时候则失败了。这些尝试就像模型的轨迹,有成功的,也有失败的。现在,你的老师不仅告诉你哪次做得好,还会告诉你哪次做错了,为什么错了。这样,你就能更清楚地知道哪些步骤是正确的,哪些是需要改正的。通过比较这些不同的尝试,你可以学得更快、更好。这就像MOPD的方法,用多次尝试的成功和失败来指导学习,而不是只看最终的结果。这样,学习变得更有效,也更贴近实际的试错过程。
简单解释 像给14岁少年讲一样
想象你在玩一款游戏,你每次都试不同的策略。有时候你赢了,有时候输了。你的哥哥会告诉你:‘这个策略不错,下次可以试试这个!’或者:‘这个方法不行,要注意这个陷阱!’通过不断比较成功和失败的经验,你学得更快、更聪明。这就像模型在学习时,不只是看最终答案,而是用多次尝试的结果来判断哪些做法是对的,哪些要避免。这样,模型就能像你一样,逐渐变得更厉害,能应对各种难题。这个方法叫做多轮次策略蒸馏,它让模型在试错中不断改进,就像你在游戏中变得越来越厉害一样。
原文摘要
Large language models are often post-trained with sparse verifier rewards, which indicate whether a sampled trajectory succeeds but provide limited guidance about where reasoning succeeds or fails. On-policy distillation (OPD) offers denser token-level supervision by training on student-generated trajectories, yet existing methods typically distill each rollout independently and ignore the other attempts sampled for the same prompt. We introduce Multi-Rollout On-Policy Distillation (MOPD), a peer-conditioned distillation framework that uses the student's local rollout group to construct more informative teacher signals. MOPD conditions the teacher on both successful and failed peer rollouts: successes provide positive evidence for valid reasoning patterns, while failures provide structured negative evidence about plausible mistakes to avoid. We study two peer-context constructions: positive peer imitation and contrastive success-failure conditioning. Experiments on competitive programming, mathematical reasoning, scientific question answering, and tool-use benchmarks show that MOPD consistently improves over standard on-policy baselines. Further teacher-signal analysis shows that mixed success-failure contexts better align teacher scores with verifier rewards, indicating that the gains arise from more faithful, instance-adaptive supervision. These results indicate that effective on-policy distillation should exploit the student's multi-rollout trial-and-error behavior rather than treating rollouts as isolated samples.