核心发现
方法论
COPD通过对比教学信号,提供轻量和重量推理的对比信息,指导学生模型优化。冻结的教师模型在相同学生状态下对轻量和重量推理进行打分,差值作为信号指导更新。
关键结果
- COPD在九个多模态基准上减少推理长度,提升效率,Acc@1K提高141.2%。
- 与ExOPD相比,COPD在WeMath上提高11.3个百分点,推理长度减少60.7%。
- COPSD变体无需外部教师,提升了模型的自蒸馏能力。
研究意义
COPD通过对比信号提升推理效率,减少冗余推理步骤,适用于多种任务和模型规模。该方法不仅在学术界具有重要意义,还能在工业应用中提高模型的计算效率。
技术贡献
COPD通过对比信号取代单一教师分布模仿,提供了新的推理压缩方法。与现有方法相比,COPD强调推理模式的相对偏好,提供了更高效的学习信号。
新颖性
COPD首次将对比信号引入到策略蒸馏中,强调推理模式的相对偏好,而非单一分布模仿,显著提升了推理效率。
局限性
- COPD在推理任务上表现优异,但在极短输出任务上可能导致精度下降。
- 对比信号的有效性依赖于教师模型的冻结状态。
未来方向
未来研究可以探索COPD在更多任务上的应用,并优化对比信号的生成机制,以提高模型的自适应能力。
AI 总览摘要
近年来,随着大规模推理模型的进步,推理过程中的冗余问题日益突出。现有的在策略蒸馏方法主要依赖于单一分布的模仿,缺乏对推理模式相对偏好的建模。
COPD通过引入对比信号,提供轻量和重量推理的对比信息,指导学生模型优化。冻结的教师模型在相同学生状态下对轻量和重量推理进行打分,差值作为信号指导更新。COPD不仅减少了推理长度,还提高了推理效率。
实验结果表明,COPD在九个多模态基准上表现出色,显著减少推理长度而不影响性能。COPSD变体进一步展示了无需外部教师的自蒸馏能力。未来研究可以探索COPD在更多任务上的应用,并优化对比信号的生成机制。
深度分析
研究背景
近年来,推理模型在多模态理解和文本推理任务中取得了显著进展。然而,随着推理能力的提高,推理过程中的冗余问题日益突出。现有的方法主要通过选择简洁的路径、偏好对、令牌预算或奖励机制来提高效率。
核心问题
现有的在策略蒸馏方法依赖于单一分布的模仿,缺乏对推理模式相对偏好的建模。这导致在推理模式之间缺乏明确的比较信号,无法直接建模这些模式之间的偏好。
核心创新
COPD通过引入对比信号,提供轻量和重量推理的对比信息,指导学生模型优化。冻结的教师模型在相同学生状态下对轻量和重量推理进行打分,差值作为信号指导更新。
方法详解
- �� 学生模型生成推理轨迹。
- �� 冻结的教师模型对相同轨迹进行轻量和重量推理的打分。
- �� 计算两者的差值作为对比信号。
- �� 使用对比信号指导学生模型的更新。
实验设计
实验在九个多模态基准上进行,包括推理和理解任务。COPD在这些任务上显著减少推理长度,提高效率。实验使用了Qwen3-VL-2B-Instruct和Qwen3.5-2B等模型。
结果分析
COPD在所有任务上减少了推理长度,提高了推理效率。与ExOPD相比,COPD在WeMath上提高11.3个百分点,推理长度减少60.7%。
应用场景
COPD适用于需要高效推理的多模态任务,如数学问题求解、逻辑推理和多步决策等。
局限与展望
COPD在推理任务上表现优异,但在极短输出任务上可能导致精度下降。对比信号的有效性依赖于教师模型的冻结状态。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。现有的方法就像是跟着一本食谱一步步来,而COPD就像是有一个经验丰富的厨师在旁边指导你,告诉你哪些步骤可以简化,哪些步骤需要仔细。通过这种对比指导,你可以更快地做好饭,而不影响味道。
简单解释 像给14岁少年讲一样
想象你在玩一个解谜游戏。通常,你会一步步尝试每个可能的解法,但这可能很耗时。COPD就像是游戏中的提示系统,它会告诉你哪些步骤可以跳过,哪些步骤需要仔细考虑。这样,你可以更快地完成游戏,而不失去乐趣!
术语表
对比学习 (Contrastive Learning)
一种通过比较样本之间的相似性和差异性来学习特征的技术。
COPD利用对比学习来指导学生模型的优化。
在策略蒸馏 (On-Policy Distillation)
一种通过在学生模型生成的轨迹上进行监督的技术。
COPD通过在策略蒸馏提供对比信号。
多模态 (Multimodal)
涉及多种数据类型(如图像、文本)的技术。
COPD在多模态基准上进行测试。
自蒸馏 (Self-distillation)
一种无需外部教师模型的蒸馏技术。
COPSD变体展示了自蒸馏能力。
推理效率 (Reasoning Efficiency)
在保持性能的前提下减少推理步骤的能力。
COPD显著提高了推理效率。
开放问题 这项研究留下的未解疑问
- 1 如何在极短输出任务中保持COPD的有效性?
- 2 对比信号的生成机制如何优化以提高模型的自适应能力?
应用场景
近期应用
数学问题求解
COPD可以用于提高数学问题求解的效率,减少不必要的推理步骤。
远期愿景
通用AI系统
COPD的对比信号机制可以用于构建更高效的通用AI系统,减少计算成本。
原文摘要
On-policy Distillation (OPD) supervises a student model on trajectories sampled from its own policy by minimizing the divergence between the output distributions of the teacher and student at each token position, thereby providing dense token-level supervision. Although existing OPD methods have demonstrated strong performance in improving the reasoning ability of student models, their objectives fundamentally rely on token-level distribution matching. Consequently, they lack an explicit signal for comparing a token's relative compatibility across reasoning modes and thus do not directly model preferences between these modes. To address this limitation, we propose COPD, a contrastive OPD framework. Specifically, for each token generated by the student model, a frozen teacher model scores the same student state under two contrasting instructions that elicit light and heavy reasoning. The difference between the resulting log probabilities serves as a token-level advantage signal to guide the OPD update. Rather than merely imitating a single teacher distribution, COPD directly encourages the student model to learn more concise and efficient reasoning strategies. We conduct experiments on nine multimodal benchmarks covering both reasoning and understanding tasks. The results show that COPD substantially reduces reasoning length without compromising model performance and consistently improves efficiency across different tasks and model scales. Furthermore, the contrastive formulation can be seamlessly integrated into the On-policy Self-distillation (OPSD) framework, where self-contrastive supervision is constructed without an additional teacher model, thereby enabling the model to distill itself toward lightweight reasoning.