Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold

TL;DR

提出扩展-压缩框架,通过多教师策略蒸馏提升推理能力,Qwen3-1.7B模型在数学推理等领域提升2.0%-8.3%。

cs.LG 🔴 高级 2026-07-30 3 次浏览
Songshuo Lu Zhi Chen Yaohua Tang
强化学习 多教师蒸馏 推理 数学推理 代码生成

核心发现

方法论

该研究提出了扩展-压缩框架,结合残差组相对策略优化(RGRPO)和可靠性门控教师联合在策略蒸馏(TU-OPD)。在扩展阶段,RGRPO通过从公共初始化训练一系列教师,覆盖未被教师联合覆盖的示例。在压缩阶段,TU-OPD让学生从自身响应前缀中学习,仅可靠教师贡献,并根据每个示例的质量加权。

关键结果

  • Qwen3-1.7B学生模型在数学推理、代码生成和指令遵循上分别比最强单一教师提高2.0%、8.3%和6.9%。
  • 实验表明,扩展阶段的多教师策略显著增强了学生模型的整体性能,尤其在数学推理中,学生模型的平均表现超过了任何单一教师。
  • 消融实验显示,教师间的互补性在压缩阶段得以有效整合,提升了学生模型的综合能力。

研究意义

该研究通过多教师策略蒸馏解决了单一强化学习教师在推理任务中覆盖不全的问题,显著提升了学生模型在多个领域的表现。这一框架为学术界和工业界提供了一种新的思路,能够更全面地利用多种推理模式,提升模型的泛化能力。

技术贡献

提出的扩展-压缩框架与现有方法的根本区别在于其多教师策略的构建和压缩过程。通过RGRPO和TU-OPD的结合,该方法不仅扩展了推理解决方案的覆盖范围,还在压缩过程中保留了教师的专业化行为,提供了新的工程可能性。

新颖性

这是首次将多教师策略与推理解决方案多样性结合的研究。与以往方法相比,该研究不仅关注教师的选择,还通过扩展-压缩框架实现了教师能力的综合利用。

局限性

  • 该方法在处理极端复杂的推理任务时可能仍然面临挑战,尤其是在教师之间存在较大差异的情况下。
  • 在某些情况下,教师的可靠性评估可能不够精确,影响学生模型的最终性能。

未来方向

未来工作可以探索如何在更大规模的数据集和更复杂的任务中应用该框架,进一步提升模型的推理能力。此外,研究如何自动化教师的选择和组合也是一个重要方向。

AI 总览摘要

在复杂推理任务中,单一强化学习教师往往只覆盖有限的解决方案模式。为解决这一问题,本文提出了一种扩展-压缩框架,通过多教师策略蒸馏提升学生模型的推理能力。

该框架包括两个阶段:扩展阶段和压缩阶段。在扩展阶段,使用残差组相对策略优化(RGRPO)训练一系列教师,覆盖未被教师联合覆盖的示例。在压缩阶段,使用可靠性门控教师联合在策略蒸馏(TU-OPD)将教师的能力压缩到单一学生模型中。

实验结果表明,Qwen3-1.7B学生模型在数学推理、代码生成和指令遵循上分别比最强单一教师提高2.0%、8.3%和6.9%。这一框架为学术界和工业界提供了一种新的思路,能够更全面地利用多种推理模式,提升模型的泛化能力。

深度分析

研究背景

近年来,强化学习在推理任务中的应用取得了显著进展。然而,单一强化学习教师往往只能覆盖有限的解决方案模式,导致模型在某些推理任务中的表现不佳。为解决这一问题,研究者们开始探索多教师策略蒸馏的方法,以期提升模型的泛化能力。

核心问题

单一强化学习教师在推理任务中覆盖不全的问题是一个重要挑战。由于推理任务的复杂性,正确的解决方案往往不唯一,单一教师可能只捕获到部分解决方案模式,导致模型在未被覆盖的区域表现不佳。

核心创新

本文提出的扩展-压缩框架通过结合残差组相对策略优化(RGRPO)和可靠性门控教师联合在策略蒸馏(TU-OPD),在扩展阶段训练一系列教师覆盖未被教师联合覆盖的示例,并在压缩阶段将教师的能力压缩到单一学生模型中。

方法详解

  • �� 扩展阶段:使用RGRPO训练一系列教师,覆盖未被教师联合覆盖的示例。
  • �� 压缩阶段:使用TU-OPD将教师的能力压缩到单一学生模型中。
  • �� 可靠性评估:根据每个示例的质量加权教师的贡献。

实验设计

实验在数学推理、代码生成和指令遵循三个领域进行,使用Skywork-OR1-RL-Data和IFBench数据集。评估指标包括Avg.@8和Pass@8。实验设计包括四个残差GRPO教师和一个学生模型。

结果分析

Qwen3-1.7B学生模型在数学推理、代码生成和指令遵循上分别比最强单一教师提高2.0%、8.3%和6.9%。实验表明,扩展阶段的多教师策略显著增强了学生模型的整体性能。

应用场景

该框架可用于提升复杂推理任务中的模型性能,适用于数学推理、代码生成和指令遵循等领域。其多教师策略蒸馏方法能够更全面地利用多种推理模式,提升模型的泛化能力。

局限与展望

尽管该框架在多个领域表现出色,但在处理极端复杂的推理任务时可能仍然面临挑战。此外,教师的可靠性评估可能不够精确,影响学生模型的最终性能。

通俗解读 非专业人士也能看懂

想象一个学校,老师们各自擅长不同的科目。有的老师擅长数学,有的老师擅长科学。我们的目标是培养一个学生,他能够从所有这些老师那里学到最好的知识。我们首先让每位老师专注于他们最擅长的领域,然后将他们的知识整合到一个学生身上。这样,学生就能在所有科目中表现出色,而不是仅仅在某一个领域。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你有四个不同的角色,每个角色都有自己的特殊技能。你想要创建一个超级角色,能够拥有所有这些技能。首先,你让每个角色在他们的领域里变得更强,然后你把他们的技能合并到一个角色中。这样,你就有了一个无敌的角色,可以在游戏中击败所有敌人!

术语表

Residual Group Relative Policy Optimization (RGRPO)

一种用于训练多个教师模型的方法,旨在覆盖未被现有教师覆盖的示例。

在扩展阶段用于训练教师模型。

Teacher-Union On-policy Distillation (TU-OPD)

一种将多个教师模型的能力压缩到单一学生模型中的方法。

在压缩阶段用于整合教师模型的能力。

Qwen3-1.7B

一种学生模型,通过多教师策略蒸馏提升推理能力。

实验中用于评估框架性能的模型。

Skywork-OR1-RL-Data

用于训练和评估模型的数学推理和代码生成数据集。

实验中使用的数据集之一。

IFBench

用于评估指令遵循任务的验证数据集。

实验中使用的数据集之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上应用该框架以提升推理能力?
  • 2 如何自动化教师的选择和组合以优化模型性能?

应用场景

近期应用

数学推理

该框架可用于提升数学推理任务中的模型性能,适用于教育和研究领域。

远期愿景

通用人工智能

通过多教师策略蒸馏,未来可能实现更强大的通用人工智能,能够在多种任务中表现出色。

原文摘要

A single reinforcement-learning run can produce a strong reasoner yet an incomplete teacher: it often amplifies only a subset of the valid solution modes. We argue that reinforcement learning (RL)-trained policies should therefore be viewed as local probes of a multi-basin reasoning solution manifold, rather than as globally reliable supervisors. Based on this view, we propose an expand-then-compress framework that couples teacher construction with multi-teacher policy distillation. In the expansion stage, Residual Group Relative Policy Optimization (RGRPO) trains a sequence of teachers from a common initialization and redirects each later round toward examples not yet covered by the accumulated teacher union. In the compression stage, reliability-gated Teacher-Union On-policy Distillation (TU-OPD) lets the student learn from its own response prefixes. For each example, only reliable teachers contribute, and their sampled-token OPD losses are weighted by their per-example quality. We further introduce Consensus-Residual Decomposition, which preserves a winner teacher's excess token preferences over its reliable peers, preventing specialist behavior from being suppressed during teacher aggregation. Experiments on mathematical reasoning, code generation, and instruction following show that the resulting Qwen3-1.7B student consistently outperforms the strongest individual teacher across all three domains, yielding relative improvements of 2.0%, 8.3%, and 6.9%, respectively, while retaining single-model inference. These results establish a simple but powerful principle: stronger students can be obtained not by selecting a single better teacher, but by deliberately constructing and compressing a complementary teacher union.

cs.LG