Self-Policy Distillation via Capability-Selective Subspace Projection

TL;DR

提出自策略蒸馏(SPD),通过低秩子空间投影实现无外部信号的能力选择,提升模型性能13%。

cs.CL 🔴 高级 2026-05-22 50 次浏览
Guangya Hao Yitong Shang Yunbo Long Zhuokai Zhao Hanxue Liang
深度学习 模型蒸馏 能力选择 子空间投影 大规模语言模型

核心发现

方法论

SPD通过在校准集上计算正确性定义标记的梯度,采用奇异值分解(SVD)提取关键能力子空间。随后,在自生成过程中,将模型的KV激活投影到此子空间,指导模型偏向目标能力。最后,利用标准的下一词预测损失对生成数据进行微调。该方法无需外部信号,依赖模型自身梯度,确保能力选择的泛化性。核心步骤包括:1)利用校准集计算梯度,2)进行SVD提取子空间,3)在自生成时引入投影钩子,4)微调模型参数。

关键结果

  • 在代码生成、数学推理和多项选择问答任务中,SPD在五个不同基础模型上平均提升13%,超越现有自蒸馏方法。具体而言,在Qwen2.5-14B模型上,性能提升幅度达16%。在跨域测试中,SPD表现出优异的泛化能力,提升15%。
  • 实验显示,SPD在源任务和迁移任务中均优于纯自蒸馏(SSD)和无筛选的自训练(PSR),尤其在out-of-domain场景中表现更为显著,验证了其能力选择的有效性。
  • 通过消除模型特定的风格和格式噪声,SPD增强了目标能力的信号纯度,显著改善了模型在未知领域的表现。

研究意义

该研究突破了无需外部信号的自蒸馏瓶颈,提出能力选择的子空间投影机制,为大模型的能力提升提供了更为普适和高效的路径。其强大的泛化能力和能力筛选能力,有望推动自动化模型微调、知识迁移和模型鲁棒性提升,具有深远的学术和工业价值。

技术贡献

提出基于梯度的低秩子空间提取机制,结合奇异值分解实现能力选择。引入投影钩子在自生成过程中引导模型偏向目标能力,避免外部信号依赖。采用LoRA微调技术,保证训练效率。该方法在不改变模型参数的前提下,增强了模型能力的可控性和泛化性,突破了现有自蒸馏的局限。

新颖性

首次提出利用模型自身梯度在能力定义标记上提取子空间,结合投影钩子实现能力选择的自蒸馏框架。区别于传统依赖外部验证器或奖励模型的方法,SPD实现了纯内生的能力筛选,显著提升跨域泛化能力,具有创新性。

局限性

  • 依赖少量校准集进行梯度提取,可能在极少样本或噪声较大情况下表现不佳。
  • 投影钩子仅在训练阶段使用,实际推理中未考虑动态能力调整的可能性。
  • 在极端复杂任务或超大模型中,子空间提取和投影可能带来额外计算成本。

未来方向

未来将探索动态子空间更新机制,结合强化学习优化能力筛选策略,扩展到多模态任务,并提升投影钩子的效率和适应性,以实现更广泛的能力调控和模型自我增强。

AI 总览摘要

大规模语言模型(LLMs)在诸多任务中展现出卓越性能,但其训练和微调仍面临能力泛化和能力干扰的挑战。传统的自蒸馏方法依赖外部验证信号,成本高且难以普适,纯自生成训练则易受风格和格式噪声干扰,导致能力提升有限。本文提出了自策略蒸馏(SPD),一种无需外部信号的能力选择框架。SPD通过在校准集上计算模型梯度,利用奇异值分解提取能力子空间,并在自生成过程中引入投影钩子,将KV激活投影到目标能力子空间,从而引导模型偏向目标能力。微调阶段,模型在纯自生成数据上进行训练,显著提升了在代码、数学推理和问答任务中的表现,平均提升13%,在跨域测试中表现尤为优异,达15%的提升。实验结果验证了SPD在能力选择和泛化方面的优势,展示了其在无外部信号条件下实现能力定向提升的潜力。这一方法为大模型的自主能力调控提供了新思路,有望推动自动化微调和知识迁移的研究进展。未来,结合动态子空间更新和多模态扩展,SPD有望成为模型能力增强的核心技术之一。

深度分析

研究背景

近年来,随着GPT、BERT等模型的崛起,模型规模不断扩大,能力也日益丰富。模型蒸馏技术通过压缩和迁移知识,提升模型效率和性能。早期的蒸馏方法如软目标蒸馏(Hinton et al.)主要依赖外部教师模型,存在成本高和泛化差的问题。后续的自蒸馏(Zhang et al.)尝试用模型自身生成数据,但受限于噪声和风格干扰,效果有限。近年来,研究者开始关注能力选择和能力干扰问题,试图在自生成数据中筛选出任务相关的信号,提升模型泛化能力。

核心问题

现有自蒸馏方法要么依赖昂贵的外部信号,要么直接用全部自生成数据,容易强化模型已有偏差,且难以在不同任务和域间泛化。模型自生成输出中,任务相关能力信号常被风格、格式和模型特定错误所淹没,导致能力提升效果受限。如何在无外部信号的情况下,有效筛选目标能力,提升模型泛化和鲁棒性,成为亟待解决的核心问题。

核心创新

本文提出的SPD创新点在于:1)利用模型梯度在正确性定义标记上提取低秩子空间,明确能力方向;2)引入投影钩子,将KV激活投影到能力子空间,指导自生成偏向目标能力;3)在微调阶段,移除钩子,利用筛选后的数据提升模型能力。与传统方法不同,SPD无需外部验证器或奖励模型,完全依赖模型内部信息,确保能力选择的普适性和效率。

方法详解

  • �� 通过校准集计算模型在正确性定义标记上的梯度,获得梯度矩阵。• 对梯度矩阵进行奇异值分解(SVD),提取主要方向,构建低秩投影子空间。• 在自生成过程中,将KV激活通过钩子投影到子空间,偏向目标能力。• 生成自数据后,移除钩子,利用标准的下一词预测损失微调模型。• 采用LoRA技术,保证训练效率和参数更新的灵活性。• 通过多任务、多域测试验证方法的有效性和泛化能力。

实验设计

在代码生成(MBPP、CodeAlpaca)、数学推理(GSM8K、SVAMP)和问答(MMLU、BBH)等多个任务上,比较基线模型、纯自训练(PSR)、传统自蒸馏(SSD)和提出的SPD。采用不同模型规模(如Qwen2.5-0.5B到14B)进行验证。指标包括准确率、NLL、答题正确率等。通过在源任务、迁移任务和跨域测试中,评估能力提升效果。超参数包括子空间秩r、校准集大小等,均经过调优。

结果分析

SPD在五个模型上平均提升13%,在Qwen2.5-14B模型上达16%。在跨域测试中,性能提升达15%,明显优于SSD和PSR。在不同任务中,SPD能有效筛除风格和格式噪声,增强能力信号,显著改善模型在未知领域的表现。实验还显示,能力子空间提取的效果对模型性能提升至关重要,子空间的质量直接影响能力偏向。

应用场景

该方法适用于自动微调、知识迁移、模型鲁棒性增强等场景。无需外部验证器,降低成本,提升效率。可应用于多模态模型、知识增强系统,推动AI自主能力调控。未来可结合动态子空间更新和多任务学习,拓展到更复杂的应用场景。

局限与展望

依赖少量校准集,可能在样本不足或噪声大时效果受影响。钩子仅在训练阶段使用,推理时未考虑动态调整。大模型中,子空间提取和投影计算成本较高,需优化算法以适应超大规模模型。未来需解决子空间动态更新和多模态扩展的技术难题。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有许多不同的机器,每台机器都能做不同的任务。有时候,你希望让某台机器专注于某个特定任务,比如装配或包装。传统的方法是给机器装上专门的传感器或外部指导,但这样成本高,还不够灵活。本文的方法就像是让工厂自己找到最擅长某项任务的“秘密路径”,然后用这个路径引导机器自己做事。工厂通过观察机器在不同任务中的表现,找到那些最能代表目标能力的“关键路线”,在机器工作时用特殊的“投影器”引导它们。这样,机器就能更专注于目标任务,效果也更好。这种方法不需要外部干预,只依靠工厂内部的观察和调整,就能让机器变得更聪明、更专注。

简单解释 像给14岁少年讲一样

想象你在学校里,有一台超级智能的学习机。平时,它会自己练习各种题目,但有时候它会偏离目标,比如喜欢用奇怪的方式答题,或者记错答案。为了让它更专注于正确的知识点,你可以用一种特别的方法:先观察它在答题时哪里出错,然后找到那些关键的知识点,把这些知识点“提取出来”。接着,在它自己练习的过程中,用一种“魔法”把这些关键知识点放大,让它更容易记住正确的答案。最后,让它用这些“重点”去重新练习,变得更聪明、更准确。这就像是你帮学习机找到最重要的知识线索,让它自己变得更厉害,而不需要外面的老师一直指导。这样,它就能在不同的考试和新题目中表现得更好啦!

原文摘要

Self-distillation bootstraps large language models (LLMs) by training on their own generations. However, existing methods either rely on external signals to curate self-generated outputs (e.g., correctness filtering, execution feedback, and reward search), which are costly and unavailable for the best-performing frontier models, or skip curation entirely and train on all raw outputs, an approach that is often domain-specific and hard to generalize. Both also share a deeper weakness that self-generated outputs entangle task-relevant capability with others, such as stylistic patterns, formatting artifacts, and model-specific errors, diluting the signal for the specific capability one aims to improve. In this paper, we propose Self-Policy Distillation (SPD), which achieves generalizable, capability selective without any external signal. Specifically, SPD extracts a low-rank capability subspace from the model's own gradients on correctness-defining tokens, projects key-value (KV) activations into this subspace during self-generation, and fine-tunes on the resulting raw outputs with standard next-token prediction loss. Through extensive experiments across code generation, mathematical reasoning, and multiple-choice QA, we show that SPD achieves up to 13% improvement over state-of-the-art self-distillation methods without external signals and up to 16% improvement over pre-trained baselines. Notably, SPD demonstrates superior generalizability, achieving 15% better performance under out-of-domain generalization settings.

cs.CL