SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

TL;DR

本研究系统分析了大规模MoE模型预训练中的剪枝与蒸馏,发现剪枝优于从零训练,结合KD和渐进式调度效果最佳。

cs.LG 🔴 高级 2026-05-09 47 次浏览
Shengkun Tang Zekun Wang Bo Zheng Liangyu Wang Rui Men Siqi Zhang Xiulong Yuan Zihan Qiu Zhiqiang Shen Dayiheng Liu
模型压缩 稀疏化 知识蒸馏 Mixture-of-Experts 预训练

核心发现

方法论

作者采用结构化剪枝(宽度、深度、专家剪枝)结合持续预训练,比较从剪枝模型和从零训练的性能差异。引入部分保持专家合并策略,结合多Token预测蒸馏(MTP KD)提升知识迁移效果。采用渐进式调度(深度优先、宽度优先、联合)优化训练轨迹。通过大规模(400B tokens)持续预训练验证不同策略的效果,结合具体指标如MMLU、GSM8K等进行评估。

关键结果

  • 在相同训练预算下,剪枝预训练模型明显优于从零训练,平均提升约11.79点(73.45 vs. 61.66),且能恢复到教师模型的86.5%性能。不同专家剪枝方法在大规模持续预训练后收敛至相似性能,提出部分保持专家合并策略,显著改善下游任务表现。结合多Token蒸馏(MTP KD)和语言模型(LM)损失,提升知识密集任务表现,渐进式调度优于一次性剪枝,最终将Qwen3-Next-80A3B压缩至23A2B模型,性能依然具有竞争力。
  • 结果显示,结构化剪枝在预训练中提供更优初始化,专家合并策略有效平衡专家专长与融合,渐进式调度带来更平滑的优化路径,结合多Token蒸馏显著提升模型泛化能力。

研究意义

该研究为大规模MoE模型的高效压缩提供了系统性方案,突破了传统只关注密集模型的局限。通过结合剪枝、蒸馏和渐进调度,有效降低模型复杂度,提升推理速度和部署效率,解决了模型规模膨胀带来的实际应用瓶颈。研究成果对未来大模型的可持续发展具有重要指导意义,推动模型压缩技术在工业界的落地应用,尤其在资源有限环境中实现高性能推理。

技术贡献

本文首次系统性比较了不同剪枝策略(宽度、深度、专家)在大规模预训练中的效果,提出部分保持专家合并策略,有效避免专家同质化。引入多Token蒸馏(MTP KD)提升知识迁移效率,结合渐进式调度实现平滑优化路径。整体架构设计兼顾模型压缩与性能恢复,为MoE模型的实用化提供技术基础,推动稀疏模型的工程应用。

新颖性

创新点在于提出部分保持专家合并策略,结合多Token蒸馏和渐进调度,系统验证在超大规模预训练中的有效性。首次在大规模MoE模型中系统性比较多种剪枝和蒸馏策略,提供实用的压缩方案,突破了以往只关注密集模型的局限,推动稀疏模型的工程落地。

局限性

  • 当前方法主要在特定模型架构(Qwen3-Next)上验证,泛化到其他MoE架构仍需验证。
  • 渐进调度虽有效,但调度策略参数仍需调优,缺乏自动化优化机制。
  • 模型压缩过程中可能存在信息丢失,影响极端任务表现,未来需结合更智能的专家选择与合并策略。

未来方向

未来将探索自动化调度策略,结合强化学习优化剪枝路径;同时研究更高效的专家合并算法,提升压缩比与性能平衡。还将扩展到多模态模型,推动稀疏大模型在实际场景中的应用落地。

AI 总览摘要

随着大规模语言模型(LLMs)不断扩大,模型的存储和计算成本成为瓶颈。Mixture-of-Experts(MoE)架构通过引入专家机制,有效扩展模型能力,但同时带来模型复杂度和部署难题。传统的模型压缩技术如结构化剪枝和知识蒸馏在密集模型中已取得显著成效,但在MoE模型中的应用仍面临挑战。

本文系统研究了大规模预训练中的MoE模型压缩策略,重点分析了剪枝初始化、专家合并、蒸馏方法及渐进调度的效果。研究发现,预训练模型经过结构化剪枝后,作为初始化比从零训练更优,能显著提升性能和收敛速度。不同专家剪枝和合并方法在大规模持续预训练后性能趋同,提出的部分保持专家合并策略有效避免专家同质化,提升下游任务表现。

此外,作者引入多Token预测蒸馏(MTP KD),结合语言模型损失,显著改善知识密集任务表现。渐进式调度(深度优先、宽度优先、联合)优于一次性剪枝,提供更平滑的优化路径。最终,将Qwen3-Next-80A3B模型压缩到23A2B,性能仍具竞争力,验证了方法的实用性和有效性。这些研究为大规模MoE模型的高效压缩提供了系统性解决方案,推动稀疏模型在工业界的应用落地。

深度分析

研究背景

近年来,随着Transformer架构的不断发展,模型规模不断扩大,带来性能提升的同时也引发存储和计算成本激增的问题。密集模型如GPT-3、PaLM等虽取得突破,但部署成本高昂。MoE架构通过引入专家机制,实现参数稀疏化,有效扩展模型能力,代表性工作包括Shazeer et al. (2017)提出的MoE模型。近年来,结构化剪枝和知识蒸馏在密集模型中已广泛应用,提升效率,但在MoE模型中的系统性研究较少,尤其是在预训练阶段的压缩策略尚未成熟。

核心问题

大规模MoE模型在预训练和推理中仍面临高昂的计算和存储成本,如何在保证模型性能的前提下实现有效压缩成为关键。传统剪枝方法在MoE中涉及专家、层和宽度的多维度剪裁,如何设计合理的初始化和调度策略,减少信息丢失,提升下游任务表现,是亟待解决的问题。此外,专家合并策略的有效性和蒸馏方法的结合也影响模型最终效果。

核心创新

本文提出部分保持专家合并策略,有效平衡专家专长和融合,避免专家同质化。引入多Token预测蒸馏(MTP KD),增强知识迁移能力,结合渐进式调度(深度优先、宽度优先、联合)优化训练轨迹。创新点在于系统性比较多种剪枝和蒸馏策略,验证在超大规模预训练中的有效性,为MoE模型压缩提供实用方案。

方法详解

  • �� 结构化剪枝:包括宽度、深度、专家剪枝,利用激活统计和重要性指标(如路由频率、软logits、REAP)选择剪枝目标。
  • �� 专家合并:基于专家相似性和重要性,采用部分保持策略,保留部分专家,合并剩余专家,避免专家同质化。
  • �� 蒸馏方法:结合多Token预测(MTP)蒸馏,监督多个未来Token,提高知识迁移效率。
  • �� 逐步调度:设计深度优先、宽度优先和联合调度策略,逐步剪枝,确保模型平滑过渡。
  • �� 实验验证:在80A3B模型上,进行400B tokens持续预训练,评估多任务性能,比较不同策略效果。

实验设计

采用Qwen3-Next架构,进行深度、宽度和专家剪枝,使用多Token蒸馏,结合不同调度策略。训练数据为400B tokens,评估指标包括MMLU、GSM8K、BBH等。对比从零训练、剪枝初始化、不同蒸馏方法和调度策略的性能差异。通过大规模持续预训练验证策略有效性,分析模型收敛速度和任务表现。

结果分析

剪枝预训练模型在多项任务中显著优于从零训练,平均提升11.79点(73.45 vs. 61.66),能恢复到教师模型86.5%的性能。专家合并策略提升下游任务表现,MTP KD结合LM损失在知识密集任务中表现优异。渐进调度在保持性能的同时,优化训练路径,最终将模型压缩至23A2B,性能依然具有竞争力。

应用场景

该方法适用于大规模语言模型的部署优化,尤其在资源有限环境中实现高效推理。可应用于工业界的对话系统、搜索引擎、内容生成等场景,降低硬件成本,提升响应速度。未来可结合自动调度和专家选择算法,推动模型压缩的智能化。

局限与展望

目前方法主要验证于Qwen系列模型,泛化到其他架构需进一步验证。调度参数仍需手动调优,自动化机制不足。模型压缩可能导致信息丢失,影响极端任务表现。未来需优化专家合并策略和调度算法,提升鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你有一个大工厂,里面有很多不同的工人(专家),每个工人擅长不同的任务。为了节省空间和人力,你想把一些工人合并,或者只用最擅长的那部分工人来完成任务。刚开始时,你可以用全部工人,但这很慢也很贵。于是,你决定只用一部分工人,或者把一些工人合并成一个更强的工人。这样既节省了空间,也能保持大部分的工作效率。这个过程就像模型剪枝和专家合并一样,目标是让工厂(模型)变得更小、更快,但仍能完成大部分任务。

简单解释 像给14岁少年讲一样

假设你有一个超级大的学校,里面有很多老师(专家),每个老师教不同的科目。可是,学校太大了,管理和维护都很困难。于是,你想把一些老师合并,或者只留下最擅长的老师。开始时,你可以让所有老师都教课,但这样很慢也很累。后来,你决定只留一些最厉害的老师,或者把一些老师合并成一个更厉害的老师。这样,学校变得更小、更容易管理,但学生们还是能学到大部分的知识。这就像把大模型变小一样,既节省资源,又能保持学习效果。

术语表

结构化剪枝 (Structured Pruning)

通过删除模型中的完整结构单元(如层、专家或注意力头)实现模型压缩,减少计算量。

在论文中用于减少模型深度、宽度和专家数量。

知识蒸馏 (Knowledge Distillation)

将大模型的知识转移到小模型中,通过训练使小模型模仿大模型的输出。

结合多Token预测蒸馏提升模型性能。

渐进调度 (Progressive Scheduling)

逐步调整模型结构(如深度、宽度或专家数),平滑过渡到目标架构。

优化剪枝和蒸馏过程中的训练路径。

专家合并 (Expert Merging)

将相似或重要性低的专家合并成一个专家,减少专家数量。

提出部分保持策略,避免专家同质化。

多Token预测蒸馏 (MTP KD)

扩展蒸馏目标到多个未来Token,提高知识迁移效率。

提升模型在知识密集任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何自动优化专家合并和调度策略,提升模型压缩的鲁棒性和效率。
  • 2 在不同类型的MoE架构中验证方法的普适性和效果。

原文摘要

Structured pruning and knowledge distillation (KD) are typical techniques for compressing large language models, but it remains unclear how they should be applied at pretraining scale, especially to recent mixture-of-experts (MoE) models. In this work, we systematically study MoE compression in large-scale pretraining, focusing on three key questions: whether pruning provides a better initialization than training from scratch, how expert compression choices affect the final model after continued training, and which training strategy is most effective. We have the following findings: First, across depth, width, and expert compression, pruning a pretrained MoE consistently outperforms training the target architecture from scratch under the same training budget. Second, different one-shot expert compression methods converge to similar final performance after large-scale continual pretraining. Motivated by this, we introduce a simple partial-preservation expert merging strategy that improves downstream performance across most benchmarks. Third, combining KD with the language modeling loss outperforms KD alone, particularly on knowledge-intensive tasks. We further propose multi-token prediction (MTP) distillation, which yields consistent gains. Finally, given the same training tokens, progressive pruning schedules outperform one-shot compression, suggesting that gradual architecture transitions lead to better optimization trajectories. Putting it all together, we compress Qwen3-Next-80A3B to a 23A2B model that retains competitive performance. These results offer practical guidance for efficient MoE compression at scale.

cs.LG cs.AI cs.CL