Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs

TL;DR

提出基于预测门控的银行级稀疏训练方法,将Dense模型转化为4倍稀疏的LLM,提升长文本处理效率。

cs.CL 🔴 高级 2026-06-09 19 次浏览
Ruixuan Huang Jinyuan Shi Hantao Huang Yifan Huang Ziyi Guan Hao Zeng Ian En-Hsu Yen Minghui Yu
大规模语言模型 稀疏训练 连续学习 预测门控 硬件优化

核心发现

方法论

本文提出一种基于低秩预测器的银行级通道路由机制,将Dense到稀疏的连续训练融入主模型路径。通过在每个层的每个token上,利用低秩预测器生成FFN通道路由logits,再采用银行内top-k规则(每64通道保留16通道)实现4倍稀疏。训练过程中,预测器与主模型共同优化,兼顾稠密模型性能与稀疏路径效率。采用硬稀疏执行与软梯度代理相结合,确保梯度传递。模型基于Qwen2.5-8B架构,在8K和32K上下文长度下训练,稀疏策略在32K阶段引入。实验中,稀疏模型在多项基准测试中表现优于简单激活幅值稀疏(Dense-4x),且性能更接近原始密集模型。研究还揭示长文本评估中的层局部长上下文失效问题,提出单层修复算法显著改善长文本表现。

关键结果

  • 稀疏模型在多项任务中性能接近或优于密集模型,尤其在长文本和推理任务中表现优异,显著优于基于激活幅值的稀疏方法。具体在RULER-CWE长文本任务中,修复后在12K-16K长度范围内性能提升20%以上。
  • 在多项基准(如MMLU、KOR-Bench)中,稀疏模型平均性能下降不超过2%,而Dense-4x在某些任务中下降超过5%。
  • 引入预测门控机制后,模型训练稳定性增强,避免了MoE风格的通道平衡偏差,且长文本表现的层局部失效得到了有效缓解。

研究意义

该研究突破了稀疏化在长文本处理中的瓶颈,将稀疏技术融入连续训练,显著降低推理成本,推动硬件友好型大模型的实际应用。通过在主路径中优化稀疏门控,兼顾模型性能与硬件效率,为未来大规模模型的稀疏训练提供新思路。长文本长距离依赖的解决方案也为自然语言理解和生成带来新的可能性,特别是在资源有限的硬件环境中。研究成果对学术界理解稀疏机制的作用机理、工业界模型部署的效率提升具有重要意义。

技术贡献

本文提出一种创新的预测门控银行级稀疏FFN架构,结合低秩预测器与硬top-k路由,实现稀疏路径的端到端训练。不同于传统MoE模型依赖专家池,本文保持密集参数化,利用预测器动态调度通道,兼容硬件加速。训练策略包括在主路径中引入稀疏门控、软梯度代理及局部修复算法,确保长文本表现稳定。模型在保持接近密集模型性能的同时,实现4倍参数稀疏,极大提升推理效率。该方法在长文本推理和多任务学习中展现出优越的适应性和可扩展性,为硬件友好的大模型设计提供了新范式。

新颖性

本研究首次将低秩预测器引入银行级通道路由,结合硬top-k稀疏机制,实现在连续训练中动态调度稀疏路径,避免MoE中专家池的复杂性。不同于传统稀疏方法依赖激活值或全局路由,本方案在主路径中优化稀疏门控,兼顾性能与硬件实现。长文本长距离依赖的局部失效问题及单层修复算法的提出,亦为长文本处理提供新思路。这些创新使得稀疏模型在长文本任务中表现优异,突破了现有稀疏化技术的局限。

局限性

  • 模型在长文本极端长度(>16K)时仍存在性能下降,尤其在某些复杂推理任务中表现不稳定,主要源于局部长上下文失效未完全解决。
  • 稀疏路径的硬件加速依赖专用硬件或稀疏核,当前GPU模拟实现未能充分展现加速潜力,实际部署仍面临硬件适配挑战。
  • 训练过程中,稀疏门控的动态调度可能引入训练不稳定性,需进一步优化调度策略和正则化机制。

未来方向

未来将结合硬件优化,开发专用稀疏硬件或稀疏核,提升实际推理速度。还将探索多层局部修复策略,增强长文本长距离依赖能力,解决极端长度下的性能瓶颈。此外,拟引入自适应稀疏策略与多任务学习框架,提升模型泛化能力和鲁棒性,为大模型的高效部署提供更全面的解决方案。

AI 总览摘要

在大规模语言模型(LLMs)逐渐成为人工智能核心工具的背景下,模型参数规模不断扩大带来的计算和存储成本也日益攀升。传统的稠密模型在推理长文本时,计算量巨大,难以满足实际应用中的效率需求。为此,本文提出了一种基于预测门控的银行级通道稀疏训练方法,将密集模型转化为4倍参数稀疏的高效模型。该方法在保持模型性能的同时,显著降低推理成本,为长文本处理提供了新的解决方案。

具体而言,作者在Qwen2.5-8B架构基础上引入低秩预测器,预测每个token在FFN中的通道路由logits,并采用银行内top-k规则(每64通道保留16通道)实现稀疏。训练过程中,预测器与主模型共同优化,确保稀疏路径的有效性。实验结果显示,该稀疏模型在多项任务中性能接近或优于密集模型,尤其在长文本和推理任务中表现优异,显著优于传统激活值稀疏方法。此外,研究还揭示了长文本评估中的层局部长上下文失效问题,并提出单层修复算法,显著改善模型在极长文本中的表现。这一创新不仅降低了推理成本,也为硬件友好的大模型设计提供了新思路。

总体而言,本文的贡献在于将稀疏化技术融入连续训练流程,突破了长文本长距离依赖的瓶颈,为未来高效、可扩展的LLMs发展提供了理论基础和实践路径。未来工作将聚焦硬件优化、多层修复策略以及多任务泛化能力的提升,推动稀疏大模型的实际部署与应用。

深度分析

研究背景

近年来,随着Transformer架构的普及,大规模语言模型(如GPT、BERT、T5)在自然语言处理任务中取得突破性进展。然而,模型参数规模不断扩大带来了巨大的计算和存储压力,限制了其在资源有限设备上的应用。为应对这一挑战,稀疏化技术逐渐成为研究热点,包括Mixture-of-Experts(MoE)、激活值稀疏等方法。MoE模型通过专家池实现条件计算,显著降低推理成本,但引入复杂的路由机制和通信开销。激活值稀疏则试图在推理时动态屏蔽部分通道,提升效率。近年来,Contextual Sparsity(如Dejavu、ShadowLLM、Sirius)强调输入依赖性,进一步推动稀疏技术在推理中的应用。尽管如此,长文本处理中的长距离依赖仍是难点,特别是在模型稀疏化后,如何保证长距离信息的有效传递成为关键难题。

核心问题

现有稀疏化方法多集中于短文本或静态稀疏策略,难以兼顾长文本的长距离依赖。尤其是在长上下文(>8K)环境下,模型容易出现性能崩溃或局部失效的问题。MoE模型虽能降低计算成本,但在长文本中存在路由不稳定、负载不均衡等问题。激活值稀疏方法在硬件实现上存在瓶颈,难以实现真正的加速。此外,长文本中的局部长上下文失效,导致模型在特定长度区间表现下降,严重影响实际应用效果。这些问题限制了稀疏模型在长文本推理中的推广,亟需一种兼顾性能、效率与硬件友好的新策略。

核心创新

本研究提出一种基于低秩预测器的银行级通道路由机制,将稠密FFN转化为稀疏子路径,核心创新包括:

  • �� 预测门控:在每个层的每个token上,利用低秩预测器生成通道路由logits,实现动态调度。
  • �� 银行内top-k:每64通道划分为一个银行,保留16通道,形成4倍稀疏,兼容硬件加速。
  • �� 连续训练:在主路径中端到端优化稀疏门控,避免MoE中的专家池复杂性。
  • �� 层局部修复:针对长文本中的局部失效,提出单层修复算法,显著改善长距离表现。这些创新使得模型在长文本推理中表现优异,突破了传统稀疏方法的局限。

方法详解

  • �� 基于Dense SwiGLU FFN,输入为xl,t ∈ Rd,输出为ydensel,t。
  • �� 引入低秩预测器Pl(x) = Wp,2l Wp,1l x,生成通道路由logits。
  • �� 在每个层中,将通道划分为银行(每银行64通道),利用预测器输出的logits进行top-k(16通道)选择,形成二值掩码。
  • �� 在前向传播中,激活被稀疏掩码筛选,未激活通道输出为零。
  • �� 反向传播时,软梯度代理确保梯度通过top-k边界传递。
  • �� 训练过程中,预测器与主模型共同优化,确保稀疏路径性能与稳定性。
  • �� 在长文本任务中,利用局部修复算法,识别并修复出现性能崩溃的层,提升整体表现。

实验设计

采用Qwen2.5-8B架构,训练数据包括多语种多领域语料,8K和32K上下文长度。稀疏模型在32K阶段引入,训练策略包括:

  • �� 先训练密集模型(8K),再继续长文本训练(32K)。
  • �� 添加预测器作为辅助,预热后引入稀疏门控。
  • �� 采用硬稀疏执行与软梯度结合,确保梯度传递。
  • �� 在多个基准(如MMLU、KOR-Bench、RULER)上评估性能,比较密集、稀疏和激活值稀疏模型。
  • �� 进行层局部修复实验,验证修复算法在长文本中的效果。

结果分析

稀疏模型在多项任务中性能接近或优于密集模型,尤其在长文本任务中表现出色。例如,在RULER-CWE长文本任务中,修复后性能提升20%以上,性能差异缩小至2%。在推理任务如MMLU、KOR-Bench中,性能下降不超过2%,优于激活值稀疏方法。模型训练过程中,预测门控机制增强了稳定性,避免MoE中的负载不均。长文本中的局部修复算法有效缓解了层局部失效问题,显著提升极长文本的理解能力。

应用场景

该方法适用于需要长文本理解的应用场景,如法律、科研、教育等领域的智能问答、内容生成。硬件友好的稀疏结构可在专用稀疏硬件或GPU稀疏核上实现加速,降低部署成本。未来,结合硬件优化,可在边缘设备实现高效长文本处理,推动智能系统的普及。

局限与展望

模型在极端超长文本(>16K)时仍存在性能下降,局部长上下文失效未完全解决。硬件加速依赖专用硬件,当前GPU模拟未能充分展现潜力。训练中稀疏门控调度可能引入不稳定性,需优化调度策略。未来需增强长距离依赖能力,提升硬件适配性。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的菜肴,里面有许多步骤和材料。传统的方法是把所有材料都准备好,然后一次性全部放入锅里,等待全部完成。而现在,这个新方法像是提前用一个小助手帮你挑选出最重要的材料(比如调味料),只用它们来做一部分菜。这个助手会根据你当前的口味偏好,动态决定哪些材料可以省略,哪些必须用。这样一来,你做菜的速度变快了,吃得也更香,菜还保持了原有的味道。这就像模型中的稀疏机制,只处理最重要的部分,节省了时间和资源,又保证了菜的质量。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个超级长的考试,题目很多,时间也很长。以前,你必须每题都认真做,花很多时间。现在,有个聪明的朋友告诉你,只需要专注于最重要的题目,把那些不太重要的题目跳过。这个朋友会根据每题的难度和你的答题情况,动态决定哪些题可以跳过,哪些要认真做。这样,你就能在有限的时间里,答对更多重要的题目,考试成绩也会更好。模型也是一样的,它会根据每个问题的重要性,选择只处理最关键的部分,从而变得更快、更聪明。

原文摘要

We study dense-to-sparse continual training as a way to construct channel-sparse large language models from dense checkpoints. Starting from a Qwen2.5-8B dense backbone, we continue training at 32K context and introduce a predictor-gated sparse SwiGLU FFN in the 32K stage. For each token and layer, we use a low-rank predictor to produce FFN-channel routing logits. We then apply a bank-wise top-k rule to retain 16 channels in every 64-channel bank, yielding 4x sparsity in the FFN intermediate activation. Unlike post-hoc sparse inference methods, the routing module is placed on the main language modeling path and optimized during continual training, enabling the dense model to be upcycled into a hardware-oriented sparse model. We report the architecture, training recipe, benchmark performance, and training lessons. We also identify a layer-local long-context failure mode on RULER-CWE and propose a single-layer repair algorithm that substantially improves the affected length range.

cs.CL