Mixture of Layers with Hybrid Attention

TL;DR

引入混合注意力的层混合模型(MoL),在WikiText-103上实现PPL 29.99。

cs.LG 🔴 高级 2026-05-10 4 次浏览
Ivan Ternovtsii Yurii Bilak
混合注意力 层混合 稀疏路由 DeltaNet 深度学习

核心发现

方法论

本文提出了一种新的层混合模型(MoL),用K个并行的薄块替代全宽度的Transformer块。通过学习的降维和升维投影连接这些薄块,并通过top-k块路由进行组合。引入混合注意力机制,结合全局上下文的共享softmax块和路由块中的Gated DeltaNet线性注意力。

关键结果

  • 在WikiText-103数据集上,MoL模型在85M参数下实现了PPL 30.95±0.11,优于传统MoE模型的表现。
  • 加入混合注意力后,MoL在198M总参数下达到PPL 29.99±0.08,并实现了高达4.9倍的前向传递加速。
  • 在Cosmopedia v2数据集上,MoL在训练35%后超过了稠密基线,最终PPL为6.49。

研究意义

该研究通过引入层混合模型(MoL)和混合注意力机制,显著提升了Transformer模型的性能,尤其是在处理大规模数据集时。MoL模型在参数效率和计算速度上均优于传统的稠密模型,具有重要的学术和工业应用价值。

技术贡献

MoL模型通过将全宽度的Transformer块替换为多个并行的薄块,并引入混合注意力机制,实现了在稀疏路由下的高效计算。这种方法提供了新的理论保证和工程实现可能性,突破了传统MoE模型的限制。

新颖性

MoL是首次将层结构进行分解并结合混合注意力机制的模型,与现有的MoE模型相比,MoL在参数效率和计算速度上具有显著优势。

局限性

  • 在大规模训练时,MoL的训练时间较长,主要由于梯度检查点和DeltaNet内核的计算压力。
  • 在某些数据集上,MoL的性能仍不及稠密模型。

未来方向

未来研究可以探索MoL在不同数据集和任务上的性能,以及进一步优化混合注意力机制的计算效率。

AI 总览摘要

传统的Mixture-of-Experts (MoE) Transformer模型在每层内将token路由到专家子网络,但层结构本身仍然是单一的。本文提出了一种称为Mixture of Layers (MoL)的新模型,它用多个并行的薄块替代了全宽度的Transformer块,并通过学习的降维和升维投影进行连接。MoL模型引入了混合注意力机制,结合了全局上下文的共享softmax块和路由块中的Gated DeltaNet线性注意力。

在WikiText-103数据集上,MoL模型在85M参数下实现了PPL 30.95±0.11,优于传统MoE模型的表现。加入混合注意力后,MoL在198M总参数下达到PPL 29.99±0.08,并实现了高达4.9倍的前向传递加速。在Cosmopedia v2数据集上,MoL在训练35%后超过了稠密基线,最终PPL为6.49。

MoL模型通过将全宽度的Transformer块替换为多个并行的薄块,并引入混合注意力机制,实现了在稀疏路由下的高效计算。这种方法提供了新的理论保证和工程实现可能性,突破了传统MoE模型的限制。未来研究可以探索MoL在不同数据集和任务上的性能,以及进一步优化混合注意力机制的计算效率。

深度分析

研究背景

Mixture-of-Experts (MoE) Transformer模型通过将token路由到专家子网络来解决参数扩展问题,但层结构仍然是单一的。MoE模型在参数效率和计算速度上存在局限性,尤其是在处理大规模数据集时。近年来,研究者们尝试通过引入稀疏路由和混合注意力机制来提升模型性能。

核心问题

传统的MoE模型在每层内将token路由到专家子网络,但层结构本身仍然是单一的。这导致在扩展到更多块时,注意力覆盖问题变得更加严重,因为每个块看到的token更少。

核心创新

MoL模型通过将全宽度的Transformer块替换为多个并行的薄块,并引入混合注意力机制,解决了注意力覆盖问题。混合注意力结合了全局上下文的共享softmax块和路由块中的Gated DeltaNet线性注意力。

方法详解

  • �� MoL用K个并行薄块替代全宽度的Transformer块。
  • �� 通过学习的降维和升维投影连接这些薄块。
  • �� 引入混合注意力机制,结合共享softmax块和Gated DeltaNet线性注意力。
  • �� 在WikiText-103和Cosmopedia v2数据集上进行实验验证。

实验设计

实验在WikiText-103和Cosmopedia v2数据集上进行,分别使用85M和198M参数。通过对比稠密基线和稀疏路由模型,验证了MoL模型的性能提升。关键超参数包括K值和top-k路由策略。

结果分析

在WikiText-103数据集上,MoL模型在85M参数下实现了PPL 30.95±0.11,优于传统MoE模型的表现。加入混合注意力后,MoL在198M总参数下达到PPL 29.99±0.08,并实现了高达4.9倍的前向传递加速。

应用场景

MoL模型在自然语言处理任务中具有广泛的应用潜力,尤其是在需要高效计算和参数效率的场景中。其混合注意力机制可以用于提升模型的全局上下文理解能力。

局限与展望

MoL模型在大规模训练时的训练时间较长,主要由于梯度检查点和DeltaNet内核的计算压力。在某些数据集上,MoL的性能仍不及稠密模型。未来研究可以探索进一步优化混合注意力机制的计算效率。

通俗解读 非专业人士也能看懂

想象一个大型工厂,传统的MoE模型就像一个工厂的流水线,每个工人都负责一个特定的任务。MoL模型则像是多个小型工作组,每个工作组都有自己的任务,并且可以根据需要灵活调整。混合注意力机制就像是一个中央控制室,确保每个工作组都能获得所需的信息和资源。通过这种方式,工厂可以更高效地运作,处理更多的订单。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,传统的MoE模型就像是游戏中的一个大团队,每个玩家都有自己的角色和任务。MoL模型则像是多个小队,每个小队都有自己的任务,可以根据游戏的需要灵活调整。混合注意力机制就像是游戏中的指挥官,确保每个小队都能获得所需的信息和资源。这样,游戏可以更高效地进行,你的团队也能赢得更多的胜利!

术语表

Mixture of Experts (MoE)

一种将token路由到多个专家子网络的模型结构,旨在提高参数效率。

在本文中,MoE用于比较传统的单一层结构。

Mixture of Layers (MoL)

一种通过多个并行薄块替代全宽度Transformer块的模型结构。

MoL是本文提出的核心模型结构。

Hybrid Attention

结合全局上下文的共享softmax块和路由块中的Gated DeltaNet线性注意力的机制。

用于解决注意力覆盖问题。

Gated DeltaNet

一种用于路由块的线性注意力机制,能够在稀疏子集上进行高效计算。

在本文中用于增强路由块的注意力能力。

Top-k Block Routing

一种选择得分最高的k个块进行激活的路由策略。

用于MoL模型中选择薄块进行计算。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化MoL模型的计算效率,特别是在大规模训练时的性能表现。
  • 2 在不同数据集和任务上,MoL模型的适用性和性能表现如何。

应用场景

近期应用

自然语言处理

MoL模型可以用于提升自然语言处理任务中的计算效率和参数效率,尤其是在大规模数据集上。

远期愿景

智能系统

MoL模型的高效计算能力可以应用于智能系统的开发,提升系统的响应速度和处理能力。

原文摘要

Standard Mixture-of-Experts (MoE) transformers route tokens to expert subnetworks within each layer, but the layer structure itself remains monolithic. We introduce Mixture of Layers (MoL), which replaces full-width transformer blocks (d_model) with K parallel thin blocks at reduced dimensionality (d_thin << d_model), connected via learned down/up projections and composed via top-k block routing. Scaling sparse block routing to many blocks creates an attention coverage problem, as each block sees fewer tokens. We address this by introducing hybrid attention, which pairs one shared softmax block for global context with Gated DeltaNet linear attention in routed blocks.

cs.LG cs.AI