A Dual-Path Architecture for Scaling Compute and Capacity in LLMs

TL;DR

提出双路径块架构,在相同FLOPs下提升LLM计算能力和容量。

cs.CL 🔴 高级 2026-05-29 3 次浏览
Markus Frey Behzad Shomali Joachim Koehler Mehdi Ali
双路径架构 循环Transformer 计算能力 参数效率 语言模型

核心发现

方法论

该研究提出了一种双路径块架构,包含一个循环的深层子层和一个扩展的宽层子层。通过独立的每个token门来结合这两个路径,允许详细的每个token路由分析。

关键结果

  • 在两个FLOP预算下,双路径模型在语言建模和下游评估中超越了iso-FLOP匹配模型,同时使用的参数比基线少。
  • 学习到的门是可解释的,并显示出系统的每个token分配:功能词和词汇内容趋势宽,而标点符号、符号和算术token趋势深。
  • 在FM=80M时,α=50配置在C4、Wiki、常识BPB、数学BPB和常识准确性上表现最佳。

研究意义

该研究通过提出一种新的双路径架构,解决了循环Transformer在固定FLOPs下容量不足的问题,提供了一种灵活的计算和容量扩展方法,对学术界和工业界具有重要意义。

技术贡献

该研究的技术贡献在于提出了一种新的双路径块架构,能够在不增加参数数量的情况下提高计算能力,并提供了新的理论保证和工程可能性。

新颖性

这是首次提出在Transformer层中分离计算和容量轴,并通过双路径块架构实现灵活的计算和容量扩展。

局限性

  • 该方法在某些任务上可能表现不佳,特别是在需要高度记忆能力的任务上。
  • 模型在高FLOP预算下仍可能受到参数瓶颈的限制。

未来方向

未来的研究方向包括探索双路径架构在其他模型中的应用,以及优化门控机制以提高性能。

AI 总览摘要

循环Transformer通过多次应用共享块,成为一种参数效率高的语言模型计算扩展途径。然而,在固定FLOPs下,循环模型的容量严格低于基线Transformer。本文提出了一种新的双路径块架构,可以灵活地扩展计算和容量。通过在单层内暴露两个轴作为并行路径:一个重复应用K次的深层子层和一个扩展的宽层子层。独立的每个token门结合这两个轴,允许详细的每个token路由分析。实验结果表明,在两个FLOP预算下,双路径模型在语言建模和下游评估中超越了iso-FLOP匹配模型,同时使用的参数比基线少。学习到的门是可解释的,并显示出系统的每个token分配:功能词和词汇内容趋势宽,而标点符号、符号和算术token趋势深。该研究通过提出一种新的双路径架构,解决了循环Transformer在固定FLOPs下容量不足的问题,提供了一种灵活的计算和容量扩展方法,对学术界和工业界具有重要意义。未来的研究方向包括探索双路径架构在其他模型中的应用,以及优化门控机制以提高性能。

深度分析

研究背景

循环Transformer通过多次应用共享块,成为一种参数效率高的语言模型计算扩展途径。然而,在固定FLOPs下,循环模型的容量严格低于基线Transformer。

核心问题

循环模型在固定FLOPs下的容量不足,影响了其在依赖存储知识的任务上的表现。

核心创新

提出了一种新的双路径块架构,可以灵活地扩展计算和容量。通过在单层内暴露两个轴作为并行路径:一个重复应用K次的深层子层和一个扩展的宽层子层。

方法详解

  • �� 深层子层:使用共享参数重复应用K次。
  • �� 宽层子层:使用扩展的前馈网络应用一次。
  • �� 每个token门:结合两个路径,允许详细的每个token路由分析。

实验设计

在两个FLOP预算下进行实验,比较双路径模型与iso-FLOP匹配模型的性能。

结果分析

双路径模型在语言建模和下游评估中表现优异,使用的参数比基线少。学习到的门显示出系统的每个token分配趋势。

应用场景

可用于提高语言模型的计算能力和容量,适用于需要高效参数使用的场景。

局限与展望

在某些任务上可能表现不佳,特别是在需要高度记忆能力的任务上。模型在高FLOP预算下仍可能受到参数瓶颈的限制。

通俗解读 非专业人士也能看懂

想象一个工厂,有两条生产线:一条专注于快速生产,另一条专注于高质量生产。双路径架构就像这两条生产线,允许每个产品根据需要选择适合的生产线。这样,既能保证生产效率,又能保证产品质量。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,有两个角色:一个擅长快速攻击,另一个擅长强力攻击。双路径架构就像这两个角色,允许你根据敌人的类型选择合适的攻击方式。这样,你可以更有效地击败敌人!

术语表

Dual-path Block (双路径块)

一种架构,包含循环的深层子层和扩展的宽层子层。

用于灵活扩展计算和容量。

Looped Transformer (循环Transformer)

通过多次应用共享块来扩展计算的Transformer。

提高参数效率。

FLOPs (浮点运算次数)

衡量计算量的指标。

用于比较模型的计算效率。

Feed-forward Network (前馈网络)

一种神经网络结构,通常用于增加模型容量。

在宽层子层中使用。

Token Gate (token门)

用于结合深层和宽层路径的机制。

允许详细的每个token路由分析。

开放问题 这项研究留下的未解疑问

  • 1 如何优化门控机制以提高性能仍是一个开放问题。
  • 2 双路径架构在其他模型中的应用尚未探索。

应用场景

近期应用

语言模型优化

提高语言模型的计算能力和容量,适用于需要高效参数使用的场景。

远期愿景

通用AI发展

双路径架构可能推动通用AI的发展,提高模型的灵活性和效率。

原文摘要

Looped transformers apply a shared block multiple times and have emerged as a parameter-efficient route to scaling compute in language models. However, at fixed FLOPs a looped model has strictly less capacity than a baseline transformer. We propose a novel dual-path block that can flexibly scale compute, the number of sequential operations applied to a hidden state, and capacity, the parameters available at a single step. For this we expose both axes as parallel pathways within a single layer: a deep sublayer re-applied K times with shared parameters, and a wide sublayer with an enlarged feed-forward network applied once. Independent per-token gates combine both axes and allow detailed per-token routing analyses. We show that across two FLOP budgets, our dual-path model surpasses iso-FLOP matched models on language modeling and downstream evaluations, while using fewer parameters than the baseline at matched FLOPs. The learned gates are directly interpretable and show systematic per-token allocation with function words and lexical content trend wide, while punctuation, symbols, and arithmetic tokens trend deep.

cs.CL