Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation

TL;DR

提出ALiBi线性偏置方法,实现Transformer模型输入长度外推,训练短序列,推理长序列。

cs.CL 🔴 高级 2021-08-28 54 次浏览
Ofir Press Noah A. Smith Mike Lewis
Transformer 位置编码 外推能力 ALiBi 效率提升

核心发现

方法论

本文提出的ALiBi方法通过在查询-键注意力分数上引入与距离成线性关系的偏置,避免了传统位置嵌入的限制。模型在训练时不依赖位置编码,利用偏置实现对长序列的外推能力。实验中,训练1.3亿参数模型在1024长度序列上,能有效外推至2048长度,且训练速度提高11%,内存减少11%。ALiBi的偏置机制具有递近偏好,增强模型对近期信息的关注,提升在WikiText-103等数据集上的表现。

关键结果

  • 在WikiText-103上,训练长度为1024的模型,推理长度扩展至2048时, perplexity与使用正弦位置嵌入的模型相当,且训练速度提升11%,内存节省11%。
  • 模型在长序列(如1万词)上的表现持续优越,超越多种位置编码方法,包括旋转位置编码和T5偏置。
  • ALiBi无需额外参数,易于集成,且在多任务、多模型规模下表现稳定,验证其良好的外推能力和训练效率。

研究意义

该研究突破了Transformer在长序列外推中的瓶颈,提供一种简洁高效的偏置机制,极大降低长序列训练成本,同时提升模型在长文本处理中的能力。对自然语言处理、生成模型等领域具有深远影响,推动大规模模型的长文本理解与生成应用落地。

技术贡献

提出线性偏置机制ALiBi,替代传统位置嵌入,实现模型对超出训练长度的序列的有效外推。该机制具有简单实现、参数少、无需额外训练,且偏置具有递近偏好,增强模型对近期信息的敏感性。实验验证其在大规模模型中的优越性能,显著提升训练速度和内存效率,为Transformer长文本应用提供新思路。

新颖性

首次系统性提出线性距离偏置ALiBi,突破了传统位置编码在长序列外推中的局限。不同于sinusoidal和旋转位置编码,ALiBi无需额外参数,且偏置具有递近偏好,显著改善模型长序列外推能力,且实现简单、效率高。这是对位置编码机制的根本创新。

局限性

  • ALiBi偏置参数(斜率)虽具有一定的鲁棒性,但在极端长序列或特定任务中可能表现不佳,需进一步调优。
  • 模型在极端长序列(如数万甚至百万词)上的外推能力仍有限,未来需结合其他机制增强。
  • 偏置机制在某些任务中可能引入偏差,影响模型的泛化能力,需结合任务特性优化。

未来方向

未来将探索ALiBi与其他位置机制的结合,提升极端长文本的外推能力;同时研究偏置参数的自适应调节策略,增强模型的泛化和鲁棒性。此外,扩展到多模态任务和多任务学习中,验证其广泛适用性。

AI 总览摘要

Transformer模型自Vaswani等人(2017)提出以来,长文本处理一直是瓶颈。传统位置编码如sinusoidal在序列长度超出训练范围时表现不佳,限制了模型的外推能力。本文提出了ALiBi(Attention with Linear Biases)机制,通过在查询-键注意力分数上引入线性距离偏置,避免了依赖位置嵌入的局限。实验显示,训练1024长度序列的模型,能在推理2048长度时保持与sinusoidal模型相当的性能,同时训练速度提升11%,内存减少11%。ALiBi偏置机制具有递近偏好,增强模型对近期信息的关注,显著优于旋转位置编码和T5偏置,且实现简单,易于集成。该方法在WikiText-103等多个数据集上验证了其强大的长序列外推能力,推动了大规模长文本模型的研究与应用。未来,将结合其他位置机制,优化偏置参数,扩展到多模态任务,进一步提升模型的长文本理解和生成能力。

深度分析

研究背景

近年来,Transformer模型在自然语言处理领域取得巨大成功,尤其是在长文本理解方面。早期工作如Vaswani等(2017)提出的sinusoidal位置编码,为模型提供了序列位置信息,但在超出训练长度时表现不佳。旋转位置编码(Su et al., 2021)和T5偏置(Raffel et al., 2020)改善了外推能力,但存在训练成本高、参数多等问题。随着模型规模不断扩大,长序列处理的效率和能力成为瓶颈,亟需更简洁高效的机制。

核心问题

核心问题在于如何在训练时使用较短序列,仍能在推理时处理更长的序列。现有位置编码在超出训练长度时表现不佳,限制了模型的外推能力。这不仅影响模型的泛化,也限制了长文本任务的实际应用。传统方法如sinusoidal虽具外推潜力,但实际效果有限,旋转位置编码和T5偏置虽改善了性能,但训练成本高,参数多,难以广泛应用。

核心创新

本文创新点在于提出ALiBi机制:• 通过在查询-键注意力分数上加入与距离线性相关的偏置,避免了位置嵌入的限制;• 该偏置具有递近偏好,增强模型对近期信息的敏感性;• 实现简单,只需修改注意力掩码,无需额外参数或复杂训练。这一机制突破了传统位置编码的局限,显著提升长序列外推能力。

方法详解

  • �� 设计线性偏置:在查询-键点积基础上加入偏置项,偏置值为m·(−(i−1),...,0),m为每个头的固定斜率;• 训练模型:在1024长度序列上训练,优化目标为最大似然;• 推理扩展:在推理时,模型可处理超过训练长度的序列,偏置机制保证了注意力的递近偏好;• 实现简便:只需修改注意力掩码,无需额外参数或训练步骤。

实验设计

  • �� 数据集:WikiText-103、Toronto BookCorpus、大规模CC100+RoBERTa语料;• 模型:16层,1024维,8头,参数1.3亿;• 训练:不同长度序列(512、1024、3072)训练,评估在长序列上的外推能力;• 对比:sinusoidal、旋转位置编码、T5偏置,验证外推性能和训练效率。

结果分析

  • �� ALiBi模型在1024训练长度下,推理2048长度时,perplexity与sinusoidal模型持平,且训练速度提升11%,内存节省11%;• 在超出训练长度的长序列(如1万词)上持续优越,超越旋转和T5偏置;• 训练短序列模型,能在长序列任务中实现更高效率与更优性能,验证其外推能力的实用性。

应用场景

  • �� 长文本生成:可用于长篇文章、代码生成等场景,减少训练成本;• 长序列理解:适合大规模文档、法律文本等应用,提升模型泛化能力;• 未来:结合多模态、多任务,推动长文本AI的发展。

局限与展望

  • �� 在极端超长序列(如百万词)上的外推仍有限,偏置参数需调优;• 仅在特定任务和模型规模验证,泛化到其他场景仍需验证;• 可能引入偏差,影响某些任务的公平性和准确性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天都处理一定数量的原料(短序列)。传统方法就像用一个固定的标签告诉工人原料的位置(位置编码),但这个标签只对短时间有效。当工厂需要处理更长的原料堆时,标签就变得不再准确。ALiBi就像在工人之间设置了一个规则:离工厂入口越近的原料越重要,离得远的原料会被逐渐忽略。这样,无论原料堆多长,工人都能根据这个规则找到重要的部分。这个规则简单,容易实现,而且能让工厂处理更长的原料堆,效率更高,效果更好。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里找书,平时老师会告诉你书的位置(位置编码),但如果书堆变得特别大,你就找不到了。ALiBi就像在每本书旁边贴了一个标签,告诉你离入口远的书不那么重要,离入口近的更重要。这样,不管书堆有多高,你都能很快找到重要的书。这种方法简单又聪明,不需要额外的标签,只用一个规则,就让你在大堆书中找到想要的内容变得更容易、更快。

术语表

位置偏置 (Positional Bias)

在注意力机制中引入的偏置,用于表达词语在序列中的相对位置,帮助模型理解顺序关系。

ALiBi通过线性偏置实现位置关系的表达。

外推能力 (Extrapolation)

模型在训练序列长度之外,仍能保持良好性能的能力。

本文重点提升Transformer的外推能力。

注意力机制 (Attention Mechanism)

模型中用以衡量不同输入部分相关性的重要组件。

ALiBi在注意力分数上引入偏置。

sinusoidal位置编码 (Sinusoidal Positional Encoding)

一种固定的非学习位置编码方式,用正弦和余弦函数生成。

传统Transformer使用此方法。

旋转位置编码 (Rotary Position Embedding)

将位置信息融入查询和键的点积中,增强外推能力。

作为ALiBi的对比方法。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端超长序列(如百万词)中保持高效外推仍是未解难题,偏置参数调优和结合其他机制可能是未来方向。
  • 2 目前对ALiBi在多模态、多任务环境中的适应性和效果还缺乏系统验证,需进一步研究。

应用场景

近期应用

长文本生成

可用于新闻、小说、代码等长文本自动生成,降低训练成本,提升效率。

长序列理解

适合法律、医学等行业的长文档分析,增强模型泛化能力。

远期愿景

多模态长文本模型

结合图像、视频等多模态信息,实现更丰富的长文本理解与生成。

原文摘要

Since the introduction of the transformer model by Vaswani et al. (2017), a fundamental question has yet to be answered: how does a model achieve extrapolation at inference time for sequences that are longer than it saw during training? We first show that extrapolation can be enabled by simply changing the position representation method, though we find that current methods do not allow for efficient extrapolation. We therefore introduce a simpler and more efficient position method, Attention with Linear Biases (ALiBi). ALiBi does not add positional embeddings to word embeddings; instead, it biases query-key attention scores with a penalty that is proportional to their distance. We show that this method trains a 1.3 billion parameter model on input sequences of length 1024 that extrapolates to input sequences of length 2048, achieving the same perplexity as a sinusoidal position embedding model trained on inputs of length 2048 but training 11% faster and using 11% less memory. ALiBi's inductive bias towards recency also leads it to outperform multiple strong position methods on the WikiText-103 benchmark.

cs.CL