Abstention and Noise Filtering: Two Missing Primitives of Softmax Attention

TL;DR

通过在softmax中引入弃权和噪声过滤,提升语言模型性能,尤其在350M参数时显著。

cs.LG 🔴 高级 2026-09-19 23 次浏览
Richard Zhe Wang
注意力机制 语言模型 噪声过滤 弃权 深度学习

核心发现

方法论

研究通过在softmax注意力机制中引入弃权和噪声过滤两个原语,分别通过每个头的学习下沉logit和对每个值的门控实现。实验在10M到350M参数的匹配模型中进行,验证了这两个原语的有效性。

关键结果

  • 在10M参数模型中,弃权几乎贡献了所有增益,而在350M参数模型中,噪声过滤贡献了大部分增益。
  • 在每个规模下,包含两个原语的模型表现最佳。
  • 通过注入干扰实验,确认门控能有效去除干扰,并揭示每种门控形式的盲点。

研究意义

该研究通过引入弃权和噪声过滤,解决了softmax注意力机制中长期存在的结构性缺陷,显著提升了语言模型的训练效率和性能,尤其在大规模模型中效果显著。

技术贡献

技术贡献在于首次明确识别并分离了弃权和噪声过滤两个机制,并通过实验验证其独立性和有效性,为注意力机制的改进提供了新的思路。

新颖性

本研究首次提出在softmax注意力中引入弃权和噪声过滤,区别于以往工作仅关注单一机制的改进。

局限性

  • 在小规模模型中,噪声过滤的增益有限。
  • 实验主要集中在特定规模的模型,未涵盖更大或更小规模。

未来方向

未来工作可探索在更大规模模型中的应用,以及在其他类型的深度学习模型中的适用性。

AI 总览摘要

在深度学习领域,softmax注意力机制因其在语言模型中的广泛应用而备受关注。然而,传统的softmax注意力存在两个结构性缺陷:无法输出空值和线性值路径。这些限制导致模型在处理无关信息时效率低下。

本研究提出通过引入弃权和噪声过滤两个原语来解决这些问题。弃权允许注意力头输出空值,从而避免注意力权重必须总和为一的限制;噪声过滤则通过在每个值上设置门控来抑制干扰。在实验中,研究者在10M到350M参数的模型上验证了这两个原语的有效性,发现随着模型规模的增大,噪声过滤的效果愈加显著。

这些发现不仅为改进现有的注意力机制提供了新的思路,也为未来的研究指明了方向。尽管在小规模模型中效果有限,但在大规模模型中的显著增益表明,这一方法具有广泛的应用潜力。

深度分析

研究背景

softmax注意力机制是深度学习中广泛使用的技术,尤其在语言模型的预训练中。然而,传统的softmax注意力存在无法输出空值和线性值路径的问题,限制了其在处理复杂信息时的效率。

核心问题

核心问题在于softmax注意力机制无法有效处理无关信息,导致模型在面对复杂输入时性能下降。解决这一问题对于提升语言模型的训练效率和性能至关重要。

核心创新

本研究的核心创新在于引入弃权和噪声过滤两个原语。弃权允许注意力头输出空值,避免注意力权重必须总和为一的限制;噪声过滤则通过在每个值上设置门控来抑制干扰。

方法详解

  • �� 在softmax中引入每个头的学习下沉logit,实现弃权。
  • �� 在每个值上设置门控,实现噪声过滤。
  • �� 在10M到350M参数的模型上进行实验,验证两个原语的有效性。

实验设计

实验在10M到350M参数的匹配模型中进行,使用相同的架构、数据顺序和优化器。通过注入干扰实验,验证门控能有效去除干扰。

结果分析

在10M参数模型中,弃权贡献了几乎所有增益,而在350M参数模型中,噪声过滤贡献了大部分增益。每个规模下,包含两个原语的模型表现最佳。

应用场景

该方法可直接应用于语言模型的预训练,尤其在大规模模型中效果显著。对于需要处理复杂信息的其他深度学习模型,也具有潜在的应用价值。

局限与展望

在小规模模型中,噪声过滤的增益有限。实验主要集中在特定规模的模型,未涵盖更大或更小规模。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统的softmax注意力就像一个只能用一个锅做所有菜的厨师,他必须把所有食材都放进去,即使有些食材不需要。弃权就像给厨师一个额外的锅,让他可以选择不放某些食材。噪声过滤则像是一个筛子,可以过滤掉不需要的杂质,让菜肴更加纯净。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象你在玩一个游戏,你的角色有一个背包,里面可以放很多东西。softmax注意力就像这个背包,但有个问题:你必须把所有东西都放进去,即使有些是垃圾!弃权就像给你一个垃圾桶,你可以把不需要的东西扔掉。噪声过滤就像一个筛子,帮你过滤掉不需要的东西,让背包更整洁。是不是很酷?

术语表

Softmax Attention (软最大化注意力)

一种用于深度学习模型的机制,用于计算不同输入的重要性。

在语言模型中用于计算每个词的重要性。

Abstention (弃权)

允许注意力头输出空值的能力,避免注意力权重必须总和为一。

通过学习下沉logit实现。

Noise Filtering (噪声过滤)

通过在每个值上设置门控来抑制干扰的能力。

在实验中验证其有效性。

Sink Logit (下沉logit)

一种用于实现弃权的技术,通过在softmax中引入学习下沉logit。

用于在实验中实现弃权。

Gate (门控)

用于控制信息流动的机制,可以通过调整权重来实现。

在噪声过滤中用于抑制干扰。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模模型中有效应用弃权和噪声过滤?
  • 2 在其他类型的深度学习模型中,这些原语是否同样有效?

应用场景

近期应用

语言模型预训练

通过引入弃权和噪声过滤,提升语言模型的训练效率和性能,尤其在大规模模型中效果显著。

远期愿景

深度学习模型优化

在其他类型的深度学习模型中应用这些原语,可能带来性能的显著提升。

原文摘要

Gating the value pathway of attention reportedly improves language model pretraining, and prior studies disagree on why. We argue and provide experimental evidence that such gates supply two different things that softmax attention lacks: abstention and noise filtering. The first is abstention, which allows an attention head to output nothing, bypassing the requirement that attention weights must sum to one. The second is noise filtering, which allows the value pathway of an attention head to suppress interference from superposed features in the residual stream. In our experiments in matched models from 10M to 350M parameters, we supply abstention through a learned per-head sink logit in the softmax and noise filtering through a gate on each value. We report three empirical findings. First, the benefit of abstention, measured as the reduction in validation loss relative to a matched baseline, declines as models grow, whereas the benefit of noise filtering increases with scale. In particular, abstention accounts for nearly all of the gain from gating at 10M and filtering for most of it at 350M. Second, the best model at every scale is the one with both primitives built in. Third, injecting controlled interference into the values a head reads confirms that the gate removes such interference, and reveals that each of the two gate forms we study has a characteristic blind spot. Supplying both primitives adds negligible parameters and remains compatible with the key-value cache.

cs.LG cs.CL