Rethinking Pairwise Token Interaction in Spiking Transformers

TL;DR

提出GSAP方法,提升Spiking Transformers在ImageNet-1K上78.19%的准确率。

cs.NE 🔴 高级 2026-09-22 9 次浏览
Sicheng Shen Dongcheng Zhao Zhiyuan Li Jinyan Yu Qian Zhang Dengpeng Xing Zhitong Zhang Tielin Zhang
Spiking Transformers GSAP 神经网络 长程通信 事件驱动

核心发现

方法论

本文提出了一种名为Gated Spike Axial Propagation (GSAP)的新方法,用于Spiking Transformers中的token交互。GSAP通过水平和垂直轴传播脉冲上下文,解耦信息传播与上下文选择。接收器条件门控决定每个token整合多少传播的上下文,同时轻量级的局部路径保留细粒度的邻域信息。

关键结果

  • 在ImageNet-1K数据集上,GSAP将Spikingformer-8-768的准确率从75.85%提升至78.19%,同时参数量从66.34M减少到62.04M。
  • 在CIFAR-100数据集上,GSAP将Spikingformer的准确率从79.21%提升至80.21%,参数量从9.36M减少到8.84M。
  • 在N-Caltech101数据集上,GSAP将准确率从84.45%提升至85.54%。

研究意义

GSAP在学术界和工业界具有重要意义。它解决了Spiking Transformers中token交互与稀疏脉冲表示不匹配的问题,通过轴向传播实现长程通信,提升了模型的表达能力和计算效率。

技术贡献

GSAP通过解耦通信与上下文选择,提供了一种新的脉冲原生交互机制,与现有方法相比,它不依赖于显式的query-key匹配,从而在长程信息交换中表现出更高的灵活性。

新颖性

GSAP首次将轴向传播引入Spiking Transformers,打破了传统的显式query-key匹配模式,提供了更灵活的长程信息交换机制。

局限性

  • GSAP在处理极端稀疏数据时可能面临挑战,因为传播路径可能不足以覆盖所有重要信息。
  • 在某些复杂任务中,GSAP的性能提升可能不如预期。
  • 需要进一步研究以优化GSAP在不同硬件上的部署。

未来方向

未来的研究可以集中在优化GSAP的硬件实现,探索其在更多任务中的应用,并结合其他先进的脉冲神经网络技术以提高性能。

AI 总览摘要

Spiking Transformers通过稀疏脉冲事件进行信息表示,具有节能的计算优势。然而,传统的token交互机制在处理稀疏脉冲时存在局限。本文提出的Gated Spike Axial Propagation (GSAP)通过解耦信息传播与上下文选择,提供了一种新的交互范式。GSAP首先沿水平和垂直轴传播脉冲上下文,然后通过接收器条件门控选择性地整合上下文信息。实验结果表明,GSAP在多个数据集上显著提升了Spiking Transformers的性能,同时减少了参数量。这一研究不仅在学术界具有重要意义,也为工业界的智能系统提供了新的设计思路。尽管GSAP在处理极端稀疏数据时可能面临挑战,但其灵活的长程通信机制为未来的研究和应用提供了广阔的空间。

深度分析

研究背景

Spiking Neural Networks (SNNs)通过稀疏脉冲事件进行信息表示,具有生物启发的节能计算优势。近年来,Transformer模型因其强大的表示能力在许多领域取得了成功。Spiking Transformers结合了SNNs的事件驱动计算和Transformers的长程依赖建模能力,成为一种有前景的架构。

核心问题

现有的Spiking Transformers大多继承了传统Transformers的token交互机制,这种机制依赖于显式的query-key匹配,可能与稀疏脉冲表示不匹配,限制了全局特征建模的能力。

核心创新

GSAP通过解耦通信与上下文选择,提供了一种新的脉冲原生交互机制。它通过水平和垂直轴的顺序传播实现长程结构化通信,接收器条件门控选择性地整合上下文信息,保留了脉冲表示的稀疏事件驱动特性。

方法详解

  • �� GSAP首先沿水平和垂直轴传播脉冲上下文,允许信息通过结构化顺序传播到达远处的token。
  • �� 接收器条件门控决定每个token整合多少传播的上下文。
  • �� 轻量级的局部路径保留细粒度的邻域信息。
  • �� 通过这种方式,GSAP将token交互重新定义为一个先传播后选择的过程。

实验设计

实验在ImageNet-1K、CIFAR-10、CIFAR-100和TinyImageNet等数据集上进行,评估了GSAP在静态图像分类、事件识别和语义分割任务中的性能。实验结果表明,GSAP在多个Spiking Transformer骨干网络上实现了性能提升,同时保持了竞争性的计算效率。

结果分析

在ImageNet-1K数据集上,GSAP将Spikingformer-8-768的准确率从75.85%提升至78.19%,同时参数量从66.34M减少到62.04M。类似的性能提升也在CIFAR-100和N-Caltech101数据集上观察到,表明GSAP在不同任务中的有效性。

应用场景

GSAP可用于需要长程信息交换的智能系统,如图像分类、事件识别和语义分割。其灵活的通信机制使其适用于资源受限的环境,如移动设备和嵌入式系统。

局限与展望

尽管GSAP在多个任务中表现出色,但在极端稀疏数据或复杂任务中可能面临挑战。此外,GSAP的硬件实现和部署仍需进一步优化。未来的研究可以集中在这些方面,以提高GSAP的适用性和性能。

通俗解读 非专业人士也能看懂

想象一个大型图书馆,书籍按主题分布在不同的书架上。传统的查找方式需要逐个书架地寻找目标书籍,这就像传统Transformers中的query-key匹配。而GSAP就像是一个智能机器人,它能沿着书架的横向和纵向快速移动,找到相关书籍并传递信息。每个书架上的接收器可以根据需要选择性地接收信息,而不必依赖于书籍的具体位置。这种方式不仅提高了信息传递的效率,还保留了书籍的稀疏分布特性。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,你的角色需要与其他玩家合作完成任务。传统的合作方式需要每个玩家之间直接沟通,这就像传统Transformers中的query-key匹配。而GSAP就像一个智能助手,它能在游戏地图上快速移动,收集和传递信息。每个玩家可以根据自己的需要选择性地接收信息,而不必依赖于其他玩家的具体位置。这种方式不仅提高了合作的效率,还保留了游戏的动态特性。

术语表

Spiking Transformer (脉冲Transformer)

结合了脉冲神经网络的事件驱动计算和Transformer的长程依赖建模能力的模型。

用于提高模型在稀疏数据上的表现。

Gated Spike Axial Propagation (GSAP)

一种新的脉冲原生交互机制,通过解耦通信与上下文选择实现长程信息交换。

作为Spiking Transformers中的token交互机制。

Query-Key Matching (查询-键匹配)

传统Transformers中用于建立token之间交互关系的方法。

在GSAP中被轴向传播替代。

Receiver-Conditioned Gate (接收器条件门控)

根据接收器当前状态选择性整合上下文信息的机制。

用于GSAP中的上下文选择。

Axial Propagation (轴向传播)

沿水平和垂直轴传播信息的机制,允许信息到达远处的token。

GSAP中用于实现长程通信。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端稀疏数据环境中优化GSAP的性能?
  • 2 GSAP在复杂任务中的性能提升是否具有普遍性?
  • 3 如何优化GSAP在不同硬件上的部署?

应用场景

近期应用

智能设备

GSAP可用于智能手机和嵌入式系统,提升在资源受限环境下的计算效率。

图像识别

在图像分类任务中,GSAP可提高模型的准确率和效率,适用于实时应用。

远期愿景

智能交通系统

GSAP可用于智能交通系统中的实时数据处理,提升交通管理效率。

原文摘要

Spiking Transformers inherit token interaction mechanisms from conventional Transformers, yet their sparse binary representations fundamentally alter how token-to-token communication is established. In particular, spike-based query-key matching produces highly sparse and input-dependent interaction patterns, coupling information propagation to the instantaneous availability of matching spike events. This motivates a different interaction paradigm in which long-range communication does not rely solely on pairwise spike coincidence. We therefore propose Gated Spike Axial Propagation (GSAP), a spike-native token interaction mechanism that decouples information propagation from context selection. Instead of directly determining communication through query-key matching, GSAP first propagates spike-based context along the horizontal and vertical axes, allowing information to reach distant tokens through structured sequential propagation. A receiver-conditioned gate then determines how much of the propagated context is incorporated at each token, while a lightweight local pathway preserves fine-grained neighborhood information. In this way, GSAP reformulates token interaction as a propagate-then-select process, enabling structured long-range communication while retaining the sparse event-driven nature of spiking representations. Code is available at https://github.com/Fancyssc/GSAP.

cs.NE