Spiking Transformer with Spatial-Temporal Attention

TL;DR

提出空间-时间注意力机制STAtten,提升Spike Transformer性能,实验在CIFAR、ImageNet等数据集均优于空间注意力。

cs.NE 🔴 高级 2024-09-30 48 引用 56 次浏览
Donghyun Lee Yuhang Li Youngeun Kim Shiting Xiao Priyadarshini Panda
神经网络 变换器 脉冲神经网络 空间-时间注意力 能效

核心发现

方法论

本文提出的STAtten结合块式空间-时间注意力机制,通过分块处理局部时间关系,利用二值Q、K、V实现低复杂度的自注意力计算。采用信息熵分析验证空间-时间联合的重要性,设计无需Softmax的二值操作,保证复杂度为O(T N D^2),兼容现有脉冲变换器架构。实现方式包括块划分、局部时间相关性建模,结合残差连接,增强特征表达能力。

关键结果

  • 在CIFAR10/100、ImageNet、CIFAR10-DVS和N-Caltech101数据集上,STAtten显著提升了多种脉冲变换器的性能。例如,在QKFormer架构中,CIFAR10准确率由94.96%提升至95.35%,CIFAR100由79.79%提升至80.20%。在序列CIFAR任务中,性能提升3%以上,验证了长距离时间依赖建模能力。
  • 在能效方面,STAtten保持与空间注意力相当的计算复杂度,显著降低能耗,验证其在边缘设备的潜力。
  • 通过消融实验,验证块大小和局部时间窗口对性能的影响,突出空间-时间联合的重要性。

研究意义

该研究突破了脉冲神经网络中仅依赖空间注意力的局限,充分利用时间动态信息,极大改善特征表达和长距离依赖建模能力。推动能效高、性能优的脉冲变换器在视觉识别、视频分析等领域的应用,为神经形态计算提供新思路,具有重要理论和实际意义。

技术贡献

提出块式空间-时间注意力STAtten,兼容现有脉冲变换器架构,保持复杂度不变。创新性地结合信息熵分析验证时间依赖性,设计无需Softmax的二值操作,提升能效。实现局部时间块处理,平衡信息捕获与存储需求,增强模型表达能力,推动脉冲变换器向更深层次的空间-时间建模发展。

新颖性

首次在脉冲神经网络中引入块式空间-时间注意力机制,突破传统空间注意力的局限。不同于以往只关注空间关系的变换器,STAtten充分利用时间动态信息,结合信息熵验证其有效性,提供一种高效、可扩展的空间-时间联合建模方案。

局限性

  • 当前方法依赖块划分策略,可能在极端长序列或高动态场景中表现有限,需进一步优化块大小和窗口设计。
  • 模型在极端低采样率或硬件限制下的表现尚未充分验证,未来需结合硬件特性进行优化。
  • 虽然保持复杂度不变,但在极大规模数据上仍存在一定的计算压力,需探索更高效的算法改进。

未来方向

未来将探索多尺度块式时间建模,结合动态块调整策略,提升长序列处理能力。还将结合神经形态硬件优化,推动实际部署,并扩展到多模态感知任务,增强模型的泛化能力和应用范围。

AI 总览摘要

脉冲神经网络(SNNs)以其生物启发和能效优势,成为深度学习的重要研究方向。近年来,变换器架构凭借其强大的长距离依赖建模能力,在视觉和语音任务中表现出色,激发了将变换器引入SNN的研究热潮。现有的脉冲变换器多依赖空间注意力机制,忽视了脉冲信号固有的时间动态特性,导致特征表达不足,性能受限。

本文提出的空间-时间注意力机制STAtten,创新性地结合块式局部时间建模,有效捕获空间和时间的联合关系。该机制无需Softmax,利用二值Q、K、V实现低复杂度的自注意力计算,兼容现有架构。通过信息熵分析验证时间依赖性的重要性,实验证明在多个静态和动态数据集上,STAtten显著提升了模型性能。例如,在QKFormer架构中,CIFAR10准确率提升至95.35%,CIFAR100提升至80.20%,在序列CIFAR任务中性能提升超过3%。

该方法不仅增强了长距离时间依赖建模能力,还保持了能效优势,为神经形态硬件的实际应用提供了技术支撑。未来,将结合多尺度块策略和硬件优化,推动空间-时间联合建模在更复杂场景中的应用,拓展脉冲神经网络的潜力。整体而言,STAtten为脉冲变换器的性能提升提供了新思路,开启了空间-时间深度融合的研究新篇章。

深度分析

研究背景

神经网络的发展经历了从卷积到变换器的演变,变换器以其长距离依赖捕获能力在视觉、语音等领域取得突破。脉冲神经网络(SNNs)因其低能耗和生物启发特性,成为未来硬件友好的模型选择。近年来,结合变换器的SNN研究逐渐兴起,如Spikformer、Spike-driven Transformer等,采用二值Q、K、V实现高效自注意力。尽管如此,现有方法多关注空间关系,忽略时间动态,限制了模型性能。

核心问题

脉冲信号的时间依赖性是提升SNN性能的关键,但现有变换器多采用空间注意力,未充分利用时间信息,导致特征表达不足,难以捕获长距离时间依赖。如何在保持低复杂度的同时,融合空间与时间信息,成为亟待解决的问题。块式时间建模虽减轻存储压力,但如何设计有效的局部时间关系捕获机制仍未解决。

核心创新

提出块式空间-时间注意力STAtten,解决长序列时间建模的复杂度问题。该机制将时间序列划分成局部块,利用二值Q、K、V实现低成本的局部时间相关性建模,避免全局时间相关的高复杂度。引入信息熵分析验证时间动态的重要性,设计无需Softmax的二值操作,提升能效。该方案兼容多种脉冲变换器架构,增强模型的空间-时间表达能力。

方法详解

  • �� 采用块划分策略,将时间序列分为多个局部块,减少存储和计算负担。
  • �� 利用二值Q、K、V实现自注意力机制,避免Softmax操作,降低复杂度。
  • �� 在每个块内执行局部空间-时间注意力,捕获局部时间依赖。
  • �� 通过信息熵分析验证时间动态信息的重要性,确保模型学习到丰富的时间特征。
  • �� 设计残差连接,增强特征表达,提升模型稳定性。
  • �� 实现过程中,结合局部时间窗口和块内操作,平衡信息捕获与计算效率。

实验设计

在CIFAR10/100、ImageNet、CIFAR10-DVS和N-Caltech101等数据集上,采用从头训练策略,比较不同架构和注意力机制的性能。设置不同块大小和时间窗口,验证模型对长距离时间依赖的捕获能力。采用准确率、能耗指标和信息熵作为评价指标,进行消融分析,确保模型在保持低复杂度的同时提升性能。

结果分析

在多个数据集上,STAtten显著优于空间注意力方案。例如,在QKFormer架构中,CIFAR10准确率由94.96%提升至95.35%,CIFAR100由79.79%提升至80.20%。在序列CIFAR任务中,性能提升超过3%。信息熵分析显示,空间-时间联合模型具有更低的熵值(4.85)和更高的准确率(79.9%),验证了其优越的特征表达能力。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天都要处理很多原材料(信息)。传统方法就像只用一个机械臂(空间注意力)搬运材料,只关注材料的类型和位置,但忽略了材料在不同时间的变化。而我们的方法像增加了一个能感知材料变化的智能系统(空间-时间注意力),可以同时考虑材料的种类、位置和变化过程。这样,工厂能更快、更准地完成任务,节省能源,也能处理更复杂的生产线。这个新系统让工厂变得更聪明、更高效,能应对各种复杂的生产需求。

简单解释 像给14岁少年讲一样

想象你在学校里,老师布置了一个任务,要你记住很多事情,比如朋友的名字、他们喜欢的游戏、上次一起玩的事情。以前,老师只让你记住每个人的名字(空间信息),但没有考虑你和朋友之间的时间关系,比如什么时候和谁玩过、谁最近变了喜欢什么。现在,老师用了一种新方法,不仅记住朋友的名字,还能记住你们之间的时间关系,比如谁最近和你玩得多、谁变了喜欢的游戏。这就像给你脑袋里装了一个聪明的记忆系统,既看得远,也看得清楚,帮你更好地记住和理解朋友们的变化。这样,你就能更快找到朋友,知道他们的最新动态,变得更聪明、更善于交朋友。

术语表

空间-时间注意力 (Spatial-Temporal Attention)

一种结合空间关系和时间动态的注意力机制,用于增强模型对序列数据的理解能力。技术上通过块式局部时间建模实现低复杂度的联合特征捕获。

本文提出的STAtten核心机制。

二值Q、K、V (Binary Q, K, V)

在脉冲神经网络中,Q、K、V采用二值表示,简化计算,避免Softmax,降低能耗。

实现低复杂度自注意力的关键技术。

信息熵 (Information Entropy)

衡量注意力分布的集中程度,低熵表示信息集中,模型更具判别性。

验证空间-时间联合注意力效果的重要指标。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化块大小和局部时间窗口,以适应极长序列和高动态场景,仍需深入研究。
  • 2 在硬件限制极端条件下,模型的鲁棒性和能效表现尚未充分验证,未来需结合硬件特性优化。

原文摘要

Spike-based Transformer presents a compelling and energy-efficient alternative to traditional Artificial Neural Network (ANN)-based Transformers, achieving impressive results through sparse binary computations. However, existing spike-based transformers predominantly focus on spatial attention while neglecting crucial temporal dependencies inherent in spike-based processing, leading to suboptimal feature representation and limited performance. To address this limitation, we propose Spiking Transformer with Spatial-Temporal Attention (STAtten), a simple and straightforward architecture that efficiently integrates both spatial and temporal information in the self-attention mechanism. STAtten introduces a block-wise computation strategy that processes information in spatial-temporal chunks, enabling comprehensive feature capture while maintaining the same computational complexity as previous spatial-only approaches. Our method can be seamlessly integrated into existing spike-based transformers without architectural overhaul. Extensive experiments demonstrate that STAtten significantly improves the performance of existing spike-based transformers across both static and neuromorphic datasets, including CIFAR10/100, ImageNet, CIFAR10-DVS, and N-Caltech101. The code is available at https://github.com/Intelligent-Computing-Lab-Yale/STAtten

cs.NE

参考文献 (20)

QKFormer: Hierarchical Spiking Transformer using Q-K Attention

Chenlin Zhou, Han Zhang, Zhaokun Zhou 等

2024 119 引用 ⭐ 高影响力 查看解读 →

Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic Chips

Man Yao, Jiakui Hu, Tianxiang Hu 等

2024 207 引用 ⭐ 高影响力 查看解读 →

Spike-driven Transformer

Man Yao, Jiakui Hu, Zhaokun Zhou 等

2023 354 引用 ⭐ 高影响力 查看解读 →

Spikformer: When Spiking Neural Network Meets Transformer

Zhaokun Zhou, Yuesheng Zhu, Chao He 等

2022 568 引用 ⭐ 高影响力 查看解读 →

Advancing Spiking Neural Networks Toward Deep Residual Learning

Yifan Hu, Lei Deng, Yujie Wu 等

2021 240 引用 ⭐ 高影响力 查看解读 →

Post-Training Quantization for Vision Transformer

Zhenhua Liu, Yunhe Wang, Kai Han 等

2021 523 引用 ⭐ 高影响力 查看解读 →

Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition

Zhengkun Tian, Jiangyan Yi, J. Tao 等

2020 56 引用 查看解读 →

Incorporating Learnable Membrane Time Constant to Enhance Learning of Spiking Neural Networks

W. Fang, Zhaofei Yu, Yan-Qing Chen 等

2020 809 引用 查看解读 →

Attention is All you Need

Ashish Vaswani, Noam Shazeer, Niki Parmar 等

2017 192915 引用 查看解读 →

DIET-SNN: Direct Input Encoding With Leakage and Threshold Optimization in Deep Spiking Neural Networks

Nitin Rathi, K. Roy

2020 166 引用 查看解读 →

Going Deeper With Directly-Trained Larger Spiking Neural Networks

Hanle Zheng, Yujie Wu, Lei Deng 等

2020 767 引用 查看解读 →

Training data-efficient image transformers & distillation through attention

Hugo Touvron, M. Cord, Matthijs Douze 等

2020 9799 引用 查看解读 →

Deep Residual Learning in Spiking Neural Networks

W. Fang, Zhaofei Yu, Yan-Qing Chen 等

2021 835 引用 查看解读 →

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 等

2020 69847 引用 查看解读 →

Towards spike-based machine intelligence with neuromorphic computing

K. Roy, Akhilesh R. Jaiswal, P. Panda

2019 2282 引用

Towards artificial general intelligence with hybrid Tianjic chip architecture

Jing Pei, Lei Deng, Sen Song 等

2019 1128 引用

Spiking-YOLO: Spiking Neural Network for Energy-Efficient Object Detection

Seijoon Kim, Seongsik Park, Byunggook Na 等

2019 560 引用 查看解读 →

Direct Training for Spiking Neural Networks: Faster, Larger, Better

Yujie Wu, Lei Deng, Guoqi Li 等

2018 816 引用 查看解读 →

SLAYER: Spike Layer Error Reassignment in Time

S. Shrestha, G. Orchard

2018 955 引用 查看解读 →

Entropy and mutual information in models of deep neural networks

Marylou Gabrié, Andre Manoel, Clément Luneau 等

2018 208 引用 查看解读 →

被引用 (20)

STEG-AIW: Spatio-Temporal Gating and Adaptive-Timestep Inference for Efficient Spiking Neural Networks

2026 ⭐ 高影响力

Spatial-Augmented Transformer with Adaptive Framing for Event-Based Human Action Recognition

2026 ⭐ 高影响力

Benchmarking Fairness in Spiking Neural Networks: Data Bias, Spurious Features, and Hardware Effects

2026 ⭐ 高影响力 查看解读 →

SpikePool: Event-driven Spiking Transformer with Pooling Attention

2025 1 引用 ⭐ 高影响力 查看解读 →

Efficient Transformer Attention for SNNs via Hadamard Simplification

1 引用

TEFormer: Structured Bidirectional Temporal Enhancement Modeling in Spiking Transformers

2026 1 引用 查看解读 →

MI-TRQR: Mutual Information-Based Temporal Redundancy Quantification and Reduction for Energy-Efficient Spiking Neural Networks

2025

SpiLiFormer: Enhancing Spiking Transformers with Lateral Inhibition

2025 8 引用 查看解读 →

MK-SGN: A Spiking Graph Convolutional Network with Multimodal Fusion and Knowledge Distillation for Skeleton-based Action Recognition

2024 8 引用 查看解读 →

SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion

2025 5 引用 查看解读 →

ASG-TDM: A Graph-Enhanced Transformer With Spiking Preprocessing and a Dendritic Head for Multi-Task Facial Analysis

2026 1 引用

Quantization Meets Spikes: Nearly Lossless Conversion at the First Timestep via Polarity Multi-Spike Mapping

ASecond-Order SpikingSSM for Wearables

2025 1 引用 查看解读 →

Temporal Dynamics Enhancer for Directly Trained Spiking Object Detectors

2025 3 引用 查看解读 →

MD-SNN: Membrane Potential-aware Distillation on Quantized Spiking Neural Network

Signal-SGN++: Topology-Enhanced Time-Frequency Spiking Graph Network for Skeleton-Based Action Recognition

2025 1 引用 查看解读 →

SQKformer: Spiking sparse QKformer with adaptive batch normalization for membrane potential

2026 4 引用

A Four-Stage Structural Evolution Framework for Spiking Neural Networks: A Review and Perspective from Binary ANN to Event-Driven Models

2026 2 引用

Hybrid Convolutional Autoencoder with Spiking Neural Network-Based Compression Approach with Binary Spike Latent for Telemedicine and Archival

2026

Differential attention vision transformer with adaptive spatial feature conditioning for remote sensing scene classification

2026 2 引用