核心发现
方法论
本文提出的STAtten结合块式空间-时间注意力机制,通过分块处理局部时间关系,利用二值Q、K、V实现低复杂度的自注意力计算。采用信息熵分析验证空间-时间联合的重要性,设计无需Softmax的二值操作,保证复杂度为O(T N D^2),兼容现有脉冲变换器架构。实现方式包括块划分、局部时间相关性建模,结合残差连接,增强特征表达能力。
关键结果
- 在CIFAR10/100、ImageNet、CIFAR10-DVS和N-Caltech101数据集上,STAtten显著提升了多种脉冲变换器的性能。例如,在QKFormer架构中,CIFAR10准确率由94.96%提升至95.35%,CIFAR100由79.79%提升至80.20%。在序列CIFAR任务中,性能提升3%以上,验证了长距离时间依赖建模能力。
- 在能效方面,STAtten保持与空间注意力相当的计算复杂度,显著降低能耗,验证其在边缘设备的潜力。
- 通过消融实验,验证块大小和局部时间窗口对性能的影响,突出空间-时间联合的重要性。
研究意义
该研究突破了脉冲神经网络中仅依赖空间注意力的局限,充分利用时间动态信息,极大改善特征表达和长距离依赖建模能力。推动能效高、性能优的脉冲变换器在视觉识别、视频分析等领域的应用,为神经形态计算提供新思路,具有重要理论和实际意义。
技术贡献
提出块式空间-时间注意力STAtten,兼容现有脉冲变换器架构,保持复杂度不变。创新性地结合信息熵分析验证时间依赖性,设计无需Softmax的二值操作,提升能效。实现局部时间块处理,平衡信息捕获与存储需求,增强模型表达能力,推动脉冲变换器向更深层次的空间-时间建模发展。
新颖性
首次在脉冲神经网络中引入块式空间-时间注意力机制,突破传统空间注意力的局限。不同于以往只关注空间关系的变换器,STAtten充分利用时间动态信息,结合信息熵验证其有效性,提供一种高效、可扩展的空间-时间联合建模方案。
局限性
- 当前方法依赖块划分策略,可能在极端长序列或高动态场景中表现有限,需进一步优化块大小和窗口设计。
- 模型在极端低采样率或硬件限制下的表现尚未充分验证,未来需结合硬件特性进行优化。
- 虽然保持复杂度不变,但在极大规模数据上仍存在一定的计算压力,需探索更高效的算法改进。
未来方向
未来将探索多尺度块式时间建模,结合动态块调整策略,提升长序列处理能力。还将结合神经形态硬件优化,推动实际部署,并扩展到多模态感知任务,增强模型的泛化能力和应用范围。
AI 总览摘要
脉冲神经网络(SNNs)以其生物启发和能效优势,成为深度学习的重要研究方向。近年来,变换器架构凭借其强大的长距离依赖建模能力,在视觉和语音任务中表现出色,激发了将变换器引入SNN的研究热潮。现有的脉冲变换器多依赖空间注意力机制,忽视了脉冲信号固有的时间动态特性,导致特征表达不足,性能受限。
本文提出的空间-时间注意力机制STAtten,创新性地结合块式局部时间建模,有效捕获空间和时间的联合关系。该机制无需Softmax,利用二值Q、K、V实现低复杂度的自注意力计算,兼容现有架构。通过信息熵分析验证时间依赖性的重要性,实验证明在多个静态和动态数据集上,STAtten显著提升了模型性能。例如,在QKFormer架构中,CIFAR10准确率提升至95.35%,CIFAR100提升至80.20%,在序列CIFAR任务中性能提升超过3%。
该方法不仅增强了长距离时间依赖建模能力,还保持了能效优势,为神经形态硬件的实际应用提供了技术支撑。未来,将结合多尺度块策略和硬件优化,推动空间-时间联合建模在更复杂场景中的应用,拓展脉冲神经网络的潜力。整体而言,STAtten为脉冲变换器的性能提升提供了新思路,开启了空间-时间深度融合的研究新篇章。
深度分析
研究背景
神经网络的发展经历了从卷积到变换器的演变,变换器以其长距离依赖捕获能力在视觉、语音等领域取得突破。脉冲神经网络(SNNs)因其低能耗和生物启发特性,成为未来硬件友好的模型选择。近年来,结合变换器的SNN研究逐渐兴起,如Spikformer、Spike-driven Transformer等,采用二值Q、K、V实现高效自注意力。尽管如此,现有方法多关注空间关系,忽略时间动态,限制了模型性能。
核心问题
脉冲信号的时间依赖性是提升SNN性能的关键,但现有变换器多采用空间注意力,未充分利用时间信息,导致特征表达不足,难以捕获长距离时间依赖。如何在保持低复杂度的同时,融合空间与时间信息,成为亟待解决的问题。块式时间建模虽减轻存储压力,但如何设计有效的局部时间关系捕获机制仍未解决。
核心创新
提出块式空间-时间注意力STAtten,解决长序列时间建模的复杂度问题。该机制将时间序列划分成局部块,利用二值Q、K、V实现低成本的局部时间相关性建模,避免全局时间相关的高复杂度。引入信息熵分析验证时间动态的重要性,设计无需Softmax的二值操作,提升能效。该方案兼容多种脉冲变换器架构,增强模型的空间-时间表达能力。
方法详解
- �� 采用块划分策略,将时间序列分为多个局部块,减少存储和计算负担。
- �� 利用二值Q、K、V实现自注意力机制,避免Softmax操作,降低复杂度。
- �� 在每个块内执行局部空间-时间注意力,捕获局部时间依赖。
- �� 通过信息熵分析验证时间动态信息的重要性,确保模型学习到丰富的时间特征。
- �� 设计残差连接,增强特征表达,提升模型稳定性。
- �� 实现过程中,结合局部时间窗口和块内操作,平衡信息捕获与计算效率。
实验设计
在CIFAR10/100、ImageNet、CIFAR10-DVS和N-Caltech101等数据集上,采用从头训练策略,比较不同架构和注意力机制的性能。设置不同块大小和时间窗口,验证模型对长距离时间依赖的捕获能力。采用准确率、能耗指标和信息熵作为评价指标,进行消融分析,确保模型在保持低复杂度的同时提升性能。
结果分析
在多个数据集上,STAtten显著优于空间注意力方案。例如,在QKFormer架构中,CIFAR10准确率由94.96%提升至95.35%,CIFAR100由79.79%提升至80.20%。在序列CIFAR任务中,性能提升超过3%。信息熵分析显示,空间-时间联合模型具有更低的熵值(4.85)和更高的准确率(79.9%),验证了其优越的特征表达能力。
通俗解读 非专业人士也能看懂
想象你在一家工厂工作,工厂每天都要处理很多原材料(信息)。传统方法就像只用一个机械臂(空间注意力)搬运材料,只关注材料的类型和位置,但忽略了材料在不同时间的变化。而我们的方法像增加了一个能感知材料变化的智能系统(空间-时间注意力),可以同时考虑材料的种类、位置和变化过程。这样,工厂能更快、更准地完成任务,节省能源,也能处理更复杂的生产线。这个新系统让工厂变得更聪明、更高效,能应对各种复杂的生产需求。
简单解释 像给14岁少年讲一样
想象你在学校里,老师布置了一个任务,要你记住很多事情,比如朋友的名字、他们喜欢的游戏、上次一起玩的事情。以前,老师只让你记住每个人的名字(空间信息),但没有考虑你和朋友之间的时间关系,比如什么时候和谁玩过、谁最近变了喜欢什么。现在,老师用了一种新方法,不仅记住朋友的名字,还能记住你们之间的时间关系,比如谁最近和你玩得多、谁变了喜欢的游戏。这就像给你脑袋里装了一个聪明的记忆系统,既看得远,也看得清楚,帮你更好地记住和理解朋友们的变化。这样,你就能更快找到朋友,知道他们的最新动态,变得更聪明、更善于交朋友。
术语表
空间-时间注意力 (Spatial-Temporal Attention)
一种结合空间关系和时间动态的注意力机制,用于增强模型对序列数据的理解能力。技术上通过块式局部时间建模实现低复杂度的联合特征捕获。
本文提出的STAtten核心机制。
二值Q、K、V (Binary Q, K, V)
在脉冲神经网络中,Q、K、V采用二值表示,简化计算,避免Softmax,降低能耗。
实现低复杂度自注意力的关键技术。
信息熵 (Information Entropy)
衡量注意力分布的集中程度,低熵表示信息集中,模型更具判别性。
验证空间-时间联合注意力效果的重要指标。
开放问题 这项研究留下的未解疑问
- 1 如何进一步优化块大小和局部时间窗口,以适应极长序列和高动态场景,仍需深入研究。
- 2 在硬件限制极端条件下,模型的鲁棒性和能效表现尚未充分验证,未来需结合硬件特性优化。
原文摘要
Spike-based Transformer presents a compelling and energy-efficient alternative to traditional Artificial Neural Network (ANN)-based Transformers, achieving impressive results through sparse binary computations. However, existing spike-based transformers predominantly focus on spatial attention while neglecting crucial temporal dependencies inherent in spike-based processing, leading to suboptimal feature representation and limited performance. To address this limitation, we propose Spiking Transformer with Spatial-Temporal Attention (STAtten), a simple and straightforward architecture that efficiently integrates both spatial and temporal information in the self-attention mechanism. STAtten introduces a block-wise computation strategy that processes information in spatial-temporal chunks, enabling comprehensive feature capture while maintaining the same computational complexity as previous spatial-only approaches. Our method can be seamlessly integrated into existing spike-based transformers without architectural overhaul. Extensive experiments demonstrate that STAtten significantly improves the performance of existing spike-based transformers across both static and neuromorphic datasets, including CIFAR10/100, ImageNet, CIFAR10-DVS, and N-Caltech101. The code is available at https://github.com/Intelligent-Computing-Lab-Yale/STAtten
参考文献 (20)
QKFormer: Hierarchical Spiking Transformer using Q-K Attention
Chenlin Zhou, Han Zhang, Zhaokun Zhou 等
Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic Chips
Man Yao, Jiakui Hu, Tianxiang Hu 等
Spikformer: When Spiking Neural Network Meets Transformer
Zhaokun Zhou, Yuesheng Zhu, Chao He 等
Advancing Spiking Neural Networks Toward Deep Residual Learning
Yifan Hu, Lei Deng, Yujie Wu 等
Post-Training Quantization for Vision Transformer
Zhenhua Liu, Yunhe Wang, Kai Han 等
Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition
Zhengkun Tian, Jiangyan Yi, J. Tao 等
Incorporating Learnable Membrane Time Constant to Enhance Learning of Spiking Neural Networks
W. Fang, Zhaofei Yu, Yan-Qing Chen 等
DIET-SNN: Direct Input Encoding With Leakage and Threshold Optimization in Deep Spiking Neural Networks
Nitin Rathi, K. Roy
Going Deeper With Directly-Trained Larger Spiking Neural Networks
Hanle Zheng, Yujie Wu, Lei Deng 等
Training data-efficient image transformers & distillation through attention
Hugo Touvron, M. Cord, Matthijs Douze 等
Deep Residual Learning in Spiking Neural Networks
W. Fang, Zhaofei Yu, Yan-Qing Chen 等
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 等
Towards spike-based machine intelligence with neuromorphic computing
K. Roy, Akhilesh R. Jaiswal, P. Panda
Towards artificial general intelligence with hybrid Tianjic chip architecture
Jing Pei, Lei Deng, Sen Song 等
Spiking-YOLO: Spiking Neural Network for Energy-Efficient Object Detection
Seijoon Kim, Seongsik Park, Byunggook Na 等
Direct Training for Spiking Neural Networks: Faster, Larger, Better
Yujie Wu, Lei Deng, Guoqi Li 等
Entropy and mutual information in models of deep neural networks
Marylou Gabrié, Andre Manoel, Clément Luneau 等
被引用 (20)
STEG-AIW: Spatio-Temporal Gating and Adaptive-Timestep Inference for Efficient Spiking Neural Networks
Spatial-Augmented Transformer with Adaptive Framing for Event-Based Human Action Recognition
Benchmarking Fairness in Spiking Neural Networks: Data Bias, Spurious Features, and Hardware Effects
SpikePool: Event-driven Spiking Transformer with Pooling Attention
Efficient Transformer Attention for SNNs via Hadamard Simplification
TEFormer: Structured Bidirectional Temporal Enhancement Modeling in Spiking Transformers
MI-TRQR: Mutual Information-Based Temporal Redundancy Quantification and Reduction for Energy-Efficient Spiking Neural Networks
SpiLiFormer: Enhancing Spiking Transformers with Lateral Inhibition
MK-SGN: A Spiking Graph Convolutional Network with Multimodal Fusion and Knowledge Distillation for Skeleton-based Action Recognition
SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion
ASG-TDM: A Graph-Enhanced Transformer With Spiking Preprocessing and a Dendritic Head for Multi-Task Facial Analysis
Quantization Meets Spikes: Nearly Lossless Conversion at the First Timestep via Polarity Multi-Spike Mapping
ASecond-Order SpikingSSM for Wearables
Temporal Dynamics Enhancer for Directly Trained Spiking Object Detectors
MD-SNN: Membrane Potential-aware Distillation on Quantized Spiking Neural Network
Signal-SGN++: Topology-Enhanced Time-Frequency Spiking Graph Network for Skeleton-Based Action Recognition
SQKformer: Spiking sparse QKformer with adaptive batch normalization for membrane potential
A Four-Stage Structural Evolution Framework for Spiking Neural Networks: A Review and Perspective from Binary ANN to Event-Driven Models
Hybrid Convolutional Autoencoder with Spiking Neural Network-Based Compression Approach with Binary Spike Latent for Telemedicine and Archival
Differential attention vision transformer with adaptive spatial feature conditioning for remote sensing scene classification