Lapis: Laplacian Spiking Attention via First-Spike Timing and Membrane Leakage

TL;DR

Lapis通过First-Spike Timing和Membrane Leakage实现Laplacian注意力,能在CIFAR-10达96.56%准确率,能耗降低14.5倍。

cs.NE 🔴 高级 2026-08-12 90 次浏览
Kaiwen Tang Jiaqi Zheng Zixuan Zhu Yiqun Wang Zhanglu Yan Weng-Fai Wong
神经网络 自注意力 脉冲神经网络 能效优化 时序编码

核心发现

方法论

Lapis提出了一种基于脉冲神经网络的Laplacian注意力机制,核心思想是利用时间到第一脉冲(TTFS)编码中的First-Spike Latency向量,通过ℓ1距离衡量查询和键的相似性。该距离经过Laplacian核映射,得到的相似度值与Leaky Integrate-and-Fire(LIF)膜电位的指数衰减特性一致,从而实现无需乘法的关系计算。具体流程包括:• 采用TTFS编码,将每个神经元的激活值转化为首次脉冲到达时间;• 计算查询和键的第一脉冲潜伏期向量的ℓ1距离,反映两个Token的时序差异;• 利用指数衰减的Laplacian核,将距离映射为相似度,符合LIF膜的泄漏动态;• 通过行归一化(采用2的幂次舍入实现移位操作)得到注意力权重;• 最后,将权重与值向量进行加权累积,完成注意力计算。该机制显著减少乘法操作,提升能效。

关键结果

  • 在CIFAR-10数据集上,Lapis达到了96.56%的top-1准确率,比传统点积注意力低0.53个百分点,但能耗降低了14.5倍,达到6.92mJ/图像;在ImageNet-1K上,Lapis-6bit模型实现83.25%的top-1准确率,能耗仅为3.28mJ/图像,远低于密集点积注意力的估算能耗。
  • 通过在不同尺度模型(如ViT-B和ViT-L)上的验证,Lapis在保持高准确率的同时,大幅降低了能量消耗,验证了其在大规模视觉任务中的实用性和优越性。
  • 消融实验显示,基于ℓ1距离的Laplacian核优于高斯核和二元匹配,且采用幂次归一化的移位操作在精度上几乎不影响,但极大简化了硬件实现,验证了设计的有效性。

研究意义

该研究突破了脉冲神经网络中注意力机制的设计瓶颈,将时序信息直接引入关系建模,打破了传统点积的限制,极大提升了能效。其创新的泄漏动态映射为未来低功耗、高速视觉处理提供了新思路,推动了神经科学启发的硬件设计与深度学习的融合。此方法不仅适用于视觉任务,也为语音、序列分析等领域的稀疏事件驱动模型提供了理论基础和实践路径,具有广泛的应用潜力。

技术贡献

Lapis的核心技术创新在于将点积替换为基于First-Spike Latency的ℓ1距离,通过Laplacian核映射实现关系建模,避免了乘法操作,简化了硬件实现。引入膜泄漏动态与距离映射的结合,为注意力机制赋予了生物启发的物理意义,增强了模型的可解释性和鲁棒性。采用幂次归一化策略,确保了数值稳定性和硬件友好性。整体框架实现了在保持高准确率的同时,显著降低能耗,为脉冲神经网络的实用化提供了技术支撑。

新颖性

本研究首次提出将First-Spike Latency作为关系度量,结合Laplacian核与膜泄漏动态,构建无乘法的注意力机制,突破了传统点积的局限。与现有的脉冲注意力方法相比,Lapis充分利用时序信息,强化了神经元的生物物理特性,提供了全新的关系建模视角。这一设计不仅在理论上创新,还在实际中实现能效的飞跃,开辟了脉冲神经网络在视觉识别中的新路径。

局限性

  • 尽管Lapis在能耗和准确率方面表现优异,但其性能仍略低于基于点积的注意力(差距约0.53个百分点),在极端低功耗场景下可能面临性能瓶颈。
  • 该方法依赖于精确的时序编码和膜泄漏模型,硬件实现复杂度较高,尤其在大规模并行场景中对时序同步要求苛刻。
  • 目前仅在视觉任务中验证,尚未扩展到多模态或序列生成任务,未来需验证其通用性和适应性。

未来方向

未来将探索多头注意力的优化策略,提升模型的表达能力;同时,结合硬件加速器设计,进一步降低时序编码和膜泄漏的实现成本。此外,计划将Lapis扩展到自然语言处理和多模态融合任务中,验证其跨领域的适用性。还将研究动态调整膜泄漏参数的方法,以适应不同任务的需求,实现更高的能效比和鲁棒性。

AI 总览摘要

在深度学习的视觉识别领域,自注意力机制已成为提升模型性能的核心技术之一。然而,传统的点积注意力在实现上依赖大量的乘法运算,导致能耗高昂,限制了其在边缘计算和低功耗场景中的应用。随着脉冲神经网络(SNN)的兴起,研究者开始尝试将生物启发的事件驱动机制引入注意力设计中,以实现更高的能效和更低的延迟。

本文提出了一种名为Lapis的创新机制,基于First-Spike Latency(首次脉冲到达时间)和膜泄漏动态,构建了无乘法的Laplacian注意力。该机制利用脉冲神经元的时序信息,将查询和键的第一脉冲潜伏期向量的ℓ1距离映射为相似度,符合生物神经元的泄漏特性。通过引入指数衰减的Laplacian核,Lapis实现了与膜泄漏动态一致的关系建模,极大简化了硬件实现,且能在保持接近点积注意力性能的同时,降低能耗达14.5倍。

在CIFAR-10和ImageNet-1K数据集上的实验结果显示,Lapis在视觉识别任务中表现优异,达到了96.56%的准确率(CIFAR-10)和83.25%的准确率(ImageNet-1K),同时能耗显著降低。特别是在6-bit量化模型中,能耗仅为3.28毫焦耳/图像,远低于传统方法的能耗极限。这些结果验证了Lapis在高效、低功耗视觉识别中的潜力,为未来边缘智能设备的设计提供了新思路。

该研究的核心创新在于将时序信息直接引入关系建模,利用膜泄漏的物理特性实现无乘法的关系计算,突破了传统注意力机制的局限。其设计理念不仅符合神经科学的生物启发,也为硬件友好的深度学习模型提供了理论基础。未来,结合硬件加速和多模态任务,Lapis有望推动低功耗智能系统的广泛应用,开启脉冲神经网络在实际场景中的新篇章。

深度分析

研究背景

近年来,深度学习在视觉识别任务中取得了巨大成功,尤其是Transformer架构引入自注意力机制后,显著提升了模型的长距离依赖建模能力。代表性工作如ViT(Vision Transformer)和DeiT(Data-efficient Image Transformer)通过点积注意力实现了优异性能,但其计算复杂度和能耗问题日益突出。脉冲神经网络(SNN)作为一种受生物启发的稀疏事件驱动模型,因其低能耗和高效率受到关注。早期研究多集中在ANN到SNN的转换或直接训练,解决了模型的可训练性和硬件实现问题,但在关系建模方面仍依赖传统点积方法,未充分利用脉冲的时序信息。近年来,基于时序编码的研究逐渐兴起,TTFS(时间到第一脉冲)编码成为低延迟、稀疏表示的主流方式。尽管如此,将时序信息融入注意力机制,特别是利用膜泄漏动态进行关系建模,仍是一个未被充分探索的方向。现有工作多采用二值匹配或离散操作,缺乏对脉冲时序的深度利用,限制了SNN在复杂视觉任务中的表现。

核心问题

传统的自注意力机制依赖点积计算,导致高能耗和硬件实现复杂。在脉冲神经网络中,脉冲的时序信息未被充分利用,关系建模仍停留在简单的二值匹配或离散操作上,无法充分发挥脉冲的时序优势。这限制了SNN在大规模视觉识别中的应用潜力,尤其是在低功耗边缘设备上。此外,如何将生物神经元的膜泄漏特性融入关系建模,既保证模型的生物合理性,又实现硬件友好,是一个亟待解决的核心问题。现有方法未能有效结合膜泄漏动态与时序信息,导致关系建模的效率和效果都难以满足实际需求。

核心创新

本研究的创新点主要包括:1)提出基于First-Spike Latency的关系度量,将时序信息直接引入关系建模,避免乘法操作,极大简化硬件实现;2)引入Laplacian核,将时序距离映射为相似度,且该映射与LIF膜泄漏动态一致,增强模型的生物合理性;3)采用幂次归一化策略,通过移位操作实现行归一化,保证数值稳定性和硬件友好性;4)在保持高准确率的同时,大幅降低能耗,验证了该机制在视觉识别中的优越性。这些创新突破了传统点积注意力的局限,为脉冲神经网络的关系建模提供了全新思路。

方法详解

  • �� 采用TTFS编码,将每个神经元的激活值转化为首次脉冲到达时间,形成First-Spike Latency向量;• 计算查询和键的潜伏期向量的ℓ1距离,反映两个Token的时序差异;• 将距离通过指数衰减的Laplacian核映射为相似度,公式为Ah_ij = exp(−Dh_ij/τh),其中Dh_ij为潜伏期差异,τh为可学习参数;• 利用膜泄漏动态,将距离映射为注意力权重,符合LIF模型的指数衰减特性;• 采用幂次归一化(通过移位操作)对行进行归一化,避免除法操作,简化硬件实现;• 最后,将归一化的注意力权重与值向量进行加权累积,完成注意力机制。

实验设计

  • �� 在CIFAR-10、CIFAR-100和ImageNet-1K数据集上进行验证,比较不同模型的准确率和能耗表现;• 采用预训练的ViT作为骨干网络,进行微调和量化,确保模型的实用性;• 设计不同尺度的Lapis模型(如Lapis-S、Lapis-B、Lapis-L),设置TTFS编码窗口T分别为15和20;• 通过消融实验验证ℓ1距离和Laplacian核的优越性,分析幂次归一化对性能的影响;• 评估模型在不同硬件模拟下的能耗,验证其低能耗优势。

结果分析

  • �� 在CIFAR-10上,Lapis达到了96.56%的top-1准确率,能耗仅为6.92毫焦耳/图像,低于传统点积注意力的能耗(约100毫焦耳);• 在ImageNet-1K上,Lapis-6bit模型实现了83.25%的top-1准确率,能耗为3.28毫焦耳/图像,显著优于现有的低能耗模型;• 消融实验显示,ℓ1距离和指数核的结合优于高斯核和二值匹配,幂次归一化几乎不影响性能但极大简化硬件实现,验证了设计的有效性。

应用场景

  • �� 该机制适用于低功耗视觉识别设备,如边缘计算终端、智能摄像头和无人机,能在保证高准确率的同时大幅降低能耗;• 未来可结合硬件加速器,推动脉冲神经网络在自动驾驶、安防监控和机器人等场景中的应用,提升实时性和能效;• 还可扩展到语音识别、序列分析等领域,利用时序关系实现更高效的事件驱动信息处理。

局限与展望

  • �� 当前模型在极端低能耗场景下仍存在性能略微下降的问题,尤其在超低比特量化时准确率会受到影响;• 依赖精确的时序编码和膜泄漏模型,硬件实现复杂,存在同步和稳定性挑战;• 目前主要在视觉任务验证,跨模态和生成任务的适应性尚未充分研究,未来需扩展验证范围。

通俗解读 非专业人士也能看懂

想象一下你在一个工厂里工作,每个工人(神经元)都在按自己的节奏工作。有的工人会在特定时间点发出信号(脉冲),而这个时间点代表了他们的工作状态。传统的工厂管理方式会让每个工人同时用力(点积),这样既费力又耗能。而Lapis就像是根据每个工人的第一个信号到达时间来判断他们的合作关系。工厂里的机器(神经元)会根据这些信号的时间差,利用一种类似泄漏的机制逐渐淡化他们之间的关系,就像水慢慢漏掉一样。这样一来,工厂可以用非常简单的方式判断哪些工人合作得更紧密,而不用复杂的计算。这个方法不仅节省了能量,还能让工厂更快地做出决策。它就像用时间来衡量合作的紧密程度,而不是用复杂的数学运算。通过这种方式,工厂变得更高效,也更接近自然界的工作方式。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,每个人都在不同的时间开始做任务。传统的方法就像让你们每个人都用手算出你们的合作程度,要用很多数学运算,既慢又费力。而这个新方法就像是根据你们第一个完成任务的时间来判断你们的配合好坏。谁先完成,谁就更紧密地合作。老师会用一种特别的“水流”模型,模拟水慢慢漏掉的过程,来衡量你们之间的配合程度。这样一来,老师只需要看你们的第一个完成时间,就能知道你们的合作关系,无需复杂的计算。这就像用时间来衡量朋友之间的关系,谁更快完成任务,关系就更紧密。这个方法既简单又节能,还能让比赛变得更快更公平。是不是很酷?未来的机器人和电脑也可以用这种方法,变得更聪明、更省电!

原文摘要

Self-attention has become central to spiking vision transformers, yet its query-key scoring is still largely inherited from dense networks. Existing spiking variants either simplify dot product scoring or replace it with discrete operators, but spike timing, the native variable of a spiking network, does not directly define how tokens are related. We propose Lapis, a spiking attention mechanism that scores each token pair by the L1 distance between its query and key first-spike latency vectors under time-to-first-spike coding, and maps this distance to an affinity through a Laplacian kernel. The kernel's exponential decay matches the impulse response of a leaky integrate-and-fire membrane, so the accumulated latency difference determines the decay of a membrane trace, while row normalization reduces to a bit shift under power-of-two rounding. Scoring therefore needs only subtraction, absolute value, and accumulation, and removes all multiplication between query and key channels. Under a matched backbone and training schedule, Lapis reaches 96.56% top-1 accuracy on CIFAR-10, within 0.53 points of dot-product scoring. On ImageNet-1K, it reduces the estimated arithmetic energy of the attention path by 14.5x relative to dense dot-product attention. The deployed 6-bit model attains 83.25% top-1 accuracy at an estimated arithmetic energy of 3.28mJ per image.

cs.NE

参考文献 (18)

Rethinking Spiking Self-Attention Mechanism: Implementing α-XNOR Similarity Calculation in Spiking Transformers

Yichen Xiao, Shuai Wang, Dehao Zhang 等

2025 18 引用

Spiking Neural Networks Need High-Frequency Information

Yuetong Fang, Deming Zhou, Ziqing Wang 等

2025 8 引用 查看解读 →

Going Deeper With Directly-Trained Larger Spiking Neural Networks

Hanle Zheng, Yujie Wu, Lei Deng 等

2020 751 引用 查看解读 →

SpikeZIP-TF: Conversion is All You Need for Transformer-based SNN

Kang You, Zekai Xu, Chen Nie 等

2024 28 引用 查看解读 →

Neuronal Dynamics: From Single Neurons To Networks And Models Of Cognition

W. Gerstner, W. M. Kistler, Richard Naud 等

2014 1709 引用

Training data-efficient image transformers & distillation through attention

Hugo Touvron, M. Cord, Matthijs Douze 等

2020 9594 引用 查看解读 →

Sorbet: A Neuromorphic Hardware-Compatible Transformer-Based Spiking Language Model

Kaiwen Tang, Zhanglu Yan, Weng-Fai Wong

2024 13 引用 查看解读 →

Fast and energy-efficient neuromorphic deep learning with first-spike times

Julian Göltz, Laura Kriener, A. Baumbach 等

2019 167 引用 查看解读 →

Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions

Wenhai Wang, Enze Xie, Xiang Li 等

2021 5195 引用 查看解读 →

Temporal Efficient Training of Spiking Neural Network via Gradient Re-weighting

Shi-Wee Deng, Yuhang Li, Shanghang Zhang 等

2022 388 引用 查看解读 →

T2FSNN: Deep Spiking Neural Networks with Time-to-first-spike Coding

Seongsik Park, Seijoon Kim, Byunggook Na 等

2020 155 引用 查看解读 →

Temporal-Coded Spiking Neural Networks with Dynamic Firing Threshold: Learning with Event-Driven Backpropagation

Wenjie Wei, Malu Zhang, Hong Qu 等

2023 46 引用

Converting High-Performance and Low-Latency SNNs Through Explicit Modeling of Residual Error in ANNs

Zhipeng Huang, Jianhao Ding, Zhiyu Pan 等

2024 6 引用 查看解读 →

Incorporating Learnable Membrane Time Constant to Enhance Learning of Spiking Neural Networks

Wei Fang, Zhaofei Yu, Yanqing Chen 等

2020 792 引用 查看解读 →

TTFSFormer: A TTFS-based Lossless Conversion of Spiking Transformer

Lu Zhao, Zihan Huang, Jianhao Ding 等

2025 15 引用

Spiking Transformer with Spatial-Temporal Attention

Donghyun Lee, Yuhang Li, Youngeun Kim 等

2024 39 引用 查看解读 →

Deep Learning in Spiking Neural Networks

A. Tavanaei, M. Ghodrati, S. Kheradpisheh 等

2018 1398 引用 查看解读 →

Otters: An Energy-Efficient SpikingTransformer via Optical Time-to-First-Spike Encoding

Zhanglu Yan, Jiayi Mao, Qianhui Liu 等

2025 8 引用 查看解读 →