ST-SpikFormer:基于时空融合编码的脉冲驱动Transformer

《Pattern Recognition》:ST-SpikFormer: Spike-driven Transformer using Spatio-Temporal Fusion coding

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition 9.1

编辑推荐:

   •我们构建了一种新颖的脉冲驱动Transformer层次架构ST-SpikFormer,该架构集成了一种新颖的编码方案和EEDP-DS模块,在保持性能的同时实现高能效。•我们提出了一种STF编码方法,该方法同时利用时间维度和空间维度,在最大化SNN的时空表达能力的同时增强了脉

  
  • •
    我们构建了一种新颖的脉冲驱动Transformer层次架构ST-SpikFormer,该架构集成了一种新颖的编码方案和EEDP-DS模块,在保持性能的同时实现高能效。
  • •
    我们提出了一种STF编码方法,该方法同时利用时间维度和空间维度,在最大化SNN的时空表达能力的同时增强了脉冲序列的稀疏性。
  • •
    我们开发了SI-LIF神经元,并引入了一个集成框架,将其与STF编码进行协同。

引言

作为第三代神经网络[1],脉冲神经网络(SNNs)凭借其受大脑启发的时空动力学和稀疏的脉冲驱动计算[2][3],吸引了越来越多的关注,这些特性从根本上促进了高能效。与传统人工神经网络(ANNs)不同,SNNs采用事件驱动的处理方式,仅在脉冲发生时执行计算,从而显著降低功耗。这使其特别适合功耗受限的边缘设备[4][5]。然而,尽管近年来取得了显著进展,SNNs在视觉任务上的表现仍不及传统的ANNs[6][7]。一个主要瓶颈在于输入编码:将静态图像输入高效且准确地转换为脉冲序列仍然是限制SNN性能的关键挑战。
当前SNN的主流输入编码方法面临着实际的权衡[8]。发射率(FR)编码[9][10]通过给定时间窗口内的脉冲数量(即发射率)来表示输入强度,提供了一种简单且鲁棒的编码策略。然而,在静态图像SNN中,FR编码(直接编码)通常在多个时间步中提供完全相同的输入,从而引入冗余计算,并未能充分利用SNN的时间维度。TTFS编码[11][12]利用第一个脉冲的时序来表示输入强度,能够以高稀疏度高效利用SNN的时间维度。然而,其单脉冲表示对噪声更为敏感,并且可能使深度网络训练变得困难。
为了克服现有输入编码方案的局限性,我们提出了一种新颖的时空融合(STF)编码方法,如图1所示。STF通过同时使用脉冲发射时间(时间维度)和脉冲幅度/计数(空间维度),将静态视觉特征转换为时间分布的脉冲序列。基于该编码框架,我们引入了多项创新,以显著提升SNN的性能,同时保持其固有的低功耗特性。首先,我们提出了平滑梯度整数漏积分放电(SI-LIF)神经元,该神经元在训练过程中具有整数激活的特性,在推理过程中具有脉冲驱动处理的特性,并将其与STF编码相结合。其次,我们提出了能效双路径下采样(EEDP-DS)模块,该模块减少了乘加(MAC)运算,支持构建脉冲驱动的Transformer架构。总之,我们构建了一种名为ST-SpikFormer的新颖脉冲驱动Transformer层次架构。ST-SpikFormer旨在作为支持事件驱动脉冲通信和稀疏脉冲驱动累积的神经形态硬件的算法探索,并为未来面向下一代Transformer的神经形态芯片设计提供灵感。
本文的主要贡献总结如下:
  • •
    ST-SpikFormer集成了一种新颖的编码方案和EEDP-DS模块,使下采样层支持残差学习,并采用脉冲深度可分离卷积,在保持性能的同时实现高能效。
  • •
    我们提出了STF编码,作为静态视觉输入的有限步长可学习时间分配机制。它可以同时利用SNN的时间和空间维度,与直接编码相比,减少了重复输入导致的冗余计算。在STF编码中,显著特征通过快速且集中的脉冲响应来表示,与直接编码相比,提高了脉冲序列的稀疏性和能效。
  • •
    我们开发了SI-LIF神经元,并引入了一个集成框架,将其与STF编码进行协同。这种集成将STF基于整数的脉冲量化与SI-LIF神经元的"训练整数激活、推理脉冲驱动"范式相结合。其结果是实现了一致的时空表示,并在从编码到训练再到推理的所有阶段都表现出强大的性能。

章节摘要

SNN的特征学习方法

SNN的训练方法主要分为两类:(1) ANN到SNN的转换[13][14],和(2) 使用替代梯度的直接训练[15][16]。基于转换的方法涉及将预训练的ANN映射为SNN。然而,该方法通常需要较长的仿真时间步,并且受限于源ANN的架构,导致近年来采用较少。相比之下,直接训练由于其架构灵活性而获得了更多关注,并且

STF编码器

图1展示了FR编码(直接编码)与我们提出的STF编码之间的差异。对于静态图像输入,传统的FR编码通常将图像复制到所有时间步以匹配SNN的时间维度。然后,连续值的像素强度在第一层被编码为脉冲。然而,这种方法使得编码序列高度冗余且时间上可预测,未能充分利用SNN的时间维度,实际上退化为

实验

本节详细分析了用于验证我们新颖的ST-SpikFormer方法的实验评估。我们介绍了用于训练和评估的数据集,随后详细说明了实现细节。之后,我们分别展示了ST-SpikFormer在CIFAR和ImageNet上的对比结果。此外,我们还深入讨论了流水线消融实验。

结论

在本工作中,我们研究了如何沿直接训练SNN的时间维度更有效地表示静态视觉输入。我们提出了时空融合(STF)编码,通过可学习的时间分配机制将静态视觉特征重新分配到各时间步,同时通过整数脉冲幅度/计数保留幅度信息。通过将该编码方案与平滑梯度整数漏积分放电(SI-LIF)神经元相结合,所提出的

CRediT作者贡献声明

桂荣磊: 撰写——原始稿件、软件、方法论、概念化。吕旭东: 撰写——审阅与编辑、监督、项目管理、方法论、资金获取。董泽康: 撰写——审阅与编辑、验证、形式化分析。高铭宇: 撰写——审阅与编辑、监督、项目管理、资金获取。张晶: 撰写——审阅与编辑、验证、调查研究、形式化分析。

利益冲突声明

作者声明不存在已知的可能影响本文所报告工作的竞争性财务利益或个人关系。

致谢

本工作得到了浙江省重大研发项目(2024C01143)、浙江省自然科学基金(LQ24F030021)、中央引导地方科技发展基金项目(2023ZY1008)以及浙江省装备电子重点实验室的支持。
桂荣磊|吕旭东|董泽康|高铭宇|张晶
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号