Auto-FSDformer:探索全脉冲驱动的Transformer模型
《Knowledge-Based Systems》:Auto-FSDformer: Searching for fully spike-driven transformer
【字体:
大
中
小
】
时间:2026年08月11日
来源:Knowledge-Based Systems 8.0
编辑推荐:
摘要
脉冲神经网络通过受生物启发的脉冲神经元实现低功耗的脉冲驱动计算,近年来受到了广泛关注。基于Transformer的脉冲神经网络也被提出,这类模型利用各种脉冲驱动的自注意力机制来减轻传统自注意力机制带来的巨大计算负担。然而,一些基于Transformer的脉冲神经网络仍保
摘要
脉冲神经网络通过受生物启发的脉冲神经元实现低功耗的脉冲驱动计算,近年来受到了广泛关注。基于Transformer的脉冲神经网络也被提出,这类模型利用各种脉冲驱动的自注意力机制来减轻传统自注意力机制带来的巨大计算负担。然而,一些基于Transformer的脉冲神经网络仍保留着一些传统人工神经网络的设计元素,无法在脉冲神经网络中完全以脉冲驱动方式运行,因而无法充分利用脉冲神经网络的能效优势。针对这一问题,我们提出了一种零样本神经架构搜索方法——Auto-FSDformer,用于自动设计最优的完全脉冲驱动型Transformer架构。具体而言,我们设计了一个全新的脉冲驱动型Transformer搜索空间,其中包含了可搜索的自注意力机制。为在该复杂的搜索空间中高效地进行搜索,我们还提出了一种无需训练的稳健代理模型NASWOT-LTD,该模型利用激活模式的多样性来表征模型性能。在该代理模型中,我们引入了层与时间加权解耦规则,以突出不同层及时间步长下激活模式的不等价性。我们在静态分类数据集和类脑计算数据集上进行了全面实验,结果表明,通过Auto-FSDformer设计的模型性能可与最先进的脉冲驱动型Transformer相媲美。
引言
作为第三代神经网络,脉冲神经网络因其高度的生物学合理性和事件驱动特性,逐渐成为传统人工神经网络的强劲竞争对手[1][2][3][4][5]。尤其是通过模拟大脑中突触的离散脉冲活动,脉冲神经网络展现出独特的脉冲驱动特性——仅有少量脉冲神经元被激活即可完成后续计算[6][7]。通常,由Loihi[8]和Tianjic[9]等类脑芯片支持的脉冲驱动运算可以实现为稀疏的可寻址累加操作[6][7],从而在运行于类脑芯片时避免使用传统的高能耗乘积累加运算,进而实现出色的能效表现。
随着Transformer的广泛应用,基于Transformer的脉冲神经网络——即脉冲驱动型Transformer——也应运而生[10][11][12][13][14][15][16][17]。这类模型不仅保留了Transformer强大的建模能力,还继承了脉冲神经网络的高能效优势,迅速成为研究热点。近年来,人们提出了多种脉冲驱动型自注意力机制,用以减轻传统自注意力机制所带来的计算负担[12][13][15][16][17]。不过,许多现有模型仍包含依赖人工神经网络结构的模块,这些模块无法完全转换为脉冲驱动运算,因此仍需进行部分乘积累加运算。虽然混合运算可以提高精度,但这类脉冲驱动型Transformer在类脑芯片上几乎无法使用,因而无法充分发挥脉冲神经网络的能效优势[12][13][14]。因此,具备新型自注意力机制的完全脉冲驱动型Transformer在实践中更具应用价值。
为设计完全脉冲驱动型的Transformer,神经架构搜索提供了一种有效解决方案。然而,传统神经架构搜索存在极高的搜索成本,需要训练和评估大量模型才能找到最优方案。在脉冲神经网络领域,这一挑战更为严峻,因为直接训练脉冲神经网络需要在多个仿真时间步长内展开网络结构[18],其训练速度远慢于传统人工神经网络。因此,基于训练的神经架构搜索方法并不适用于脉冲神经网络。为提高效率,近期的一些研究采用了零样本神经架构搜索方法,这类方法依靠无需训练的零成本代理模型来评估模型性能,从而实现更高效的脉冲神经网络搜索[19][20][21][22][23]。目前,许多针对脉冲神经网络的代理模型都是基于经典的无需训练的神经架构搜索代理模型NASWOT[24]构建的,该模型通过评估数据样本中激活模式的多样性来表征模型的表达能力,以此作为真实性能的指标[20][21][22][23]。但我们发现,当应用于包含多种自注意力机制的复杂搜索空间时,这类代理模型会出现不稳定且泛化能力差的问题。
为解决上述问题,我们提出了一种名为Auto-FSDformer的零样本神经架构搜索方法,用于设计最优的完全脉冲驱动型Transformer架构。我们的主要贡献如下:
• 我们构建了一个全新的脉冲驱动型Transformer搜索空间,其中整合了多种最新开发的自注意力机制。该空间内的所有运算均为纯脉冲驱动式,从而能够充分发挥脉冲神经网络的能效优势。
• 鉴于不同层及时间步长下激活模式的不等价性,我们引入了层与时间加权解耦规则,并提出了一种无需训练的NASWOT-LTD代理模型。
• 我们在静态分类数据集和类脑计算数据集上进行了全面实验与消融研究,以验证Auto-FSDformer及NASWOT-LTD代理模型的有效性。
本文的其余结构如下:第2节介绍一些基本概念以及关于脉冲驱动型Transformer和神经架构搜索的相关研究;第3节详细阐述所提出的Auto-FSDformer的设计,包括搜索空间以及无需训练的NASWOT-LTD代理模型;第4节为实验结果,第5节为消融研究,我们通过大量实验和消融分析来验证Auto-FSDformer与NASWOT-LTD的组合效果;最后在第6节总结全文。
段落摘录
脉冲神经网络
作为第三代神经网络,脉冲神经网络与传统人工神经网络的不同之处在于,它采用受生物启发的脉冲神经元作为非线性激活函数。漏积分-触发神经元是最流行的神经元模型之一,因其简单且高效而广受认可[1]。它的行为具有基本的生物学特性,其数学表达式如下:
uit = τ·decay·uit?1 + 1 ? oit?1 + ∑j wi·jojt,
其中oit = guit ? v,当uit > vt时,oit = 1,否则为0。这里uit和oit分别表示……
Auto-FSDformer
在本节中,我们提出了Auto-FSDformer,这是一种零样本神经架构搜索方法,可用于自动设计最优的完全脉冲驱动型Transformer架构。首先,我们为脉冲驱动型Transformer设计了一个全新的搜索空间,其中包含了多种脉冲驱动型自注意力机制。其次,我们提出了一种无需训练的稳健代理模型NASWOT-LTD,用于高效评估候选模型。最后,我们运用多目标遗传算法NSGA-II[36]来寻找最优方案。
实验结果
在本节中,我们在静态分类数据集和类脑计算数据集上进行了大量实验,以评估Auto-FSDformer与NASWOT-LTD组合的效果。
消融研究
如2.3节所述,SAHD、PBSE和BIE这三种代理模型是基于原始的NASWOT发展而来的。与NASWOT类似,这些代理模型允许将不同层及时间步长下的激活模式叠加在一起,但这并不符合我们在3.2节中提出的LTD规则。为探究LTD规则是否能提升这些代理模型的性能,我们将该规则引入到SAHD、PBSE和BIE中。具体而言,我们通过先仅应用层与时间解耦规则,再逐步添加其他规则的方式来进行增量分析……
结论与未来工作
在这项工作中,我们提出了一种名为Auto-FSDformer的零样本神经架构搜索方法,用于寻找最优的完全脉冲驱动型Transformer架构。我们设计了一个全新的搜索空间,其中整合了多种脉冲驱动型自注意力机制。此外,为解决不同层及时间步长产生的激活模式不等价性问题,我们引入了LTD规则,并提出了一种无需训练的稳健零成本代理模型NASWOT-LTD,以提升搜索效率。
作者贡献声明
安阳:撰写——初稿、可视化、软件、方法论、研究设计、形式分析、数据整理、概念构思。刘颖:撰写——初稿、指导监督、资金获取、形式分析。
利益冲突声明
作者声明不存在任何可能影响本文研究的已知财务利益或个人关系。
致谢
本研究得到了中国国家自然科学基金的支持,项目编号为62471436。
安阳 | 刘颖
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号