ME-MoD:面向内存高效深度混合型视觉Transformer加速器的算法-硬件-数据流协同设计
《IEEE Transactions on Very Large Scale Integration (VLSI) Systems》:ME-MoD: Algorithm-Hardware-Dataflow Co-Design for Memory Efficient Mixture-of-Depth-Based Vision Transformer Accelerator
【字体:
大
中
小
】
时间:2026年08月04日
来源:IEEE Transactions on Very Large Scale Integration (VLSI) Systems 3.2
编辑推荐:
摘要:变换器在性能上优于传统神经网络,但存在较高的计算和内存成本,这限制了其在边缘设备上的应用。尽管许多硬件加速器试图解决这一问题,但原有的变换器结构仍制约着优化效果。最近出现的一种突破性技术——深度混合架构(MoDs),通过条件化计算有效降低了大型语言模型的计算复杂度,为设计高
摘要:
变换器在性能上优于传统神经网络,但存在较高的计算和内存成本,这限制了其在边缘设备上的应用。尽管许多硬件加速器试图解决这一问题,但原有的变换器结构仍制约着优化效果。最近出现的一种突破性技术——深度混合架构(MoDs),通过条件化计算有效降低了大型语言模型的计算复杂度,为设计高效的硬件加速器提供了契机。然而,当将其应用于视觉变换器时,MoD会出现精度下降以及过度的外部内存访问问题。因此,本文提出了ME-MoD,这是一种首个基于内存效率优化的MoD型视觉变换器推理加速器,它采用了重新排序以及算法、硬件与数据流协同设计的理念。在算法层面,分布调整前向传播(DAF)和路由决策前向传播(RDF)技术通过令牌重新排序来恢复精度并降低内存访问成本。在架构层面,层归一化-路由融合模块以及令牌重新排序与顺序记录模块提升了计算效率,同时减少了内存开销。此外,还设计了令牌静态层融合数据流以及片上动态内存模块,进一步优化了由MoD所引导的有效令牌的层间计算中间结果所带来的外部内存访问问题。在几乎不损失精度的情况下,我们的ME-MoD加速器实现了1.62×倍的推理速度提升,与标准MoD相比,其外部内存带宽需求降低了46.5%,能耗降低了45.2%。它的能效达到了23.6 TOPS/W,这一数值比现有的最先进设计高出4.02×倍。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号