ME-MoD:面向内存高效深度混合型视觉Transformer加速器的算法-硬件-数据流协同设计

《IEEE Transactions on Very Large Scale Integration (VLSI) Systems》:ME-MoD: Algorithm-Hardware-Dataflow Co-Design for Memory Efficient Mixture-of-Depth-Based Vision Transformer Accelerator

【字体: 时间:2026年08月04日 来源:IEEE Transactions on Very Large Scale Integration (VLSI) Systems 3.2

编辑推荐:

  摘要:变换器在性能上优于传统神经网络,但存在较高的计算和内存成本,这限制了其在边缘设备上的应用。尽管许多硬件加速器试图解决这一问题,但原有的变换器结构仍制约着优化效果。最近出现的一种突破性技术——深度混合架构(MoDs),通过条件化计算有效降低了大型语言模型的计算复杂度,为设计高

  

摘要:

变换器在性能上优于传统神经网络,但存在较高的计算和内存成本,这限制了其在边缘设备上的应用。尽管许多硬件加速器试图解决这一问题,但原有的变换器结构仍制约着优化效果。最近出现的一种突破性技术——深度混合架构(MoDs),通过条件化计算有效降低了大型语言模型的计算复杂度,为设计高效的硬件加速器提供了契机。然而,当将其应用于视觉变换器时,MoD会出现精度下降以及过度的外部内存访问问题。因此,本文提出了ME-MoD,这是一种首个基于内存效率优化的MoD型视觉变换器推理加速器,它采用了重新排序以及算法、硬件与数据流协同设计的理念。在算法层面,分布调整前向传播(DAF)和路由决策前向传播(RDF)技术通过令牌重新排序来恢复精度并降低内存访问成本。在架构层面,层归一化-路由融合模块以及令牌重新排序与顺序记录模块提升了计算效率,同时减少了内存开销。此外,还设计了令牌静态层融合数据流以及片上动态内存模块,进一步优化了由MoD所引导的有效令牌的层间计算中间结果所带来的外部内存访问问题。在几乎不损失精度的情况下,我们的ME-MoD加速器实现了1.62×倍的推理速度提升,与标准MoD相比,其外部内存带宽需求降低了46.5%,能耗降低了45.2%。它的能效达到了23.6 TOPS/W,这一数值比现有的最先进设计高出4.02×倍。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号