综述:FPGA上深度学习模型部署方法的研究进展分析

《Electronics》:Analysis of Research Progress on Deployment Methods for Deep Learning Models on FPGAs

【字体: 时间:2026年08月11日 来源:Electronics 2.9

编辑推荐:

  深度学习(Deep Learning, DL)模型在自然语言处理、计算机视觉、内容生成和边缘智能领域取得了显著进展;然而,其快速增长的计算复杂度、内存需求和部署多样性为实际实现带来了重大挑战。现场可编程门阵列(Field-Programmable Gate A

  
深度学习(Deep Learning, DL)模型在自然语言处理、计算机视觉、内容生成和边缘智能领域取得了显著进展;然而,其快速增长的计算复杂度、内存需求和部署多样性为实际实现带来了重大挑战。现场可编程门阵列(Field-Programmable Gate Arrays, FPGAs)提供定制化的低精度计算、空间数据流、片上数据重用、可重构性以及丰富的I/O能力,使其成为深度学习推理的重要平台。本研究从跨层视角(涵盖模型、编译器、架构、运行时和电子设计自动化(EDA))对基于FPGA的深度学习部署进行了系统综述。遵循PRISMA指导的证据综合协议,本综述分析了深度学习工作负载特征、FPGA架构优化、部署工具流程和物理实现挑战。沿着专业化-可编程性连续统(specialization–programmability continuum)提出了统一的分类法,包括模型固定加速器、基于生成器的加速器、模板可配置加速器和ISA可编程覆盖层(overlays)。这些方法根据硬件再生需求、模型适应性、算子覆盖范围、编译成本和部署灵活性进行了比较。此外,还从计算、内存行为和运行时协调的角度分析了新兴工作负载,包括视觉Transformer、图神经网络、大语言模型和多模态模型。综述表明,FPGA部署效率越来越依赖于内存容量、可变状态管理、算子支持和端到端编译能力,而非仅峰值乘累加吞吐量。基于对70项主要FPGA实现研究的分析,本文强调可靠的跨研究比较需要仔细考虑模型配置、精度、执行阶段、批大小、内存驻留、FPGA平台和证据成熟度。对于多模态生成模型,当前证据仍然有限,在审查的文献中未发现端到端的基于FPGA的视觉-语言模型实现。本综述为未来基于FPGA的深度学习部署研究提供了系统视角,强调跨层优化、物理感知编译、可扩展加速器架构和实际部署效率。
**2. Review Methodology and Background**
**2.1. Review Methodology**:采用PRISMA 2020和PRISMA-S扩展的指导,建立了结构化证据综合协议,包括研究问题(RQ1-RQ4)、数据源(OpenAlex和arXiv)、搜索策略(9个宽泛概念和4个细化概念)、筛选标准(纳入和排除)、质量评估(六维度评分,0-2分,分类为高、中、低强度)和数据提取字段。搜索返回8260条数据库记录,加上26条额外记录,去重后5668条进行标题/摘要筛选,1235篇全文评估,最终纳入70项主要FPGA实现研究。质量评估显示46篇高强度、24篇中强度,平均分9.50,但可重复性维度(Q6)均值最低(0.66)。
**2.2. Fundamental Concepts of Deep Learning Models**:深度学习(DL)模型从早期感知机发展到多层神经网络,利用误差反向传播(backpropagation)训练。卷积神经网络(CNN)和循环神经网络(RNN)引入空间和时间结构,Transformer(2017)通过自注意力(self-attention)和并行化取代递归。模型演化分为三个时期:小规模规则网络、大规模CNN,以及异构、内存密集型的生成式和多模态模型。DL模型的特征包括算子图(operator graph)、张量(tensor)维度、量化(quantization)、稀疏性(sparsity)和算子融合(operator fusion),这些决定FPGA上的并行性、缓冲和外部内存流量。
**2.3. FPGA Fundamentals and Hardware Architectural Optimizations for DL Model Acceleration**:FPGA由可配置逻辑块(CLB)、查找表(LUT)、触发器(FF)、数字信号处理(DSP)块、片上内存(BRAM/URAM)和可编程互连组成。FPGA适用于DL加速的原因:低精度计算容忍性、空间计算匹配数据流、低批大小低延迟推理、可重构性和丰富I/O。架构优化方向包括:增强基础资源(如低精度乘法器、DSP分解、BRAM内计算)、引入专用张量计算硬块(如Tensor Slices、AI Tensor Block)、以及集成粗粒度AI加速核和片上网络(NoC)。

**3. A Unified Taxonomy of FPGA Deployment Paradigms Along the Specialization-Programmability Continuum**
**3.1. Classification Rationale and Analytical Dimensions**:以重复部署动作为主要分类规则,即新模型改变什么工件(artifact)以及是否重复综合、布局布线。辅助维度包括工作负载阶段、图/序列动态性、算子异构性等。分类沿专业化-可编程性连续统,不假定严格性能排序。
**3.2. Fully Customized Model-Fixed Accelerators**:为固定图或窄模型系列定制数据路径、缓冲器和控制调度,可实现高效率和低开销,但模型或设备变化需重新设计并触发综合布局布线,适用于模型和设备稳定、延迟或能量目标严格的场景。
**3.3. Automatically Generated Model-Specific Accelerators**:通过编译器、HLS或生成器(如Caffeine、fpgaConvNet、DNNBuilder、FINN、HPIPE、hls4ml)自动生成硬件,保留每模型硬件专业化,但生成的新硬件仍需综合布局布线;层流水线和时分复用是内部数据流选择,不改变分类。
**3.4. Template-Based Configurable and Reconfigurable Accelerators**:复用已实现或可实现的阵列、数据流模板或模块化结构(如NeuFlow),通过配置选择数据路径、映射或模块行为,降低迭代成本,但覆盖范围受模板容量和支持的数据流限制。
**3.5. Instruction-Programmable Overlay Processors**:预实现处理器或CGRA风格平台,通过ISA(指令集架构)和微架构抽象DL计算,模型编译为指令而非新硬件;平台构造一次,模型部署重复编译,但未支持的算子需回退或扩展。
**3.6. Cross-Category Comparison and Boundary Cases**:四类在硬件再生范围、部署成本、算子覆盖、重用性上呈趋势变化,但效率潜力受数据流质量、内存带宽、编译器决策等影响,无单一类别适用于所有场景。
**3.7. Emerging Workloads and Their Deployment Implications**:正交工作负载瓶颈轴分析四个类别在不同工作负载下的适用性。
- **3.7.1. Vision Transformers**:注意力块包含QK转置、Softmax、AV乘积依赖链,计算、内存和运行时协调瓶颈;融合和近似策略需平衡缓冲容量和同步开销。
- **3.7.2. Graph Neural Networks**:图结构导致不规则邻域遍历和节点度方差,内存带宽和负载均衡是关键瓶颈;动态图需运行时调度。
- **3.7.3. Large Language Models**:预填充(prefill)阶段高并行,解码(decode)阶段受内存带宽限制,长上下文需KV缓存管理;代表性研究(FlightLLM、Hummingbird、TerEffic等)报告了条件性性能,但阶段、模型、精度和平台不同无法直接比较。
- **3.7.4. Multimodal Models**:当前证据有限,仅一项直接FPGA多模态研究(TRINE),未发现端到端生成式视觉-语言模型(VLM)FPGA实现。

**4. Optimization and Improvement of FPGA EDA Toolchains for DL Model Deployment**
**4.1. Role of FPGA EDA Toolchains in DL Model Deployment**:DL模型部署需经过HLS、逻辑综合、布局、布线、静态时序分析和比特流生成,传统EDA工具对DL结构缺乏感知,需跨层协同优化。
**4.2. HLS and Front-End Compilation Optimization**:HLS前端包括算子模板优化、数据流优化(融合、循环分块、双缓冲)和精度/稀疏性优化;物理感知HLS(如AutoBridge、FADO)将后段反馈纳入前端。
**4.3. Design Space Exploration and Hardware-Parameter Search**:DSE探索PE数、DSP模式、矩阵分块、缓冲容量等参数,早期采用Roofline模型,后续引入启发式搜索(如AutoDSE),需结合后段时序反馈。
**4.4. Logic Synthesis and Resource-Mapping Optimization**:综合阶段优化资源绑定(LUT/DSP选择)和算术结构(加法树平衡、重定时),但缺乏物理信息,需融入DSP/BRAM位置约束。
**4.5. Floorplanning and Placement Optimization**:布局规划施加粗粒度约束,详细放置如DSPlacer利用图卷积网络(GCN)识别数据路径DSP,通过最小成本流和整数线性规划(ILP)优化DSP级联,改善最差负松弛(WNS)。
**4.6. Routing and Congestion Control**:布线压力来自PE阵列密集连接、归约操作和宽数据路径,策略包括拥塞感知布局布线、时序驱动布线和专用互连资源利用。
**4.7. Integrated Environments for Rapid Prototyping and FPGA Deployment**:综合环境连接模型导入到部署流程。
- **4.7.1. Vendor-Provided Integrated Deployment Stacks**:如AMD Vitis AI/DPU、Intel FPGA AI Suite、MathWorks Deep Learning HDL Toolbox,提供预验证引擎和编译器,缩短模型迭代,但受限于设备系列和算子支持。
- **4.7.2. Open-Source Model-to-Hardware Frameworks**:如FINN、hls4ml、fpgaConvNet、PYNQ,暴露编译和硬件生成过程,支持定制,但需用户管理工具版本和时序闭合。
- **4.7.3. Comparison, Applicability, and Limitations**:各环境在再编译边界、算子覆盖、物理设计可见性、可移植性上不同,选择需基于应用约束(算子支持、编译时间、内存行为等)。

**5. Discussion**
**5.1. Comparative Analysis of Deployment Paradigms**:跨范式比较需控制模型、精度、批大小等变量,现有证据缺乏配对实验;性能差异可能源于频率、并行性、稀疏性、内存带宽等协同因素,而非范式标签本身。
**5.2. Practical Selection of Integrated Toolflows**:选择需基于应用契约(模型族、设备范围、精度、延迟、更新频率等),并检查算子支持、编译分区报告、阶段编译时间和板级测量。
**5.3. Benchmark Comparability and Limitations of Existing Studies**:跨研究基准比较受限于分母变化(模型、阶段、内存配置、证据成熟度);能量声明需明确功率边界;缺失字段(如TTFT、TPOT、KV缓存位置)限制瓶颈推断;可重复性低(Q6均值0.66)和出版偏倚(成功案例为主)是主要局限。

**6. Challenges and Future Trends in FPGA-Based DL Model Deployment**
(1)模型复杂性增加导致资源映射压力,需关注计算图级别数据流和内存调度;
(2)性能与部署灵活性的权衡,未来需探索模型族特定硬件生成、可扩展覆盖层或混合架构;
(3)EDA工具链和物理实现约束,需从DSP中心放置转向数据流感知实现,并融入计算图信息;
(4)异构平台协同部署,FPGA作为可重构计算节点与CPU、GPU、NPU协作。

**7. Conclusions**
本文系统综述了FPGA上深度学习模型部署方法,建立了跨层分析框架,提出四类分类法,强调部署效率依赖于内存、状态管理、算子支持和端到端编译能力,而非仅MAC吞吐量。未来研究应聚焦于跨层协同优化、低精度和稀疏映射、KV缓存管理、物理感知编译和实际部署度量。多模态生成模型证据不足,未发现端到端FPGA视觉-语言模型实现。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号