硬件感知的知识蒸馏CNN用于FPGA上斑块相关血管造影发现的实时分类

《Frontiers in Digital Health》:Hardware-aware knowledge-distilled CNN for real-time classification of plaque-associated angiographic findings on FPGA

【字体: 时间:2026年09月04日 来源:Frontiers in Digital Health 5.2

编辑推荐:

  摘要 冠状动脉疾病(CAD)是全球死亡率的主要原因之一,需要对冠状动脉造影图像中的冠状动脉狭窄和斑块相关的血管造影发现进行准确评估。尽管基于深度学习的诊断模型已展现出较高的预测能力,但由于计算复杂性和内存需求,其在资源受限的嵌入式平台上的部署仍然具有挑战性。为

  
摘要
冠状动脉疾病(CAD)是全球死亡率的主要原因之一,需要对冠状动脉造影图像中的冠状动脉狭窄和斑块相关的血管造影发现进行准确评估。尽管基于深度学习的诊断模型已展现出较高的预测能力,但由于计算复杂性和内存需求,其在资源受限的嵌入式平台上的部署仍然具有挑战性。为解决这些局限性,本研究提出了一种基于知识蒸馏的硬件感知框架,将高容量教师网络中的判别性知识迁移至轻量级卷积神经网络(CNN)。该框架将斑块相关血管造影发现的软件级定位与面向FPGA的优化相结合。采用90%训练集和10%测试集的划分方式,所提出的模型达到了98.64%的准确率、99.06%的精确率、97.82%的召回率、PPV为0.99、NPV为0.98、MCC为0.96,AUC为0.9940。在10折交叉验证下,该模型达到了97.53%±0.27%的平均准确率、97.82%的精确率、96.94%的召回率、PPV为0.98、NPV为0.97、MCC为0.95,平均AUC为0.9897,这证实了研究所提出的模型具有较高的鲁棒性能。在硬件实现方面,优化后的学生CNN使用Vitis高层次综合(HLS)工具链部署在Xilinx Zynq UltraScale+MPSoC FPGA上。所实现的加速器达到了10.6 μs的内核级推理延迟和约94,339次推理/秒的峰值片上内核吞吐量,同时保持了均衡的硬件资源利用率和低功耗。总体而言,所提出的框架在高效FPGA部署的同时,实现了对斑块相关血管造影发现的准确分类。
**硬件感知知识蒸馏CNN用于FPGA实时分类斑块相关血管造影发现的论文解读**

**一、研究背景与问题**

冠状动脉疾病(coronary artery disease, CAD)是全球范围内导致死亡的主要原因之一,其病理特征为冠状动脉内动脉粥样硬化斑块的进行性积聚,导致动脉管腔狭窄并减少心肌灌注。冠状动脉造影是评估管腔狭窄的临床参考标准,广泛应用于血管异常的诊断。然而,对造影图像的 manual 分析耗时且高度依赖临床医生的经验,易导致诊断不一致。深度学习,特别是卷积神经网络(convolutional neural network, CNN),在医学图像分析中展现出强大的能力,已被成功应用于冠状动脉狭窄诊断、斑块特征描述及CAD诊断。尽管现有CNN模型在分类斑块相关血管造影发现方面具有较高准确性,但多数模型参数量庞大、计算密集,不利于在资源受限环境中进行实时分类。模型压缩技术,如剪枝、量化和知识蒸馏,已被用于在保持准确性的同时降低网络复杂度。知识蒸馏能将大型网络的知识迁移至紧凑网络,从而减少计算成本并适用于资源受限应用。与此同时,现场可编程门阵列(field-programmable gate array, FPGA)硬件加速平台因其确定性延迟、高并行性和能效优势而受到关注。然而,现有基于FPGA的实现大多聚焦于传统CNN架构,未结合知识蒸馏或压缩策略;而多数知识蒸馏研究仅在软件环境中评估模型,未考虑硬件部署约束。因此,将知识蒸馏网络与硬件高效FPGA实现相结合的集成框架仍较为有限。为此,研究人员开展了本研究,旨在开发一种集成分割感知教师-学生知识蒸馏策略与FPGA定向优化的框架,以实现低延迟、资源高效的斑块相关血管造影发现分类。

**二、研究内容**

本研究提出了一种两阶段知识蒸馏深度学习框架。第一阶段,在软件层面从冠状动脉造影图像中定位斑块区域,以分离出诊断相关区域。第二阶段,通过从高容量教师网络向轻量级学生CNN进行知识蒸馏,获得紧凑的学生CNN,用于执行斑块相关血管造影发现的二分类任务。蒸馏后的学生模型经Vitis高层次综合(high-level synthesis, HLS)设计流程综合,并部署于Xilinx Zynq UltraScale+FPGA平台,以实现低延迟、资源高效的实时推理。该框架结合了血管特征引导的教师学习、轻量级学生CNN优化、参数剪枝、8位定点量化和基于FPGA的推理加速。研究评估了模型在软件层面的诊断性能(包括90%训练/10%测试划分和10折交叉验证),并分析了FPGA部署后的硬件资源利用率、延迟、吞吐量和功耗。

**三、关键技术方法**

研究人员使用了多项关键技术方法。数据集方面,采用了公开的ARCADE Phase 1 Task 2(狭窄检测)数据集,包含1,500幅冠状动脉X射线血管造影图像,其中1,000幅用于训练、200幅公开验证、300幅私有测试,标注格式为COCO格式。数据预处理包括伽马校正以增强血管对比度,以及基于生成对抗网络(generative adversarial network, GAN)的数据增强,仅应用于阳性训练样本,将有效训练集增至约9,600幅图像。框架核心为分割感知的教师-学生知识蒸馏架构:教师网络采用编码器-解码器结构并带空洞空间金字塔池化(atrous spatial pyramid pooling, ASPP),使用Dice损失和二元交叉熵(binary cross-entropy, BCE)损失的混合损失函数进行训练;学生网络为轻量级CNN,由32、64、128通道的卷积层、全局平均池化、全连接层和SoftMax分类器构成。知识蒸馏损失由交叉熵损失、KL散度损失和特征对齐损失加权组合而成。硬件部署方面,采用Vitis HLS设计流程将C++模型综合为寄存器传输级(register transfer level, RTL)硬件模块,应用循环展开和数据流流水线优化,并在Vivado工具中完成FPGA实现。

**四、研究结果**

**软件级诊断性能评估。** 在90%训练/10%测试划分下,蒸馏学生CNN达到了98.64%的准确率、99.06%的精确率、97.82%的召回率和0.96的MCC,优于基线模型UNet、3D-CNN和RFDS。在10折交叉验证下,模型平均准确率为97.53%±0.27%,验证了其鲁棒性。

**消融研究。** 消融实验表明,伽马校正、GAN增强、知识蒸馏、软标签(温度T=4)、特征对齐损失、30%幅度剪枝和INT8量化各组件均对性能有贡献。完整框架在加入所有组件后达到98.64%的准确率,略低于峰值蒸馏模型(98.85%)但显著减少了存储需求。

**模型渐进性能比较。** 知识蒸馏将基线学生模型的准确率从93.71%提升至98.85%。30%幅度剪枝和INT8量化分别仅引入0.14%和0.21%的准确率下降,但将模型存储从193.38 KB降至34.65 KB,总体内存减少82.08%。

**混淆矩阵和ROC分析。** 在验证集(n=200)上,模型正确分类了95个阳性和100个阴性病例,仅产生3个假阴性和2个假阳性。接受者操作特征曲线下面积(AUC)在90%/10%划分下达0.9940,10折交叉验证下平均AUC为0.9897。

**Vitis HLS综合与RTL验证。** RTL协同仿真以PASS状态完成,验证了功能正确性,总推理延迟为1,087个时钟周期。模块级延迟分析显示compute_loop占用1,045个时钟周期。RTL波形验证确认了AXI-Stream接口的正确同步和可靠数据传输。

**FPGA硬件实现。** 在Zynq UltraScale+MPSoC平台上,后实现资源利用率为LUT 46.82%、FF 38.66%、BRAM 41.03%、LUTRAM 10.24%、BUFG 0.37%。时序分析显示时钟周期为7.30 ns,时序裕量为+2.70 ns,成功实现时序收敛。内核级推理延迟为10.6 μs(1,060个时钟周期),峰值片上内核吞吐量为94,339次推理/秒。总片上功耗为4.41 W,其中动态功耗3.712 W(84.17%),静态功耗0.699 W(15.85%)。

**五、讨论与结论**

讨论部分指出,所提出的框架在冠状动脉造影分析中实现了分类性能与硬件效率之间的良好平衡。研究存在的局限性包括:仅在单一公开数据集上评估,缺乏多中心外部验证;由于数据集未提供患者级标识符,无法进行患者级评估;冠状动脉造影主要显示血管腔而非动脉壁,阳性预测应解释为斑块相关血管造影发现而非直接的可视化斑块形态。未来工作将聚焦于多中心临床验证、患者级评估、与临床医生判读的比较、整合IVUS、OCT和CCTA等补充成像模态,以及面向低功耗边缘部署和多类冠状动脉疾病评估的进一步优化。

研究结论为:本研究提出了一个基于知识蒸馏的硬件感知CNN框架,用于冠状动脉造影图像中斑块相关血管造影发现的分类,并在Zynq UltraScale+MPSoC FPGA上实现了高效部署。实验评估在90%/10%划分下达到98.64%的分类准确率和0.9940的AUC,在10折交叉验证下达到97.53%±0.27%的平均准确率和0.9897的平均AUC。后实现FPGA设计成功实现了时序收敛,时钟周期为7.30 ns,时序裕量为+2.70 ns,仅需46.82% LUT、38.66% FF和41.03% BRAM资源,且不使用URAM。加速器达到了10.6 μs的内核级推理延迟和94,339次推理/秒的峰值片上内核吞吐量,总片上功耗为4.41 W。总体而言,该框架有效平衡了诊断准确性与硬件效率,为资源受限临床环境中的实时冠状动脉造影图像计算机辅助分析提供了一种实用解决方案。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号