基于多视角和多帧投票的X射线冠状动脉造影中狭窄检测与量化
《Journal of Medical Imaging》:Multi-view and multi-frame voting-based stenosis detection and quantification in X-ray coronary angiography
【字体:
大
中
小
】
时间:2026年09月09日
来源:Journal of Medical Imaging 2.3
编辑推荐:
(a) 冠状动脉血管树的多视角XCA图像。图中部分由BioRender创建。7 (b) 根据SYNTAX评分方案划分的冠状动脉树分段。图改编自Syntax Score Calculator网站。8
1. 引言
心血管疾病仍然是全球死亡的主要原因,其中冠状动脉疾病(CAD)
(a) 冠状动脉血管树的多视角XCA图像。图中部分由BioRender创建。7 (b) 根据SYNTAX评分方案划分的冠状动脉树分段。图改编自Syntax Score Calculator网站。8
1. 引言
心血管疾病仍然是全球死亡的主要原因,其中冠状动脉疾病(CAD)是主要贡献因素之一。1 CAD是由于动脉粥样硬化斑块在冠状动脉中积累,导致病理性狭窄(stenosis),这可能减少血流或诱发心肌梗死。2 X射线冠状动脉造影(XCA)是CAD评估的金标准成像方式,即在多个X射线视频序列中填充对比剂以显影冠状血管3(图1)。这些投影视频从不同视角获取,通常涵盖右前斜位—左前斜位以及头侧—尾侧方向。CAD治疗的临床决策取决于狭窄的严重程度及其在冠状动脉树中的位置4(图1)。
冠状动脉树主要分为右冠状动脉(RCA)和左冠状动脉(LCA)。LCA由左主干(LM)、左前降支(LAD)和左回旋支(LCX)组成。为实现标准化定位,冠状动脉树根据SYNTAX评分方案分为25个分段。5 该评分系统量化CAD的复杂性,并指导选择最佳血运重建策略:经皮冠状动脉介入治疗(PCI)或冠状动脉搭桥术(CABG)。SYNTAX评分根据冠状动脉树分段中重度狭窄的数量和位置以及若干复杂性特征计算得出(表1)。欧洲和美国心肌血运重建指南推荐在临床中使用SYNTAX评分。6
严重狭窄以高斑块积累和明显的管腔缩窄为特征,需要进行干预;而非严重狭窄则可能无需立即治疗。在临床实践中,狭窄通常基于对XCA视频中管腔缩窄程度的目测判断被归类为严重或非严重。9 然而,由于复杂的血管解剖结构、有限的图像质量和心脏运动,解释较为困难。此外,目视评估容易受到观察者间变异和偏倚的影响,导致诊断不一致。需要获取具有不同视角的多组投影视频,以捕捉冠状动脉树的复杂结构并精确定位和量化狭窄区域。自动化方法可以增强狭窄识别和定量的信心,最终提高可重复性并支持临床决策。
大多数现有的狭窄检测方法针对单帧XCA图像运行。卷积神经网络(CNN)已被应用于分割血管管腔,并通过沿提取的血管中心线测量血管直径来实现狭窄识别和评估。10–12 使用单阶段检测方法获得了更准确的结果。13,14 例如,CathAI方法检测狭窄并确定冠状动脉树中狭窄的定位所在冠状动脉分段。15 该方法包括一个四步处理流程:图像初步分类、狭窄检测、分段确定和狭窄百分比计算。然而,由于限于静态XCA帧,其分段确定仅达到中等准确度(平均精度为48.1%)。单帧方法存在丢失关键信息的风险,因为血管在心动周期中的可见性动态变化。
为解决此问题,DeepCoro将CathAI扩展至视频分析。16 该方法包括冠状动脉分段的像素级标注、连续XCA帧的配准,以及用于狭窄百分比计算的视频分类。该方法改善了狭窄-分段分配和严重程度估计。尽管如此,上述方法仅使用单视角XCA记录进行评估,忽略了三维(3D)树结构在二维(2D)投影中可见性有限的问题。17 此外,不对称狭窄可能根据投影角度被遗漏,这进一步凸显了多视角考量对于可靠严重程度估计的必要性。Cong等人18提出了一种用于多视角图像狭窄分类的方法,产生患者级别的严重程度估计,但其方法不包括用于狭窄定位的冠状动脉分段确定。上述方法对其研究数据集应用了限制性标准,例如排除植入起搏器的患者、完全血管闭塞患者、既往接受血运重建介入治疗的患者,或血管可见性不足的视频——这限制了其在真实临床实践中的适用性。在大多数研究中,XCA视频由人工标注为LCA或RCA。
本研究的目标是通过自动将25个冠状动脉分段分类为狭窄或非狭窄5,并在检测到狭窄时进一步分类为严重或非严重,为CAD患者的SYNTAX评分计算提供输入。在我们的先前工作中,我们提出了一个四步流程来处理多个投影角度的XCA视频,以在患者级别预测25个冠状动脉分段的狭窄存在情况。19 该流程包括候选帧选择模型、狭窄和分段检测模型、光学跟踪以配准连续帧中对同一狭窄的不同检测,以及针对每组检测的基于投票的分段确定程序。对于训练和评估,我们使用了一个多中心的多血管CAD患者数据集,包含逐分段的狭窄标注。为训练帧选择模型和狭窄检测模型,由专家心脏病学家对选定帧进行了标注。然而,该数据集包含一些错误标注。主要的标注错误在于患者级别(狭窄分段被归类为健康)和帧级别(狭窄区域未用边界框标注)均未对非严重、低度狭窄进行标注。该方法使用每位患者获取的多视角XCA视频序列在患者级别进行评估。尽管该方法展现了前景,在这一极具挑战性的逐分段狭窄检测任务中取得了54.55%的F1分数,但其性能仍有待改进。
在本研究中,我们在该工作的基础上进行了若干增强:
1. 通过纠正标注错误(例如,添加先前未标注的狭窄区域)和优化模型,对训练数据集进行完善
2. 通过纠正患者级别标注(例如,识别先前未标注的非严重狭窄分段)来提高评估准确度
3. 除了检测和定位之外,整合狭窄严重程度估计
4. 单视角与多视角XCA序列的性能分析
5. 全面评估,包括单步评估、消融实验和失效分析
6. 与DeepCoro流程进行比较。16
相对于现有方法,我们的工作在方法和临床方面的贡献包括:在单一处理流程中结合帧级狭窄定位、同步分段检测、时间跟踪、基于分割的程度估计和多视角聚合,并在现实的多中心数据集上进行评估。这些改进共同旨在为冠状动脉造影视频中的自动狭窄分析提供更稳健且临床实用的工具。
2. 材料与方法
我们提出一个多步流程来处理XCA视频(图2),这是在先前工作19基础上的扩展,该工作包含一个四步流程来处理不同投影角度的视频,并在聚合视频级别预测后,在患者级别预测狭窄分段。首先,使用一个图像分类模型选择具有足够血管管腔可见性的候选帧(步骤1)。将目标检测模型应用于选定帧,以查找狭窄区域并确定相应的冠状动脉分段(步骤2.1)。随后,使用光流模型配准连续帧中检测到的区域并分配显示同一狭窄的帧检测(步骤3)。输出为相关联检测中最频繁预测的分段(步骤4.1)。最后,将多个投影视频的结果聚合成患者级别的狭窄评估。在本工作中,我们通过对步骤2.1中检测到的区域使用血管管腔分割来计算狭窄程度,从而增强该流程(步骤2.2)。在跟踪之后,检测集合的分段输出通过关联检测的中位数程度得到狭窄程度的补充(步骤4.2)。聚合同一分段各检测集合在所有多视角视频中的程度,通过狭窄严重程度分类增强了患者级别预测。
2.1 数据
我们使用了一个包含219位患者的多中心数据集用于模型训练和方法评估。该数据集包含来自Charité大学医院德国心脏中心(DHZC)柏林两个队列的多血管CAD患者,并获得了当地伦理委员会的批准(EA1/395/20)。第一个队列由126位具有复杂三支血管疾病、正准备接受CABG手术的患者组成。第二个队列包括93位具有多处狭窄(主要位于左前降支)且符合PCI与CABG结合杂交手术条件的患者。
XCA检查在38家不同的机构进行,其中大部分位于德国柏林。每位患者的检查包括多组XCA投影视频,采用非标准化、异质的视角,在单次介入前会话中获取。视频以短时间间隔录制以调整投影角度,且未与心动周期同步。视频表现出典型的2D造影成像问题,包括投影畸变、血管重叠以及由血管运动引起的管腔可见性变化。这凸显了为可靠血管分析而考虑来自不同视角的多个视频必要性。
未应用任何排除标准,确保数据集反映真实的临床条件。患者人口统计数据、危险因素和CAD范围的分布显示于图3。由于该数据集由多中心XCA检查组成,其中包含使用不同成像设备获取的数据,采集参数存在显著差异(图4)。这种多样性使得我们的方法能够在机构和采集设备之间进行泛化。冠状动脉树分段的狭窄存在情况及相应的狭窄严重程度(定义为高(狭窄程度≥75%)、中度(50%至74%)或低(<50%))由专家心脏病学家诊断。狭窄≥75%被视为严重,否则为非严重。在整个数据集中,5165个冠状动脉分段中有1531个被标记为狭窄,其中909个为严重。25个冠状动脉分段类别5中狭窄的分布高度不均衡(图5)。
为模型训练,额外创建了标注。对于帧选择模型,共标注了4462帧为低对比度(对比剂注射前或后)或高对比度(当整个冠状动脉分支可见时)。对于狭窄检测模型,高对比度帧中的狭窄由专家心脏病学家使用边界框标注并分配至相应冠状动脉分段。20 由于总帧数较高,仅对选定帧进行了标注。
2.2 处理流程
步骤1:帧选择——使用Inception-v3对具有足够血管管腔可见性的候选帧进行分类,这是一个小型CNN分类模型,可实现较短的推理时间。21 模型参数以ImageNet权重初始化,并以学习率1×10??、批大小8和二元交叉熵损失训练10个epoch。训练时,高对比度和低对比度标注(第2.1节)作为标签。
步骤2.1:狭窄检测和分段确定——使用faster R-CNN ResNet-101 V2识别选定候选帧中的狭窄区域,这是一个包含用于目标检测的区域提议网络的CNN。22 一项研究表明,与其他检测模型相比,faster R-CNN模型在XCA帧狭窄检测任务中表现出优越性能。13 一个检测由边界框坐标、置信度分数和分类的冠状动脉分段(25个分段之一)5组成。模型参数使用common objects in context (COCO)数据集权重23初始化,并以加权平滑L1损失(定位)、加权焦点损失(分类)和衰减学习率(初始值为1×10??)训练10,000个epoch。训练时,使用标注了狭窄区域边界框和相应分段标签的帧(第2.1节)。
仅保留置信度得分大于0.8的检测,以拒绝假阳性检测并减少处理时间。步骤2.2:狭窄程度计算——为了确定检测到的狭窄程度,进行了以下步骤:血管分割、中心线提取、直径及程度计算。血管分割使用nnU-Net模型进行,该模型在公开ARCADE数据集的二值血管掩码上进行训练。由于狭窄区域的管腔通常无法正确勾勒,因此额外应用了Frangi血管度滤波器。过滤后的图像以0.0为阈值进行二值化。得到的血管掩码使用Lee方法进行骨架化处理,以提取血管中心线。血管直径通过测量中心线上每个点到背景在垂直方向上的距离获得。血管直径在检测区域周围从中心线垂直测量,狭窄程度计算为最小管腔直径与参考直径(远端方向上的最大直径)的比值。在直径计算中,边界框在x和y方向上各增加10像素的填充,以包含周围具有参考直径的血管结构。中断的中心线表明存在严重狭窄,因为造影剂减少导致分割不一致。这些检测直接赋予99%的狭窄程度。位于分叉处且具有分支中心线的检测被排除在直径计算之外。步骤3:狭窄跟踪——将检测进行跟踪,以链接跨帧显示同一狭窄的检测。使用RAFT模型为每对连续帧计算光流场。该场由每个像素的一个向量组成,指向其在后续帧中对应位置的方向。对于每个检测,计算血管掩码内的平均流向量。具有≥10%空间重叠的检测被分组为同一狭窄的检测集合。步骤4.1和4.2:视频级预测——每组检测被分配到步骤2.1中最频繁预测的冠状动脉节段。该组的狭窄程度定义为步骤3中计算的所有程度的中位数。跟踪步骤和基于投票的预测的目的是为了补偿步骤1和2.2中单个检测的不准确性。在单帧上进行同时狭窄检测和节段分类是一项具有挑战性的任务。由于噪声、低对比度和血管结构重叠,检测错误频繁发生。XCA检查的每个视频都通过该流程进行处理,从而可以实现每位患者的分节段狭窄预测。在患者层面,如果在至少一个投影视频中检测到狭窄并将其分配到该节段,则该冠状动脉节段被认为存在狭窄。相应的程度定义为所有在步骤4.2中分类为相应节段的检测集合的中位程度。计算程度大于50%的狭窄被分类为严重,否则为非严重。2.3. 评估该方法使用2.1节描述的数据集进行评估。由于我们在模型训练和方法评估中使用了相同的患者,因此在患者层面应用了五折交叉验证。在每折中,80%的患者用于训练(步骤1和2.1中的模型),20%用于通过完整流程进行推理。在所有折中,为所有219名患者生成了包含分节段狭窄检测和严重程度估计的预测。我们评估两个任务:1. 分节段狭窄分类(狭窄与非狭窄)2. 狭窄节段的狭窄严重程度分类(严重与非严重)。任务1使用灵敏度和特异度进行评估,以研究漏诊狭窄的数量和假阳性狭窄分类的数量。精确率和F1分数用于研究命中率。由于假阳性狭窄分类会传播到不正确的SYNTAX节段分类中,我们优化方法以趋向特异度和精确率。由于最终的患者级预测是通过步骤4.1中的多数投票获得的,因此不提供从中可以推导出有意义的ROC曲线的连续决策分数,故不计算不依赖于阈值的指标ROC曲线下面积。任务2使用灵敏度和特异度进行评估,以研究正确分类为严重或非严重的情况,使用精确率和F1分数研究严重分类中的命中率,并使用AUROC研究预测类别的可分性。由于冠状动脉节段4、15和16的狭窄标注不一致,未对这些节段进行分节段狭窄分类评估。严重程度分类仅对较大的血管节段(1、2、6、7、11和13)进行评估,这些节段与治疗最为相关。除了患者级性能外,步骤1、2.1和2.2中使用的机器学习模型也分别进行评估。帧选择模型作为图像分类器运行,使用被标记为严重或非严重所选帧的灵敏度、特异度、精确率和F1分数进行评估。我们选择的模型与其他最先进的图像分类模型(ConvNeXt和Vision Transformer)进行了比较。狭窄检测模型作为目标检测器运行,使用区域检测的灵敏度、精确率和F1分数以及多类别节段分类的平均准确率,在有标注狭窄区域的帧上进行评估。模型选择基于其在之前研究中比较不同检测模型的优越性能。尽管如此,我们使用自己的数据集将所选模型与另一最先进的目标检测模型(RetinaNet)进行了比较。步骤2.2中使用的分割方法使用公开XCA数据集的126个测试样本,以Dice分数、Hausdorff距离、Jaccard分数和中心线Dice进行分割指标评估。然而,分割性能的显著性仍然有限,因为外部数据集不是专门的狭窄数据集。通过消融研究实验分析了流程步骤对患者级预测的贡献,在每一步中进行修改(表2)。在实验1中,我们从流程中移除了帧选择模型,并对所有视频帧执行其余步骤。在实验2中,我们修改了检测模型发现的检测的置信度得分阈值。在实验3中,我们将用于计算相应检测狭窄程度的边界框在x和y方向上分别减少和增加10像素。在实验4中,我们移除了跟踪算法,并将分类为同一节段的检测分配为视频中的同一检测集合。此外,步骤1和2.1中使用的模型使用标注帧分别评估,以了解它们对患者级性能的影响。表2 消融研究实验。实验、流程步骤、修改。实验1、步骤1、移除帧选择并包含所有视频帧。实验2、步骤2.1、修改框选择的置信度得分阈值。实验3、步骤2.2、修改程度计算的框大小。实验4、步骤3、移除跟踪算法并将分类为同一节段的检测框分配为同一狭窄。我们在患者层面调查了不同的失败案例,以提供详细的误差分析:漏诊存在的狭窄(假阴性)、在健康节段中检测到狭窄(假阳性)和严重程度误分类,即严重狭窄被分类为非严重或非严重狭窄被误分类为严重。为确定错误原因,我们回顾性分析了10名具有相应失败案例的患者。2.4. 与DeepCoro流程的比较为了对性能进行基准测试,我们使用自己的数据集将我们的方法与DeepCoro方法进行比较。DeepCoro流程的前两个步骤从CathAI方法中采用,包括(1)初级解剖结构检测和(2)狭窄框检测。由于无法获得CathAI的两个模型访问权限,我们手动将视频标记为RCA和LCA以确保兼容性,并应用我们的模型进行狭窄框检测以预测框坐标,忽略分类的节段。DeepCoro流程中的后续步骤包括(3)检测到的框在视频帧之间的配准,(4)帧中冠状动脉节段的像素级标记,(5)检测到的狭窄分配到冠状动脉节段,(6)确定狭窄百分比。步骤3至6的推理代码以及步骤4和6中使用的模型权重均已公开可用。为确保公平比较,我们将测试条件与DeepCoro设置对齐。仅处理血管可见性良好的视频(基于心脏专家的标注),仅评估管腔直径大于1.5 mm的主要冠状动脉节段(1至8、11和13)。3. 结果所提出的方法在患者层面进行两个分类任务的评估:(1)分节段狭窄检测和(2)狭窄严重程度估计。我们调查单个流程组件对患者层面预测性能的影响。此外,我们分析了多视角考虑对狭窄严重程度分类的影响,并使用相同的数据集将我们的方法与DeepCoro流程进行比较。3.1. 患者级评估对于分节段狭窄检测,我们的方法达到了61.42%的总体灵敏度、84.31%的特异度、67.99%的精确率和64.54%的F1分数。检测性能在不同节段差异显著(图5)。较大、近端的节段(例如RCA节段1至3、LAD节段6至7和LCX节段11至13)中的狭窄比较小或远端节段中的狭窄更频繁地被检测到。对于狭窄严重程度分类,该方法达到了68.62%的总体灵敏度、53.68%的特异度、67.58%的精确率、68.09%的F1分数和64.26%的AUROC。最佳性能在较大血管中观察到,反映了更好的管腔可见性和更可靠的直径估计。表3 严重程度分类评估。(1)RCA近端、(2)RCA中段、(6)LAD近端、(7)LAD中段、(11)LCX近端、(13)LCX远端、总计。狭窄总数:8、8、7、15、8、11、0、4、0、1、63、2、5(注:数据对应表格各列);严重狭窄数:3、8、4、0、1、2、1、7、0、4、0、1、6、3、2、5;非严重狭窄数:5、0、4、7、3、7、4、0、4、7、1、0、2、3、1。灵敏度(%):71.05、70.06、66.12、58.57、82.58、7.5、68.62;特异度(%):68.06、8.09、29.73、52.54、4.68、50.0、53.68;精确率(%):62.79、65.12、75.47、68.33、55.93、73.68、67.58;F1分数(%):66.67、67.47、70.48、63.08、66.67、80.0、68.09;AUROC(%):76.21、71.73、51.64、53.93、68.09、70.0、64.26。3.2. 流程步骤评估步骤1中的帧选择模型在标注帧上表现出稳健的性能,达到了93.79%的灵敏度、97.56%的特异度、97.48%的精确率和95.60%的F1分数。相比之下,步骤2.1中的狭窄检测模型单独表现较低,在5664个标注帧上,区域检测的灵敏度、精确率和F1分数分别为27.90%、55.04%和46.64%,节段分类的平均准确率为59.71%。我们管道中选择的两个模型均优于类似的最先进模型(表4和表5)。步骤2.2中的分割方法在外部数据集上达到了60.23%的Dice分数、118.03 mm的Hausdorff距离、44.09%的Jaccard分数和59.37%的中心线Dice。表4 步骤1帧分类模型的基线实验。灵敏度(%)、特异度(%)、精确率(%)、F1分数(%)。Inception-v3(基线):93.79、97.56、97.48、95.60;ConvNeXt:93.08、93.28、93.35、93.16;Vision Transformer:91.10、93.93、94.02、92.45。注:粗体表示各指标在所有实验中的最佳值。表5 步骤2.1狭窄和节段检测模型的基线实验。灵敏度(%)、精确率(%)、F1分数(%)、平均准确率(%)。Faster R-CNN(基线):27.90、55.04、46.64、59.71;RetinaNet:24.53、44.24、39.49、56.94。注:粗体表示各指标在所有实验中的最佳值。3.3. 消融研究消融研究实验的结果如表6和图6所示。修改步骤2.1中的置信度得分阈值对狭窄检测性能的影响最为显著。降低阈值提高了灵敏度但降低了精确率,而提高阈值则产生相反的效果。修改步骤2.2中用于直径估计的边界框大小主要影响严重程度分类。减小框大小导致灵敏度大幅下降,而增大框则在不损失特异度的情况下提高了灵敏度。移除跟踪步骤(实验4)对总体性能影响甚微,表明跟踪的主要优势在于稳定视频级预测,而非显著提高检测率。回顾性识别出的三种失败案例的原因如表7所示。代表性示例如图7至图9所示,说明了近端和远端血管节段中的典型错误来源。表6 消融研究结果。狭窄分类:灵敏度(%)、特异度(%)、精确率(%)、F1分数(%);严重程度分类:灵敏度(%)、特异度(%)、精确率(%)、F1分数(%)、AUROC(%)。基线:61.42、84.31、67.99、64.54;68.62、53.68、67.58、68.09、64.26。实验1:63.66、84.83、65.81、64.72;66.57、52.48、65.77、66.17、62.00。实验2(thr=0.7):69.42、86.32、61.54、65.24;64.59、57.14、66.09、65.33、63.78。实验2(thr=0.9):50.93、81.45、70.95、59.29;64.07、46.93、64.55、64.31、59.10。实验3(?10%):61.42、84.31、67.99、64.54;36.28、75.91、68.45、47.42、61.09。实验3(+10%):61.42、84.31、67.99、64.54;79.09、39.66、65.09、71.41、61.93。实验4:65.32、85.44、66.56、65.93;67.98、54.81、67.57、67.77、65.26。图6 使用不同置信度得分阈值的患者级性能。
基线阈值为 0.8。
**表 7 失败原因。**
**漏检狭窄**
- 在步骤 2.1 中正确定位,但置信度分数低于阈值
- 在步骤 2.1 中正确定位,但分段分类错误
- 步骤 4.1 中由于误检检测导致的检测集错误分段判定
**假阳性狭窄检测**
- 步骤 2.1 中的假阳性检测
- 步骤 4.1 中由于误检检测导致的检测集错误分段判定
- 狭窄确实存在,但数据集中存在缺失或错误的专家标注
**严重度误分类**
- 步骤 2.2 中由于分叉处分支中心线导致直径计算不准确
- 步骤 2.2 中由于低血管对比度导致的不准确分割造成中心线中断
- 由于血管重叠导致直径计算不准确
**图 7** 下载全尺寸图像 近端段漏检狭窄的示例。(a) 低置信度分数。(b) 错误的分段分类。远端段:(c) 低置信度分数和 (d) 错误的分段分类。
**图 8** 下载全尺寸图像 对不存在的狭窄进行假阳性判定的示例(近端段)。(a) 假阳性检测。(b) 错误的分段分类。远端段:(c) 假阳性检测和 (d) 错误的分段分类。
**图 9** 下载全尺寸图像 近端段严重度误分类的示例。(a) 分叉。(b) 分割失败。远端段:(c) 分割失败和 (d) 分割失败。紫色阴影区域表示分割后的血管管腔,蓝色线表示步骤 2.2 中用于程度计算的中心线。
**3.4. 多视角考量**
我们还评估了多视角分析对狭窄严重度分类的影响(表 8)。当严重度仅从单一投影估计时,性能明显较低。相比之下,纳入多视角检测提高了所有指标的分类性能。
**表 8** 在单视角投影视频与多视角投影视频中发现狭窄时,狭窄严重度分类性能的比较。
| 指标 | 单视角 | 多视角 |
|------|--------|--------|
| 狭窄总数 | 97 | 459 |
| 重度狭窄数 | 40 | 285 |
| 非重度狭窄数 | 57 | 174 |
| 敏感性 (%) | 60.76 | 64.56 |
| 特异性 (%) | 52.63 | 56.90 |
| 精确度 (%) | 50.91 | 71.04 |
| F1 分数 (%) | 58.95 | 67.65 |
| AUROC (%) | 63.86 | 64.81 |
注:粗体表示单视角与多视角比较中每项指标的最佳性能值。
F1 分数从 48.57%(单视角)提升至 64.14%(多视角),AUROC 从 50.32% 提升至 65.89%。这些发现表明,多视角考量提高了严重度估算的置信度并降低了误分类率。
**3.5. 与 DeepCoro 流程的比较**
我们在相同的测试条件下(第 2.4 节)将我们的方法与 DeepCoro 流程进行了比较(表 9)。DeepCoro 取得了更高的敏感性(81.88% 对 54.64%),但以较低的特异性和精确度为代价。我们的方法表现出更好的特异性(84.96% 对 69.15%)和精确度(77.18% 对 55.84%),从而获得了更高的 F1 分数(84.20% 对 70.21%)。
**表 9** 我们所提方法与 DeepCoro 流程的比较。
| 狭窄分类 | DeepCoro | 我们的方法 | 严重度分类 | DeepCoro | 我们的方法 |
|----------|----------|------------|------------|----------|------------|
| 敏感性 (%) | 58.97 | 58.66 | 61.40 | 63.87 |
| 特异性 (%) | 58.33 | 86.43 | 57.50 | 59.03 |
| 精确度 (%) | 58.29 | 74.44 | 56.79 | 68.03 |
| F1 分数 (%) | 71.30 | 83.44 | 57.14 | 63.21 |
| AUROC (%) | — | — | 60.50 | 64.76 |
注:粗体表示 DeepCoro 与我们的方法比较中每项指标的最佳性能值。
对于狭窄严重度分类,我们的流程明显优于 DeepCoro,取得了更高的敏感性(87.50% 对 62.50%)、精确度(88.89% 对 57.14%)、F1 分数(72.73% 对 56.91%)和 AUROC(64.66% 对 60.14%)。
总体而言,这些结果表明,与 DeepCoro 的框注册和基于 CNN 的视频分类相比,我们的像素级测量和基于投票的聚合策略产生了更稳健的严重度估算。
**4. 讨论**
在本研究中,我们提出了一种多步骤处理流程,用于在 XCA 视频中自动检测狭窄冠状动脉段并估计相应的狭窄严重度。该方法在患者层面进行了评估,纳入了多视角投影视频以捕捉完整的冠状动脉树并提高诊断可靠性。
与我们的早期工作相比,我们在精确度和 F1 分数方面取得了实质性改进(从 52.81% 提升至 67.99%,从 54.55% 提升至 64.54%)。这些提升主要归功于标注纠正和模型微调。较大和近端段(如 RCA 第 1 至 3 段、LAD 第 6 至 7 段和 LCX 第 11 至 13 段)中的狭窄比在较小和远端段中的狭窄具有更高的敏感性。这可以归因于较大的血管管腔和增加的对比度可见性,有助于检测直径不规则性(图 5)。严重度分类的评估显示在主要血管段中具有足够的性能(表 3),尽管在 XCA 视频中识别狭窄存在挑战。两个任务的绩效都依赖于参考标注。所述的成像问题(第 1 节)和模糊的狭窄使狭窄定位和严重度分类的标注变得复杂,导致不一致、错误和观察员特定的标注。我们的模型计为误分类的狭窄最终位于两个段之间,或者严重度是边缘案例。
消融和回顾性分析提供了关于各个流程组件贡献的重要见解。尽管帧选择模型运行可靠,在移除时仅对最终性能产生适度影响,但步骤 2.1 中的狭窄检测和分段分类阶段成为主要错误来源(图 7 和 8)。这一发现反映了在不同成像条件下在单帧中检测狭窄的固有难度。提高基线阈值导致大多数指标的性能损失,尤其是对敏感性的影响,因为后续流程步骤中考虑的框更少(图 6)。降低阈值提高了敏感性,但降低了其余指标并显著增加了推理时间。严重度误分类主要是由于步骤 2.2 中的分割问题,源于狭窄区域血管对比度不足(图 9)。重要的是,随后的跟踪和投票机制有效地弥补了这些局限,凸显了聚合多个检测以稳定患者层面预测的价值。
为调查多视角考量对严重度估算性能的影响,我们比较了仅在单一投影视频中发现与在多视角投影视频中发现的狭窄的严重度分类(表 8)。与在多视角投影中发现的狭窄相比,仅在单一投影视频中发现的狭窄的严重度分类置信度显著较低(图 10)。这与临床理解一致:动脉粥样硬化斑块常导致不对称的椭圆形狭窄,其可见性强烈依赖于成像角度。因此,多视角分析提供了对 3D 狭窄形态更完整的评估。尽管如此,由于 XCA 视频的低对比度和有限的空间分辨率,狭窄程度的量化仍然是一项困难的任务。
**图 10** 下载全尺寸图像 对在单一投影中检测到的狭窄进行程度计算(a),其中重度狭窄被错误分类为非重度,程度为 36%。对在两个投影中检测到的重度狭窄进行程度计算(b)和(c),其中狭窄被正确分类为重度,程度分别为 87% 和 61%。紫色阴影区域表示分割后的血管管腔,蓝色线表示步骤 2.2 中用于程度计算的中心线。
与 DeepCoro 流程相比,两种方法漏检了相似数量的狭窄。两种方法可比的敏感性反映了在 XCA 视频中可靠检测狭窄的固有难度,特别是在具有挑战性的成像条件下,如血管重叠、低对比度和投影变异性(第 1 节)。这凸显了需要额外的视觉审查以降低漏检狭窄的风险。DeepCoro 的总检测数更高,但以增加假阳性为代价,降低了特异性和精确度。我们的方法有意倾向于保守的狭窄预测,优先考虑特异性和精确度,以减少可能导致不必要的临床审查工作量的假阳性发现。对于严重度估算,我们的方法始终优于 DeepCoro。这些结果表明,像素级、逐帧狭窄量化结合跨帧和视角的基于投票的聚合,比 DeepCoro 的框注册后接基于 CNN 的视频分类提供了更大的稳健性(表 9)。
尽管这些发现令人振奋,但挑战依然存在。狭窄程度的量化受到低对比度、图像噪声和复杂树状结构在 2D 投影视频中运动的影响。尽管相关方法局限于较大的段,但我们的工作将远端段纳入患者层面预测,但在较小和远端血管中的狭窄显示出低敏感性(图 5)。这可以归因于代表小血管的像素数量少、血管对比度不足、周围结构的遮挡以及在树状复杂度增加时远端区域复杂的分段分配(图 7–9)。提高这些区域的性能可能需要更大的训练数据集,更具平衡性的冠状动脉段类别表示,多位标注者的一致标注,以及检测模型的更广泛训练。
**5. 结论**
我们提出了一种多步骤处理流程,用于在 XCA 视频中自动检测、定位和评估冠状动脉狭窄的严重度。该方法使用来自多血管 CAD 患者的多视角 XCA 记录的多中心数据集在患者层面进行了评估。
我们的结果表明,该方法在大型冠状动脉段中实现了可靠的狭窄识别,并提供了具有临床意义的严重度估算。纳入多个视角显著提高了严重度分类性能,凸显了多视角分析对于稳健狭窄评估的必要性。与 DeepCoro 流程相比,我们的方法表现出优越的精确度、特异性和严重度估算,尽管以降低狭窄检测率为代价。
未来的工作将专注于扩展数据集以实现冠状动脉段的更平衡表示,增加标注者数量以获得更一致和可靠的狭窄标注,并完善检测模型以提高在较小和远端血管中的敏感性。我们的方法可以通过纳入高级分析(如斑块特征化和血管运动评估)来增强。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号