超越分割精度:超声图像分析中的模型可靠性与失效模式理解

《Frontiers in Medical Technology》:Beyond segmentation accuracy: understanding model reliability and failure modes in ultrasound image analysis

【字体: 大 中 小 】 时间:2026年09月24日 来源:Frontiers in Medical Technology 4.6

编辑推荐:

  摘要专业翻译 超声图像的分割具有复杂性,尽管深度学习提升了自动化水平,但信任度仍然有限,制约了其推广应用。可解释性方法可能有助于揭示模型行为与失效模式,从而支持更可信的人工智能系统。研究人员训练了一个以ResNet-18为骨干网络的U-Net模型,用于分割使用

  
摘要专业翻译 超声图像的分割具有复杂性,尽管深度学习提升了自动化水平,但信任度仍然有限,制约了其推广应用。可解释性方法可能有助于揭示模型行为与失效模式,从而支持更可信的人工智能系统。研究人员训练了一个以ResNet-18为骨干网络的U-Net模型,用于分割使用十种超声探头(N = 162)在爱丁堡管道体模(Edinburgh Pipe Phantom)上采集的图像中的管道结构。采用五折交叉验证评估性能。预测熵(predictive entropy)与20次蒙特卡洛dropout(Monte Carlo dropout)前向传播的方差分别作为数据相关与模型相关不确定性的近似度量。使用布里尔分数(Brier score)与期望校准误差(expected calibration error, ECE)评估校准性能。评估了来自四个编码器阶段与最终解码器块的输入梯度显著性图(input-gradient saliency)和梯度加权类激活映射(Grad-CAM)图。对于探索性的前瞻性质量控制,完全空掩膜失效可直接从模型输出中识别,而非空预测则根据基于参考标准的性能标准进行回顾性分类,并评估了无参考标准的不确定性与形态学特征作为候选指标。模型取得了Dice分数(Dice score)0.81 ± 0.03和HD95为11.98 ± 3.39。共识别出七种分割错误:三种未预测出前景掩膜的完全失效,以及四种分割了错误管道的非空预测。Dice分数与布里尔分数(Spearman ρ = ?0.96)和ECE(ρ = ?0.72)显著相关,而预测熵与蒙特卡洛dropout方差与分割性能的相关性较弱(|ρ| < 0.4)。在选定的失效示例中,不确定性与激活有时与参考管道区域重叠,尽管分割结果不正确。完全空掩膜失效可从模型输出中确定性识别,而所评估的无参考标准指标对识别低质量非空分割的能力有限。在该体模数据集与模型配置下,校准指标与分割质量的关联程度高于所评估的不确定性近似方法。注意力图与不确定性图为选定错误提供了互补的描述性信息,但反映的是空间敏感性而非因果推理。简单的输出检查能够确定性识别完全分割失效;然而,所评估的无参考标准指标不足以对更细微的非空错误进行经过验证的前瞻性识别。这些发现支持对EPP分割采用多模态模型评估,同时强调未来研究需要在独立数据集、设备与架构上进行验证。

论文解读文章

一、研究背景与问题提出

超声成像是全球应用最广泛的医学成像模态之一,具有实时成像、成本相对较低且无电离辐射等优势。超声扫描仪在其使用寿命的不同时间点需要进行质量保证与性能评估,这一过程通常依赖医学物理师扫描测试对象(即体模,phantom),体模提供可预测且受控的测试环境。采集的图像随后需与既定指南进行比较分析,这是一个耗时的过程,可通过自动化分割及后续分析加以加速。
图像分割是医学图像分析的常规任务,能够支持器官面积或体积的自动计算以及计算机辅助诊断。然而,超声分割本身具有固有挑战性:超声束在组织内的不同声学相互作用会产生特征性斑点噪声、遮挡器官的声影、可能的伪影以及低信噪比。尽管多种深度学习(deep-learning, DL)方法已被开发用于超声图像自动分割,主要采用卷积神经网络(convolutional neural networks, CNNs)如U-Net或ResNet,但由于深度学习研究的"黑箱"问题——即只能看到给定输入的输出而无法理解模型如何得出预测——机器学习预测的可信度及错误临床影响日益引发关注。
在本研究中,分割性能指模型预测分割掩膜与对应参考掩膜之间的一致性;校准指预测概率与观测像素标签之间的一致性;不确定性指预测中估计的模糊性或变异性;可靠性指在所评估条件下的一致行为。可信度则作为更广泛的概念,可能包含性能、校准、鲁棒性、透明度与适当使用。
分辨率积分(resolution integral)于2004年首次被描述,是代表灰度超声扫描仪整体成像性能的无量纲单一品质因数,可实现扫描仪之间及其生命周期不同阶段的直接比较。分辨率积分测量可通过爱丁堡管道体模(Edinburgh Pipe Phantom, EPP)获得,该体模是包含悬浮在组织模拟材料中的无壁、充液管道的专用测试对象。传统方法要求操作员识别每条管道最浅和最深的可见范围,因此耗时且可能依赖观察者。先前研究虽开发了通过管道分割自动化这些测量的深度学习方法,但其校准、不确定性、注意力模式及失效模式尚未被检验。
本研究并非提出新的可解释性算法,而是对先前开发的EPP分割模型进行整合评估,结合互补的性能、校准、不确定性与注意力分析。研究目标是确定这些度量是否能提供超越常规分割指标的信息,检查完全与部分失效,并评估简单的无参考标准指标能否支持图像级质量控制。所有结论均限于所评估的EPP数据集与模型配置。

二、研究设计与关键技术方法

研究人员使用GE Logiq E10、Mindray A20和Samsung R20超声扫描仪配合多种凸阵、线阵和相控阵探头(N = 10)对EPP进行扫描,共采集162幅图像。每幅图像被裁剪至包含目标管道和深度刻度的方形区域并调整为256 × 256像素。使用VIA标注软件为每幅图像创建了地面真值二值掩膜。采用分层五折交叉验证进行训练与测试,根据各超声探头进行分层,使十个探头的相对贡献在五折中大致平衡。
模型采用以ResNet-18为骨干网络的改进U-Net架构,通过segmentation_models_pytorch包实现。为便于蒙特卡洛dropout,在每个编码器特征图解码前独立应用二维dropout层(p = 0.3)。网络接受单通道灰度超声图像并生成管道和背景的二分类logits。训练使用带标签平滑(ε = 0.1)的交叉熵损失、Adam优化器(初始学习率0.001)以及ImageNet预训练权重的ResNet-18编码器。模型训练50个epoch,根据验证Dice分数选择最佳检查点。
不确定性方面,预测熵从SoftMax概率导出,作为数据相关模糊性的近似;蒙特卡洛dropout方差在20次随机前向传播中计算,作为模型相关(认知)不确定性的近似。校准评估采用布里尔分数和期望校准误差(ECE)。可解释性方面,使用输入梯度显著性和梯度加权类激活映射(Grad-CAM),应用于四个编码器阶段的最终残差块和最后一个解码器块。此外,研究评估了基于形态学(边界框填充率、预测面积偏差、组件计数偏差)和基于不确定性(平均熵)的图像级无参考标准质量控制指标。

三、研究结果

训练评估:训练损失在所有五折中持续下降,验证损失通常先下降后达到平台期。部分验证曲线观察到较大变异性和有限的后期发散,提示存在轻度折特异性过拟合。基于验证性能的检查点模型选择防止了后期泛化较差的epoch被用于留出测试。
分割性能:在GPU工作站上单次前向传播平均推理时间为每幅图像0.003 ± 8.289e-5秒,在仅CPU笔记本上为0.036 ± 0.001秒。留出分割性能在各折间相似,总体Dice分数为0.81 ± 0.03。162幅图像中发生三次完全失效(1.85%)。各折的精确率、召回率、Jaccard系数(JC)、相对绝对体积差(RAVD)和平均表面距离(ASD)均保持相对一致。
模型注意力与不确定性可视化:在选定的良好分割示例中,显著性集中在管道末端附近,包括用于浅表可见性测量的上端。在错误分割示例中,模型分割了非目标管道,而升高的不确定性和激活也与目标区域的某些部分重叠。早期编码器图保留了更精细的空间细节,而深层编码器图更粗糙,最终解码器图反映了重建的分割特征。
校准与可靠性分析:预测熵、蒙特卡洛dropout方差和校准指标在五折间大致相似。每折的平均蒙特卡洛dropout方差均低于0.01,表明在所选dropout配置下随机传播间的变异有限。Dice分数与布里尔分数(ρ = ?0.96)和ECE(ρ = ?0.72)呈强负相关,表明重叠更好的图像也倾向于显示预测概率与参考标签之间更紧密的一致性。HD95与布里尔分数呈正相关(ρ = 0.82)。预测熵和蒙特卡洛dropout方差与分割指标的相关性较弱(|ρ| < 0.4)。注意力定位与Dice分数在最终解码器块中显示最强的平均正相关(平均ρ = 0.60),其次是编码器阶段2(平均ρ = 0.51)。解码器注意力熵也与Dice分数呈正平均相关(平均ρ = 0.66),而输入梯度显著性图的相应关联较弱。
失效模式分析:在两次完全失效案例中,升高的预测熵和蒙特卡洛dropout方差与参考管道区域的部分重叠,而显著性激活有限。在第三次失效中,编码器阶段2和3及最终解码器块中可见与参考管道重叠的激活。图像级质量控制分析中,基于组件计数和预测面积偏差的方法均通过识别23个低质量案例达到1.00的灵敏度,而基于边界框填充率和平均熵的方法仅识别了22个。然而,这些指标的特异性不足,无法支持其作为前瞻性质量控制标准的使用。四个错误管道非空预测中,仅基于组件计数偏差的方法识别了全部案例。

四、讨论与结论总结

讨论部分指出,校准指标与分割质量的关联程度高于所评估的不确定性近似方法。Dice分数与布里尔分数和ECE的强关联表明,较差的分割往往包含更大的概率误差或较差的概率-频率一致性。然而,校准和分割指标是针对相同参考掩膜计算的,因此这些相关性并非校准可前瞻性识别失效的独立证据。预测熵和蒙特卡洛dropout方差与分割性能的弱关联可能反映受控体模测试数据集的特性,但也可能取决于dropout概率、dropout在解码器前的放置位置以及20次前向传播的使用。视觉分析提供了互补但必然有限的信息,这些图代表敏感性或激活,而非决策过程的因果解释。
研究结论为:在该受控EPP数据集中,所评估的以ResNet-18为编码器的U-Net实现了一致的留出分割性能和较低的完全失效率。校准指标与基于参考标准的分割质量的关联程度强于预测熵或蒙特卡洛dropout方差,而显著性和分层Grad-CAM提供了重叠指标无法捕获的选定错误的描述性信息。然而,无参考标准的质量控制指标缺乏特异性,可视化也不构成因果解释。该框架作为审计EPP分割模型的概念验证具有实用性,但在做出更广泛或可部署的可靠性声明之前,需要独立验证、替代架构和不确定性方法以及前瞻性阈值评估。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号