胸部 X 光分类中不确定标签的严谨贝叶斯边缘化

《Spatial Statistics》:Principled Bayesian marginalization of uncertain labels in chest X-ray classification

【字体: 时间:2026年09月09日 来源:Spatial Statistics 2.7

编辑推荐:

   **摘要** 大规模胸部X光片数据集推动了基于深度学习的诊断方法的显著进步,但这些数据集通常依赖于从自由文本放射学报告中提取的弱监督信号。在CheXpert等数据集中,诊断模糊性通过一个"不确定"标签被显式编码,而这一标签通常通过启发式重标注规则来解决,这些规则强加了任意的二

  

**摘要**
大规模胸部X光片数据集推动了基于深度学习的诊断方法的显著进步,但这些数据集通常依赖于从自由文本放射学报告中提取的弱监督信号。在CheXpert等数据集中,诊断模糊性通过一个"不确定"标签被显式编码,而这一标签通常通过启发式重标注规则来解决,这些规则强加了任意的二元决策,并经常导致预测校准偏差。

在这项工作中,我们提出了一种原则性的贝叶斯学习框架,将不确定标签视为Rubin因果分类框架下的缺失数据问题。通过实证分析和建模考量,我们认为CheXpert中的标签不确定性主要表现为非随机缺失(MNAR),因为不确定性概率取决于潜在的疾病严重程度。因此,不确定标签被建模为潜在变量,并在训练过程中通过蒙特卡洛Dropout进行边际化处理,以执行近似贝叶斯推断。为了进一步利用认知不确定性,我们引入了一种软补全标签袋装策略,该策略在不对模糊样本强制执行硬标签分配的情况下对学习效果进行正则化。

在CheXpert数据集上的大量实验表明,对不确定标签进行贝叶斯边际化可以带来判别性能的一致提升,同时大幅增强预测可靠性。我们的框架将平均AUROC提高了超过12个百分点,并将具有高度标注模糊性的病理疾病的预期校准误差(ECE)降低了近一个数量级。这些结果突出了原则性不确定性建模和缺失数据视角对于开发医学图像分析中可靠深度学习系统的重要性。

**引言**
胸部X光摄影(CXR)是全球最常见的诊断影像学检查,作为分诊、筛查和纵向监测的一线工具,广泛应用于各种临床场景(Geertse et al., 2015)。尽管应用广泛,但由于解剖结构重叠、影像学征象细微以及观察者的组间和组内变异较大,CXR解读仍然是一项认知负荷繁重的任务(Brady et al., 2012, Irvin et al., 2019)。在高通量临床环境中,放射科医生必须在巨大工作量压力下平衡准确性与效率,这些挑战进一步加剧(世界卫生组织 et al., 2016)。

深度学习的快速发展从根本上改变了CXR自动化解读的格局。卷积神经网络(CNNs)以及近期的视觉Transformer(ViTs),在各种诊断任务中展现出令人印象深刻性能。CheXNet(Rajpurkar et al., 2017)等里程碑式研究在肺炎检测中报告了放射科医生水平的性能,催生了对AI辅助放射学的广泛兴趣。随后的大规模数据集——包括ChestX-ray14(Wang et al., 2017)、MIMIC-CXR(Johnson et al., 2019)和CheXpert(Irvin et al., 2019)——使得在数十万张图像上训练越来越复杂的模型成为可能,推动了自动化诊断、分诊优先级排序和流程优化方面的快速进展。

尽管取得了这些进展,监督信号的可靠性仍然是核心瓶颈。与自然图像分类不同,后者的标签通常对应于视觉上明确无歧的类别,CXR解读在许多情况下缺乏明确的客观标准。放射学报告本质上是主观的,并且经常使用"可能"、"不能排除"或"很可能"等保留性语言来编码诊断不确定性。因此,大规模CXR数据集依赖自动化的自然语言处理(NLP)管线从自由文本报告中提取标签,这引入了两个叠加的不确定性来源。

首先,NLP系统并不完美,可能会误解细微的语言构造、否定表达或上下文限定词。其次,也是更根本的是,放射学报告本身就反映了真正的临床模糊性和观察者间变异。多项研究表明,放射科专家之间存在显著分歧,特别是在早期实变、轻度水肿或肺不张等细微发现方面(Mettler, 2018, Katabathina et al., 2013)。在这种情况下,报告编码的不是错误,而是对诊断不确定性的诚实承认。

CheXpert数据集通过引入一个"不确定"标签显式地将这种模糊性操作化。而不是强制做出二元决策,不确定的发现被保留为单独的类别,影响了临床上具有显著意义病理的约10%–40%的标签。虽然这一设计选择提高了透明度,但它与标准监督学习假设引入了根本性的不匹配,后者通常需要完整且确定的标签。

对CheXpert中不确定性处理的早期方法依赖于简单的启发式方法。CheXpert的原始研究(Irvin et al., 2019)提出将不确定标签映射为正类(U-Ones)或负类(U-Zeros)。虽然计算上很方便,但这些策略对本质上模糊的数据强加了任意的决策。此外,利用点估计的标准神经网络通常无法将预测不确定性分解为其组成部分。这些模型没有区分认知不确定性(模型无知)和偶然不确定性(数据歧义),而是将两者压缩为单一的预测分布,这种分布经常过度自信。

后续工作探索了替代启发式方法,包括掩蔽不确定标签(U-Ignore)或应用均匀标签平滑(Müller et al., 2019)。尽管这些方法减少了一些偏差,但它们未能将不确定性建模为结构化的统计现象。平行的研究线,如视觉-语言对比学习(例如CheXzero(Tiu et al., 2022)),减少了对显式标签的依赖,但通常仍然校准不足。我们认为,解决这一"认知差距"——即无法将模型无知与临床歧义区分开来——对于开发风险敏感的临床AI至关重要。

平行的研究线试图完全绕过离散标签。如CheXzero(Tiu et al., 2022)、BioViL(Boecking et al., 2022)和ConVIRT(Zhang et al., 2022)等视觉-语言模型,通过对比学习将图像与自由文本报告对齐,减少了对显式标签的依赖。然而,这些模型仍然需要标记的验证集来进行临床基准测试和部署,此时不确定性重新成为核心挑战。此外,它们的概率输出通常校准不良,限制了其适用于风险敏感的临床决策。

许多先前工作的一个关键局限在于,隐含地将不确定标签视为有噪声或不正确的观察。经典噪声标签学习技术——如Co-teaching(Han et al., 2018)、损失修正或基于置信度的样本重加权——旨在识别和抑制标记错误的数据。然而在医学影像中,不确定标签不一定是错误的;相反,它反映的是信息不完整或真正的诊断模糊性。

从统计学角度来看,不确定标签更自然地通过缺失数据理论的视角来解释。Rubin的框架区分了完全随机缺失(MCAR)、随机缺失(MAR)和非随机缺失(MNAR)机制(Pham et al., 2022)。在CXR报告中,不确定性很少与潜在病理独立。细微或早期的疾病比明显的病理更可能被报告为不确定,这表明了MNAR机制,其中缺失性取决于潜在的疾病状态本身。

因此,设计一个针对MNAR定制的框架并非任意的理论练习,而是与医学数据集构建的实证现实所必需的对齐。忽略这种依赖性会导致有偏估计器和校准不良的预测。虽然我们专门解决了临床模糊性的MNAR本质,但我们的方法旨在提供一个稳健的概率基础,以考虑信息从放射学报告中"缺失"的系统方式,超越基于启发式的标签工程的局限性。

虽然贝叶斯方法为处理潜在变量和不确定性提供了原则性框架,但其在大规模医学影像中的应用有限。大多数深度学习模型使用模型参数的点估计,这本身就无法将预测不确定性分解为其组成部分。与区分认知不确定性(模型无知)和偶然不确定性(数据歧义)不同,标准点估计模型将两者压缩为单一的预测分布,这种分布经常过度自信。这种缺乏分离在医学影像中尤为 problematic,因为边界情况经常被误解为高置信度的证据,破坏了临床部署中的信任和安全。

蒙特卡洛Dropout(Gal and Ghahramani, 2016)提供了深度神经网络中贝叶斯推断的计算可处理近似。虽然这项技术已经成熟并被广泛应用于医学影像(Combalia et al., 2020, Leibig et al., 2017, Lemay et al., 2022, Singh et al., 2022),但这些先前的应用主要聚焦于事后不确定性估计、不确定性可视化或选择性预测。本工作所解决的关键差距在于,我们不仅仅是使用蒙特卡洛Dropout在训练后测量不确定性;相反,我们将其直接集成到学习目标中来解决一个缺失数据问题。我们的主要贡献是一个原则性框架,使用这种贝叶斯近似来在训练过程中主动边际化潜在的不确定标签,并明确地将其建模为非随机缺失(MNAR)。

**数据集与队列选择**
我们使用CheXpert数据集(Irvin et al., 2019),这是一个大规模公共基准数据集,包含来自65,240名患者的N=224,314张胸部X光片,仅用于模型训练。标签是使用基于NLP的标注器从自由文本放射学报告中自动提取的,该标注器将每种病理分配为三种状态之一:阳性(1)、阴性(0)或不确定(u)。这些标签是潜在临床状态的多噪声代理,已知表现出系统性的不确定性。

**标签不确定性作为缺失数据问题**
在大规模医学影像数据集中,观察到的标签通常代表对不可观察的潜在临床状态的不完美观察。设D={(x_i, ?_i, m_i)}_{i=1}^N表示观察数据集,其中x_i ∈ R^d是胸部X光片,?_i ∈ {0,1}^K是报告标签,m_i ∈ {0,1}^K是二值掩码,指示每个标签是否被观察到或被标记为不确定。当m_{i,k}=0时,真正的二值标签y_{i,k}未被观察到,被视为潜在变量。

**贝叶斯推断方法论**
确定性神经网络提供点估计,通常在有歧义的输入上产生过度自信的预测。为了捕获认知不确定性,我们采用蒙特卡洛(MC)Dropout作为近似贝叶斯推断技术。

**标签不确定性的普遍性**
如表1详细所述,标签不确定性并非在整个数据集中均匀分布,而是系统性地集中在临床上有歧义的病理中。虽然标准发现的不确定性率低于15%,但竞争病理均超过18%,其中心脏扩大和水肿达到约38%。

这一视觉证据补充了表1中的数值数据,表明CheXpert中的缺失性不是随机的伪影,而是临床复杂性的系统性特征。

**讨论**
本研究表明,CheXpert中的标签不确定性既显著又系统性地集中在临床上有歧义的病理中。通过通过原则性的贝叶斯边际化框架解决这种不确定性,我们实现了在判别性、校准性和稳健性方面的一致提升。如表1所示,竞争病理表现出超过30%的不确定性率,证实了缺失标签是信息性的而非随机的。这支持了我们的[结论]。

**结论**
在这项工作中,我们提出了一个处理胸部X光片分类中标签不确定性的原则性贝叶斯边际化框架,并展示了其在CheXpert数据集上的有效性。我们的实证分析确认CheXpert中的不确定性不是随机的伪影,而是高度结构化的——特别是非随机缺失(MNAR)——特别是在传统启发式标签映射无法提供可靠概率预测的竞争病理中。

**局限性与未来工作**
尽管在判别性和校准性方面取得了显著进展,但本工作的若干局限性值得讨论。首先,所有实验都在CheXpert数据集上进行,其中不确定性标签来自自动报告解析,而非放射科医生的明确置信度评分。虽然这种设置代表了现实世界的弱监督,但它将临床模糊性与NLP提取引入的噪声混杂在一起;未来的工作可以利用多读者数据集...

**CRediT作者贡献声明**
Subhrajit Saha:本研究的概念、设计、实施、分析和撰写。Sthitadhi Das:本研究的概念、设计、实施、分析和撰写。

**代码可用性**
所有用于数据预处理、统计建模和图表生成的代码,均以开源许可证在GitHub仓库中公开提供:https://github.com/sthdas999/Bayesian-Marginalization-of-Uncertain-Labels-for-Reliable-Chest-X-ray-Diagnosis。该仓库包含带有注释的脚本和说明,可重现完整的分析流程。

**伦理声明**
本研究不涉及需要伦理审查的人类参与者或动物。所有使用的数据均来自公开获取的医疗实验。

**资金**
本研究未获得公共、商业或非营利部门资助机构的任何特定拨款。

**利益冲突声明**
作者声明他们没有已知的竞争性经济利益或个人关系,这些利益或关系可能已影响本论文所报告的工作。

Subhrajit Saha | Sthitadhi Das
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号