《Insights into Imaging》:Development of an expert-annotated chest X-ray dataset to support AI validation in tuberculosis diagnosis
编辑推荐:
目的:评估六位美国国家职业安全与健康研究所(NIOSH)认证的B读取者(在标准化胸部X光(CXR)尘肺分类中获得认证的医师)在CXR上诊断结核病(TB)的阅片者间一致性和诊断性能,以开发一个可靠的数据集,支持人工智能(AI)模型在TB检测中的外部验证。材料与方
目的:评估六位美国国家职业安全与健康研究所(NIOSH)认证的B读取者(在标准化胸部X光(CXR)尘肺分类中获得认证的医师)在CXR上诊断结核病(TB)的阅片者间一致性和诊断性能,以开发一个可靠的数据集,支持人工智能(AI)模型在TB检测中的外部验证。材料与方法:由六位B读取者分析了来自五家机构的1097张CXR。纳入年龄≥15岁的患者,排除人类免疫缺陷病毒(HIV)或机会性感染者。CXR被分类为无异常或异常。使用修改的国际劳工组织(ILO)分类对异常进行分类,并分为符合TB或不符合TB。微生物学参考包括痰涂片、培养或分子检测。描述性统计总结了CXR和微生物学发现。使用Fleiss' kappa评估阅片者间一致性。通过比较CXR发现与微生物学参考来评估诊断性能。结果:在3117次读取中,69%的CXR为异常,31%为无异常。微生物学结果证实,87%的异常CXR为TB病例,而83%的无异常CXR为非TB。所有发现的Fleiss' κ=0.83,符合TB发现的κ=0.67,活动性TB发现的κ=0.76。对于符合TB的发现,敏感性、特异性和准确性范围分别为77.2%-91.1%、87.4%-98.6%和84.1%-90.1%。结论:B读取者在CXR上诊断TB表现出高度一致性和高准确性,提供了一个可靠的数据集,可用于TB诊断中AI模型的外部验证。关键相关性声明:凭借显著的阅片者间一致性和强大的诊断性能,B读取者对CXR的解释提供了一个可靠的数据集,支持TB诊断中AI模型的外部验证。要点:B读取者可以为TB诊断中AI模型的验证提供可靠参考。在基于CXR的TB诊断中,B读取者之间观察到了较低的变异性和高准确性。
研究背景与意义:2022年全球估计有1060万人罹患结核病(TB),约130万人死亡。尽管全球努力,TB相关死亡从2015年至2022年仅下降19%,远低于世界卫生组织(WHO)设定的2025年降低75%的目标,凸显急需创新策略。胸部X光(CXR)是WHO推荐的TB系统筛查工具,但解读时存在阅片者间变异,以往研究仅报告读者间一致性一般,且CXR特异性低,易产生假阳性。人工智能(AI)辅助检测软件在TB筛检中展现潜力,但多数AI模型在外部数据集上表现逊于内部数据,仅6%的医学影像AI模型得到外部验证,缺乏稳健的外部验证数据集限制了其广泛应用。B读取者是由美国国家职业安全与健康研究所(NIOSH)认证、擅长尘肺CXR分类的医师,在尘肺诊断中与其他读者相比一致性更高。研究人员假设B读取者在CXR上识别TB同样具备高水平,因此开展本研究。该研究成果发表在《Insights into Imaging》期刊上。
关键技术与方法:研究从泰国五个地理区域(机构1至5)收集1097张CXR,排除HIV阳性及儿科病例,平均年龄49.4岁,57.7%为男性。六位资深胸放射科医生(均经NIOSH认证,经验15年以上,其中三位来自同一中心)使用集成ePAD影像平台和电子病例报告表(eCRF)的网络应用进行独立解读。CXR分类为无异常或异常,异常发现按修改的国际劳工组织(ILO)分类分为肺实质、胸膜及其他异常,最终判断为符合TB(活动性或不确定活动性)或不符合TB。微生物学金标准包括痰涂片、培养或分子检测。统计采用Fleiss' kappa评估多位读者一致性,Cohen's kappa评估成对读者一致性,通过比较CXR解读与微生物学结果计算诊断性能指标。所有解读经≥2/3读者共识作为最终判断。
研究结果:
- 基线患者特征:机构1和2提供近似均衡的TB/非TB病例(各150/150和148/150),机构3仅提供TB病例(200例),机构4和5也近均衡(74/75和74/76)。
- 所有CXR发现:3117次读取中,69%(2158次)为异常,31%(959次)为无异常。微生物学验证:87%的异常CXR来自TB患者,83%的无异常CXR来自非TB患者。各B读者异常发现比例相似(66%-73%)。
- 符合TB的发现:各B读者识别为符合TB的比例为52.6%-66.4%,其中44%-62%归为活动性TB,表现为空洞(19%-50%)、粟粒结节(1.2%-51%)、斑片状浸润(28%-57%)、胸腔积液(4.3%-15%)和单侧淋巴结增大(1.7%-21%)。
- 阅片者一致性:所有发现的Fleiss' kappa为0.83(几乎完美一致),符合TB发现为0.67(显著一致),活动性TB发现为0.76(显著一致)。最低一致性为粟粒结节(κ=0.17)。成对B读者间一致性(Cohen's kappa)范围0.78-0.91,经验差异未显著影响一致性水平。
- 每图像读取计数:按微生物学状态分层显示,非TB图像中>94%的TB相关发现被0位读者标记;TB阳性CXR中,空洞由≥2位读者标记的比例为51%(346例),单侧淋巴结增大最低(4.6%,31例)。
- 诊断性能:六位B读者的敏感性77.2%-91.1%,特异性87.4%-98.6%,准确性84.1%-90.1%,显示高特异性与可靠准确性。
讨论与结论:本研究首次评估B读取者在TB诊断中的阅片者间变异,发现整体一致性优于既往研究(κ=0.83 vs 先前0.53),活动性TB一致性也更高(κ=0.76 vs 0.54-0.64)。B读者经验对一致性影响不大(成对κ0.78-0.91)。空洞和斑片状浸润一致性良好,但胸腔积液一致性因读者可能根据其他特征改变诊断而下降;粟粒结节和淋巴结增大一致性较低(κ分别为0.17和0.28),与既往研究一致,因其影像学特征细微。诊断性能方面,B读者特异性(87%-98.6%)高于既往高流行区报告(67%-97%),敏感性(77.2%-91.1%)略低,体现特异性与敏感性的权衡。研究优势包括微生物学确认诊断、多中心多样化病例、三人共识减少主观变异。局限性:排除HIV和儿科CXR、数据源自泰国高发地区、未与非B读者比较。总之,研究人员的发现表明,B读取者在CXR上诊断TB表现出高准确性和一致性。尽管AI模型在TB诊断中的应用日益增多,但其真实世界性能和临床效用因国家和地区而异。该数据集为TB诊断中AI模型的外部验证提供了可靠参考。