深度学习辅助低剂量CT筛查肺癌检测的诊断准确性:一项系统评价与荟萃分析

《Diagnostic and Prognostic Research》:Diagnostic accuracy of deep learning-assisted low-dose CT screening for lung cancer detection: a systematic review and meta-analysis

【字体: 时间:2026年08月11日 来源:Diagnostic and Prognostic Research 3.9

编辑推荐:

  摘要 背景:深度学习(DL)辅助低剂量计算机断层扫描(LDCT)可能改善肺癌筛查,但现有证据异质性较大,患者层面的诊断准确性仍不确定。 方法:检索MEDLINE、Embase和Web of Science数据库,时间范围为2010年1月至2025年12月,

  
摘要

背景:深度学习(DL)辅助低剂量计算机断层扫描(LDCT)可能改善肺癌筛查,但现有证据异质性较大,患者层面的诊断准确性仍不确定。

方法:检索MEDLINE、Embase和Web of Science数据库,时间范围为2010年1月至2025年12月,纳入评估DL辅助LDCT在肺癌筛查或筛查相关人群中应用的研究。两名评价者独立筛选研究、提取数据并使用QUADAS-2工具评估偏倚风险。采用改编自CLAIM和STARD-AI的条目对人工智能(AI)专项报告完整性进行描述性评估。对于在定义阈值下具有完整或可重建患者层面2×2数据的研究,采用双变量随机效应模型和层次汇总受试者工作特征(HSROC)模型进行合并。缺乏充分阈值特异性数据的研究采用叙述性综合。

结果:共11项研究符合纳入标准。其中5项研究提供了可用的阈值特异性2×2数据,包含2,220名参与者、232例肺癌病例和1,988例非病例,纳入荟萃分析。其余6项研究因患者层面的真阳性(TP)、假阳性(FP)、假阴性(FN)和真阴性(TN)值不可获得或无法重建而进行叙述性综合。合并敏感度为85.4%(95%置信区间[CI],79.1–90.0),合并特异度为83.5%(95% CI,73.5–90.2)。阳性似然比为5.17,阴性似然比为0.18,诊断比值比为29.53。没有研究在QUADAS-2所有领域均处于低偏倚风险,且AI专项报告缺陷较为普遍。由于仅有5项研究符合定量纳入条件,亚组分析、元回归分析和敏感性分析均不可行。未检测到小研究效应的统计学证据,但由于仅合并了5项研究,该评估结论尚不确定。

结论:DL辅助LDCT在肺癌筛查中显示出有前景但属初步的诊断准确性。然而,现有证据基础规模小、异质性高且方法学受限,不支持自主临床使用。DL目前最宜被视为放射科医师主导的筛查路径中的决策支持工具,有待前瞻性外部验证和基于工作流程的评估。
深度学习辅助低剂量CT肺癌筛查诊断准确性的系统评价与荟萃分析解读

**研究背景与问题**

肺癌是全球发病率和死亡率最高的恶性肿瘤,2022年全球新发病例约250万例,死亡约180万例。低剂量计算机断层扫描(LDCT)筛查已被美国国家肺癌筛查试验(NLST)和荷兰-比利时随机肺癌筛查试验(NELSON)证实可降低高危人群的肺癌死亡率,因此现行指南推荐对符合条件的人群进行LDCT筛查。然而,LDCT筛查本质上是结节管理问题而非简单的图像分类问题。筛查中检出的大多数结节为良性,需要基于风险进行分诊;在NLST中,96.4%的阳性筛查结果为假阳性。因此,特异度的轻微下降可能导致召回率增加、更多随访影像检查和侵入性检查。深度学习(DL)辅助LDCT可能通过整合三维影像、结节形态学、全肺背景和纵向变化来改善恶性肿瘤风险评估,但既往综述常将筛查与有症状、偶发、富结节或病灶水平研究混为一体,导致证据异质性强,难以直接推断至受试者层面的LDCT筛查场景。此外,人工智能(AI)模型在筛查中的临床价值取决于其预期角色——独立分类、预筛查、二次阅读或同步支持——不同部署模式对特异度、工作量和后续管理产生不同影响。现有证据在患者层面诊断准确性方面仍不确定,且缺乏将系统评价资格与荟萃分析资格明确区分的严格评估框架,这些问题都要求开展一项聚焦筛查人群、以受试者层面准确性为核心的系统评价与荟萃分析。

**研究开展内容与结论**

研究人员系统检索了MEDLINE、Embase和Web of Science数据库,筛选2010年1月至2025年12月间发表的相关研究,纳入在筛查或筛查相关人群中评估DL辅助LDCT的前瞻性或回顾性横断面研究、队列研究和配对比较研究。最终11项研究纳入系统评价,其中5项研究提供可用或可重建的阈值特异性受试者层面2×2数据并纳入荟萃分析,共包含2,220名参与者(232例肺癌病例和1,988例非病例);其余6项研究因缺乏可用的阈值特异性数据而进行叙述性综合。采用双变量随机效应模型和层次汇总受试者工作特征(HSROC)模型进行定量合并,合并敏感度为85.4%(95%置信区间[CI],79.1–90.0),合并特异度为83.5%(95% CI,73.5–90.2),诊断比值比为29.53(95% CI,13.27–65.71),阳性似然比为5.17(95% CI,3.08–8.69),阴性似然比为0.18(95% CI,0.12–0.26)。所有研究均未在QUADAS-2全部领域处于低偏倚风险,AI专项报告完整性评估显示外部测试报告率7/11、可解释性3/11、模型可用性4/11、工作流整合8/11,没有研究明确报告监管状态。研究结论认为DL辅助LDCT在肺癌筛查中显示出有前景但属初步的诊断准确性,但现有证据基础规模小、异质性高且方法学受限,不支持自主临床使用,DL目前最宜作为放射科医师主导筛查路径中的决策支持工具,有待前瞻性外部验证和工作流评估。

**主要技术方法**

研究人员采用了以下关键技术方法:(1)双变量随机效应模型和HSROC模型,用于联合合并敏感度和特异度并考虑其相关性及研究间异质性;(2)QUADAS-2工具独立评估偏倚风险和适用性;(3)改编自CLAIM 2024和STARD-AI的7个条目对AI专项报告完整性进行描述性评估;(4)Deeks漏斗图不对称性检验评估小研究效应;(5)对于2×2数据缺失的研究,仅允许在疾病阳性与阴性分母及阈值特异性敏感度和特异度能够唯一确定内部一致整数表格时进行重建,且计数不得从AUC、单独四舍五入准确度或均值重采样结果推断;(6)模型和阈值选择遵循预设层次优先级,优先选择受试者或筛查检查水平估计、外部验证结果和作者的主要估计。样本队列来源包括美国、欧洲和亚洲的多中心回顾性和前瞻性筛查队列,其中5项荟萃分析研究均评估独立AI系统,2项报告了外部验证。

**研究结果**

**定量合格研究的诊断准确性**

5项荟萃分析研究的样本量范围为100至1,139名参与者,敏感度范围为75.0%至95.5%,特异度范围为64.0%至92.7%。其中Ardila等人报告敏感度81.5%、特异度89.3%,Wang等人(包含最多肺癌病例)报告敏感度83.3%、特异度74.8%。研究间变异在特异度方面大于敏感度。双变量随机效应模型合并敏感度为85.4%(95% CI,79.1%–90.0%),合并特异度为83.5%(95% CI,73.5%–90.2%)。HSROC形状参数无统计学意义(β=2.14,p=0.488),但受限于研究数量较少。由于仅5项研究符合定量纳入条件,未进行亚组分析和元回归分析。

**不符合定量荟萃分析研究的叙述性综合**

6项叙述性综合研究分别评估了LDCT筛查的不同组成部分:肺结节自动识别、检出结节恶性预测、利用当前和既往LDCT检查评估恶性肿瘤风险、以及筛查项目内AI辅助风险分类。Shao等人评估的移动LDCT筛查系统先识别肺结节再将受试者分配至多类风险类别;Trajanovski等人应用两阶段模型为多个筛查队列的每次CT检查分配连续癌症风险评分;Venkadesh等人[10]评估模型对单个检出结节良恶性的分类能力,在目标特异度90%下报告敏感度;Venkadesh等人[9]利用当前和既往LDCT检查估计单个检出结节的三年前恶性肿瘤风险并报告连续风险评分;Wang等人[24]报告了多模态风险模型的排列平均性能和最优工作点;Wu等人报告了AI阳性和AI阴性组的癌症分布,但相应非癌症计数不完整。这些研究均因阈值特异性受试者层面2×2数据不完整而无法进行定量合并。

**阈值无关的判别能力**

10/11项研究报告了AUC/C统计量,但各研究的模型、队列、预测时间跨度和分析单位不同,无法直接比较,报告值范围约为0.76至0.99。荟萃分析研究中,Ardila为0.944(来自与所选2×2估计不同的队列)、Aslani为0.77(范围0.76–0.88)、Hsu为0.873、Lv在内部验证为0.969和外部验证为0.855、Wang为0.88(95% CI,0.85–0.91)。叙述性综合研究中各AUC值因结局类型和分析单位差异而仅作叙述性综合。

**其他分析**

计划中的敏感性分析因仅合并5项研究而不可行。Deeks回归检验未检测到漏斗图不对称性(p=0.368),但仅5项研究的检验效能不足,不能排除发表偏倚或其他小研究效应。

**讨论与结论**

**讨论总结**

DL辅助LDCT显示出有前景但属初步的筛查准确性,但临床就绪性无法推断:仅5项研究被合并,均评估独立AI,特异度变异性大,6项合格研究缺乏阈值特异性受试者数据。与既往综述相比,本研究的估计值低于Thong等人报告的敏感度94.6%和特异度93.6%,这一差异可能源于既往综述纳入了有症状、偶发和病灶水平研究而对筛查人群表现产生高估。与Geppert等人的结论一致,AI可能提高敏感度或效率,但可能降低特异度或增加风险分类的复杂性。临床上,现有证据不支持AI自主诊断或AI触发的侵入性管理;预筛查和分诊是更合理的近期角色,可识别明确阴性检查或优先处理可疑扫描,减少工作量和审查延迟。第二阅读和同步支持角色可能有助于检测遗漏发现、比较既往扫描和标准化风险评估,但可能增加假阳性,其价值应通过召回率、随访影像、活检负担、间期癌和工作量来判断。证据在方法学上尚不成熟,AI专项报告在可解释性、模型可用性、工作流实施和监管状态方面存在明显缺陷。未来研究应前瞻性、多中心、外部验证并嵌入筛查工作流,遵循CLAIM、STARD-AI、TRIPOD+AI和DECIDE-AI报告标准,比较人单独、AI单独和人-AI联合策略,预设可行阈值,并报告AUC、校准度、完整2×2数据、决策曲线、召回率、活检率、间期癌、工作量和成本效益。

**研究结论翻译**

DL辅助LDCT是有前景的,但尚不成熟,不能用于自主或无条件的临床应用。其最合理的角色是在放射科医师主导的路径中作为决策支持——预筛查、分诊、二次阅读或同步辅助。在常规部署之前,需要开展前瞻性外部验证和工作流研究。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号