深度学习PET/CT融合在肿瘤影像中的增量价值与架构差异:系统综述与荟萃分析

《Journal of Imaging Informatics in Medicine》:A Meta-Analysis of Deep-Learning-Based Fusion of Positron Emission Tomography and Computed Tomography in Oncologic Imaging

【字体: 大 中 小 】 时间:2026年09月24日 来源:Journal of Imaging Informatics in Medicine 3.1

编辑推荐:

  本研究旨在评估基于深度学习的正电子发射断层扫描(PET)与计算机断层扫描(CT)融合相比匹配的单模态PET和CT是否改善性能,以及不同融合架构是否与模型性能相关。按照2020年系统综述和荟萃分析优先报告条目(PRISMA)对五个数据库进行了检索(2018年1月

  
本研究旨在评估基于深度学习的正电子发射断层扫描(PET)与计算机断层扫描(CT)融合相比匹配的单模态PET和CT是否改善性能,以及不同融合架构是否与模型性能相关。按照2020年系统综述和荟萃分析优先报告条目(PRISMA)对五个数据库进行了检索(2018年1月至2025年5月8日)。研究根据临床任务、融合层级(早期、中期、晚期或混合)及融合机制(固定或可学习)进行分类。使用具有出版物层级聚类的稳健方差估计对增量性能和绝对性能进行综合。在892条记录中,纳入103项研究(133个分析单元);30个单元进入增量综合,61个单元进入绝对综合(60个加权)。PET/CT融合在Dice相似系数(平均差(MD)=0.044;95%置信区间(CI),0.027–0.060)、受试者工作特征曲线下面积(AUC;MD=0.090;95% CI,0.036–0.144)和一致性指数(C指数;MD=0.038;95% CI,0.037–0.038)方面显示出积极效应;Dice和C指数为探索性结果。增量I2对于Dice和C指数为0%,对于AUC为94.6%。绝对性能分别为0.758、0.820和0.728,存在显著异质性。中期和混合融合的绝对Dice高于早期融合。可学习融合操作并未显著优于固定融合操作。深度学习PET/CT融合在肿瘤影像中显示出潜在价值,但证据异质性和有限的外部验证限制了其解释。需要更清晰地区分融合层级和机制,并辅以更标准化和外部验证的研究,以识别具有临床意义的融合策略。
该综述的主体内容包括引言、方法、结果、讨论和结论,系统评估了基于深度学习的PET/CT融合在肿瘤影像中的增量性能与架构效应。

**引言**

正电子发射断层扫描联合计算机断层扫描(PET/CT)在当代肿瘤影像中发挥重要作用,PET提供代谢与功能信息,CT提供详细解剖背景,二者互补有助于病灶检测、分期和治疗评估。常规临床实践中的融合主要限于空间配准和视觉叠加,缺乏通过可学习表示显式建模跨模态关系。深度学习通过学习代谢与结构信息的联合表征,推动了更高级的多模态融合,涌现出从输入级拼接、双流中间特征聚合到注意力交互模块和决策级集成等多种PET/CT融合设计。然而,仅按融合层级分类可能无法充分刻画当代架构,需要补充融合机制维度。已有综述覆盖的模态、任务和疾病异质性较大,限制了针对PET/CT的推断。针对肿瘤学中PET/CT融合的增量价值和架构设计进行定量综合,有助于识别有前景的架构策略,指导更严谨的模型开发与验证。

**方法**

**研究设计与报告**
该综述遵循PRISMA 2020指南,在定量综合前预先设定资格标准、分析单元定义、数据提取流程、架构分类规则和统计方法,以保证方法学一致性与可重复性。

**文献检索**
系统检索PubMed、Scopus、Web of Science、IEEE Xplore和Google Scholar,时间范围为2018年1月1日至2025年5月8日。检索词组合覆盖深度学习(如deep learning、卷积神经网络(CNN)、transformer、神经网络、人工智能)与多模态融合(如fusion、multimodal、dual stream、dual encoder)相关术语,并针对各数据库调整布尔运算符和检索字段。

**资格标准**
纳入的研究需满足:评估基于深度学习的PET/CT融合在人类肿瘤学中的应用;实现显式PET/CT融合架构并可依据分类学确定融合层级和机制;对分割、分类或预后预测任务报告定量性能指标,即Dice相似系数(Dice)、受试者工作特征曲线下面积(AUC)或一致性指数(C-index)。排除传统独立图像融合、仅基于影像组学或常规机器学习、纳入其他附加模态或非影像信息、非肿瘤应用、体模或动物研究、任务不适用(如目标检测)以及方法学信息不足等研究。

**分析单元**
由于一项出版物可能报告多个癌种或临床任务,编码与综合在分析单元层面而非出版物层面进行。分析单元定义为出版物内一个特定癌种或临床任务(分割、分类或预后预测)。来自同一出版物的多个分析单元在后续统计中通过出版物层次聚类处理。

**数据提取与评分者间信度**
两名评审员独立完成标题/摘要筛选、全文资格评估、数据提取和架构分类。对于同一分析单元报告多种模型配置时,优先选择作者最终或提出的完整PET/CT融合模型,而非数值表现最佳变体;当模型在多种验证设置下报告时,按外部验证、独立内部留出测试集、交叉验证的优先顺序选择最独立的评估。分类过程中迭代完善融合层级和机制的操作性定义,最终使用统一分类体系重新评估所有研究,并通过讨论解决不一致。

**PET/CT融合分类法**
融合层级分为早期、中期、晚期或混合。早期融合对应输入、数据、图像或通道级融合;中期融合包括联合、中间、表征、潜在、特征、网络或模型级融合;晚期融合对应决策、输出、预测、评分或概率级融合。混合融合定义为同一推理路径中多个融合层级均为必要组成部分。融合机制分为固定和可学习:固定融合操作采用预定义的无参数操作(如通道堆叠、拼接、加法、平均或投票);可学习融合操作存在专门的可训练组件(如注意力、门控、交叉注意力、可训练模态加权或专门的transformer融合模块)。若架构同时包含固定合并操作和专用可学习PET/CT整合组件,归类为可学习;信息不足则归为不清楚。

**目标与定量综合**
设定了两个互补目标。主要目标量化PET/CT融合相对于研究的匹配单模态成像的增量性能,计算平均差(PET/CT融合减去匹配单模态性能),表达为ΔDice、ΔAUC或ΔC指数。次要目标综合绝对PET/CT融合性能并评估其与融合层级和机制的关联。

**效应量构建与数据处理**
结果指标统一为0–1比例。优先使用报告的标准差(SD);无SD但有95%置信区间(CI)时,按公式由CI和有效样本量推算SD。由于缺少配对预测或组内协方差,增量效应方差按零协方差计算,并认为在真实正相关条件下该假设偏保守。

**统计分析**
定量综合采用稳健方差估计(RVE)和随机效应模型,以出版物为聚类单位处理分析单元之间的相关性;采用Tipton小样本校正,假设研究内相关系数ρ=0.8。异质性通过τ2、Cochran Q和I2评估。敏感性分析包括逐一排除出版物聚类的留一聚类分析。亚组分析和RVE元回归用于评估绝对性能与融合层级和机制的关联。当RVE自由度(df)≥4时认为估计可靠,df<4时视为探索性。针对至少10个独立出版物聚类的综合进行漏斗图不对称性评估。

**结果**

**研究选择**
五个数据库共检索到892条记录,去重后568条进入标题/摘要筛选,删除320条后248篇全文评估资格;详细评估后排除21项研究,最终纳入103项研究(133个分析单元)。其中61个分析单元满足次要定量资格,包含30个主要资格单元;72个仅作描述性综合。

**研究特征**
分析单元数量自2023年起显著增长,2024年最多(39/133)。分割任务占主导(95/133,71.4%),其次为分类(31/133,23.3%)和预后预测(7/133,5.3%)。头颈癌(41个)和肺癌(38个)最常见。交叉验证为主要验证策略(59个),内部留出验证49个,外部验证21个,不清楚4个。融合层级中,中期融合最多(67个),早期43个,混合19个,晚期4个。固定融合操作占优势(83个),可学习48个,2个不清楚。证据地图显示文献集中于头颈癌分割和肺癌分割/分类等少数癌种-任务组合。

**评分者间一致性**
预一致性共识前,分析单元判定一致性96.2%(κ=0.93),融合层级94.0%(κ=0.90),融合机制89.5%(κ=0.78),联合分类84.2%(κ=0.79)。定量资格主要(Primary Yes)和次要(Secondary Yes)判定一致性分别为82.7%和81.2%。

**定量综合**
增量性能方面,30个分析单元进入增量综合。增量Dice从16个分析单元(13个出版物聚类)估计,合并平均差MD=0.044(95% CI 0.027–0.060),异质性RVE I2=0%,但df=3.47,视为探索性。增量AUC从9个分析单元(8个出版物聚类)估计,MD=0.090(95% CI 0.036–0.144),df=5.91,是唯一满足预设可靠性标准的增量分析,但异质性较高(I2=94.6%)。增量C指数从5个分析单元(5个出版物聚类)估计,MD=0.038(95% CI 0.037–0.038),I2=0%,但df=1.00,视为探索性。绝对性能方面,60个加权分析单元包括42个Dice、12个AUC和6个C指数;一个Dice单元因缺乏有效样本量被排除。合并绝对Dice为0.758(95% CI 0.732–0.783),I2=100.0%;绝对AUC为0.820(95% CI 0.764–0.877),I2=99.6%;绝对C指数为0.728(95% CI 0.673–0.782),I2=89.8%。

**融合架构与绝对Dice性能的关联**
基于42个可汇总Dice分析单元进行元回归。融合层级方面,早期融合绝对Dice为0.706,中期为0.784,混合为0.798,晚期为0.663。以早期为参照,中期融合ΔDice=0.078(95% CI 0.020–0.137,P=0.013),混合融合ΔDice=0.081(95% CI 0.016–0.146,P=0.021),组间差异有统计学意义;晚期与早期未见差异(ΔDice=?0.043,95% CI ?0.391至0.306,P=0.577),但该对比因自由度极低而视为探索性。融合机制方面,固定融合绝对Dice为0.749,可学习融合为0.776,可学习融合并未显著优于固定(ΔDice=0.027,95% CI ?0.024至0.078,P=0.282)。

**敏感性分析**
留一聚类分析显示,绝对性能估计较稳定,Dice最大变化0.6%,AUC 1.9%,C指数2.1%。增量Dice对Shao_2024最敏感,去除后MD从0.044降至0.037(降幅14.5%),方向仍为正。增量AUC对Aksu_2025最敏感,去除后MD从0.090降至0.075(降幅17.2%),df降为3.59,低于可靠性阈值。增量C指数权重高度集中于HuiqinWu_2024(占反向方差权重99.88%),但去除后估计变化仅2.9%。

**发表偏倚评估**
对增量Dice、绝对Dice和绝对AUC进行了基于聚类的Egger型检验,均未发现显著漏斗图不对称(P分别为0.163、0.574和0.489)。增量AUC、增量C指数和绝对C指数因独立聚类数不足10个,仅作描述性评估,未进行正式检验。

**讨论**

**主要发现**
该综述区分了三个常被混淆的问题:PET/CT融合是否增加价值、融合应发生在何处、PET与CT应如何整合。103项研究、133个分析单元显示,PET/CT融合在Dice、AUC和C指数上均呈现一致的有利增量信号,但仅增量AUC满足预设可靠性标准。绝对性能虽较高,但存在显著异质性,应视为描述性汇总。融合层级与分割性能相关,而可学习融合操作未显著优于固定操作。

**跨临床任务的增量价值**
分割、分类和预后预测中增量效应方向均支持融合,但证据强度不同。AUC提供了最可靠的统计信号,尽管异质性和敏感性较高。Dice和C指数的阳性发现因自由度不足而视为探索性。Dice提高0.044反映空间重叠改善,但现有文献未证明该幅度足以改变临床工作流程或患者管理;AUC和C指数增加亦不等同于临床决策改善。未来研究应结合手动轮廓修正、工作流程效率、决策影响和外部多中心验证。

**架构解释:融合位置与方式**
中期和混合融合与较高绝对Dice相关,晚期融合因样本极少无法可靠比较。可学习融合与固定融合无显著差异,但该结果不应解释为等价;置信区间仍兼容微弱的可学习优势。Shiri等展示了输入级固定融合仍可使下游网络学习联合表征;Xue等为中期固定融合实例;Shao等为中期可学习融合实例,其内部消融显示可学习交互可改善特定架构性能,但跨研究未能证实总体优势。混合融合研究进一步说明融合层级和机制需分开考虑,如Diao等使用中间特征拼接与Dempster–Shafer证据融合(混合+固定),而Lei Bi等结合早期融合、模态特定流和联合transformer解码器(混合+可学习)。真正的晚期融合较少见,如Andrearczyk等将PET和CT分别处理后仅在体素级输出概率处结合。这些分析主要适用于占多数的分割任务,分类和预后预测中的架构模式尚不明确。

**证据成熟度、稳健性与可推广性**
文献自2023年起快速增长,但集中于少数任务和癌种,且外部验证仅涉及21/103项研究(24/133个分析单元)。绝对性能分析中异质性极大,合并估计应视为不同研究间平均值而非预期基准。正式漏斗图检验虽未发现显著不对称,但若干综合因聚类数较少无法排除发表偏倚。有限的外部验证引发对域移位的担忧,不同扫描仪、采集重建协议、患者人群和标注实践可能影响模型迁移性能。

**优势、局限与优先方向**
主要优势在于区分增量效益与绝对性能,有效处理分析单元独立性,并明确分离融合层级与融合机制。局限包括架构分类可能残留主观性、绝对综合的极端异质性限制临床解读、分类和预后预测样本较少、增量方差计算采用零协方差假设可能加宽置信区间,以及交叉验证研究中有效样本量和标准差报告不一致等。未来研究应优先采用匹配单模态对照、患者层面评估并报告不确定性、外部或多中心验证、以及在相同研究内对融合策略进行直接比较。

**结论**
深度学习PET/CT融合在肿瘤分割、分类和预后预测中显示出潜力,但当前证据尚未确立统一的、可重复的临床获益。融合层级可能影响分割性能,而更高架构复杂度或可适应性并不保证性能提升。该综述通过区分增量效益与绝对性能、融合层级与融合机制,为解释多模态PET/CT模型提供了更清晰的框架。临床转化需依赖在多种中心、扫描仪和患者人群中可重复的增益,以及对肿瘤描绘、诊断或预后评估或临床工作流程有意义的改善。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号