综述:计算与人工智能影像生物标志物预测和评估口腔鳞状细胞癌免疫治疗反应:一项系统综述与功能性Meta综合

《Medical Sciences》:Computational and AI-Enabled Imaging Biomarkers for Predicting and Assessing Immunotherapy Response in Oral Squamous Cell Carcinoma: A Systematic Review with Functional Meta-Synthesis

【字体: 时间:2026年09月09日 来源:Medical Sciences 5.9

编辑推荐:

  背景/目的:计算与人工智能(AI)影像生物标志物在口腔鳞状细胞癌(OSCC)免疫治疗反应评估中的应用日益受到关注,但现有证据异质性较大。本系统综述旨在识别、严格评价并综合用于预测或评估OSCC中已观察到的免疫治疗反应的影像生物标志物。方法:检索PubMed/M

  
背景/目的:计算与人工智能(AI)影像生物标志物在口腔鳞状细胞癌(OSCC)免疫治疗反应评估中的应用日益受到关注,但现有证据异质性较大。本系统综述旨在识别、严格评价并综合用于预测或评估OSCC中已观察到的免疫治疗反应的影像生物标志物。方法:检索PubMed/MEDLINE、Embase和Scopus数据库,检索时间从建库至2026年7月31日,无语言限制。研究方案已在PROSPERO注册。纳入研究评估了定量、影像组学、机器学习或相关医学影像生物标志物与病理或影像学反应之间的关联。采用设计特异性工具评估偏倚风险,并辅以影像组学特异性方法学评价。预先指定了结构化的无Meta分析综合(Synthesis Without Meta-analysis)。结果:共纳入7篇报告,涵盖治疗前预测、早期/治疗中动态评估以及新辅助后/术前反应评估。治疗前计算机断层扫描(CT)和磁共振成像(MRI)影像组学显示出判别性能,而基线正电子发射断层扫描(PET)摄取单独与病理反应的一致性关联未被证实。纵向成纤维细胞活化蛋白抑制剂正电子发射断层扫描(FAPI PET)变化与主要病理反应(MPR)相关,MRI生境及纵向生境模型在与临床信息结合时显示出更高的研究内判别力。没有任何计算模型在OSCC人群中经过独立的体外验证,且没有三项足够可比的研究可进行Meta分析。结论:计算影像在免疫治疗反应评估的多个阶段具有应用前景。然而,基于当前证据,所综述的任何影像生物标志物或模型均尚不能视为可常规用于临床。需要开展前瞻性、多中心、OSCC特异性验证,并标准化影像和分析流程,以确立其普适性和临床效用。
  1. 1.
    引言
口腔癌是全球重大健康问题,在唇、口腔及咽部区域癌症中占重要比重。2022年全球新发唇、口腔及咽部癌症约75.8万例,其中口腔肿瘤约占42%。该解剖区域大多数恶性肿瘤为鳞状细胞癌,口腔鳞状细胞癌(OSCC)因此对口腔癌发病率贡献显著。对于可切除疾病,手术仍是核心治疗手段,常联合颈清扫术,并根据病理风险特征辅以术后放疗或放化疗,这对言语、吞咽、咀嚼及外观可能产生重要影响。程序性细胞死亡蛋白1(PD-1)导向的免疫治疗已改变了复发或转移性头颈部鳞状细胞癌(HNSCC)的系统治疗格局,III期KEYNOTE-689试验近期将该治疗策略拓展至围手术期,证明在可切除的局部晚期HNSCC中,手术联合风险适应性辅助治疗基础上加用帕博利珠单抗可改善无事件生存期。随着免疫治疗进入潜在可治愈疾病领域,准确评估治疗反应对口腔肿瘤患者日益重要。
免疫检查点抑制的反应仍具有异质性。针对可切除HNSCC新辅助免疫治疗及化学免疫治疗的系统综述和Meta分析报告了有意义的主要病理反应(MPR)和完全病理反应(pCR)率,同时也显示许多患者未能获得深度肿瘤消退。程序性死亡配体1(PD-L1)联合阳性评分(CPS)是用于富集PD-1阻断获益的最成熟组织生物标志物,但其预测能力受空间和时间异质性、组织取样及检测相关因素限制,且不能完整反映肿瘤-免疫-间质相互作用。这些局限性为补充性影像生物标志物提供了依据,后者可无创表征肿瘤表型并在多个治疗时间点重复评估。
OSCC中的影像证据已从传统定量测量发展为日益复杂的计算表征。系列正电子发射断层扫描/计算机断层扫描(PET/CT)研究在免疫治疗前后评估了代谢、PD-L1靶向及成纤维细胞活化蛋白抑制剂信号,结果提示纵向变化可能传递与单独基线摄取不同的信息。计算方法通过CT和MRI影像组学、瘤内及瘤周建模、生境成像及纵向delta-影像组学扩展了这一框架。重要的是,这些方法并非针对单一临床任务。治疗前模型旨在治疗开始前预测反应易感性,早期动态生物标志物评估治疗开始后的治疗相关变化,而新辅助后/术前模型则在最终病理评估前尝试表征残余反应。这些区分具有临床重要性,因为在不同治疗阶段获得的性能估计不应被解释为同一预测问题的度量。
尽管文献不断涌现,尚无既往综述在OSCC聚焦的免疫治疗框架内专门综合这些影像反应任务。现有HNSCC新辅助免疫治疗系统综述主要关注疗效、安全性、病理反应率及候选组织或分子生物标志物,而更广泛的免疫治疗生物标志物综述强调PD-L1、肿瘤突变负荷、免疫细胞群、转录组特征及循环标志物,影像仅作为更广泛生物标志物景观的一部分被考虑。相反,近期一项针对HNSCC治疗反应评估的MRI影像组学系统综述和Meta分析聚焦于新辅助化疗而非免疫治疗,且纳入了解剖学上异质的头颈人群。近期口腔癌人工智能综述同样主要集中于检测、诊断及风险或预后分类,而非免疫治疗反应。因此,悬而未决的问题不仅是影像能否区分应答者与非应答者,还包括哪些影像方法已在OSCC免疫治疗反应评估的每个临床不同阶段得到评价、其性能验证的稳健性如何,以及现有证据距离临床转化有多近。
本系统综述因此旨在识别、严格评价并综合用于预测或评估OSCC免疫治疗基础治疗中已观察到反应的定量、计算及AI医学影像生物标志物。根据影像模态、分析方法、采集时机、治疗背景、反应定义及验证水平评估证据,同时检查校准、临床效用、可重复性、可解释性及报告的生物学关联。混合HNSCC研究仅在口腔特异性反应或模型性能数据可单独提取时纳入,从而保持对目标人群的直接性。
  1. 2.
    材料与方法
2.1. 综述设计与方案
本系统综述按照PRISMA 2020声明进行和报告。方案遵循PRISMA-P原则预先制定,并在PROSPERO注册。综述旨在评估提供OSCC免疫治疗基础治疗中已观察到反应的定量或计算信息的医学影像生物标志物,同时保留传统定量影像、影像组学及机器学习或深度学习方法的区分。由于预期可用证据在影像模态、分析策略、图像采集时机、治疗背景及反应定义方面存在显著差异,预先指定结构化综合作为主要分析方法,仅当临床和方法学上合理时才允许探索性定量合并。
2.2. 纳入标准
综述问题为:在经组织学确诊的OSCC或OCSCC成人患者接受含免疫治疗方案的情况下,哪些定量、计算、影像组学、机器学习或深度学习医学影像生物标志物已被评估用于预测或评估已观察到的治疗反应,其预测性能和方法学稳健性如何?采用PICOS框架定义纳入标准,并将影像时机作为额外预先指定维度。
参与者为任何临床相关疾病分期的经组织学确诊原发性OSCC或OCSCC成人,包括可切除局部晚期、复发或转移性疾病。混合HNSCC队列仅在口腔特异性反应估计或模型性能数据可单独提取时考虑。暴露为在接受含免疫治疗方案患者中评估的医学影像衍生定量、计算或AI生物标志物,包括CT定量影像和影像组学、MRI及衍生定量参数、PET/CT和分子PET影像、瘤内或瘤周影像组学、生境和delta-影像组学方法、机器学习和深度学习模型以及多模态影像-临床模型。影像可在治疗前、免疫治疗期间或之后不久、或新辅助治疗完成后但最终病理反应确定前获得。这些时间点分别保留,因为治疗前预测因子、早期动态生物标志物和术前反应评估生物标志物回答不同临床问题。
不要求单独的未治疗或活性治疗对照组。合格比较包括应答者与非应答者、pCR与非pCR、MPR与非MPR、影像学应答者与非应答者、替代影像模型、临床模型及病理生物标志物如PD-L1 CPS。主要结局为对含免疫治疗方案的已观察到反应。合格终点包括pCR、MPR、百分比病理肿瘤消退或可比病理反应类别,以及根据RECIST、iRECIST或其他明确框架的影像学反应。可提取的预测性能指标包括AUC/c统计量、敏感性、特异性、准确性、预测值、似然比及影像生物标志物与反应的相关性或回归估计。病理和影像学反应结局不被视为可互换。次要结局包括校准、决策曲线分析(DCA)、净临床获益、验证水平、可重复性、模型可解释性、相对于临床或病理生物标志物的增量性能、相关生物学关联及与所评估反应预测模型直接关联的无进展生存期(PFS)或总生存期(OS)。
纳入报告足够信息以评估合格影像生物标志物或预测模型的人类原始研究。合格设计包括前瞻性和回顾性队列、临床试验的二次影像分析、前瞻性影像生物标志物研究及模型开发和/或验证研究。仅全文原始报告贡献主要综合。无对应全文报告的会议摘要仅作为补充新兴证据保留,不用于主要综合或任何定量合并。
2.3. 排除标准
排除以下研究:评估非口腔原发肿瘤或混合HNSCC人群而无单独可提取口腔特异性影像反应或模型性能结果者;使用动物或体外数据者;仅评估影像用于诊断、解剖分期、监测、分割或传统视觉反应评估而无定量/计算生物标志物者;预测PD-L1表达、免疫细胞浸润、分子特征、复发、预后、淋巴结转移、分级或其他生物学终点而无已观察到免疫治疗反应结局者;仅使用组织病理学、病理组学、基因组、转录组或其他非医学影像信息者;或评估不含免疫治疗成分的治疗者。综述、Meta分析、社论、评论、病例报告、无结果方案及非全文会议报告也从主要证据集中排除。
2.4. 信息来源与检索策略
检索PubMed/MEDLINE、Embase和Scopus数据库,时间从建库至2026年7月31日,无出版日期或语言限制。使用Google Scholar作为补充来源,筛选按相关性排序的前200条记录。还进行了纳入研究和相关综述的参考文献回溯检索和引文前向检索,并检索ClinicalTrials.gov和其他研究注册库以识别关联出版物、伴随报告及潜在重叠试验队列。注册库中仅注册但未发表的结果不作为主要证据。
数据库策略结合三个核心概念:OSCC/OCSCC、定量或计算医学影像、以及免疫治疗或免疫检查点阻断。为降低仅以HNSCC索引的混合队列遗漏风险,每个数据库策略还纳入补充HNSCC敏感性组件,将HNSCC术语与计算影像和治疗反应术语结合。通过该敏感性组件识别的记录仍受预先指定的单独可提取口腔特异性反应或模型性能数据要求的约束。
2.5. 选择过程
两名评审员独立根据预先指定纳入标准筛选标题和摘要。任一评审员认为可能相关的报告均进行独立全文评估。分歧通过讨论解决,无法达成共识时由第三名评审员裁决。全文阶段排除原因已记录。分类选择决策的评审员间一致性高(Cohen's κ = 0.90)。
2.6. 数据收集过程
两名评审员使用标准化、预测试表格独立提取数据。使用CHARMS检查表开发提取框架,并扩展以捕获影像特异性特征和单一定量生物标志物研究。分歧通过共识解决,必要时由第三名评审员裁决。分类决策一致性κ = 0.90,连续数值数据一致性ICC = 0.91。
2.7. 数据条目
提取的研究水平信息包括作者、发表年份、国家、招募机构、招募期、研究设计、前瞻性或回顾性状态、试验注册标识、样本量、疾病背景、解剖口腔亚部位、肿瘤分期、纳入标准及治疗方案。影像变量包括模态、可用时扫描仪特征、采集序列或示踪剂、相对于治疗和手术的时机、分割策略、区域或感兴趣体积、图像预处理、定量影像参数、影像组学特征族、特征选择程序、生境或delta特征推导及影像分析软件。
对于计算模型,收集候选预测因子、最终特征集、算法或模型类别、超参数调优、类别不平衡和缺失数据处理、训练/测试分割、交叉验证或bootstrap程序、内部和外部验证、模型校准、决策曲线分析及可解释性方法。训练、内部验证、留出测试和外部验证性能估计分别提取。结局数据包括治疗反应的定义和时机、参考标准、应答者和非应答者数量及所有报告的不确定性估计判别或分类指标。还记录资助、利益冲突、方案可用性、生物学关联及与跨出版物参与者重叠相关的信息。
2.8. 多报告管理和参与者重叠处理
在合并任何参与者总数或定量估计前检查潜在参与者重叠。比较纳入报告的招募机构、招募窗口、试验标识、纳入标准、治疗方案、影像方案、作者及报告队列特征。当报告明显源自同一试验或来源人群时关联多篇报告。当重叠可能但无法在参与者水平量化时,保留贡献不同合格影像分析的报告,但将其视为潜在非独立证据。不允许此类报告同时贡献于同一合并分母或探索性Meta分析。构建跨出版物重叠矩阵记录这些判断。当已发表汇总信息不足以确立独立性时,记录建立跨报告确定性关联所需的具体信息。
2.9. 偏倚风险和方法学质量评估
采用设计匹配的评估策略,因为证据基础包含多变量预测模型和个体定量影像生物标志物研究。多变量回归、影像组学、机器学习和深度学习预测模型研究使用PROBAST+AI评估。模型开发研究应用PROBAST+AI模型开发组件;评估先前开发模型或算法的研究使用模型评估组件。当报告同时包含开发和评估时,分别考虑相关组件。评估个体定量影像生物标志物而不开发多变量预测模型的研究使用QUIPS框架评估。此外,影像组学和AI研究使用METRICS作为影像组学特异性方法学质量的补充评估。METRICS不替代偏倚风险评估,不因分数排除研究。所有评估由两名评审员独立进行,随后达成共识。分类偏倚风险判断一致性κ = 0.90,连续METRICS评分一致性ICC = 0.91。
2.10. 报告偏倚评估
通过比较全文出版物与试验注册、方案、会议报告及伴随出版物(可用时)定性评估选择性结局和分析报告。特别关注预先指定反应结局、影像时间点、模型选择程序及报告性能指标的差异。漏斗图或回归检验的小研究效应正式评估仅在至少10项充分可比且独立的研究贡献于同一定量综合时预先指定;否则描述性考虑发表和选择性报告偏倚。
2.11. 证据可信度
与注册方案一致,未对整个证据基础施加正式GRADE评级。综述结合预测模型研究和单一定量影像生物标志物研究,目标不是估计单一干预效应。因此,在每个综合领域内通过考虑偏倚风险、对OSCC/OCSCC的直接性、发现一致性、精确性、样本量、验证水平、跨中心和影像平台普适性、潜在报告偏倚及贡献队列独立性来透明表征可信度。外部验证与留出测试和内部重采样明确区分,潜在重叠人群的证据被解释为非独立。
2.12. 数据综合与统计分析
主要综合使用由SWiM报告指南适用要素指导的结构化功能性Meta综合。功能性综合分四步进行。首先,标准化研究、影像、治疗和结局水平数据。其次,提取后根据预先指定因素将研究分组为临床和方法学一致的证据领域。第三,在各组内比较影像-反应关联的方向和幅度、判别和分类性能、校准、验证、临床效用及方法学局限性。最后,跨组整合发现以识别趋同和分歧模式。探索性定量综合预先指定但非自动。仅当至少三项独立研究在人群、治疗背景、影像模态或分析类别、影像时间点、反应定义和性能指标方面充分可比时考虑Meta分析。每个独立队列一项估计贡献于给定分析。对于充分可比的AUC/c统计量估计,验证或测试集估计将转换为适当无界尺度,优选logit尺度,使用随机效应模型合并并反向转换呈现。若预先指定可比性标准未满足,则不产生合并估计,SWiM-informed功能性Meta综合构成最终综合。
  1. 3.
    结果
3.1. 研究选择
数据库检索识别653条记录。去除247条重复记录后,406条唯一记录进行标题和摘要筛选。其中393条被排除,13篇报告检索并全文评估。全文阶段排除6篇报告。5篇在混合HNSCC人群中评估影像生物标志物或预测模型,但仅报告整体HNSCC队列的治疗反应关联或模型性能估计,口腔特异性结果无法单独提取,不符合预先指定人群标准。其余1篇纳入局部晚期HNSCC患者,但分析队列中无合格口腔原发肿瘤。7篇报告符合纳入标准。Google Scholar补充筛选、引文检索及试验注册库检索未识别额外合格报告。
3.2. 纳入报告和人群特征
纳入7篇发表于2022至2026年的合格报告。证据地理集中,5篇在中国进行,1篇在美国,1篇在荷兰。研究设计包括4项回顾性队列或模型开发研究、2项前瞻性生物标志物研究和1项基于前瞻性收集随机II期试验数据的回顾性影像分析。6篇报告仅纳入OSCC或OCSCC患者,Lin等人评估更广泛HNSCC人群但单独报告口腔鳞癌亚组的治疗反应模型性能。临床背景主要为围手术期。6篇报告评估接受新辅助免疫治疗或NACI后行根治性手术的患者,Ma等人纳入接受PD-1抑制剂治疗且免疫治疗期间未手术的局部晚期和复发/转移性OSCC。可评估队列规模从16至212名患者不等。
Lin等人与Ding等人之间识别出潜在部分参与者重叠,因两篇报告均纳入中山大学孙逸仙纪念医院治疗的患者,招募期大幅重叠。Lin等人报告90例与本综述相关的口腔鳞癌病例,其中61例纳入孙逸仙纪念医院训练/内部验证队列,可能与Ding等人报告的195例单中心OCSCC队列重叠。其余29例口腔鳞癌病例从外部中心招募,不可能与Ding等人队列重叠。已发表报告未提供参与者水平关联信息或确认个体患者是否共享的跨出版物声明。由于缺乏此类信息,实际重叠程度无法确定。两篇报告均保留,因其评估不同影像策略,但被视为潜在非独立证据。
3.3. 影像和计算方法
纳入报告涵盖不同影像复杂度水平,从系列半定量PET测量到高维影像组学及空间和时间分辨生境模型。3项研究评估纵向PET生物标志物而未开发多变量预测模型,4项使用基于CT或MRI的影像组学或机器学习方法。PET研究依赖示踪剂摄取的系列变化。Shah等人量化原发肿瘤和颈部淋巴结在新辅助免疫治疗前后FDG摄取,包括SUVmax的绝对和百分比变化。Wondergem等人结合代谢FDG影像与PD-L1靶向PET,提供治疗期间代谢和靶特异性测量。Jiang等人使用68Ga-FAPI-04 PET/CT在基线和两周期NACI后,从SUVmax、SUVmean和SUVpeak计算纵向变化。计算研究使用不同影像组学表征,包括常规肿瘤影像组学、瘤内和瘤周影像组学、生境影像及纵向DeltaHabitat特征。Ma等人从二维治疗前CT肿瘤切面提取手工特征,使用LASSO特征选择后构建多个机器学习分类器。Lin等人使用治疗前多中心MRI推导瘤内和同心瘤周影像组学特征,随后将影像信息与临床病理变量整合。Yuan等人跨多个MRI序列将瘤内和瘤周区域划分为K-means定义的生境。Ding等人将生境分析与delta-影像组学结合,量化治疗前后检查间亚区域影像表型变化。
3.4. 影像生物标志物和模型的治疗反应预测
主要治疗反应结局在各报告间不同。6项研究将影像发现与术后病理反应对照,Ma等人根据iRECIST评估影像学反应。PET研究主要通过示踪剂摄取的纵向变化评估反应。Shah等人报告原发肿瘤FDG摄取早期变化与后续病理反应无显著关联。Wondergem等人发现基线PD-L1靶向PET摄取无显著区分,但病理应答者中观察到治疗相关FDG变化。Jiang等人报告FAPI摄取纵向变化对MPR具有显著判别力,而基线FAPI测量与反应无显著关联。治疗前计算方法中,Ma等人评估多个CT影像组学分类器对iRECIST定义反应的判别力,神经网络模型报告最高判别力。Lin等人评估治疗前MRI影像组学对NACI后pCR的预测,并提供口腔鳞癌亚组可单独提取性能。生境MRI研究在治疗开始后评估反应。Yuan等人评估NACI后、手术前获得的瘤内和瘤周生境特征,Ding等人纳入NACI前后MRI检查间纵向变化。两篇报告均报告影像单独和影像-临床整合方法的性能。
3.5. 验证、校准、临床效用和可解释性
4篇计算模型报告的验证程序不同。Ma等人使用留一交叉验证(LOOCV)而无独立测试队列。Yuan等人使用五折交叉验证。Ding等人在同中心留出测试集评估性能。Lin等人对整体HNSCC模型包含训练、内部验证和外部验证队列,但口腔鳞癌亚组未单独报告外部验证性能。4篇计算模型研究中有3篇报告校准,Ma等人未报告校准评估。无研究在独立OSCC/OCSCC人群中提供外部校准。Ma等人、Lin等人和Ding等人报告DCA,Yuan等人未报告净获益分析。无报告前瞻性评估模型指导决策对患者管理或临床结局的影响。两篇MRI影像组学研究报告明确可解释性分析。Lin等人检查影像组学特征与数字化定量组织病理特征之间的关联,Yuan等人使用SHAP特征归因并研究组织免疫特征关系。计算影像研究使用手动肿瘤勾画,通常经放射科医师审查或确认。定量分割或特征可重复性未一致报告,纵向DeltaHabitat方法额外需要系列MRI检查的配准。
3.6. 生物学关联和附加结局
7篇纳入报告中有4篇报告与治疗反应或影像特征相关的生物学关联。Wondergem等人评估外周免疫细胞表型。达到MPR的患者基线循环CD8+ T细胞活化更高,表现为PD-1、TIGIT和IFNγ表达更高及PD-L1表达更低。Jiang等人对20例影像分析患者中11例术后肿瘤标本进行FAP、CD8、GZMB和PD-L1免疫组化评估。FAP表达与术前FAPI摄取正相关,包括SUVmax(r = 0.720,p < 0.05)、SUVmean(r = 0.720,p < 0.05)和SUVpeak(r = 0.736,p < 0.01)。PD-L1表达与术前PET参数呈类似正相关。CD8表达与GZMB正相关(r = 0.873,p < 0.01),而CD8和GZMB均与PET参数无显著相关。与non-MPR组相比,MPR患者CD8和GZMB表达更高,FAP和PD-L1表达更低。Lin等人检查38例患者治疗前活检样本,比较瘤内和瘤周影像组学特征与数字化定量病理特征。Yuan等人研究SHAP识别的生境特征的生物学关联。3个瘤内生境特征和1个瘤周生境特征根据PD-L1 CPS类别显著不同(t = 2.027–2.275,p < 0.05)。2个瘤周生境特征与基质CD45+细胞密度强相关(r = 0.958和?0.920,p < 0.05)。无纳入报告提供与合格口腔特异性影像反应预测模型直接关联的PFS或OS分析。
3.7. 偏倚风险和方法学质量
3篇评估个体定量PET生物标志物的报告使用QUIPS评估,4篇影像组学或机器学习预测模型报告使用PROBAST+AI评估。QUIPS评估中,研究参与和结局测量在所有3篇报告中评为低偏倚风险。Shah等人预测因子测量、研究混杂及统计分析和报告评为中等风险。Wondergem等人失访和混杂中等风险,统计分析和报告高风险。Jiang等人失访及统计分析和报告高风险,混杂中等风险。模型开发方面,PROBAST+AI识别所有4篇预测模型报告在参与者和结局领域低关注,分析领域均评为高关注。预测因子领域关注对Ma等人和Ding等人低,对Lin等人和Yuan等人不清楚。因此所有4篇报告整体模型开发质量判断为高关注。模型评估组件中,所有4篇报告分析领域和整体偏倚风险评为高。Ma等人使用LOOCV,但已发表工作流未确定完整特征选择程序在每次重采样迭代内重复。Lin等人对整体HNSCC模型包含独立训练、内部验证和外部验证队列,但合格口腔鳞癌性能估计作为亚组结果报告。Yuan等人使用五折交叉验证,但已发表工作流未确定聚类、插补和特征选择程序在每折内完全重复。Ding等人使用7:3留出测试分区,但随机分区重复以获得近似平衡的基线特征。所有4篇报告评估适用性评为低关注。跨4篇预测模型报告的反复分析领域关注涉及相对于模型复杂性的有限样本量、特征选择和其他数据驱动预处理步骤未完全包含在重采样程序内的不完整证据,以及未建立独立OSCC/OCSCC特异性外部有效性的评估策略。METRICS范围为38.3%至88.5%。Ma等人评分38.3%,归类为低方法学质量;Lin等人评分88.5%,归类为优秀;Yuan等人评分49.9%;Ding等人评分59.5%,均在中等类别内。项目层面反复弱点包括早期数据分区和泄漏预防不足或不明确、预处理和特征提取参数报告不完整、外部测试有限及数据、代码和模型公开可用性受限。仅2项研究报告移除非稳健特征,定量分割或特征可重复性评估未一致记录。3项研究报告校准和不确定性估计,但无研究提供独立OSCC特异性外部校准。
3.8. 报告偏倚和证据可信度
与影像反应分析相关的前瞻性注册或方案文档在各纳入报告中可用程度不同。Shah等人是注册II期试验NCT02919683的二次回顾性FDG-PET/CT分析。Wondergem等人的NeoNivo试验注册和方案前瞻性指定PD-L1和FDG PET测量、纵向摄取变化及影像、治疗反应和生物学标志物之间的关系。Jiang等人将FAPI-PET反应分析描述为相应注册临床方案内预先指定的探索性目标。未识别Ma等人或Lin等人的研究特异性前瞻性影像组学分析方案或注册。Yuan等人报告试验注册,但在回顾性数据收集期完成后提交。Ding等人将其队列与注册新辅助化学免疫治疗试验关联,但未识别专门预先指定DeltaHabitat建模分析的前瞻性注册。因未达到至少10项充分可比独立报告贡献于共同定量综合的预先指定最低要求,未进行发表偏倚或小研究效应的正式评估。证据可信度受合格研究数量有限、影像模态和采集时机差异、治疗反应定义和治疗背景异质性及计算模型缺乏OSCC/OCSCC人群中独立报告外部验证的限制。跨三个功能性影像组,无影像生物标志物或计算模型在独立OSCC人群中使用相同影像构念、影像时间点、反应定义和验证框架被独立复制。
定量综合和探索性Meta分析适宜性:使用预先指定标准评估探索性定量合并可行性。无至少三项独立报告组满足所有标准,因此未进行Meta分析。3篇PET报告无法定量合并。Shah等人评估纵向FDG-PET/CT变化与病理反应的关系但未报告主要影像-反应关联的AUC。Wondergem等人评估FDG-PET和PD-L1靶向PET,同样未提供适合合并的判别估计。Jiang等人评估系列68Ga-FAPI-04 PET/CT并报告ΔSUV测量对MPR的AUC。PET报告在示踪剂、定量生物标志物、反应定义和可用性能指标方面不同,仅1篇为直接定义病理反应分类提供AUC。Ma等人是唯一CT影像组学报告,评估治疗前对iRECIST定义影像学反应的预测。Lin等人、Yuan等人和Ding等人的MRI报告均报告NACI后pCR的AUC,但这些估计代表不同预测任务。Lin等人评估治疗前MRI影像组学,其AUC反映NACI开始前预测pCR的能力。Yuan等人从NACI后、手术前获得的MRI推导生境特征,其AUC反映使用基线不可用信息的治疗后反应评估。Ding等人量化NACI前后MRI检查间的DeltaHabitat变化,其预测依赖两个时间点的纵向信息。因此,尽管3项研究共享MRI模态和pCR结局,其模型使用不同临床决策点可用的根本不同信息集。此外,Lin等人和Ding等人因孙逸仙纪念医院可能部分参与者重叠被分类为潜在非独立。可用验证估计也来自不同评估程序。Ma等人使用LOOCV,Lin等人报告从更广泛HNSCC人群开发和验证模型的口腔亚组估计,Yuan等人报告五折交叉验证性能,Ding等人报告同中心留出测试集结果。这些估计在结构化综合中分别保留。同样未进行敏感性和特异性的双变量Meta分析,因缺乏至少3项具有可比影像方法、反应定义和可重建分类数据的独立研究。
3.9. 结构化功能性Meta综合
结构化功能性Meta综合根据影像时机和相对于免疫治疗基础治疗的预期临床作用组织可用证据。识别3个不同组:治疗前预测、早期/治疗中动态评估和新辅助后/术前反应评估。治疗前预测包括CT和MRI影像组学模型及基线定量PET测量。Ma等人评估治疗前CT影像组学对iRECIST定义反应的预测,神经网络分类器在评估模型中报告最高判别力(AUC 0.864)。Lin等人评估治疗前MRI影像组学-临床模型对NACI后pCR的预测,口腔鳞癌亚组AUC为0.816(95% CI,0.725–0.906)。相比之下,基线分子影像测量未一致区分后续病理反应。Wondergem等人发现应答者和非应答者基线PD-L1靶向PET SUVpeak无显著差异,Jiang等人发现基线FAPI摄取与MPR无显著关联。早期/治疗中动态评估由3项纵向PET研究代表。Shah等人发现原发肿瘤FDG SUVmax早期变化与后续病理反应无显著关联。Wondergem等人同样未报告系列PET的判别AUC,但所有达到MPR或部分病理反应的患者治疗后FDG SUVpeak下降。相比之下,Jiang等人报告纵向FAPI变化判别MPR,ΔSUVmax和ΔSUVpeak各产生AUC 0.927,ΔSUVmean AUC 0.917。纵向PET证据因此不一致:反应相关变化根据示踪剂和定量测量而不同。新辅助后/术前评估由2项纳入空间或纵向肿瘤异质性信息的MRI研究代表。Yuan等人评估NACI后、手术前获得的MRI瘤内和瘤周生境特征,整合生境-临床模型在五折交叉验证中平均测试AUC为0.843。Ding等人量化NACI前后MRI定义生境的纵向变化,DeltaHabitat模型测试集AUC为0.878,与临床变量结合时增至0.915。在这些个体研究中,整合影像-临床方法显示比各自影像单独组件更高的报告判别力。总体而言,证据包含3个临床不同影像反应框架而非单一同质预测任务。然而,无影像生物标志物或计算模型在OSCC队列中使用相同影像构念、治疗时间点、反应定义和验证框架被独立复制。
  1. 4.
    讨论
本系统综述识别计算影像在免疫治疗OSCC中的3个临床不同作用:治疗前预测、早期/治疗中动态评估和新辅助后/术前反应评估。PET发现说明动态影像的机会和解释挑战。常规FDG摄取变化在合格口腔研究中与病理反应无一致关联,而Jiang等人小前瞻性队列中纵向FAPI衍生变化判别MPR。更广泛HNSCC文献证据与更全面纵向代谢测量可能优于简单SUV评估的可能性一致,也强调免疫相关炎症摄取的潜在混杂效应。影像组学研究代表互补途径。治疗前CT和MRI模型试图在治疗前估计反应易感性,而生境和DeltaHabitat方法使用治疗开始后获得的空间或纵向信息。个体队列内报告判别力令人鼓舞,整合影像-临床方法有时优于影像单独组件。然而,来自治疗后或纵向模型的更高AUC不应被解释为内在优于治疗前影像组学的证据,因为这些模型可获取额外治疗反应信息并回答更晚临床问题。报告生物学关联为计算影像超越常规形态学提供潜在转化依据。影像特征或分子影像测量与PD-L1相关变量、免疫细胞特征、成纤维细胞相关发现或基质免疫细胞密度相关。其潜在价值更合理地补充而非替代组织生物标志物。转化主要约束不是判别力本身,而是模型开发和验证方式。本综述纳入的计算模型均无独立OSCC/OCSCC人群特异性外部验证。PROBAST+AI在所有4篇预测模型报告中识别分析领域为主要关注来源。反复局限性包括相对于模型复杂性的有限有效样本量、特征选择和预处理程序未完全包含在重采样内的不完整证据,以及数据分区策略未始终提供完全独立性能评估。这些局限性可促进过拟合和乐观性能估计,限制跨机构、扫描仪、采集协议、分割实践和患者人群的可迁移性。METRICS同样显示影像组学特异性方法学质量显著变异。不进行Meta分析的决定因此是方法学上不可比性的结果,而非仅合格报告数量少。最接近的明显簇是3篇报告pCR相关AUC的MRI研究,但其估计针对不同临床任务。Lin等人使用治疗前MRI,Yuan等人评估NACI后/术前生境影像,Ding等人建模NACI前后检查间纵向变化。这些时间点决定每模型可用信息,因此其AUC不能视为共同MRI生物标志物性能参数的重复估计。可比性进一步被不同影像组学表征和验证框架及Lin等人与Ding等人之间可能部分参与者重叠降低。PET证据因示踪剂、定量测量、反应终点和可用判别统计差异更不适合合并。本综述方法学优势包括严格口腔特异性纳入标准、根据预期临床使用分离影像方法、设计匹配偏倚风险评估、METRICS补充影像组学评估、跨出版物参与者重叠显式评估及可用注册和方案考虑。重要局限性包括仅7篇报告符合标准、多数计算证据来自中国、若干生物标志物队列小、反应定义不同、一项合格估计来自更广泛HNSCC模型的口腔亚组及可能参与者重叠影响部分MRI证据。多项计算研究缺乏前瞻性分析方案,无法可靠排除选择性分析报告。排除会议摘要改善方法学可评估性但可能遗漏非常近期初步证据。鉴于小而快速演变的证据基础,阳性或高性能模型的优先发表也不能排除。未来研究应优先前瞻性多中心OSCC队列,预先指定临床使用和影像时间点。共享采集、重建、分割和预处理协议、协作多中心联盟及去标识影像存储库或联邦数据集可促进独立验证。关键分析优先事项是将所有数据驱动预处理、特征选择和模型调优保持在训练程序内,外部测试前锁定最终模型,并报告校准和判别力。性能要求应决策特异性而非基于通用AUC或预测值阈值。中心分离外部验证应先于前瞻性临床影响研究。
  1. 5.
    结论
当前证据支持计算影像在免疫治疗OSCC中的3个功能不同作用:治疗前预测、早期/治疗中动态评估和新辅助后/术前反应评估。目前均未准备常规临床使用。其中,新辅助后/术前MRI生境和纵向DeltaHabitat建模当前提供最一致的希望信号,因2项研究报告病理完全反应的有意义判别并在影像信息与临床变量整合时显示改善性能。然而,这些模型使用治疗开始后获得的信息且验证仍不充分,其明显更高判别力不应被解释为优于治疗前方法的证据。纵向FAPI-PET也显示对主要病理反应的强判别力,但该发现来自单一小队列,需独立复制。未来研究应超越重复单队列模型开发。应预先指定预期临床决策和影像时间点;协调图像采集、重建、预处理和分割程序;特征定义和提取遵循标准化框架;所有数据驱动预处理、特征选择和模型调优限于训练程序以最小化信息泄漏和过拟合。最终模型应在中心分离独立OSCC队列评估前锁定,报告校准、不确定性、相对于临床预测因子的增量价值及临床
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号