《Translational Oncology》:A dual-tower multimodal framework with feature quality enhancement for predicting pathological complete response after neoadjuvant chemotherapy in breast cancer: a multicenter study
编辑推荐:
背景: 乳腺癌是全球女性最常见的恶性肿瘤,也是癌症相关死亡的主要原因之一。新辅助化疗(NAC)已成为局部晚期疾病的标准治疗手段,并在三阴性及HER2阳性亚型中广泛采用。病理完全缓解(pCR)是公认的与无病生存期和总生存期改善相关的替代终点。然而,pCR目前仅在
背景: 乳腺癌是全球女性最常见的恶性肿瘤,也是癌症相关死亡的主要原因之一。新辅助化疗(NAC)已成为局部晚期疾病的标准治疗手段,并在三阴性及HER2阳性亚型中广泛采用。病理完全缓解(pCR)是公认的与无病生存期和总生存期改善相关的替代终点。然而,pCR目前仅在术后才能确定,这从根本上限制了其在治疗过程中指导临床决策的效用。尽管多参数磁共振成像(mpMRI)在评估治疗反应方面已有应用,但既往研究受限于多种因素:多模态融合策略依赖简单特征拼接,无法捕捉灌注与弥散信息之间的非线性关系;表征判别力不足,因为训练通常仅由分类目标引导,未促进类内紧凑性和类间分离性;以及可重复性和域偏移方面的持续挑战。
方法: 为应对上述局限,研究人员开发并外部验证了一种多模态人工智能融合与预测系统(AIFPS),整合三项互补策略。其一,采用带多模态注意力模块的双塔三维网络并行建模动态对比增强(DCE)和弥散加权成像(DWI),以捕捉模态特异性和跨模态肿瘤表征。其二,受度量学习启发的特征质量增强器(FQE)模块,在训练中联合优化类内紧凑性、类间可分离性和特征一致性,以提升潜在表征的判别力和鲁棒性。其三,将质量增强的深度特征与治疗前、治疗后及delta影像组学特征,连同临床病理变量,通过稳定性导向的特征选择和L2正则化逻辑回归进行分层整合。研究假设该整合多模态方法相比使用较少模态或标准晚期融合策略的模型,能产生更优的预测性能和跨机构泛化能力,同时保持临床可解释性。
结果: 研究纳入来自五个三级中心的1,291例患者。开发队列包含683例连续患者(239例[35.0%]达到pCR),三个独立外部验证队列分别来自YiZhong(196例)、ShanZhong(235例)和Xian(177例)。在开发队列中,AIFPS的曲线下面积(AUC)达0.882(95% CI:0.855–0.905),显著优于所有单模态和双模态模型。在外部验证中,模型保持强判别力,AUC分别为0.853(95% CI:0.778–0.915)、0.888(95% CI:0.846–0.926)和0.895(95% CI:0.846–0.936)。在所有队列中,AIFPS均取得数值最高的AUC,而单模态模型的外部表现变异性更大。消融研究证实了多模态注意力块和FQE模块的互补贡献。亚组分析显示模型在HER2阳性亚型中表现稳健,但在luminal亚型中判别力有限(AUC=0.510)。特征归因分析表明,影像衍生特征占主导地位,delta影像组学特征和深度特征贡献显著,且三种模态的贡献在统计上平衡(Kruskal-Wallis H=1.28, p=0.529)。
结论: 该可解释的多模态AI系统在三个独立机构中实现了竞争性且一致的应答分层。模型的治疗降阶梯适用性目前在HER2阳性疾病中得到最佳支持;鉴于在luminal亚型中的表现不佳,当前模型不应在未经专门重新校准的情况下应用于该亚组。经前瞻性验证后,该方法可能支持个性化治疗规划和手术决策。
论文解读
一、研究背景与问题
乳腺癌是全球女性最常见的恶性肿瘤和癌症相关死亡的主要原因之一。随着精准医学时代的到来,治疗策略日益由肿瘤生物学特征和个体患者特征所引导。新辅助化疗(NAC)已成为局部晚期乳腺癌的标准治疗手段,并在三阴性(TNBC)和HER2阳性亚型中广泛采用。新辅助化疗除缩小肿瘤负荷以利于保乳手术外,还提供了体内评估化疗敏感性的关键机会。病理完全缓解(pCR)定义为手术标本中无残留浸润性癌,是公认的与改善无病生存期和总生存期密切相关的替代终点。然而,pCR目前仅在术后才能确定,这从根本上限制了其在治疗过程中指导临床决策的效用。
多参数磁共振成像(mpMRI)结合动态对比增强(DCE)和弥散加权成像(DWI)被广泛用于评估治疗反应。DCE捕捉与血管性和通透性相关的对比剂动力学信息,而DWI反映与细胞密度相关的微结构特性。然而,传统视觉评估仍具主观性,推动了人工智能(AI)在量化复杂影像模式中的应用。尽管在预测pCR方面已取得进展,但既往研究受限于若干关键问题:多模态融合策略依赖简单特征拼接,无法捕捉灌注与弥散信息之间的非线性关系;表征判别力不足,因为训练通常仅由分类目标引导,未促进类内紧凑性和类间分离性;以及可重复性和域偏移方面的持续挑战——在单中心队列上训练的模型应用于成像协议和患者特征不同的外部数据集时,性能常显著下降。
二、研究内容与结论
为应对上述局限,研究人员开发并外部验证了一种多模态人工智能融合与预测系统(AIFPS),整合三项互补策略。第一,采用带多模态注意力块(MAB)的双塔三维网络并行建模DCE和DWI,以捕捉模态特异性和跨模态肿瘤表征。第二,受度量学习启发的特征质量增强器(FQE)模块,在训练中联合优化类内紧凑性、类间可分离性和特征一致性,以提升潜在表征的判别力和鲁棒性。第三,将质量增强的深度特征与治疗前、治疗后及delta影像组学特征,连同临床病理变量,通过稳定性导向的特征选择和L2正则化逻辑回归进行分层整合。研究假设该整合多模态方法能产生更优的预测性能和跨机构泛化能力,同时保持临床可解释性。
研究最终纳入来自五个三级中心的1,291例患者,其中开发队列(由SYF和ZY两个中心汇集的683例患者)用于模型训练,三个独立单中心外部验证队列(YiZhong 196例、ShanZhong 235例、Xian 177例)用于评估跨机构泛化能力。所有患者均接受标准新辅助化疗后行根治性手术,并具有可用于模型输入的术后mpMRI(DCE和DWI)、配对治疗前影像(用于纵向影像组学分析)及术后病理评估。
三、关键技术方法
研究人员采用以下主要技术方法:其一,基于3D ResNet-18骨干的双塔三维网络,并行处理DCE和DWI影像,并引入多模态注意力块(MAB)捕捉跨模态非线性互补信息;其二,特征质量增强器(FQE)模块,通过类内紧凑性、类间可分离性和特征一致性约束对潜在表征进行正则化;其三,影像组学特征提取,从治疗前和治疗后肿瘤感兴趣区(ROI)提取特征,delta影像组学定义为同一序列治疗后与治疗前的差值;其四,分层融合框架,通过稳定性导向的特征选择和L2正则化逻辑回归整合深度特征、影像组学特征和临床病理变量。样本队列来源包括五个中国三级医疗中心,涵盖GE、Siemens和Philips等多个厂商的1.5T或3.0T扫描仪。
四、研究结果
模型性能与外部泛化能力: 在开发队列中,AIFPS的AUC达0.882(95% CI:0.855–0.905),经多重比较校正后显著优于所有单模态和双模态模型。在外部验证中,模型保持强判别力,AUC分别为0.853(YiZhong)、0.888(ShanZhong)和0.895(Xian)。AIFPS在所有队列中均取得数值最高的AUC,而单模态模型的外部表现变异性更大(如纯深度学习模型AUC范围0.700–0.809)。决策曲线分析表明,AIFPS在0–20%的临床相关阈值范围内提供高于"全部治疗"和"不治疗"策略的净获益。
与单模态和双模态模型的比较: 单模态模型在外部队列中表现不稳定,双模态策略在若干队列中相对单模态有所改善,而完整AIFPS在每个队列中均取得最高数值AUC,且未出现某些单模态模型所观察到的性能骤降,表明整合全部三种数据流可减少对任何单一不稳定模态的依赖。
亚组分析: 预设亚组分析按分子亚型、激素受体状态、HER2状态和基线T分期进行。模型在多数亚组中保持中度至高度判别力,开发队列中AUC范围从luminal亚型的0.510到HER2阳性亚型的0.865。外部验证中,HER2阳性病例和T1–2肿瘤保持稳健性能。在样本量较小的分层中性能估计欠稳定。校准分析显示Brier评分低且一致(0.131–0.141),校准斜率接近1(范围0.897–1.197),表明跨机构分布偏移下概率准确性稳定。
模型可解释性与可视化: 梯度加权类激活映射(Grad-CAM)显示模型注意力主要定位于肿瘤感兴趣区和周围瘤周区域,DCE和DWI模态间呈现互补的空间关注。特征重要性分析表明影像衍生特征占主导地位,排名最高的预测因子包括delta DCE纹理特征(重要性4.13)和delta DCE灰度共生矩阵特征(重要性2.92)。三种模态的贡献在统计上平衡(Kruskal-Wallis H=1.28, p=0.529),支持整合所有可用模态的合理性。点二列相关分析显示DL_219、DL_218和DL_31等深度特征与pCR结局具有强关联(|r|>0.3)。Ki-67是最有影响力的临床预测因子之一(重要性1.60)。SHAP值个体预测解释揭示了错误分类病例中影像衍生表征与临床病理预测因子提供不一致或冲突信号的情况。
深度学习架构消融研究: 基线双塔ResNet-18模型(不含FQE和MAB)在外部验证队列中AUC范围为0.794–0.825。独立集成MAB带来一致的AUC改善;独立应用FQE模块在VC2中将AUC提升至0.857。两个模块的协同组合在所有外部队列中取得最高性能(AUC 0.853、0.888和0.895),证明多模态注意力和特征质量约束的同步应用显著增强了深度学习表征的判别力和跨机构鲁棒性。
五、讨论与结论
讨论部分指出,该研究的关键方法学贡献在于将多种成熟技术协同整合为针对pCR预测的统一框架。FQE模块将度量学习原理——类内紧凑性、类间可分离性和特征一致性约束——适配用于正则化双塔网络学习的潜在表征,其组合应用在多模态MRI融合框架中具有新颖性。将质量增强的深度特征与传统影像组学和临床变量通过可解释的逻辑回归模型整合,在预测性能与临床透明度之间取得平衡。与多组学策略相比,该研究依赖常规采集的MRI和标准临床变量,增强了在缺乏全面分子谱分析条件下的可行性和可扩展性。模型依赖临床可解释的区域和预测因子(如Ki-67和HER2状态),支持其临床采用潜力。亚组表现的异质性提示模型在luminal亚型中的判别力有限(AUC=0.510),可能反映该分层内显著的类别不平衡(pCR率约14%),因此当前系统不应用于指导luminal疾病患者的治疗降阶梯决策。未来研究可探索亚型特异性建模和纳入循环肿瘤DNA等额外生物标志物,以及增加治疗中期影像时间点以更好表征应答轨迹。
研究结论指出,该可解释的多模态AI系统在三个独立机构中实现了竞争性且一致的应答分层。模型的治疗降阶梯适用性目前在HER2阳性疾病中得到最佳支持;鉴于在luminal亚型中的表现不佳,当前模型不应在未经专门重新校准的情况下应用于该亚组。经前瞻性验证后,该方法可能支持个性化治疗规划和手术决策。