《Clinical and Translational Medicine》:An interpretable multi-task whole-slide histopathology AI model for non-small cell lung cancer: Cross-cohort generalisation, spatial attention–transcriptomic integration, and molecular–immune profiling
背景:肿瘤-淋巴结-转移(TNM)分期不能完全解释非小细胞肺癌(NSCLC)的预后异质性。研究人员评估了苏木精-伊红(H&E)全切片图像(WSI)是否能够估计组织学亚型、病理分期概率、生存风险以及空间相关的生物学关联。
方法:SparseAGE-MTL,一个具有共享投影-拓扑编码器和任务特异性输出头的弱监督多任务多实例学习(MIL)模型,在954例癌症基因组图谱(TCGA)病例中,使用七种病理特征空间和18种比较模型进行训练和基准测试。外部评估使用了948例组织微阵列(TMA)和324例全切片(WSI)病例。注意力图与10x Visium空间转录组学(ST)进行共配准,并与批量转录组学、免疫浸润估计和ESTIMATE评分整合。分析包括配对模型比较、错误发现率(FDR)校正、Cox模型、校准评估和决策曲线分析。
结果:在CONCH特征空间中,SparseAGE-MTL在内部基准测试中对腺癌/鳞状细胞癌分类达到93.73%准确率、98.19%受试者工作特征曲线下面积(AUC)和93.08% F1分数;外部AUC值约为0.91和0.82。分期估计的区分度较低,外部总体AUC约为0.70,且校准具有队列依赖性。风险评分定义的组在两种组织学亚型中总生存期(OS)存在差异,并在外部呈现相似趋势。高注意力区域富集于肿瘤-基质或肿瘤-免疫界面,并与B细胞、成纤维细胞、C1QC、COL1A1、上皮-间质转化(EMT)、转移和缺氧信号相关。高风险病例显示恶性通路激活、较低的免疫/基质评分、较高的肿瘤纯度以及亚型特异性免疫/基质差异。将风险评分添加到临床模型后,外部合并一致性指数(C-index)从约0.620增加至0.672。
结论:在回顾性队列中,SparseAGE-MTL从常规病理图像中生成亚型分类、分期概率和生存风险输出。亚型分类在数值性能上高于分期估计。生存风险和注意力输出与结局及空间/转录组特征相关,但在临床使用前需要前瞻性、治疗标注的验证。
**论文解读:基于多任务弱监督组织病理学AI的非小细胞肺癌整合分析框架**
**研究背景**
非小细胞肺癌(NSCLC)是肺癌中最常见的类型,约占80%–85%,尽管诊疗策略不断进步,总体5年生存率仍仅约26.4%。目前,TNM分期系统是早期可切除NSCLC手术和辅助治疗决策的主要依据,但临床证据表明,相同TNM分期并接受相似治疗的患者,其无病生存期(DFS)和总生存期(OS)仍存在显著差异。此外,NSCLC的两大主要组织学亚型——肺腺癌(LUAD)和肺鳞状细胞癌(LUSC)——在驱动突变谱、代谢通路和免疫状态上存在系统性差异,这些差异及微环境异质性无法被TNM分期完全捕获。因此,从常规苏木精-伊红(H&E)全切片图像(WSI)中衍生的风险评分,可能为术后风险分层、辅助治疗讨论和监测计划提供补充信息。若该风险评分能与空间分辨分子程序(如空间转录组学特征)和肿瘤免疫微环境(TIME)表型以可解释方式关联,则可将形态学层面的风险表型与局部免疫-基质微环境、缺氧相关区域、肿瘤-基质界面等空间结构对齐,从而支持后续治疗相关生物标志物假设的生成。
现有NSCLC预测模型虽已扩展至影像组学、ctDNA、转录组学、蛋白质组学和组织病理学等多种模态,但通常聚焦于单一数据类型或单一临床任务(如亚型分类、突变预测或生存预测)。对于NSCLC中相互关联的组织学亚型、病理分期和生存风险,在统一WSI框架下的系统评估仍有限。此外,真实世界应用中的病理图像模型需应对不同机构、制片流程和切片格式导致的域偏移,尤其是当WSI和组织微阵列(TMA)共存时,跨中心和跨切片类型的性能需进一步验证。同时,注意力热图虽广泛用于显示模型关注区域,但高注意力区域是否对应特定分子通路、空间转录组状态或TIME表型,仍缺乏定量证据。因此,亟需建立一个基于常规H&E WSI的分析框架,共同评估相关但不等价的临床终点(包括组织学亚型、病理分期和生存风险),在外部队列中测试泛化性,并阐明WSI衍生风险评分与肿瘤分子状态及免疫微环境的关系。
**研究内容与结论**
研究人员开发了SparseAGE-MTL,一个用于NSCLC H&E WSI的弱监督联合多任务多实例学习(MIL)框架,可在统一架构内同时进行NSCLC亚型分类、LUAD/LUSC病理分期预测和生存风险估计。在TCGA队列中,研究人员系统比较了SparseAGE-MTL与其非多任务对照SparseAGE-MIL、单任务配置及18种代表性MIL框架,涵盖七种特征空间和11个终点级指标。研究随后整合基准性能与拓扑诊断结果选择默认特征空间,并在两个独立外部队列(涵盖WSI和TMA)中评估跨中心和跨切片类型的泛化性。接着,研究人员将SparseAGE-MTL生成的任务特异性注意力热图与10x Visium空间转录组学共配准,分析高注意力区域在细胞类型组成、功能状态和信号通路方面的生物学背景。最后,利用TCGA-LUAD和TCGA-LUSC批量转录组学及外部随访数据,比较模型衍生高风险与低风险组间的差异表达、通路富集、多算法免疫浸润、ESTIMATE评分及临床效用,以评估WSI衍生风险评分与分子通路、TIME表型及临床预后信息的关系。
该研究论文发表在《Clinical and Translational Medicine》。
**主要关键方法**
研究人员采用弱监督多任务MIL框架SparseAGE-MTL,使用共享投影-拓扑编码器(包括特征投影网络和空间-特征拓扑聚合器)及任务特异性注意力池化、残差任务适配器和终点特异性输出头。特征提取使用七种预训练特征提取器(CONCH、Virchow2、H-optimus-1、UNI2-h、PLIP、UNI、ResNet-50),在TCGA队列(954例)中进行基准测试,并与18种比较模型(包括Mamba-MIL、TKA-MIL、WiKG、RRT-MIL、MHIM-MIL、HMKGN、ACMIL、Patch-GCN、Trans-MIL、DTFD-MIL、HIGT、CLAM、DS-MIL、CAMIL、AB-MIL、SCMIL、IB-MIL)进行配对比较。外部验证使用来自南方医科大学珠江医院(SMUZH)的948例TMA和来自四川省医学科学院·四川省人民医院(SAMSPH)的324例WSI。空间转录组分析使用公开的10x Visium数据,注意力图与空间转录组斑点共配准。批量转录组免疫浸润分析使用TIMER、CIBERSORT、QUANTISEQ、MCP-counter、xCell和EPIC六种算法。
**研究结果**
**3.1 SparseAGE-MTL在特征空间和MIL架构间显示稳定的竞争性基准性能**
通过覆盖七种特征提取器、11种终点级指标和19种模型的系统基准测试,SparseAGE-MTL在77个特征-终点-指标设置中获得最低总体平均排名(2.11),与非多任务对照SparseAGE-MIL(2.16)共同构成排名最高的SparseAGE家族。在CONCH特征空间中,SparseAGE-MTL对LUAD/LUSC亚型分类达到93.73%准确率、98.19% AUC和93.08% F1分数;LUAD分期预测准确率55.68%、AUC 69.19%;LUSC分期预测准确率54.11%、AUC 62.10%;LUAD和LUSC生存预测C-index分别为64.22%和59.38%。配对折叠水平差异分析显示,SparseAGE-MTL与最佳非SparseAGE基线之间的差异总体接近零或略高于零,支持其跨特征和跨终点的排名稳定性。
**3.2 空间-特征拓扑聚合器诊断与注意力集中度分析**
在ResNet-50、PLIP、UNI和CONCH四种特征空间中,经空间-特征拓扑聚合器更新后的补丁嵌入在t-SNE可视化中显示出肿瘤与非肿瘤/正常补丁更清晰的分离趋势,表明聚合器可改变补丁级嵌入分布。K敏感性分析显示,在CONCH和PLIP特征空间中,准确率、AUC、F1分数等指标随K值变化波动较小,单尺度诊断设置中K=6在多数指标上达到最优或接近最优性能。拓扑空间足迹分析表明,学习到的Top-K邻域不仅限于网格相邻补丁,而是包含大量长距离连接(距离≥5的邻居占较大比例),表明聚合器能够建立跨局部区域的补丁级连接。注意力集中度分析显示,SparseAGE-MTL的注意力权重高度集中在少数补丁上,高注意力区域与原始H&E图像中的肿瘤形态和肿瘤-基质界面结构存在空间对应。
**3.3 基于基准性能和拓扑诊断的默认特征空间选择**
特征提取器贡献分析显示,CONCH在所有模型和终点级指标中具有最高全局平均得分,其次为Virchow2、H-optimus-1和UNI2-h。端点归一化敏感性分析进一步确认CONCH和Virchow2在SparseAGE-MTL和SparseAGE-MIL中均处于领先地位。方差贡献分析显示,MIL架构解释了端点归一化基准性能变异的最大部分,其次为特征提取器。综合跨模型基准性能、端点归一化特征提取器敏感性、拓扑诊断和K敏感性,研究人员选择CONCH作为后续泛化研究、注意力分析和生物学解释的默认特征空间。
**3.4 SparseAGE-MTL在NSCLC任务中的跨队列验证**
**3.4.1 跨机构和切片类型的亚型分类**
以TCGA-NSCLC为源域,CONCH为默认特征空间,SparseAGE-MTL在内部验证集保持接近0.99的AUC,在外部SMUZH TMA队列和SAMSPH WSI队列中AUC分别为约0.91和0.82。外部校准曲线偏离完美校准线,Brier分数和期望校准误差(ECE)分别为约0.25和0.17,提示模型预测概率不宜直接作为校准诊断概率,但亚型区分度在跨中心和跨切片类型域偏移下仍可接受。
**3.4.2 外部分期预测显示LUAD和LUSC中有限的区分度**
LUAD和LUSC病理分期预测的外部验证显示,混淆矩阵和预测置信度分布表明错误预测通常伴随较低或更分散的最大类概率。在SMUZH队列中,小提琴图显示不同病理分期患者间预测概率存在可观察差异,但校准分析显示训练集校准较稳定,而验证和外部队列存在队列依赖性变异。总体而言,SparseAGE-MTL可提供形态学衍生的分期概率估计以辅助表征肿瘤形态进展模式,但其输出需与标准病理TNM分期信息结合解读。
**3.4.3 LUAD和LUSC生存风险分层的外部验证**
在离散时间生存预测任务中,SparseAGE-MTL基于H&E切片提供LUAD和LUSC的生存风险分层。在TCGA训练队列中,中位风险评分定义的高风险与低风险组在两种亚型中均显示显著的OS差异(LUAD HR约1.9,C-index=0.676;LUSC HR约2.5,C-index=0.703)。在SMUZH TMA和SAMSPH WSI外部队列中,相同阈值定义的高风险组也显示更差生存结局的趋势。校准曲线显示预测生存概率总体上反映观察生存估计的变化方向,但部分外部队列-时间点组合存在偏差,尤其当事件数有限时。
**3.5 NSCLC中转录组结构与模型注意力的空间耦合**
**3.5.1 Visium ST揭示的细胞类型和功能状态空间景观**
利用10x Visium数据,通过标志基因评分在斑点分辨率下进行细胞亚型注释,并映射至匹配的H&E切片。以LUSC样本为例,肿瘤细胞形成大片连续空间分布,间质中穿插浆细胞、肺泡2型细胞、胸膜下成纤维细胞等亚型,形成高度免疫和基质元素浸润的肿瘤微环境。细胞亚型整合为六种主要细胞谱系:肺上皮肿瘤细胞、非恶性肺上皮细胞、B细胞、成纤维细胞和平滑肌细胞、非B免疫细胞及内皮细胞。功能状态注释显示转移和EMT信号在肿瘤主体内高度重叠,侵袭和缺氧信号亦被检测到。通过SFTPC表达验证细胞注释可靠性,UMAP显示六种谱系形成相对分离的聚类。以肺上皮肿瘤细胞为中心,将样本分为肿瘤核心、250μm肿瘤周围区域和远端背景组织,发现250μm区域形成连续环状包绕肿瘤岛,其中C1QC和COL1A1显著富集,且B细胞、非B免疫细胞、成纤维细胞和平滑肌细胞比例升高,表明该区域构成区别于肿瘤核心和远端组织的免疫-基质界面微环境。
**3.5.2 SparseAGE-MTL注意力热点与空间微环境特征的对齐**
H&E WSI与匹配Visium切片配准后,SparseAGE-MTL注意力权重在LUSC组织切片中呈非均匀空间分布。高注意力区域更频繁出现在肿瘤密集区域和特定肿瘤-基质/免疫界面区域,与巨噬细胞相关和成纤维细胞相关信号在空间上接近。功能注释显示高注意力区域与侵袭、EMT、转移、缺氧和炎症相关特征空间对应。斑点级定量验证显示,在3615个有效映射斑点中,肿瘤密集区域归一化注意力中位数最高(0.341),肿瘤-基质/免疫界面区域次之(0.302),其他组织和基质/免疫丰富区域较低。前10%注意力斑点富集于肿瘤密集区域(富集比1.89,FDR q=0.00088)和肿瘤-基质/免疫界面区域(富集比1.21,FDR q=0.00088),而基质/免疫丰富区域未富集。注意力分数与细胞周期评分、DNA修复评分和增殖性巨噬细胞相关评分呈正相关,与B细胞和浆细胞相关特征呈负相关。
**3.5.3 LUSC亚群组成驱动肿瘤微环境中注意力热点的差异**
在LUSC肿瘤区域内,高优先级与低优先级肿瘤斑点间存在系统性转录组差异。高注意力区域中,与应激反应、细胞存活、信号转导调节和肿瘤进展相关的基因(如HSPA6、PROX1、CITED4、CIART、CD55)显著上调,而细胞粘附、轴突导向和代谢稳态维持相关基因(如SEMA6C、LMO4、MEGF6、HIGD家族)下调。功能富集分析显示,高优先级肿瘤斑点中上调基因富集于缺氧反应、氧水平下降反应、细胞应激反应、上皮细胞增殖正调控和内皮细胞增殖正调控等GO生物学过程;KEGG通路富集包括MAPK信号通路、内质网蛋白质加工、HIF-1信号通路、AMPK信号通路等。GSEA进一步确认高优先级肿瘤斑点中程序性细胞死亡调控、凋亡过程、细胞应激反应、非生物刺激反应和氧水平反应等模块正向富集。这些结果支持高注意力LUSC区域与缺氧相关应激适应和生存导向通路活性相关。
**3.6 高风险与低风险组间的分子和免疫微环境差异**
**3.6.1 高风险与低风险组间差异表达基因的鉴定**
在LUAD和LUSC队列中,高风险组呈现与低风险组不同的表达谱。LUAD高风险组中,与氧化还原稳态、铁代谢和细胞应激相关的基因(如NQO1、OSGIN1、HMOX1、FTH1、FTL)显著上调,而神经元分化或良性代谢状态相关基因(如NEUROD1、NNAT、MYBPC1)下调。LUSC高风险组中,与基底样上皮重塑、屏障功能和炎症反应相关的基因(如MATN4、CRABP1、ECEL1、FOXC2)上调,某些受体、转运体和代谢酶基因下调。
**3.6.2 基因本体富集分析**
GO富集分析显示,LUAD高风险组上调基因富集于NADP代谢过程、铁死亡及其调控、戊糖磷酸途径等代谢相关生物学过程,以及染色质结构、溶酶体/自噬体等细胞组分,氧化还原酶活性、铁离子/胆汁酸结合等分子功能。LUSC高风险组上调基因富集于激素代谢、营养反应调控、胆碱能突触传递和神经/离子通道相关过程,细胞组分富集于突触膜、离子通道复合物和神经递质受体复合物,分子功能偏向谷氨酸受体结合、离子通道活性和内肽酶抑制剂活性。
**3.6.3 免疫细胞浸润谱比较**
使用六种算法(TIMER、CIBERSORT、QUANTISEQ、MCP-counter、xCell、EPIC)评估免疫/基质细胞浸润评分,经FDR校正后,LUAD中48个细胞类型×算法组合达到FDR显著性,其中23个在高风险组中升高、25个降低;LUSC中51个组合达到显著性,其中13个升高、38个降低。代表性结果包括:LUAD高风险组中内皮细胞、CD8+ T细胞、静息NK细胞、M2型巨噬细胞和中性粒细胞评分降低,而浆细胞和癌症相关成纤维细胞(CAF)评分升高;LUSC高风险组中内皮细胞、单核细胞、巨噬细胞、中性粒细胞、CD8+ T细胞和NK细胞评分广泛降低,而未分类细胞、Th1细胞和浆细胞评分升高。这些结果提示模型衍生风险状态与亚型特异性和算法依赖性的免疫/基质浸润差异相关。
**3.6.4 冷/热肿瘤表型分布**
ESTIMATE分析显示,LUAD高风险组基质评分、免疫评分和ESTIMATE总分显著低于低风险组,肿瘤纯度显著升高,符合“冷肿瘤”特征。LUSC中趋势更显著,高风险组基质、免疫和ESTIMATE评分普遍较低,肿瘤纯度较高(所有p<0.0001),而低风险组更接近“热肿瘤”特征,与空间转录组数据中高风险LUSC缺乏有效抗肿瘤免疫但富集缺氧和应激信号一致。
**3.7 SparseAGE-MTL风险评分的临床增量价值**
多变量Cox分析显示,在调整年龄、性别、病理亚型和病理分期后,标准化的SparseAGE-MTL风险评分仍与OS独立相关(每1个标准差增加,HR=1.70,95% CI: 1.43–2.02)。在外部合并验证队列中,临床模型、SparseAGE-MTL模型和联合模型的C-index分别约为0.620、0.666和0.672,联合模型略高。校准曲线显示联合模型对1年、3年和5年生存概率预测具有可接受的校准模式,但不同时间点仍存在偏差。决策曲线分析显示,联合模型在选定阈值概率范围内具有相对较高的净获益,提示SparseAGE-MTL风险评分可为临床预后模型提供适度的增量信息。
**总结讨论与结论**
讨论部分指出,SparseAGE-MTL通过共享投影-拓扑编码器结合任务特异性注意力池化、残差任务适配器和终点特异性输出头,实现了亚型分类、分期预测和生存风险估计的联合多任务学习。其跨队列泛化能力可能有助于解决数字病理研究中的外部验证不足问题。注意力热点与肿瘤-基质/免疫界面及EMT、转移、缺氧等功能模块高度重叠,提示模型关注区域指向高度侵袭和适应性的高风险LUSC微环境。批量转录组层面,高风险组显示恶性进展相关通路激活,免疫微环境呈现“冷肿瘤”或“免疫排斥”特征。临床效用分析显示风险评分在临床变量基础上提供适度增量信息。但研究存在局限性:外部验证主要基于中国手术切除病例,未验证晚期、系统治疗队列和活检标本;空间转录组验证样本量有限;校准分析显示预测概率未在队列间一致校准。未来需前瞻性、多国验证及治疗注释队列评估。
研究结论翻译:本研究开发了SparseAGE-MTL,一个用于NSCLC H&E WSI的弱监督联合多任务MIL框架,可同时进行亚型分类、病理分期预测和生存风险估计。基准比较显示其在特征空间和终点间具有稳定的竞争性性能,并部分泛化至外部WSI和TMA队列。拓扑诊断、空间转录组共配准和批量转录组/TIME分析共同表明,模型注意力和WSI衍生风险分层与肿瘤-基质/免疫界面、恶性通路激活及亚型特异性免疫/基质浸润差异相关。临床效用分析进一步提示SparseAGE-MTL风险评分可能为临床预后模型提供适度增量信息。总体而言,该框架为构建具有空间和生物学可解释性的病理AI模型提供了方法学基础,但临床部署仍需在前瞻性验证和治疗反应队列中进一步评估。