《Frontiers in Oncology》:Prediction of overall survival in primary lung adenocarcinoma using machine learning and deep learning: a cohort study in Latin America country cancer center
编辑推荐:
摘要
背景:肺腺癌是非小细胞肺癌中最常见的亚型,也是全球癌症相关死亡的主要原因之一。其显著的临床异质性导致患者结局多变且预后不良。本研究旨在开发并比较统计学、机器学习和深度学习模型,用于预测原发性肺腺癌患者的总生存期(OS)。
方法:这项回顾性队列研究
摘要
背景:肺腺癌是非小细胞肺癌中最常见的亚型,也是全球癌症相关死亡的主要原因之一。其显著的临床异质性导致患者结局多变且预后不良。本研究旨在开发并比较统计学、机器学习和深度学习模型,用于预测原发性肺腺癌患者的总生存期(OS)。
方法:这项回顾性队列研究纳入了原发性肺腺癌患者。在嵌套交叉验证框架内,使用折叠特异性链式方程多重插补处理缺失数据。预测因子选择和超参数调整在5个外层和3个内层折中进行,采用单变量Cox分析、弹性网络、基于XGBoost的重要性和临床标准。使用惩罚Cox回归、随机生存森林(RSF)、DeepSurv和DeepHit对总生存期进行建模。模型性能通过折叠外预测评估,使用一致性指数、时间依赖性AUC、校准度和综合布里尔分数(IBS)。敏感性分析包括按生物标志物状态对IV期患者进行倾向评分匹配的生存比较。
结果:队列包括254例患者,中位总生存期为12.8个月。随机生存森林表现最佳(Harrell C指数0.760;平均时间依赖性AUC 0.851;综合布里尔分数0.160),并清晰区分高危及低危组(p < 0.001)。临床分期、ECOG状态、系统性治疗、性别和年龄是最有影响力的预测因子。校准度可接受,但存在轻微的生存高估。探索性倾向评分匹配分析在IV期亚组中提示RSF具有最高的表观性能,但匹配样本量较小限制了确定性结论。
结论:在该队列中,机器学习模型显示出预测肺腺癌总生存期的潜力。RSF实现了最高的观察区分度,而惩罚Cox模型以较低复杂度表现出竞争性性能。这些发现提示RSF可能补充传统生存模型;然而,回顾性单中心设计、中等样本量、缺失数据以及缺乏外部验证限制了其普适性。
论文解读:
**研究背景与目的**
肺癌是全球最常见的恶性肿瘤之一,年新发病例约221万,五年死亡率约75%。在拉丁美洲和加勒比地区,肺癌是第三大确诊癌症,但却是癌症相关死亡的首要原因,每年导致约86,627例死亡。肺腺癌是非小细胞肺癌(NSCLC)中最常见的亚型,尤其在非吸烟者和女性中高发。传统生存分析工具如Kaplan-Meier法和Cox比例风险模型存在局限性:Kaplan-Meier法无法同时评估多个变量的影响,而Cox模型假设风险比例恒定且协变量与风险呈对数线性关系,这在真实临床数据中往往难以满足。此外,现有机器学习预测模型多基于白人或亚洲人群数据,缺乏拉丁美洲人群的验证。因此,研究人员利用拉丁美洲队列,开发并比较统计学、机器学习和深度学习模型,以预测原发性肺腺癌患者的总生存期(OS),评估其区分度、校准度和预测误差,并探索分子亚组间的生存差异。该论文发表在《Frontiers in Oncology》。
**主要技术方法**
研究纳入哥伦比亚国立癌症研究所2010年5月至2025年10月期间经组织病理学确诊的原发性肺腺癌患者,共254例。采用回顾性队列设计,在嵌套交叉验证框架内(5个外层、3个内层折)进行折叠特异性多重插补(MICE)处理缺失数据。预测因子筛选结合单变量Cox回归、弹性网络Cox、XGBoost重要性和临床标准。构建了惩罚Cox回归、随机生存森林(RSF)、DeepSurv和DeepHit四种模型,通过一致性指数(C-index)、时间依赖性AUC、综合布里尔分数(IBS)及校准度评估性能。对IV期患者按EGFR、ALK、PD-L1状态进行倾向评分匹配(PSM)作为敏感性分析。
**研究结果**
*数据选择*:最终分析队列包括254例患者,其中160例死亡(62.99%),94例删失(37.01%)。61.02%为IV期,女性占61.02%,大多数患者ECOG评分为0-1(64.56%)。EGFR突变阳性占29.66%,ALK重排阳性占13.39%,PD-L1表达<1%占48.03%。
*协变量选择*:共纳入14个候选协变量,包括年龄、性别、个人癌症史、肺癌家族史、肺部疾病史、基线ECOG状态、吸烟史、临床分期(TNM)、EGFR突变、ALK重排、PD-L1表达、姑息性系统性治疗、胸外治疗和转移情况。排除维持治疗和第二线姑息治疗等缺失率超过50%的变量。选择在每个训练分区独立进行,所选预测因子集可能因分区而异。
*生存模型性能*:RSF在所有区分度指标上表现最佳,Harrell C指数为0.760(95%CI 0.732-0.796),Uno C指数0.752,平均时间依赖性AUC 0.851,IBS 0.160。惩罚Cox模型区分度次之(C指数0.745),但校准度良好。DeepHit区分度最差(C指数0.522),预测误差最大(IBS 0.314)。DeepSurv区分度最低(C指数0.705),但IBS为0.192,显示区分度与预测误差之间的权衡。置换重要性分析显示,临床分期(TNM)、ECOG状态和姑息性系统性治疗对RSF风险预测影响最大。RSF的校准斜率在12、24和36个月分别为1.47、1.52和1.33,提示预测生存概率相对观测结果有一定压缩。
*生存分析*:Kaplan-Meier估计一年、两年、三年生存率分别为53.2%、41.0%和30.8%,中位生存期12.8个月。RSF预测的生存概率与Kaplan-Meier估计绝对差异在0.028-0.038之间。临床分期、ECOG状态和性别均显示显著生存差异(log-rank p<0.05)。依据RSF风险评分分组,高危组(n=107)生存曲线显著差于低危组(n=147)(log-rank p<0.001),表明RSF风险评分的强区分能力。
*敏感性分析*:在IV期患者中,PSM成功应用于EGFR、ALK和PD-L1亚组,匹配后协变量均衡(平均SMD分别为0.0751、0.0670和0.0459)。EGFR阳性患者中位生存期长于阴性患者(13.74 vs 5.50个月),12个月生存率绝对差异24.9个百分点(95%CI 2.5-47.4,p=0.029),12个月限制平均生存时间(RMST)差异2.54个月(95%CI 0.48-4.59,p=0.016)。ALK和PD-L1亚组因匹配样本量小、置信区间宽,未显示明确差异。在匹配数据集中,RSF的C指数最高(0.7718),Cox模型紧随其后(0.7617),差异微小。
**讨论与结论**
本研究表明,在拉丁美洲肺腺癌队列中,机器学习模型特别是RSF在预测总生存期方面具有潜力,其区分度优于传统Cox模型和深度学习模型。RSF识别的关键预测因子与文献报道一致。折叠特异性多重插补和嵌套交叉验证减少了信息泄漏,提高了模型可靠性。DeepHit性能较差可能与样本量小、缺失数据及交叉验证内有效训练集缩小有关。校准分析提示RSF能保持风险排序,但预测概率与观测概率的绝对一致性仍有改善空间。EGFR阳性可能带来早期生存优势,但后期减弱,结果仅为探索性。研究局限性包括回顾性单中心设计、样本量中等、缺失数据、缺乏外部验证及治疗时间异质性。结论指出,机器学习方法可补充传统生存模型,但在用于临床预后分层前,需在更大、独立且优选前瞻性多中心队列中验证。