基于机器学习的分诊模型的开发与验证:整合全身炎症、营养、凝血和肿瘤标志物参数用于识别肺癌基线远处转移

《Frontiers in Oncology》:Development and validation of a machine-learning-based triage model incorporating systemic inflammatory, nutritional, coagulation, and tumor marker parameters for identifying baseline distant metastasis in lung cancer

【字体: 时间:2026年09月09日 来源:Frontiers in Oncology 3.4

编辑推荐:

  目的:本研究旨在开发并验证一种基于机器学习的模型,通过整合多维治疗前指标——包括全身炎症、肿瘤、凝血及营养参数——来识别肺癌基线远处转移。 方法:这项回顾性病例对照研究纳入了2023年11月至2024年10月在广州市第一人民医院确诊的

  


**目的:** 本研究旨在开发并验证一种基于机器学习的模型,通过整合多维治疗前指标——包括全身炎症、肿瘤、凝血及营养参数——来识别肺癌基线远处转移。

**方法:** 这项回顾性病例对照研究纳入了2023年11月至2024年10月在广州市第一人民医院确诊的408例未经治疗的新发肺癌患者,其中202例伴有远处转移,206例无远处转移。共收集18项外周血生物标志物(涵盖全身炎症、肿瘤负荷、凝血及营养状态)以及6项人口学和临床特征作为候选预测因子。在初步单因素逻辑回归筛选后,在训练集内实施嵌套5折交叉验证,每一折中独立联合应用三种互补的特征选择算法(LASSO、RFE和Boruta)以获得稳健的预测特征集。基于所选特征,在每一折内开发九种机器学习分类器,并通过五折平均AUC进行算法比较和最优分类器选择。模型性能通过受试者工作特征曲线下面积(AUC)、准确率、阳性预测值、阴性预测值、F1分数及95%置信区间进行评估。根据总体性能选择最优模型;其校准通过校准曲线和Hosmer–Lemeshow拟合优度检验评估,临床净收益通过决策曲线和临床影响曲线量化。为便于床旁风险分层,基于最终模型构建列线图以实现个体化概率估计。进一步使用SHAP值检验特征重要性和模型可解释性。

**结果:** AdaBoost算法在识别肺癌基线远处转移方面表现出最佳性能,测试集AUC为0.840(95% CI:0.757–0.912),因此被选为最终模型。严格的嵌套5折交叉验证提供了无偏的AUC估计值0.82,与测试AUC 0.84高度一致,进一步证实了模型的稳定性。学习曲线、决策曲线分析和校准曲线共同证实了其良好的泛化能力、临床净收益和校准准确性,在广泛的阈值概率范围内均具有正向净收益。SHAP分析确定CEA、SII、吸烟史、CYFRA21-1、D-二聚体、纤维蛋白原、AGR、组织学类型、SIRI和NSE为模型风险分层的前10位贡献因素——这一排序与决策树模型的排序高度一致——强调了它们的生物学和临床相关性。

**结论:** 本研究开发并内部验证了一种基于AdaBoost的模型,用于肺癌治疗前基线远处转移的识别。作为整合常规实验室参数的低成本、非侵入性工具,该模型在早期风险分层方面显示出初步前景,但在临床实施前仍需外部验证。
### 论文解读文章

#### 研究背景与意义

肺癌是全球癌症相关发病和死亡的首要原因,2022年全球统计显示其占新发恶性肿瘤病例的12.34%和癌症相关死亡的21.36%。临床实践中约75%的肺癌患者在初诊时已存在转移,常见转移部位包括脑、骨、肝和肾上腺。局部复发和远处转移是肺癌患者死亡风险显著增加的主要因素,超过90%的肿瘤相关死亡归因于转移性疾病而非原发肿瘤本身。

肺癌转移是一个涉及全身炎症、免疫营养、凝血–纤溶失调及肿瘤衍生标志物的多因素过程。慢性炎症通过分泌细胞因子和趋化因子重塑肿瘤微环境,促进上皮–间质转化(EMT)和肿瘤细胞侵袭。中性粒细胞、淋巴细胞、血小板和单核细胞等炎症细胞参与肿瘤播散和转移。基于这些细胞成分的多种炎症指数,如中性粒细胞与淋巴细胞比值(NLR)、血小板与淋巴细胞比值(PLR)、淋巴细胞与单核细胞比值(LMR)、系统性免疫炎症指数(SII)和系统性炎症反应指数(SIRI),已在多种实体瘤中得到验证。营养不良进一步损害免疫功能并促进肿瘤增殖,白蛋白与球蛋白比值(AGR)和预后营养指数(PNI)等复合营养–炎症指标在晚期非小细胞肺癌中被证实为独立预后因素。凝血功能异常也通过促进血管生成、调节生长因子和抑制自然杀伤细胞活性等机制参与肿瘤进展和转移,纤维蛋白原(FIB)和D-二聚体(D-D)是高凝状态和继发性纤溶的关键生物标志物。此外,CEA、CYFRA21-1、NSE等常规血清肿瘤标志物与肺癌肿瘤负荷及转移播散显著相关。

然而,现有研究大多聚焦于晚期肺癌的疗效评估或预后分析,缺乏在初始诊断时利用上述指标进行治疗前风险分层的工具。虽然影像组学或基因组学特征结合机器学习算法在预测肺腺癌肺内转移或非小细胞肺癌淋巴结转移中取得了较好性能(AUC>0.81),但这些方法依赖影像学或有创组织/液体活检,受制于高成本、辐射暴露、采样频率受限或较高的技术壁垒,难以广泛用于早期转移风险预警。因此,开发一种低成本、非侵入性、整合常规实验室指标的分诊工具,对基线转移风险进行分层,有助于个体化分期检查并优化资源配置。本研究正是基于这一临床需求,利用临床可获取、可重复且低成本的实验室指标,基于九种机器学习算法构建诊断分诊框架,并采用SHAP方法识别关键特征及其贡献方向。

该研究发表于《Frontiers in Oncology》。

#### 主要关键技术方法

研究人员采用回顾性病例对照设计,纳入广州市第一人民医院2023年11月至2024年10月间408例初治肺癌患者(转移组202例,非转移组206例),按7:3随机分为训练集(n=285)和测试集(n=123)。在训练集内实施嵌套5折交叉验证,每一折中独立执行单因素逻辑回归筛选(P<0.05)后,并行应用LASSO回归、Boruta算法和递归特征消除(RFE)三种特征选择方法,仅保留三种算法共同选中的特征。基于所选特征构建九种机器学习分类器(决策树、K近邻、LightGBM、逻辑回归、随机森林、支持向量机、神经网络、AdaBoost、CatBoost),采用网格搜索结合内部3折交叉验证进行超参数调优,以五折平均AUC作为算法比较指标。最终模型在锁定后在测试集上进行单次评估,并构建列线图、校准曲线、决策曲线及SHAP分析。

#### 研究结果

##### 基线特征和实验室参数比较

转移组与非转移组比较显示,转移组吸烟史比例显著更高(64.8% vs 35.2%,P<0.001),组织学类型分布存在显著差异(P=0.001)。凝血标志物(D-二聚体、纤维蛋白原、血小板计数)、肿瘤标志物(CEA、CYFRA21-1、NSE)及全身炎症指数(SII、NLR、PLR、SIRI)在转移组显著升高(P<0.001);而免疫营养指标如LMR、ALB、AGR、PNI和HALP显著降低(P<0.001)。提示远处转移患者表现出更明显的全身炎症和高凝状态、更差的营养和免疫状态以及更高的肿瘤负荷。

##### 单因素逻辑回归分析

单因素逻辑回归识别出多个与远处转移显著相关的变量,包括吸烟史(OR=7.314)、小细胞肺癌组织学类型(OR=3.193)、SIRI(OR=2.049)、NLR、PLR、CEA、CYFRA21-1、NSE、FIB、D-D、ALB、AGR和PNI等(P<0.05)。性别、年龄、饮酒史和BMI与转移状态无显著关联。

##### 特征选择

在嵌套5折交叉验证框架内,每一折中使用三种互补算法(LASSO、Boruta、RFE)并行筛选,仅保留三种方法共同选中的特征。结果在五折中一致识别出10个核心预测因子:吸烟史、组织学类型、D-二聚体、纤维蛋白原、AGR、CEA、CYFRA21-1、NSE、SII和SIRI。

##### 多重共线性评估

Pearson相关分析显示SII与SIRI呈强正相关,AGR与其他变量多呈负相关。方差膨胀因子(VIF)全部低于2.5,表明无显著多重共线性,因此保留全部10个特征进入最终模型。

##### 机器学习模型性能比较

在独立测试集上,AdaBoost实现了最佳总体性能:AUC为0.840,准确率0.715,灵敏度71.7%,特异度71.4%,约登指数0.431。随机森林次之(AUC=0.813),神经网络(AUC=0.782)和KNN(AUC=0.718)表现中等,而逻辑回归(AUC=0.716)、SVM(AUC=0.715)和决策树(AUC=0.667)区分能力有限。LightGBM测试AUC降至0.600,训练–测试差距达0.386,提示严重过拟合;CatBoost虽特异度达97.0%但灵敏度仅13.3%,预测严重失衡,二者均不适合临床应用。DeLong检验证实AdaBoost显著优于CatBoost、KNN、LR、SVM和LGBM,而与RF、NN和DT无显著差异。

##### AdaBoost模型性能

训练集和测试集的校准曲线均显示预测概率与实际结果高度一致,Hosmer–Lemeshow检验P值分别为0.053和0.122,平均绝对误差分别为0.048和0.057,表明校准良好。决策曲线分析显示模型在阈值概率0.12–0.90(训练集)和0.13–0.95(测试集)范围内产生显著净临床收益。基于最终AdaBoost模型构建的列线图可实现个体化风险评分。混淆矩阵显示训练集灵敏度94%、特异度82%,测试集灵敏度72%、特异度71%,性能均衡。临床影响曲线表明在阈值概率超过60%时,模型识别的高风险人数与实际转移人数接近。

##### 特征重要性和模型可解释性

AdaBoost特征重要性排序和SHAP分析均确认吸烟史、CEA、CYFRA21-1、D-二聚体和NSE为贡献最大的预测因子。SHAP摘要图显示吸烟史、CEA、CYFRA21-1、D-二聚体和NSE对模型预测具有最大的正向贡献,其中吸烟史影响最强。个体层面SHAP瀑布图示例中,高CEA水平贡献+0.187,而SII贡献–0.147,最终估计概率为0.688,表明该患者基线转移风险显著升高。

#### 讨论与结论

讨论部分指出,SII和SIRI作为整合关键免疫细胞群的新型指标,以往研究多集中于治疗后的预后价值,本研究首次将其纳入治疗前转移风险预测模型并证实其与基线远处转移的关联。D-二聚体和纤维蛋白原的升高反映高凝状态和继发性纤溶,与转移负荷相关。AGR降低提示营养不良和慢性炎症状态,可能通过损害宿主抗肿瘤免疫促进转移。吸烟史和组织学类型(尤其是小细胞肺癌和腺癌)是肺癌转移的内在行为决定因素。

与现有预测模型相比,本模型整合全身炎症、肿瘤标志物、凝血功能和营养状态四个病理性维度,独立测试集AUC达0.840,优于既往单一组织学或单一转移部位的模型(如D-二聚体+纤维蛋白原AUC 0.802,骨转移多标志物AUC 0.955,Qi等C-index 0.710–0.714,Du等测试AUC 0.810)。亚组分析排除小细胞肺癌后测试AUC为0.803,排除组织学类型和吸烟史后AUC仍保持在0.824–0.829,证明模型性能主要由整合的血清生物标志物驱动而非组织学亚型。

研究结论:本研究开发并内部验证了一种基于AdaBoost算法的肺癌基线远处转移治疗前风险分层模型。该模型整合了反映全身炎症、凝血状态、肿瘤负荷和营养状况的常规实验室指标,结合严谨的特征工程和比较机器学习分析,显示出良好的判别能力和满意的校准性能。SHAP可解释性分析增强了模型透明度,有助于将算法输出转化为临床可解释的风险估计。作为一种基于常规实验室检查的低成本、非侵入
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号