
-
生物通官微
陪你抓住生命科技
跳动的脉搏
经过内部验证的机器学习模型利用多中心真实世界数据来识别哮喘及其表现型
《Scientific Reports》:Internally validated machine learning models identify asthma and its phenotypes using multicenter real-world data
【字体: 大 中 小 】 时间:2026年07月12日 来源:Scientific Reports 4.9
编辑推荐:
摘要哮喘具有显著的临床异质性,因此需要通过精确的表型分析来实现个性化治疗。本研究旨在利用常规收集的临床数据,开发并内部验证用于哮喘横向识别与表型分析的机器学习模型。研究整合了MIMIC-IV和OPCRD数据库中的数据,共纳入3,025例符合条件的患者(其中2,180例为哮喘患者,
哮喘具有显著的临床异质性,因此需要通过精确的表型分析来实现个性化治疗。本研究旨在利用常规收集的临床数据,开发并内部验证用于哮喘横向识别与表型分析的机器学习模型。研究整合了MIMIC-IV和OPCRD数据库中的数据,共纳入3,025例符合条件的患者(其中2,180例为哮喘患者,845例为非哮喘患者)。研究人员提取了30个基线变量,包括人口统计学特征、临床症状、生物标志物、环境暴露因素以及遗传史等信息。这些数据被按7:3的比例分为训练集(2,118例)和测试集(907例)。研究中采用了LASSO回归(带L1正则化处理)和随机森林模型。性能评估通过ROC曲线下面积来体现,而特征重要性则通过吉尼指数的平均下降幅度来判定。在测试集中,对于所有分析任务,LASSO模型得到的ROC曲线下面积均高于随机森林模型。具体而言,LASSO模型在整体哮喘分析中的AUC值为0.836,2型哮喘为0.782,过敏性哮喘为0.751,早发性哮喘为0.723。德隆检验显示,2型哮喘、过敏性哮喘以及早发性哮喘的AUC差异具有统计学意义(分别为P?<?0.001、P?=?0.045、P?=?0.026),而整体哮喘的差异则无统计学意义(P?=?0.101)。在λ.1se参数下,整体哮喘模型保留了9个预测因子,其中过敏史、家族哮喘史以及喘息频率是影响力最强的因素。在排除了相关生物标志物后,2型哮喘的识别依赖于支气管扩张剂反应性、家族哮喘史以及喘息频率;而早发性哮喘则主要通过与过敏史、当前年龄以及FeNO指标的负相关关系来判定。随机森林分析表明,年龄、FeNO、IgE以及肺功能指标是早发性哮喘的主要特征。总体来看,LASSO回归在哮喘表型分析方面表现优异且易于解释,在2型哮喘和早发性哮喘的分析中相比随机森林模型具有统计学上的优势。常规临床变量能够有效识别哮喘及其亚型,有望在电子病历系统中得到应用,不过仍需进一步的外部验证。