低维数据中临床预测模型的变量选择——一项比较传统回归与机器学习方法的仿真研究

《BMC Medical Research Methodology》:Variable selection for clinical prediction models in low-dimensional data - a simulation study comparing traditional regression and machine learning methods

【字体: 时间:2026年07月08日 来源:BMC Medical Research Methodology 3.7

编辑推荐:

  目的:存在多种用于开发临床预测模型 (CPM) 和进行变量选择的方法。本研究的目的是设计一个公平的仿真研究方案,并探究不同方法在低维数据情境下预测连续结局时的特性、优势与不足。 方法:在本仿真研究中,研究人员对传统(采用逐步选择的线性回归)和机器学习(采用弹

  
目的:存在多种用于开发临床预测模型 (CPM) 和进行变量选择的方法。本研究的目的是设计一个公平的仿真研究方案,并探究不同方法在低维数据情境下预测连续结局时的特性、优势与不足。
方法:在本仿真研究中,研究人员对传统(采用逐步选择的线性回归)和机器学习(采用弹性网络 (elastic net) 的正则化回归、梯度提升 (gradient boosting)、随机森林 (random forest))的变量选择策略进行了中性比较,以推导 CPM。生成的数据集共包含 15 个变量,其中 8 个为预测变量。四种复杂性递增的数据与结局生成机制产生了生物医学中典型的数据结构,涵盖了线性关联,并逐步将非线性和非加性元素引入数据结构。
结果:所有方法的性能通常随着样本量增加和数据噪声减少而改善。使用回归模型和以树为基学习器的梯度提升 (gradient boosting) 以及弹性网络正则化回归 (elastic net) 几乎包含了所有变量(即预测变量和非预测变量),尤其是在样本量增加时。在大多数场景中,采用逐步选择的线性回归模型 (LMSS) 在正确纳入预测变量和排除非预测变量之间表现出最佳的权衡,即使连续预测变量的函数形式偏离线性时也是如此。在更复杂的数据中,使用 Boruta 或 Hapfelmeier 方法进行随机森林 (random forest) 变量选择的表现与 LMSS 相似。
结论:样本量必须足够大,以便这些方法能够可靠地识别预测变量,并确保所开发的 CPM 准确且校准良好。LMSS 显示出良好的特性,而采用 Boruta 或 Hapfelmeier 方法的随机森林 (random forest) 是假设预测变量与结局之间存在复杂关联时的合适替代方案。
**研究背景与意义**

临床预测模型 (CPM) 旨在提供个体未来发生特定事件(预后)或当前存在特定疾病或状况(诊断)的风险或概率。在循证医学时代,CPM 的数据驱动支持可被视为外部证据体的一部分,应充分整合到医疗决策中。开发 CPM 时,研究者常面临众多候选预测变量。纳入无关的噪声变量或错误排除相关预测变量会严重影响 CPM 的准确性和可靠性,即使在低维数据中,随着候选预测变量数量增加或样本量减少,过拟合风险也会增加。变量识别是开发 CPM 的关键环节,不仅涉及选择相关变量,模型选择也至关重要。一方面,传统的线性和广义线性回归模型在生物统计学中已证明其价值,可与逐步选择等变量选择策略结合使用。另一方面,具有内在变量选择功能的机器学习 (ML) 算法(如随机森林 (random forest) 或梯度提升 (gradient boosting))是应对这些任务的替代方案。两种方法各有优劣。基于回归的模型易于理解和解释,但要求数据满足某些假设(如预测变量与结局呈线性关系)。机器学习模型则旨在处理复杂的(例如非线性或非加性)关系,并能处理大量候选变量。为了在低维数据集上开发一个理想情况下包含相关预测变量并排除无关变量的 CPM,有多种适用方法可用。这就引出了方法选择的问题。为了给实证研究者提供关于方法优缺点的指导,本研究旨在对不同的传统(采用逐步选择的线性回归)和现代机器学习变量选择策略(采用弹性网络 (elastic net) 的正则化回归、随机森林 (random forest)、梯度提升 (gradient boosting))进行中性比较研究,以开发针对连续结局的 CPM。

**主要研究方法**

研究人员设计了一个公平的仿真研究,生成了包含 15 个变量的数据集(8个预测变量,7个非预测变量),并设置了四种复杂性递增的数据与结局生成机制 (DGM/OGM),涵盖了从纯线性关系到引入非线性、非加性元素及交互作用的典型生物医学数据结构。样本量(n ∈ {100, 250, 500, 1000})和结局的噪声水平(通过调整误差项方差实现解释变异 R2 ∈ {0.3, 0.5, 0.8})被系统改变,构成48个场景,每个场景模拟500次。比较的方法包括:线性回归结合逐步选择 (LMSS)、弹性网络正则化回归 (ENET)、多变量分数多项式 (MFP, 作为基准方法)、基于回归模型的梯度提升 (GBM)、基于决策树的梯度提升 (GBT)、结合Boruta方法的随机森林 (RFB) 和结合Hapfelmeier方法的随机森林 (RFH)。评估指标聚焦于变量选择性能(如变量纳入频率、真纳入频率 (TIF)、真排除频率 (TEF)、模型大小、与真实变量重要性排名的Kendall's τ一致性)和预测性能(在包含10万个观测的测试集上计算均方根预测误差 (RMSPE) 和校准斜率)。此外,还进行了模型大小限制为最多4个变量的分析,并拟合了仅包含真实预测变量的“先知”模型作为参照。

**研究结果**

**1. 变量选择性能**
在所有模拟的500次重复中,共观察到70次方法失败,均发生在最小样本量(n=100)场景,此时采用仅包含关键预测变量x5的回退模型。
* **纳入-排除平衡**:在仅存在线性关联的设置A中,LMSS在变量选择性能上优于其他方法。在包含非线性和更复杂相关结构的设置B、C和D中,LMSS在正确纳入预测变量和排除非预测变量之间仍表现出良好的权衡,与RFB和RFH表现相当。ENET、GBM和GBT在所有场景中表现最差,倾向于纳入几乎所有变量,显示出在本研究数据情境下变量选择能力有限。
* **变量重要性排序一致性**:在较简单的设置A和B中,LMSS产生的变量重要性排名与真实排名(由ΔR2衡量)一致性最高(Kendall's τ最大),其次是ENET和GBM。在更复杂的设置C和D中,回归方法的一致性下降,被RFB和RFH超越。
* **具体变量选择模式**:最重要的预测变量x5几乎总是被所有方法正确选择(除n=100外)。具有二次效应且在设置C/D中与一个非预测变量x13存在三次相关的预测变量x3,被识别的频率较低,尤其是被LMSS在设置C和D中识别时。由于LMSS、ENET和GBM无法建模x3的二次效应函数,它们经常在设置C和D中选择与x3存在强二次相关的非预测变量x13,从而部分捕获了x3的效应。在包含交互作用的设置D中,交互变量x11被基于回归的方法选择的频率较低,而参与交互的弱二元预测变量x8被RFB和RFH更可靠地识别。

**2. 预测性能**
* **预测准确性 (RMSPE)**:在所有模拟场景中,真实先知模型 (TOM) 的预测最准确。预测性能随着噪声减少(R2增加)和样本量增加而改善。在仅存在线性效应的设置A中,基于回归的方法(LMSS、ENET、GBM)的预测误差最低。在更复杂的设置C和D中,对于小样本量(n ≤ 250),基于回归的方法(尤其是ENET和GBM)表现最佳;而RFB、RFH和GBT的预测准确性随着样本量增加改善最明显。
* **模型校准**:校准斜率的中位数随着样本量增加而趋近于理想值1,但存在方法间差异。LMSS的校准斜率中位数小于1,表明预测过于极端;RFB和RFH的校准斜率中位数大于1,表明预测向均值收缩过度,在低噪声数据中尤为明显。ENET、GBM和GBT由于设计上采用了收缩,获得了最佳的校准斜率中位数,但GBT的校准斜率变异性较高。
* **大小限制模型**:当限制模型最多包含4个变量时,在设置A和B中,其性能与无限制模型相似。在设置C和D中,大小限制的LMSS、ENET和GBM的真纳入频率 (TIF) 仅达到约80%,因为它们经常纳入非预测变量x13而非预测变量x3。其RMSPE略高于无限制模型,校准模式也类似。

**3. 综合排名与实例应用**
综合变量选择权衡、所选变量数量、Kendall's τ、RMSPE和校准斜率五个性能指标的排名显示:在设置A中,LMSS是表现最佳的方法;在更复杂的设置C和D中,RFB在所有场景中名列前茅(除设置C中n=1000外),并在设置B中进入前三。在应用于预测肝移植患者术中失血量的真实数据集(n=779)时,所有方法都选择了评估肝硬化预后的Child-Pugh评分、测量凝血时间的国际标准化比值 (INR)、指示慢性肝病严重程度的MELD评分、血小板浓度和再移植指标。部分凝血活酶时间 (PTT) 和供受体体重比仅被基于树的方法选择。冷缺血时间仅被GBT和MFP选择,且MFP估计其与失血量存在非线性的关联形式(幂次p1=0, p2=0.5)。通过5折交叉验证评估,各方法的RMSPE相似,但MFP显示出最佳的RMSPE和可接受的校准。

**讨论与结论总结**

在讨论部分,研究人员指出,ENET、GBM和GBT在模型拟合过程中直接进行变量选择,其超参数通常通过最小化预测误差的重采样策略确定,这常导致纳入非预测变量,本研究中也观察到了几乎纳入所有变量的现象。结合稳定性选择框架可能有助于解决此问题并强制模型更加简洁。LMSS在识别预测变量方面显示出有竞争力的特性,因为它能够部分地通过线性形式近似非线性的函数形式。如果预测变量真实函数形式严重偏离线性或存在交互作用,但能通过专家知识或探索性数据分析获知,则采用逐步选择的线性回归模型在实践中可能能更好地应对这些挑战。随机森林 (random forest) 内在包含了非线性相关和函数形式,当树深度超过1时也能包含交互作用。因此,与基于回归的方法相比,所需的关于底层关联的建模选择更少,RFB和RFH在本研究的复杂数据场景中变量选择表现尤其出色。

与二分类预测的结论类似,机器学习模型需要更大的训练数据才能达到与线性模型相当的连续结局预测性能。先前研究推荐在类似数据情境下使用Boruta和Hapfelmeier方法进行随机森林变量选择,本研究证实这些方法与其他建模技术相比也是成功的。然而,要使这些方法获得优越性能,基于本研究结果,样本量应足够大(大约500-1000个观测),且数据噪声不应太大。MFP在某些重复中对部分观测的极端预测是由于外推造成的,当测试数据中连续变量的值超出训练数据范围时可能发生,在实际应用中可通过手动调整平移因子或截断预测变量极值来轻松解决。真实数据示例表明MFP具有强大的竞争潜力。

CPM的校准是一个重要方面,研究人员观察到方法间存在根本性差异。对于线性回归模型,收缩随着样本量和R2的增加而减小,这与LMSS(和TOM)的校准斜率随n增加收敛于1的发现一致。随机森林方法预测过于温和可能是由于对单个决策树的平均以及缺乏外推能力。

研究人员承认本研究的局限性:仿真研究限于特定场景;各复杂性级别的数据生成机制和结局生成机制虽尽可能相似但并非直接可比;设置A因结局生成机制有利于线性模型而不适合公平比较回归模型和机器学习方法;回归方法在设置D中因仅限于主效应且不允许探索预测变量间的交互作用而处于劣势;评估纳入-排除平衡时对真纳入频率和真排除频率赋予了相等权重;使用了默认设置而未进行过多的超参数调优。尽管如此,该仿真研究允许公平评估R语言中广泛使用的默认实现的优缺点。

**研究结论**:通过所开发的仿真研究设计,研究人员比较了开发CPM时进行变量选择的传统和机器学习方法,并确定了在不同现实数据情境下的优选方法。LMSS表现出良好的特性,即使关联非线性的情况,只要非线性函数形式能被线性形式近似或通过纳入额外的相关变量部分捕获即可。随机森林方法RFB和RFH在变量选择、简洁性和预测方面获得了令人满意的结果。当数据结构复杂或可能存在未知交互作用,且模型可解释性和透明度要求不那么关键时,特别推荐使用它们。正如许多出版物所公认的,样本量必须足够大,对于本研究调查的低维数据,至少需要500个观测才能获得满意且稳定的性能,这也证实了Riley等人2023年的类似结论。特别是在变量选择背景下,实践中应使用诸如自助法 (bootstrap) 等方法评估不稳定性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号