《Scientific Reports》:Measuring the optimistic bias of cross-validation in radiomics
编辑推荐:
在放射组学中,独立外部数据通常不可用,交叉验证(CV)方案被广泛用于获得性能估计。由于计算成本较低,简单k折CV优于嵌套CV,尽管嵌套CV已知能提供更准确的估计。在最近的一项研究中,研究人员得出结论,出于实际原因,两种方案之间没有显著差异。然而,该研究仅在低维
在放射组学中,独立外部数据通常不可用,交叉验证(CV)方案被广泛用于获得性能估计。由于计算成本较低,简单k折CV优于嵌套CV,尽管嵌套CV已知能提供更准确的估计。在最近的一项研究中,研究人员得出结论,出于实际原因,两种方案之间没有显著差异。然而,该研究仅在低维数据集上进行,这些数据集并不反映典型的放射组学数据特征。尽管先前研究表明,仅使用简单k折CV时,高维数据集中可能出现乐观偏差(即模型真实性能被高估),但该偏差在放射组学数据集中的程度目前尚不清楚。本研究通过比较32个公开放射组学数据集上的简单k折CV、留出法CV和嵌套CV,评估了嵌套CV在放射组学中的必要性。总共评估了30,720个模型,以确保稳健和全面的比较。每种验证方案通过使用50:50训练-测试比率重复分割数据进行测试。训练数据用于模型开发和内部验证,而测试数据保留用于性能评估。模型性能使用受试者工作特征曲线下面积(AUC)、F1分数和马修斯相关系数(MCC)进行测量。然后将交叉验证估计值与测试集上的估计值进行比较,以评估潜在的乐观偏差。此外,实验在来自UCI存储库的110个低维数据集上重复,涉及105,600个模型,以比较高维和低维数据之间的发现。结果显示,在放射组学数据中,简单k折CV表现出显著的乐观偏差,AUC偏差高达0.128,F1分数偏差高达0.130,MCC偏差高达0.264,而留出法CV保持相对无偏。嵌套CV根据模型表现出低但可变的偏差,其中简单集成模型实现了最佳性能。较大的样本量减少了乐观偏差和变异性,尤其是在简单k折CV中,但未观察到与数据集维度或特征数量的显著关系。相比之下,简单k折CV在UCI数据集上无偏(AUC偏差<0.014,F1偏差<0.016,MCC偏差<0.014),三种CV方案之间未发现明显差异。因此,在放射组学中,简单k折CV与嵌套CV之间存在实质性的实际差异。这一发现进一步强调,低维数据集的结果不一定能推广到放射组学。
**放射组学中交叉验证乐观偏差的量化研究:背景、方法、结果与结论**
**研究背景与问题**
放射组学是一种从放射影像中高通量提取定量特征并利用机器学习构建预测模型的方法,广泛应用于诊断、预后和治疗规划。然而,放射组学面临的主要挑战是样本量有限,这通常源于注释成本、罕见病和隐私约束。当大量特征(通常远超样本量)与少量样本结合时,形成高维数据集(大p小n,p>>n),极易导致过拟合,即模型学习数据噪声而非真实模式,从而在训练集上表现良好但在新数据上性能显著下降。为获得可靠性能估计,独立测试集是理想选择,但实际中常不可得,因此交叉验证(CV)方案被广泛使用。简单k折CV因其计算成本低而被优先采用,但嵌套CV已知能提供更准确的估计。先前研究(如Wainer和Cawley)认为,出于实际目的,两种方案无显著差异,但该研究仅基于低维UCI数据集,不反映放射组学的高维特征。其他研究提示高维数据集中简单k折CV可能存在乐观偏差(高估真实性能),但该偏差在放射组学中的具体程度尚不明确。本研究旨在通过比较多种CV方案,量化放射组学中简单k折CV的乐观偏差,并评估嵌套CV的必要性。
**关键技术与方法**
本研究使用radMLBench集合中的32个公开放射组学数据集(样本量>100,所有数据集均来自先前伦理批准的公共数据库),以及UCI存储库中的110个低维数据集(用于对比)。主要技术方法包括:三种特征选择算法(LASSO、MRMRe、ET)和四种分类器(NB、LR、RF、SVM)。验证方案包括简单k折CV(5折和10折)、留出法k折CV(30%留出集)和嵌套CV(5×10和10×5),每种方案均进行5次重复以优化模型配置。性能评估指标为AUC、F1分数和MCC,通过50:50分层训练-测试分割重复10次以评估变异。所有模型训练使用Python 3.10及scikit-learn v1.5.2,超参数优化通过网格搜索(Optuna v4.1.0)完成。
**研究结果**
**1. 总体乐观偏差**
在32个放射组学数据集上评估了30,720个模型。结果显示,简单k折CV表现出显著乐观偏差:AUC偏差高达0.128±0.057,F1偏差高达0.130±0.102,MCC偏差高达0.264±0.094。相比之下,留出法CV在所有指标上保持相对无偏。嵌套CV的偏差较低但依赖于模型类型,其中简单集成模型表现最佳,而重拟合模型次之。
**2. 重复CV及折叠数的影响**
将CV重复5次可减少简单k折CV的偏差(AUC减少0.018-0.030,F1减少0.020-0.040,MCC减少0.060-0.074),但绝对偏差仍较大。增加外折叠数(从5到10)对简单k折CV效应更强(AUC减少0.014-0.017),对其他方案影响较小。重复CV对留出法和嵌套CV的偏差减少幅度有限(<0.014在AUC中)。
**3. 数据集特征与偏差的关系**
线性回归分析表明,样本量是影响简单k折CV乐观偏差的显著因素(p<0.05),样本量越大偏差越小。但未发现特征数量或维度与偏差的显著关系。嵌套CV中仅少数方案显示样本量影响。方差分析显示,留出法CV的方差略高于其他方案,且方差与样本量负相关,但与特征数或维度无关。
**4. 低维UCI数据集对比**
在110个UCI数据集上评估了105,600个模型。简单k折CV在UCI数据中几乎无偏(AUC偏差<0.014,F1偏差<0.016,MCC偏差<0.014),三种CV方案间无显著差异。重复CV或增加折叠数的影响极小(<0.004在AUC中)。这表明低维数据结果不能推广到放射组学。
**讨论与结论**
讨论部分指出,简单k折CV的乐观偏差源于同一数据既用于模型选择又用于性能估计,导致过拟合。留出法CV因使用独立测试集而相对无偏。嵌套CV仅在采用第二次简单k折CV重拟合时获得无偏估计,而简单集成模型因模型配置多样性而表现最佳。集成模型在简单和留出法CV中表现不佳,可能因模型误差不独立。样本量增大可缓解偏差,但放射组学数据集通常较小,因此偏差问题突出。研究结果与Varma和Simon以及Subramanian和Simon的早期发现一致,但进一步量化了放射组学中的实际偏差程度。本研究推荐:在缺乏独立测试集时,避免使用简单k折CV,而采用留出法CV或嵌套CV(特别是嵌套5×10 CV配合简单集成模型)以获得更可靠的性能估计。研究结论强调:低维数据集的结果不能泛化到放射组学,放射组学中简单k折CV与嵌套CV存在实质性差异。本研究定量评估了多种验证方案的乐观偏差,证实简单k折CV在放射组学中导致显著高估,推荐使用重复留出法CV和嵌套CV,并指出该发现对放射组学模型的临床可重复性具有重要意义。