综述:物联网环境下新生儿数字孪生的重复测量预测因子临床预测模型验证:一种方法学框架

《Applied Sciences》:Validation of Clinical Prediction Models with Repeated-Measures Predictors: A Methodological Framework for Neonatal Digital Twins in IoT Environments

【字体: 时间:2026年07月19日 来源:Applied Sciences 2.5

编辑推荐:

  背景:新生儿重症监护病房(NICU)是医学中数据最丰富的物联网(IoT)环境之一,监测数字孪生(DTs)——通过连续获取的生理数据流预测临床事件——是领先的拟议应用。支撑此类DTs的预测模型的验证方法学标准仍不明确。监测DT的可信度不会超过其所包含的预测模型的

  
背景:新生儿重症监护病房(NICU)是医学中数据最丰富的物联网(IoT)环境之一,监测数字孪生(DTs)——通过连续获取的生理数据流预测临床事件——是领先的拟议应用。支撑此类DTs的预测模型的验证方法学标准仍不明确。监测DT的可信度不会超过其所包含的预测模型的验证结果。NICU生理数据的特点是重复的受试者内测量以及按婴儿和中心聚类,这些结构特征违反了标准预测模型验证方法的独立性假设。方法:本方法学综述探讨了具有重复测量预测因子的临床预测模型的验证策略,重点在于在受试者内依赖下保持有效性的交叉验证方法、校准感知模型评估以及特征选择稳定性。结果:在监测DT开发流程中发现了若干方法学空白。本研究总结了最近模拟证据,量化了在该情境下朴素交叉验证产生的乐观偏差,并将其定位为本文推荐的验证策略的基础。结论:提出了NICU数字孪生验证框架(NICU-DTVF),阐明了可信监测DT应满足的验证条件,并明确说明了每个组件的方法学成熟度水平。一个实现聚类感知验证作为该框架组件的开源R包(cawCV)正在开发中。所描述的验证原则具有普遍性,可扩展到新生儿环境之外的聚类重复测量预测问题。
1. 引言
新生儿重症监护病房(NICU)是临床医学中设备最密集的物联网(IoT)环境之一,每位危重新生儿都受到床边设备的持续监测,这些设备生成异质性、高频的生理数据流,呈现出与工业和工程领域中IoT系统相同的实时采集、集成和预测建模挑战。这些信号包括ECG和体积描记图等高频率波形数据,以及较低频率的设备输出和离散的电子健康记录事件,包括实验室测量、药物施用和护理评估。在持续数周至数月的住院期间,这些多模态数据源为每位患者生成数百万个观察值,使NICU成为高度仪器化的临床环境,类似于首次开发DT架构的工业IoT系统。
数字孪生(DT)在最一般的表述中,是一个计算模型,以足够高的保真度镜像物理实体,以促进模拟、预测和决策支持[1]。在制造和工程文献中,DT框架已成熟:数据采集、模型校准、实时同步和部署的架构已得到系统描述[2,3]。这些框架向临床医学的转化近年来显著加速,拟议应用涵盖从个体化给药到计算机模拟手术规划[4,5]。具体在新生儿医学中,Pammi及其同事[6]提出了一种引人注目的愿景,即数字孪生和合成患者数据可以通过提供虚拟对照组、减少入组负担,并实现对医学中最脆弱人群之一的干预措施的更快速评估,来赋能儿科临床试验。实现这一愿景关键取决于本文所涉及的预测建模基础设施。监测DT应用——计算模型与NICU IoT数据流持续同步以生成更新的风险预测——是NICU已代表的IoT环境的自然应用,也是本文的焦点。遵循Drummond和Gonsard[7]的分类法,DTs可分为模拟或监测变体;监测DT——从持续更新的生理数据流进行事实预测——是本文的唯一焦点,而模拟DT——在假设干预下进行反事实预测——由于第2.3节详述的原因不在本文范围内。这一范围限制反映在图1中。
图1. 概念性NICU-DTVF架构,用于IoT使能的新生儿监测数字孪生。
该愿景在科学上动机充分。极早产儿的不良结局频繁、临床后果严重,且通常先于临床显现之前就能在连续监测数据中检测到生理变化,如晚发性败血症所证明的[8]。然而,尚缺乏构建这样一个可负责的监测DT所需的经过验证的方法学框架。Pammi等人的观点[6]与许多DT临床文献一样,适当聚焦于概念案例和伦理前提。它没有,也无意指定最适合高维新生儿IoT数据的监督学习策略,或当数据按婴儿和中心聚类并在婴儿内时间自相关时保持有效性的交叉验证方法。这些空白并非外围实现细节;它们是区分DT愿景与可实现临床应用的关键未解决问题。本文认为,新生儿数字孪生实施的主要障碍不是数据可用性,而是缺乏经过验证的方法学标准。
该问题在结构上与高维生物医学环境中已确立的挑战有相似之处。在基因组分类中,大特征空间、小有效样本量和非独立观察的组合造成了一场方法学危机,花了十多年时间通过开发惩罚回归、集成方法和严格的交叉验证协议才部分解决[9,10,11]。NICU DT问题共享这一结构:特征维度高,罕见临床结局的有效样本量小,婴儿内观察序列相关,且方法学捷径(例如过拟合模型、乐观偏差的性能估计、校准不良的预测)的后果具有临床意义[12]。从高维基因组预测中吸取的经验教训直接适用于此处,但它们向DT-IoT背景的转化尚未被系统描述。此外,部署前的验证是工程领域DTs公认的一般要求,从机器人控制系统的预执行验证[13]到电力电子状态监测DTs的可靠性评估[14],国家科学院已将其确定为跨领域的基础性要求[15]。本文的方法学贡献在于具体说明验证要求在新儿监测DT背景下需要什么,其中数据结构——重复的受试者内生理测量,按婴儿和中心聚类——使得标准验证方法无效。
标准的临床预测建模方法学,包括用于横截面结局预测的惩罚回归、时间外部验证和基于列线图的部署,对于每个受试者单次观察的临床结局已建立完善[16,17]。本文所解决的方法学空白涉及下一步:验证由重复的受试者内生理测量数据构建的预测模型,因为标准验证方法所依赖的独立性假设被违反。作者最近的模拟工作量化了当这些假设被忽略时产生的乐观偏差,为本文开发的交叉验证建议提供了基础[18]。本文考察了在IoT使能的NICU环境中构建和验证新生儿DTs所需的机器学习方法学,特别关注DT-IoT实践与新生儿临床要求之间差距最尖锐的三个问题领域:聚类时间自相关数据的交叉验证策略、小有效样本量下的特征选择,以及校准感知模型评估。遵循Drummond和Gonsard[7]的分类法,DTs可分为模拟或监测变体;本文聚焦于监测DT,它对来自持续更新的生理数据流的临床事件进行事实预测,是本文所描述的验证方法学直接适用的变体。模拟DT在假设干预下进行反事实预测,引发了一组不同的识别和验证问题,不在本文范围内,并在相关处提及。提出了一个结构化框架,将临床预测模型标准[16,19]与DT-IoT方法学相结合,并以优先排序的研究议程作为结论。目标不是调查已经完成的工作——因为现有的DT临床文献,包括涵盖心血管、神经、肿瘤和其他生理系统的DT应用、方法和挑战的全面综述,已在别处被回顾[4,20,21]——而是具体说明在新生儿DTs可以被负责任地构建和可信地部署之前必须完成的工作。尽管本文中的例子均来自新生儿重症监护,但所描述的验证原则具有普遍性:它们适用于任何基于重复测量或聚类数据构建的临床预测模型,包括成人重症监护、电子健康记录衍生的队列以及可穿戴设备监测。本文的概念范围,涵盖从物理孪生到临床应用的完整新生儿DT流程,总结在图1中,方法学问题领域在后续章节中详述,对应于机器学习流程阶段。

2. NICU作为DT-IoT用例:数据景观与临床要求
2.1. 物理孪生基础:NICU中的IoT数据流
理解新生儿DT必须建模的数据,始于清晰核算物理孪生——住院的早产儿——实际生成的数据。NICU生理数据环境在至少三个维度上表现出极端异质性:采样率、数据类型和临床信号密度(即每单位时间内数据中包含的临床有意义信息的量)。高频连续流包括心电图波形、脉搏血氧饱和度体积描记图和有创动脉压力轨迹,采样率可能为125–500 Hz,每位患者每天产生数千万个数据点。中频呼吸监测系统捕获呼吸机衍生参数(潮气量、吸气峰压、顺应性、阻力),按每次呼吸分辨率,通常每分钟数十次观察。在低频极端,离散临床事件(例如实验室抽血、药物施用、护理评估、放射学解释)作为结构化或半结构化条目记录在电子健康记录(EHR)中,通常具有不规则且临床驱动的时序,而非固定间隔。
这些数据流并非独立。NICU中的生理参数以反映潜在病理生理学的方式耦合:心率变异性模式比晚发性败血症提前12–24小时[8];脑氧合趋势在自动调节受损的情况下与平均动脉压共同变化[22];呼吸机衍生顺应性轨迹追踪肺表面活性物质反应并预测拔管准备就绪[23]。孤立建模每个流的新生儿DT未能捕捉这种临床丰富性。这些数据的耦合、序列相关结构正是使其验证非平凡的原因,这一观察直接关系到第4节开发的交叉验证框架。

2.2. 感兴趣的临床结局及其统计含义
NICU中最重要且监测DT必须最终预测的临床结局具有两个特征,这些特征造成了结构性统计挑战:它们罕见,且定义不一致。在28周前出生的极早产儿中,坏死性小肠结肠炎(NEC)发生率约为9%[24];晚发性败血症约为20%[24];重度脑室内出血(IVH,III–IV级)约为14%[24]。支气管肺发育不良(BPD)影响至少40%的极早产儿存活者,取决于所应用的定义;2018年NICHD研讨会[25]提出了一个严重程度分级的生理定义以解决早期标准的局限性,尽管由于定义异质性,不同队列的BPD率差异很大。在当代美国学术队列中,极早产儿NICU出院前死亡率总体约为22%[24],在存活阈值附近的胎龄每相差一周,变化陡峭,23周时超过50%,28周时降至10%以下(表1)。这些结局每个都是每个婴儿的单一固定二元终点;监测DT通过随着生理预测因子流积累而刷新预测来进行预测,这一结构与第4节验证方法学所解决的重复测量预测因子、受试者水平二元结局公式一致。
表1. 主要NICU结局的大致发生率、预测目标类型、数据来源和主要验证挑战。
这些事件率对DT模型开发有一个直接后果,在DT-IoT文献中经常被忽视:在单中心规模下,可用于训练监督分类模型的正结局案例数量通常少于每类20个,这是无论使用何种学习算法,误分类错误率急剧增加且模型稳定性显著下降的区间(图2)[11,26]。一个假设中心每年收治60例极早产儿,NEC率约为9%,每年产生约5–6例NEC病例,在五年的数据收集中可能产生25–30例训练数据集。这不是可以通过改进特征工程或更复杂的模型架构解决的问题;这是单中心新生儿数据的根本约束,必然推动NICU DT开发走向多中心架构(引入额外一层数据聚类),并使第3节和第4节中的方法学选择成为具有后果性的而非学术性的。联邦学习在第6节讨论,提供了一种增加有效样本量以克服这一罕见事件约束的架构策略,而无需跨机构集中受保护的健康信息。
图2. 作为训练集大小(每类N)的函数的k-最近邻(KNN)和偏最小二乘结合线性判别分析(PLS+LDA)分类器的误分类率[11,26]。阴影区域代表单中心NICU罕见结局的典型操作范围。当每类N<20时,性能急剧下降。

2.3. 临床有用的NICU DT必须做什么
遵循Drummond和Gonsard[7]提出的分类法,新生儿DTs可分为模拟或监测变体,这一区别不仅是架构性的,而且对应于统计公式的根本差异。监测DT通过实时IoT数据馈送保持与物理孪生的连续同步,随着新生理信息到达更新其内部状态,并基于在观察条件下估计结局的事实预测模型。模拟DT是一次性的患者状态计算模型,用于情景测试或反事实预测,估计在假设干预下的患者特异性结局。反事实公式需要专门的识别假设(一致性、条件可交换性、阳性性)、估计方法(如逆概率加权)以及超出标准预测建模框架的验证程序[27]。本文聚焦于监测DT,因为其事实预测任务——将重复测量生理预测因子映射到临床结局——是本文描述的聚类感知验证方法学直接适用的公式。模拟DT被认为具有临床相关性,但被视为超出范围,因为其反事实验证负担是一个不同的问题。
对于监测DT,核心要求是一个预测模型,其估计性能可信:准确估计的区分度和校准度,而非由方法学捷径乐观膨胀。由于预测因子是重复的婴儿内生理测量,对可信性能估计的主要威胁是数据的依赖结构,标准验证方法无法适应。旨在床边部署的监测DT还必须满足操作要求,包括校准驱动的报警性能和前瞻性决策阈值验证(第4.4节),以及符合HIPAA的IoT数据管道架构(第6节)。本文的其余部分按照这些要求在DT开发流程中出现的顺序加以处理。

3. 用于DT构建的监督学习方法
3.1. 框架化预测问题
从IoT数据构建监测DT需要将一组输入特征(来自生理流、EHR记录和人口统计学特征)映射到一个或多个临床目标结局。根据应用,该目标可以是二元结局(出生后30天内是否发生NEC)、连续生理轨迹(预测未来6小时动脉血氧饱和度)或时间至事件终点(拔管准备就绪的天数)。每种公式对应不同系列的监督学习方法:用于二元和分类结局的分类模型,用于连续目标的回归模型,以及用于具有信息性删失的时间至事件终点的生存或竞争风险模型。这些公式之间的选择不仅是技术性的;它决定了DT能代表什么和不能代表什么。
在NICU背景下,不良结局的二元分类是与监测DT应用最相关的公式,也是受第2.2节描述的小有效样本量挑战最严重的公式。以下小节聚焦于这个问题,尽管方法学原则可推广到其他公式。

3.2. 高维度和有效小N下的特征选择
特征选择,即识别哪些输入携带预测信号、哪些是噪声的过程,是高维NICU IoT数据上监督学习的前提,正如在基因组分类中一样[9]。单个VLBW婴儿的连续生理监测数据集可能包含数百个衍生特征:每个波形的均值、方差和分布汇总;通道间的交叉谱相干性;离散临床数据的自上次事件以来时间特征;以及生理与临床预测因子之间的交互项。当候选特征数量大幅超过结局事件数量时——在单中心NICU数据中几乎是普遍条件——标准最大似然估计无定义或严重过拟合,某种形式的正则化或预选择是必要的。
三种广泛策略可用。过滤方法通过单变量关联(如t检验、Wilcoxon秩和统计量或信息论度量)对特征进行排序,并在模型拟合前保留前k个子集。它们计算效率高,但忽略特征间依赖关系,且可能不稳定:训练样本的微小扰动可产生显著不同的特征排名,这一现象在高维生物医学环境中已有充分记录[9,11,26,28]。包装方法(如递归特征消除、顺序前向选择)通过内部交叉验证模型性能评估特征子集,使其对特定学习算法敏感,且在大特征空间中计算成本高昂。嵌入方法,最重要的是LASSO(最小绝对收缩和选择算子)和弹性网正则化,通过惩罚系数绝对值之和同时进行特征选择和模型估计,将无信息预测因子精确收缩为零[29]。对于临床预测建模,当简约性和临床可解释性为优先时,通常倾向于嵌入方法如LASSO,因为其调优参数可通过内部交叉验证选择,并产生适合临床部署的稀疏模型[17,30]。
所有特征选择方法在小样本设置中一个关键但被低估的性质是不稳定性:当有效样本量较小时,所选特征集在训练数据的bootstrap重抽样中变化很大[28]。模拟证据证实,尽管LASSO在嵌入方法中更受青睐,但在单中心NICU数据特有的小N区间内仍易受这种不稳定性影响[31]。这种不稳定性不仅仅是理论上的问题。其预测特征在重抽样训练迭代中变化很大的新生儿DT可能难以验证、更新或跨机构比较,因为这种变异性可能反映对抽样变异的敏感性,而非稳定的潜在信号。稳定性知情选择方法(例如稳定性选择[32],对许多bootstrap子样本应用特征选择,仅保留高频选择的特征)为评估所选预测因子的稳健性提供了原则性框架,并可能提高相对于单次选择的再现性。鉴于对临床预测建模中模型稳健性和再现性的重要性认识日益增加,本文提出报告预测因子稳定性的度量作为对NICU DT模型现有报告标准(如TRIPOD+AI中的校准报告,即用于个体预后或诊断的多变量预测模型透明报告的AI扩展声明[19])的补充。作为实际最低要求,应数值报告大校准和校准斜率,同时通过局部加权回归将观察结局对预测概率进行拟合的灵活校准曲线;两者均可通过标准统计软件(如R 4.6.1中的rms和CalibrationCurves包)计算,无需额外数据收集。

3.3. 稀疏高维NICU数据的学习算法选择
鉴于上述特征选择景观,NICU DT构建的监督学习算法选择应遵循三个标准:在小有效样本量下的性能、对类别不平衡的稳健性,以及足以支持临床信任和监管审查的可解释性。惩罚逻辑回归(如LASSO或弹性网)在三个方面均表现合理。在小N下的性能与更复杂的方法相比具有竞争力[10],其系数结构透明,且输出是校准概率,适用于临床决策阈值。来自大规模系统综述的证据证实了这一偏好:在临床预测建模研究中,使用表格数据的灵活机器学习方法相比逻辑回归未表现出平均性能优势[33]。Van Calster等人[31]将其部分归因于临床数据集普遍存在的低信噪比条件,正是定义单中心NICU数据的条件,其中惩罚回归不易对无关结构过拟合。集成方法,特别是随机森林和梯度提升,提供更大的建模灵活性,但在较小样本中其优势可能因方差增加和过拟合风险而减弱[10,11],且其黑箱性质可能对临床采纳和根据FDA数字健康框架[34]的监管许可造成障碍。事后可解释性工具如SHapley Additive exPlanations(SHAP)可以量化特征级对个体预测的贡献,并可能部分缓解这些透明性障碍,提供与集成和惩罚回归方法兼容的模型无关解释。
深度学习架构,包括循环神经网络(RNNs)和基于Transformer的模型,原则上非常适合NICU IoT流的时间结构,因为它们可以对汇总统计量丢弃的生理时间序列内长程依赖关系进行建模。然而,在实践中,它们的性能取决于大型训练数据集的可用性[35],在小样本和稀疏结局的情况下可能容易过拟合。它们在NICU DT开发中的适当角色可能在于迁移学习管道:在大规模无标签生理或EHR语料库上进行预训练以学习通用表示,然后对标记临床结局进行微调,已显示出改进的性能,特别是在低标签设置中[36,37],通常在将模型适应于较小NICU队列时需要额外正则化[38]。这种架构将表示学习(从无标签输入数据中无监督提取信息特征)的数据量需求与临床预测的标记结局需求分离开,并且是该领域在近期更有希望的方向之一。跨机构汇集的重症监护时间序列上的自监督预训练已产生了早期阶段的重症监护基础模型,在标记结局数据稀缺时优于任务特定基线[39,40]。这些努力仍植根于成人重症监护,在比任何单中心NICU所能提供的更大的多站点队列上训练,尚未在新生儿生理流或本文所处理的重复测量、受试者水平二元结局上进行评估;因此它们与NICU DT开发的相关性是一个有前景但经验上未经测试的扩展,而非既定实践。跨新生儿网络的联邦预训练,在第6节中作为解决单中心样本量限制的策略进行讨论,是组装这些基础模型所需的跨机构数据量的合理途径。
一个相关方向是多模态人工智能,其中单个模型联合摄入生理时间序列以及其他数据模态,如胸片、颅超声图像或临床叙事文本,而非将每种模态视为独立的预测流。在成人重症监护预测任务中,多模态架构通过捕捉任一模态单独无法揭示的跨模态模式,显示出比单模态模型更好的性能。对于NICU DTs,这引发了与本文中描述的固定和重复测量预测因子相同身份的介导泄漏问题:与特定婴儿相关的成像或文本模态本身是准标识符,如果验证策略按受试者划分时间序列数据,但无意中允许同一婴儿的成像或文本数据出现在训练和验证折中,将重新引入本文旨在防止的泄漏。因此,多模态NICU DT验证被指出是本文提出框架的一个开放扩展,而非已解决的问题。

3.4. 处理时间依赖性和类别不平衡
NICU数据的两个结构特征需要明确的统计适应性,而通用机器学习管道默认不提供。第一个是时间依赖性:同一婴儿内的重复观察序列相关,违反了大多数标准学习算法所依赖的独立性假设。忽略这一结构不仅降低效率,它使标准交叉验证程序无效(第4节讨论),并可能通过将自相关观察视为独立证据而产生虚假的自信预测。状态空间模型显式建模婴儿内时间结构,对于监测DT构建优于静态快照方法[41]。互补方法如变化点检测和惩罚回归的混合效应扩展为捕捉时间异质性和聚类提供了替代框架。
第二个是类别不平衡。对于罕见结局如NEC(约9%发生率)或重度IVH(约14%发生率),对全部观察预测多数类别的朴素分类器可实现高准确率但无临床效用。处理不平衡的标准方法包括代价敏感学习(在训练期间对少数类别分配更高的误分类惩罚)和重抽样方法如SMOTE(合成少数类过采样技术),该技术生成合成少数类观察以重新平衡训练集。第三种方法,阈值调整,将分类决策边界从0.5移向优化临床相关性能指标(如固定特异性下的灵敏度)的值。每种方法涉及权衡,最优策略取决于结局和样本量[42]。重要的是,任何为了解决不平衡而对训练数据进行的重抽样必须发生在交叉验证循环内部:在分割成折之前应用SMOTE会从验证集向训练集泄漏信息,产生正好使临床预测模型不可靠的乐观偏差性能估计[19]。Van Calster等人[31]记录了这种和相关交叉验证失败,包括在将拟合模型应用于测试集之前未能冻结模型,以及未能重复所有预处理步骤在每次交叉验证折内,作为已发表预测模型中膨胀表面性能的最有后果性来源之一。重抽样向纵向设置的扩展(构建合成少数类轨迹而非合成单时间点观察)以及针对时间序列类别不平衡调整的基于树的集成代价敏感变体,已被提议作为时间点SMOTE的替代方案;在重复测量、罕见事件NICU设置中专门评估它们的性能被指出是第8.2节中的一个开放问题,而非本文的确定建议。

4. NICU DT背景下的交叉验证与模型评估
4.1. 为什么标准交叉验证对NICU数据失败
交叉验证是估计监督学习模型在新未见数据上表现如何的主要工具,以及在开发期间选择竞争模型的主要工具。在标准k折交叉验证中,数据集被划分为k个非重叠折;每折依次作为验证集,而其余k-1折形成训练集,性能估计在各折间平均。该程序在观察独立同分布(i.i.d.)时产生近似无偏的性能估计,而NICU IoT数据以根本方式违反了这一假设。
同一婴儿内的重复生理测量序列相关:明天的心率变异性可由今天预测,而今天又由昨天预测。当时间相邻的观察被任意分割到训练和验证折时,验证集并非真正独立于训练数据,因为其观察在统计上仍依赖于附近的训练观察,因此估计性能将具有乐观偏差。这是与在时间序列预测中应用标准CV时膨胀表面性能的相同现象[43],并且直接相关于监测DT开发,其中输入特征是生理流的时间汇总。
多中心NICU数据按婴儿和中心聚类。来自同一婴儿的观察共享未测量的个体特征(如遗传背景、产前暴露、机构护理实践),使它们彼此之间比来自不同婴儿的观察更相似。当标准k折分割将同一婴儿的观察放入训练和验证折时,模型实际上是以不同形式在已见过的患者上进行评估。在多中心数据集中,同样的问题规模扩大:在单一机构内训练和验证的模型尚未经过临床部署所需的传输性测试。标准交叉验证对两个层次的聚类均视而不见。
这种担忧不仅仅是理论上的,最近的NICU预测实践说明了这一点。在一项使用约6000例NICU入院每日生命体征数据的建模竞赛中[44],五个参赛团队中只有一个在模型评估期间通过留一患者交叉验证明确考虑了重复测量聚类。该团队提交的模型——一个带有非线性项和工程化心率变异性特征的逻辑回归——在留出测试数据上实现了最高的受试者工作特征曲线下面积,优于使用神经网络、随机森林、CatBoost和XGBoost方法并应用标准k折交叉验证且无患者级分区的其他四个团队。在已发表的NICU预测研究中,将k折CV应用于重复每日观察而未指定折是在患者还是观察水平,也观察到类似的不明确性[45,46]。因此,新生儿预测文献中聚类感知最佳实践与常规分析实现之间的方法学差距是常态而非例外,并且是依赖于相同数据结构和建模传统的DT开发工作的直接风险。在这种数据结构中,观察级交叉验证产生的乐观偏差大小已通过作者最近的一项析因模拟研究在参数空间上进行了量化[17],本文开发的聚类感知验证建议即基于此。
因此,在监测DT设置中,两种不同的泄漏轴威胁有效性,应被识别为独立问题。第一种是聚类泄漏:来自同一婴儿或中心的观察出现在训练和验证分区中,由第4.2节描述的聚类感知分区解决。第二种是时间前瞻泄漏:使用在预测时间原点之后记录的预测因子值,这使模型能够访问在部署时进行预测的时刻不可用的信息。监测DT定义上随着生理数据积累生成预测,结构上易受这种第二种泄漏形式的影响,当模态包括结局相关但非因果的信号时,如诊断后实验室值、诊断后影像报告或提及感兴趣结局的临床笔记[47],会产生一种互补形式。两种形式均通过将所有特征锚定到定义好的预测时间原点、通过仔细排除诊断后变量,以及在时间自相关为关注点时通过下面描述的时间有序交叉验证设计来缓解。聚类感知和时间有序策略是互补的:每种应对一个泄漏轴,监测DT验证管道必须同时应对两者。

4.2. NICU DT验证的适当策略
几种交叉验证策略提供逐步增强的对这些偏差来源的保护,同时计算和数据量成本逐步增加(表2)。此处描述的策略并非新生儿数据特有;它们适用于任何基于重复测量或聚类观察构建的预测模型,NICU用作工作示例。标准朴素k折CV,如上所述,仅适用于i.i.d.子集上的内部超参数调优,不应用于报告NICU DT模型的最终性能。留一法CV(LOOCV),k折当k等于样本量时的特殊极限情况,在小样本中产生低方差但通常乐观偏差的误差估计,且其离散误分类率度量产生频繁的平局,使其不适合比较竞争分类器[9]。这两种方法均未充分应对NICU数据的时间或聚类结构。
表2. NICU DT模型的交叉验证策略比较。Y = 解决;~ = 部分解决;N = 未解决。
受试者级k折CV通过将任何单个婴儿的所有观察分配到同一折,使没有婴儿贡献观察给训练和验证分区,从而解决聚类泄漏。这是任何从重复受试者内测量开发、具有受试者水平结局的预测模型的最低聚类感知标准。留一聚类CV,其中每次迭代完全保留一个聚类(一个婴儿或一个中心),是聚类感知分区的极限情况,并提供最强的聚类泄漏保护;留一中心CV(LOCO-CV)是其中心级形式。
阻塞时间序列CV通过强制时间排序约束来解决时间自相关:训练数据在日历时间上始终先于验证数据,并且可在训练和验证窗口之间插入间隙以防止短程自相关泄漏。该方法正确模拟了前瞻性部署:在2018–2021年NICU数据上训练的模型在2022–2023年数据上评估,如同在实践中。一个改进,bootstrap时间序列CV,在许多时间连续块的bootstrap重抽样上应用此阻塞结构,而非单个训练-测试划分,从而减少性能估计的方差而不牺牲时间排序。该方法对于罕见结局特别有价值,其中单个阻塞划分可能偶然将大多数正例分配到训练或验证窗口,产生不稳定的估计。两种变体对于纵向NICU结局模型均优于标准CV。
留一中心CV是最严格的策略,也是与多站点DT验证最相关的。每个中心依次作为验证集被保留,其余中心构成训练集,性能报告为各保留中心的平均值。该程序直接估计模型对新机构的传输性,正是决定在具有95%分位数VLBW量的学术中心训练的NICU DT是否在社区医院表现充分的属性。LOCO-CV或其等效的多中心留出设计,被提议作为任何旨在多站点部署的NICU DT模型报告最终性能的最低标准。其计算成本相对于bootstrap方法适中(对于C个中心需要恰好C次模型拟合),且其可解释性高。虽然计算成本曾是大规模网络中迭代模型拟合的实际障碍,但第3.3节推荐的惩罚回归模型类型在现代硬件上秒级拟合,使LOCO-CV对于C=20–30个参与中心的NICU研究网络在计算上也是可及的。
最近一项关于重复测量预测因子和受试者水平二元结局的预测模型交叉验证策略的析因模拟研究发现,朴素观察级交叉验证可大幅高估模型区分度,受试者工作特征曲线下面积(AUROC)的乐观偏差范围从+0.039到+0.204,跨越162个条件。该偏差的大小随组内相关系数增加、时间自相关增强、聚类数减少和事件率降低而单调增加[18]。受试者级k折交叉验证,其中任何单个婴儿的所有观察分配到同一折,在检查的条件下产生与留一受试者交叉验证大致一致的AUROC估计,因此被推荐为任何从重复受试者内测量开发的NICU预测模型的最低聚类感知标准[18]。为促进这些策略在新生儿预测工作流中的采纳,一个实现上述朴素观察级、受试者级和留一聚类交叉验证策略的开源R包(cawCV)正在由作者开发[48]。最近一项对52项预测性医疗保健中多模态机器学习研究的系统综述发现,仅12%(6项研究)在来自不同机构、时间段或采集设置的数据上进行了真正的外部验证[47],证实了方法学上严格的内部验证与已证明的跨站点传输性之间的差距是当代临床预测建模的主要失败模式,而非边缘情况。
表2中每种策略都有相应的局限性。受试者级k折CV,最低标准,不解决时间自相关,并且当受试者内相关相对于受试者数量较强时仍可产生乐观估计。阻塞和bootstrap时间序列CV解决时间结构但不解决跨受试者聚类,且仅当单个模型也不预期跨中心泛化时适用。留一中心CV在两条轴上提供最强保护,但四种策略中计算成本最高,且需要多中心数据才能实施,在单中心模型开发期间不可用。表2中没有单一策略统一优越;适当的选择取决于给定数据集和部署设置中存在哪些对有效性的威胁。
一个工作实证示例说明了这种乐观偏差的大小,并演示了NICU-DTVF原则2的应用。在一个由101例极低出生体重婴儿组成的队列中,具有每日血氧测量和早产儿视网膜病变结局(Srivatsa等,引用自[18]),朴素观察级10折交叉验证对重度ROP(15例事件,101例受试者)产生AUROC为0.686,而留一聚类交叉验证为0.608,乐观偏差为+0.078 AUROC单位(95%百分位数区间:+0.072, +0.082)。对于任何ROP(48例事件),相应的乐观偏差较小但仍可观:+0.031 AUROC单位(朴素0.682 vs LOCO 0.650)。受试者级10折交叉验证在两种情况下均紧密近似LOCO参考(偏差≤0.015),与上述受试者级分区作为最低充分标准一致。乐观偏差的大小对于更罕见结局(重度ROP,15例事件)大于更常见结局(任何ROP,48例事件),与一般模式一致,即朴素交叉验证乐观偏差随着感兴趣结局的有效样本量减小而增加。

4.3. 超越区分度的性能指标
AUROC已成为临床预测模型的默认性能指标,并且具有实际意义:它估计随机选择的阳性受试者获得比随机选择的阴性受试者更高预测概率的概率。然而,对于罕见NICU结局,AUROC可能人为偏高:一个模型为少数真正阳性分配适度升高的概率,同时正确分类绝大多数真正阴性,可实现AUROC高于0.80,同时提供有限的临床效用。精确率-召回率曲线下面积(AUPRC)对于不平衡结局更具信息性,应连同AUROC一起报告用于罕见NICU终点[49]。
校准度,即预测概率与观察事件率之间的一致性,通常是监测DT应用中更具临床相关性的指标,也是经常被忽视的指标[12]。校准不良的监测DT将系统性地高估或低估事件风险,降低每个依赖于其预测概率的下游临床决策。校准评估应遵循Riley等人[16]和Van Calster等人[12]推荐的框架:大校准(平均预测概率与观察事件率)、校准斜率(理想为1.0;斜率小于1.0表示过拟合),以及图形方式报告跨预测概率范围的灵活校准曲线。Van Calster等人[31]澄清,强校准——要求在每种可能的协变量模式亚组内进行正确的风险估计——在实践中是不可实现的标准。现实且适当的目标是中等校准,即所有被分配预测风险为X%的个体中,观察事件比例近似于X%,通过灵活校准图进行评估。NICU DT模型应被要求达到这一可实现的中等校准标准,而非不可实现的理想标准。
临床效用评估,目前大多数NICU预测模型报告中缺失,应伴随区分度和校准度指标。决策曲线分析(DCA),评估跨一系列临床合理决策阈值的净临床获益,提供了适用于标准验证数据的临床效用早期近似,无需额外数据收集[31]。DCA适用于任何可指定临床决策阈值的NICU DT风险模型,建议将其纳入验证报告作为效用评估的实际最低要求。DCA提供了在假设阈值偏好下的潜在净获益估计,并不替代模型衍生风险评分触发的临床干预的前瞻性评估;临床影响的决定性评估需要单独的结果研究。

4.4. 从预测到行动:决策阈值与临床部署
输出预测概率的监测DT还必须指定这些概率如何转化为临床行动。这需要一个决策阈值,高于该阈值的预测触发警报、启动监测升级或提示临床审查。在标准二元分类中,默认阈值0.5很少在临床上合适,特别是对于罕见不良结局。对于NEC或重度IVH等疾病,漏诊的临床成本通常超过不必要警报的负担,证明较低的阈值是合理的,该阈值提高灵敏度,同时特异性成本可接受。第4.3节引入的DCA框架为阈值选择提供了原则性基础:跨临床合理决策阈值评估的净获益曲线明确了假阳性和假阴性之间的权衡,并识别出模型相对于治疗全部或不治疗[31]提供临床效用的阈值。阈值应事先指定并临床论证,而非仅从验证数据事后推导。
NICU环境对DT衍生风险警报构成了一个特定危害:报警疲劳。重症监护病房的床边监测系统有充分记录显示生成频繁警报,其中大多数临床不可操作,导致护理人员报警疲劳。校准不良或过度触发的DT风险模型加剧了这一问题,通过降低临床警报流的信噪比,反而降低患者安全。校准质量直接决定警报负担:系统高估风险的模型将产生远超其真阳性率的警报,消耗护理注意力而无临床获益。因此,第4.3节描述的中等校准目标不仅是统计理想,而且是NICU监测背景下的患者安全要求。阈值选择应在任何DT衍生警报系统部署到临床护理之前,针对测量到的警报率
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号