《Journal of International Medical Research》:Development and interpretability of a machine learning model for postoperative hypothermia prediction in placenta previa Cesarean section: A retrospective cohort study
编辑推荐:
摘要
目的:开发并验证一种针对前置胎盘剖宫产患者围术期低体温的可解释机器学习预测模型,并识别关键预测因子,以支持临床个体化体温管理和护理决策。
方法:本研究为一项基于BioStudies公共数据库的回顾性二次分析。研究采用了包括逻辑回归、决策树和随机森林在
摘要
目的:开发并验证一种针对前置胎盘剖宫产患者围术期低体温的可解释机器学习预测模型,并识别关键预测因子,以支持临床个体化体温管理和护理决策。
方法:本研究为一项基于BioStudies公共数据库的回顾性二次分析。研究采用了包括逻辑回归、决策树和随机森林在内的十种机器学习算法构建低体温预测模型。选取准确率、精确率、召回率、F1分数和曲线下面积(AUC)作为评估指标以筛选最优模型,并应用局部可解释模型无关解释(LIME)对单样本预测输出生成个体化解释。共167例真实世界患者作为独立测试队列,而由合成数据保险库(SDV)算法生成的1000例合成数据病例作为训练队列。
结果:跨模型性能比较显示,随机森林模型在训练集中AUC达到0.781,但在测试集中仅为0.638,存在严重的过拟合迹象。梯度提升模型普遍存在测试集召回率低于0.25的问题,漏诊风险较高。逻辑回归(LR)模型展现出最优的整体性能:在所有评估模型中,其测试队列准确率最高,AUC为0.705,F1分数为0.430,召回率为0.327。特征重要性分析发现,术中出血量是低体温的最强预测因子,其次是体重作为第二个核心贡献因素。LIME能够直观地可视化单个样本预测的特征贡献。这些输出使护理人员能够制定量身定制的加温干预方案。
结论:本研究开发的逻辑回归预测模型可能作为一种具有足够泛化能力和临床可解释性的临床实用工具,用于识别前置胎盘剖宫产患者的低体温风险。
**论文解读:基于多源数据融合的可解释机器学习模型预测前置胎盘剖宫产术后低体温**
**一、研究背景与问题提出**
围术期低体温(Perioperative hypothermia)是外科手术最常见的并发症之一。在接受剖宫产的患者中,低体温可通过胎盘循环损害胎儿体温调节,增加新生儿酸中毒和低Apgar评分的风险。研究表明,在高危产科手术人群中,低体温的发生率可超过60%。术中低体温会增加术中出血量增加、术后寒战等不良事件的风险。
前置胎盘(Placenta previa)是产科常见的高危妊娠类型,受其影响的患者平均术中失血量可达1000–2000 mL,导致继发于大量失血的低体温高发生率。低体温进一步加剧凝血功能障碍并导致产后出血增加,这使其成为前置胎盘围术期管理中的一个关键挑战。然而,目前针对前置胎盘患者的临床体温管理仍依赖经验性判断,难以提供精确干预。
现有的大多数围术期低体温预测模型是针对普通手术或普通剖宫产人群开发的。这些模型未纳入前置胎盘患者的独特高危特征,导致其在该特定群体中预测性能不佳。近年来,机器学习(Machine learning, ML)已在多个临床领域得到成功应用,包括普通外科术后并发症预测、急诊剖宫产预测、产后出血风险评估、早产预测、新生儿重症监护病房入住预测及癌症复发预后等。然而,传统机器学习模型的“黑箱”性质阻碍了临床医生和护士理解其决策逻辑。合成数据生成技术可以在不损害患者隐私的情况下扩大训练样本量。可解释人工智能(Explainable artificial intelligence, XAI)通过直观展示每个特征对预测结果的贡献来解决模型的“黑箱”局限性。基于上述背景,本研究聚焦于前置胎盘剖宫产这一低体温高危人群,采用真实世界数据与SDV生成的合成数据相融合的方法开发预测模型,并通过多算法比较筛选具有最优泛化能力的模型,旨在为前置胎盘患者的围术期体温管理和护理干预提供临床实用的决策工具。
**二、研究方法与技术**
本研究为一项回顾性二次分析,数据来源于公开的BioStudies数据库,该数据库包含完全去标识化和匿名化的参与者数据。研究对象为2019年5月至2023年期间在全身麻醉下接受择期剖宫产的前置胎盘孕妇,共纳入167例患者作为真实世界测试队列。
研究采用合成数据保险库(Synthetic Data Vault, SDV)算法构建生成模型,以167例真实世界数据作为训练输入,生成1000例合成数据作为训练队列。使用同质性评分评估分类变量的分布一致性,验证合成数据符合临床逻辑和特征。
研究纳入13个预测变量和1个结局变量,所有变量均为临床护理评估和麻醉记录中常规采集的指标。预测变量包括:组别、年龄、身高、体重、身体质量指数、分娩时胎龄、既往剖宫产史、甲状腺功能减退、糖尿病、术前体温、术中输液量、术中出血量、手术持续时间。结局变量为术后即刻低体温,定义为手术结束后由护理人员立即测量的鼓膜温度<36°C。
数据预处理包括:分类变量采用独热编码转换为数值变量,连续变量采用Z-score标准化。缺失数据处理方面,缺失率>30%的变量被排除,其余变量中分类变量采用众数填补,连续变量采用中位数填补。训练队列采用5折交叉验证优化模型超参数。研究构建了10种常用机器学习模型,涵盖线性模型(逻辑回归、线性支持向量机)、基于树的模型(决策树、随机森林、梯度提升决策树、XGBoost、LightGBM、CatBoost、AdaBoost)以及基于实例的模型(k近邻)。模型性能评估使用准确率、精确率、召回率、F1分数和AUC五个核心指标。LIME算法用于最优模型的单样本可解释性分析。
**三、研究结果**
**1. 合成数据有效性验证**
合成数据队列与医院人群队列(测试集)的基线特征比较显示,合成数据队列的同质性评分为91.3%,高于80%的阈值,确认合成数据集符合机器学习模型构建要求。训练集与测试集在年龄、身高、体重、身体质量指数、分娩胎龄、术前体温、术中输液量、手术持续时间等变量上无统计学显著差异,但在术中出血量、组别、既往剖宫产史和低体温发生率上存在显著差异。
**2. 变量相关性分析**
变量间的Pearson相关分析显示,与低体温发生率相关的正相关系数前三位的变量分别是术中出血量、手术持续时间和术中输液量。体重与低体温之间的负相关系数最高。
**3. 不同机器学习模型性能比较**
随机森林模型在训练集上表现最佳,AUC为0.781,F1分数为0.619,但测试集AUC仅为0.638,F1分数为0.376,显示出严重的过拟合迹象。梯度提升模型(GBDT、XGBoost、LGBM、CatBoost)训练集精确率均高于0.70,但召回率普遍低于0.30,且测试集召回率均低于0.25,漏诊风险较高。传统线性模型(逻辑回归、线性SVC)具有最优的泛化能力,训练集与测试集之间的性能偏差均<10%,无过拟合风险。在所有模型中,逻辑回归模型综合性能最佳:其测试集准确率为0.731(所有模型中最高),F1分数为0.430(所有模型中最高),召回率为0.327(所有模型中最高),AUC达到0.705,接近线性SVC实现的最高AUC 0.712。
**4. 模型特征重要性分析**
LGBM模型的特征重要性排序结果显示:术中出血量是低体温的最强预测特征,体重是第二个核心预测因素。
**5. LIME单样本可解释性结果**
选择一名典型患者进行LIME解释。该模型预测该患者低体温发生概率为38%,最终分类为低体温低风险,但仍存在一定程度的发生风险。LIME瀑布图展示了特征贡献的逻辑:术中出血量是最强的风险因素,手术持续时间是第二大风险因素。
**四、讨论总结与研究结论**
本研究是首个针对前置胎盘剖宫产这一低体温高危人群,使用多源数据融合方法开发围术期低体温预测模型的研究。通过多算法比较筛选出具有最优泛化能力的逻辑回归模型,并结合LIME可解释性分析实现个体化风险解释。所有预测变量均为临床护理实践中常规采集的指标,不增加额外医疗负担。该模型可直接嵌入产科护理临床决策支持系统,为围术期体温管理和护理干预提供可实施的决策工具。
在内部有效性方面,训练队列中采用5折交叉验证,结合训练集和测试集的严格分离,有助于减少过拟合和数据泄漏。逻辑回归模型的训练-测试性能差距<5%,进一步支持了内部一致性。在外部有效性方面,独立的真实世界测试队列提供了初步的泛化证据,但单中心设计和相对较小的测试样本限制了外部有效性主张的强度。SDV算法虽然保留了边际分布和成对相关性,但可能无法捕捉真实临床数据中存在的高阶交互。此外,未纳入手术室温度、麻醉药物剂量、麻醉持续时间等可能影响体温的重要混杂变量,构成了当前模型的一个显著局限性。
本研究表明,术中出血量是前置胎盘患者低体温的最强预测因子,这与前置胎盘的手术特点密切相关。前置胎盘患者的胎盘附着于子宫下段,术中剥离面血窦丰富,术中出血量可达非复杂性剖宫产的3至5倍。大量失血带走大量体热,而输注室温液体和血制品进一步降低核心体温。体重被确定为第二个核心预测因素,体重较低的患者脂肪储备较少,热量丢失更快,低体温风险更高。既往剖宫产史被确定为独立风险因素。LIME算法的应用使护理人员不仅能够知道患者是否属于高危,还能理解患者为何处于高危状态,从而制定针对性的干预措施,真正实现个体化围术期体温护理。
研究结论部分指出,基于前置胎盘剖宫产患者的真实世界数据,本研究使用SDV生成的合成数据扩大训练样本。所构建的逻辑回归预测模型可能作为一种具有良好泛化能力和临床可解释性的临床实用工具,用于识别围术期低体温风险患者。包括术中出血量、体重和既往剖宫产史在内的关键预测因素可指导护理人员制定个体化加温策略。在临床实施前,有必要进行前瞻性多中心验证。
尽管存在上述局限性,该模型依赖常规采集的临床变量,结合其可解释性和透明的风险因素识别,为临床实施提供了实用基础。未来临床应用途径可能包括:整合到电子健康记录系统中进行实时风险标记;进行前瞻性验证以确定临床有效性;纳入额外的围术期变量以提高预测准确性。本研究严格遵守《赫尔辛基宣言》,使用完全去标识化的公共数据库,因此无需伦理批准和知情同意。