《PLOS One》:Performance of machine learning–based prediction models for hypoglycemia in Chinese patients with diabetes: A systematic review and meta-analysis
编辑推荐:
目的:本研究旨在系统评估基于机器学习(machine learning, ML)模型在中国糖尿病患者低血糖预测中的预测性能。
方法:研究人员系统检索了PubMed、Embase、Web of Science、Cochrane Library、CINAHL、C
目的:本研究旨在系统评估基于机器学习(machine learning, ML)模型在中国糖尿病患者低血糖预测中的预测性能。
方法:研究人员系统检索了PubMed、Embase、Web of Science、Cochrane Library、CINAHL、CNKI和万方数据库,检索时间从建库至2026年2月。纳入标准为关注ML模型开发或验证、且用于预测中国糖尿病患者低血糖的合格研究。研究筛选和数据提取由两名评审人员独立完成。收集了研究特征、建模方法、预测因子、验证方法和模型性能等信息。采用随机效应模型对受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)进行合并分析。采用预测模型偏倚风险评估工具(Prediction Model Risk of Bias Assessment Tool, PROBAST)评估研究质量。
结果:共纳入13项研究,低血糖合并患病率为25%(95%置信区间[confidence interval, CI]:17%–33%)。总体合并AUC为0.90(95%CI:0.87–0.93)。按照建模算法进行的亚组分析显示,极端梯度提升(extreme gradient boosting, XGBoost)的合并AUC为0.89,随机森林(random forest, RF)为0.88,支持向量机(support vector machine, SVM)为0.85,轻量梯度提升机(Light Gradient Boosting Machine, LightGBM)为0.84,逻辑回归(logistic regression, LR)为0.83,决策树(decision tree, DT)模型为0.81。常见预测因子包括年龄、胰岛素使用、体质指数、HbA1c、肌酐和低血糖史。
结论:研究人员试图为糖尿病患者低血糖的机器学习预测模型提供一个全面的概述。尽管已有若干具有良好判别性能的模型被报道,但该领域研究仍处于早期阶段。许多研究存在方法学局限和验证不足的问题。模型的稳健性和可解释性也令人担忧。需要更多努力来开发可靠且可解释的模型,并促进其在临床实践中用于早期风险识别的应用。
**机器学习预测模型在中国糖尿病患者低血糖预测中的性能:系统综述与Meta分析论文解读**
**一、研究背景与目的**
糖尿病是全球最常见的慢性代谢性疾病之一。据国际糖尿病联盟(International Diabetes Federation, IDF)数据,中国成人糖尿病患者约1.48亿,是全球糖尿病患者人数最多的国家。低血糖(hypoglycemia)是降糖治疗过程中最常见且易被低估的并发症之一,接受胰岛素或口服降糖药的患者中,轻中度低血糖发生率分别可达50%和45%,严重低血糖发生率约为21%和6%。低血糖不仅损害生活质量与治疗依从性,严重时还与跌倒、心血管事件和死亡风险增加相关,致死率约为12.9%,重症时可达24.9%。
传统预测模型多基于人口学特征、临床及治疗变量构建,但其预测性能和跨人群普适性有限。随着复杂临床数据的可及性增加,机器学习(machine learning, ML)模型已逐渐应用于低血糖预测。然而,既往系统综述并未针对中国糖尿病患者这一特殊人群进行评估。鉴于中国糖尿病患者的临床特征、饮食模式、血糖监测可及性和降糖用药与西方国家存在差异,开展针对中国人群的系统评价具有重要意义。本研究旨在系统评估ML预测模型在中国糖尿病患者低血糖预测中的性能、方法学质量和临床适用性。
**二、研究方法**
该meta分析已在PROSPERO注册(CRD420261338933),遵循PRISMA-DTA指南。研究人员系统检索了PubMed、Embase、Web of Science、Cochrane Library、CINAHL、CNKI和万方数据库,时间从建库至2026年2月,并手动筛选纳入研究的参考文献。采用PICOTS框架设定纳入标准,纳入的研究均为在中国开展的、开发或验证ML低血糖预测模型的观察性研究。两名评审人员独立完成文献筛选、数据提取和质量评价,数据提取基于CHARMS清单,质量评价采用PROBAST工具。使用STATA 18.0软件进行meta分析,采用随机效应模型合并AUC,以I
2统计量评估异质性,并进行了亚组分析、敏感性分析和发表偏倚评估(Egger检验和漏斗图)。最终纳入13项研究。
**三、研究结果**
**1. 研究筛选与纳入研究特征**
共检索到5,450条记录,排除重复后筛选2,235篇,经全文评估最终纳入13项研究。研究发表于2022至2026年,均在中国开展。11项为回顾性设计,2项为前瞻性设计。研究主要聚焦2型糖尿病(type 2 diabetes mellitus, T2DM)患者,3项研究同时纳入1型糖尿病(type 1 diabetes mellitus, T1DM)和T2DM人群。预测时间范围从30分钟至12个月不等。11项为单中心研究,2项为多中心研究。
**2. 模型开发与验证**
建模数据集样本量为192至255,404例,验证数据集为70至109,459例。应用的方法包括逻辑回归(logistic regression, LR)、随机森林(random forest, RF)、支持向量机(support vector machine, SVM)、决策树(decision tree, DT)、极端梯度提升(extreme gradient boosting, XGBoost)、轻量梯度提升机(Light Gradient Boosting Machine, LightGBM)、深度神经网络(deep neural network, DNN)和长短期记忆网络(long short-term memory, LSTM)。其中XGBoost和RF常被报告为最优模型,AUC范围0.822至0.978。7项研究进行了外部验证,其余采用k折交叉验证或自举法进行内部验证。仅6项研究报告了校准评估(5项使用校准曲线,1项使用Hosmer-Lemeshow检验),没有研究报告决策曲线分析。
**3. 低血糖合并患病率**
12项研究报告了低血糖患病率,采用随机效应模型(REML)合并后,汇总患病率为25%(95%CI:17%–33%)。
**4. 预测因子**
13项研究共提取超过40个预测因子,最常报告的包括年龄、胰岛素使用、漏餐、体质指数(body mass index, BMI)、HbA
1c、肌酐和低血糖史。
**5. 总体AUC汇总**
总体合并AUC为0.90(95%CI:0.87–0.93),表明现有低血糖风险预测模型的总体预测效能处于良好水平。
**6. 亚组分析**
按建模算法分层:XGBoost合并AUC为0.89,RF为0.88,SVM为0.85,LightGBM为0.84,LR为0.83,DT为0.81。按研究设计分层,回顾性研究的AUC为0.88,前瞻性研究为0.85。按中心类型分层,单中心为0.88,多中心为0.87。按预测因子类型分层,基于临床变量的模型为0.88,基于持续葡萄糖监测(continuous glucose monitoring, CGM)时间序列数据的模型为0.89。按验证方法分层,内部验证为0.90,外部验证为0.87。
**7. 质量评估**
PROBAST评估显示,4项研究总体偏倚风险低,2项不清楚,其余为高偏倚风险。多数研究在参与者和预测因子领域偏倚风险低,但部分研究在结局和分析领域存在问题。
**8. 敏感性分析与发表偏倚**
逐一排除单个研究的敏感性分析显示合并结果无明显变化,表明结果稳健。Begg检验P值为0.669,漏斗图基本对称,未发现明显发表偏倚。
**四、讨论与结论总结**
讨论部分指出:①中国糖尿病患者低血糖合并患病率为25%,疾病负担较重;②ML模型(尤其XGBoost和RF)的预测性能优于传统逻辑回归模型,但AUC仅反映判别能力,不能完全代表校准度和临床实用性,目前校准报告和临床效用评估不足;③外部验证模型的AUC低于内部验证模型,提示内部验证可能产生乐观估计;④年龄、胰岛素使用、BMI、HbA
1c、肌酐和低血糖史是较稳定的核心预测因子;⑤CGM数据模型与传统临床变量模型的AUC无显著差异,但纳入CGM数据的研究仅2项,需谨慎解读;⑥未来研究应标准化方法流程、全面评估校准度、提高模型可解释性(如Shapley Additive Explanations, SHAP)、推进模型嵌入电子病历和血糖管理平台,并优先进行外部验证;⑦本研究存在局限,如仅检索中英文文献、研究异质性较大、多数模型基于回顾性数据且外部验证有限。
研究结论:本研究纳入13项针对中国糖尿病患者的低血糖ML预测模型,这些模型在预测因子、建模方法、验证策略和性能报告方面存在较大差异。当前证据表明,大多数模型具备可接受的判别能力,部分已接受外部验证,显示出逐步向临床应用迈进的趋势。ML预测低血糖的科学研究正在稳步发展,这些模型在支持早期风险识别和临床决策方面具有巨大潜力,但需谨慎考虑研究设计、验证策略、校准报告和模型透明度等因素。