
-
生物通官微
陪你抓住生命科技
跳动的脉搏
一种用于可靠预测糖尿病风险的、可比较且易于解释的机器学习框架
《Scientific Reports》:A comparative and interpretable machine learning framework for reliable diabetes risk prediction
【字体: 大 中 小 】 时间:2026年07月08日 来源:Scientific Reports 4.9
编辑推荐:
摘要糖尿病是一种常见的代谢性疾病,在全球范围内普遍存在。在大多数情况下,它会导致心脏病、肾病和失明等严重后果。及时且准确诊断糖尿病对于采取干预措施并改善患者预后至关重要。机器学习方法为医疗保健领域提供了有效的预测建模解决方案,但目前的大部分研究由于数据集不平衡、仅采用单一的训练测
糖尿病是一种常见的代谢性疾病,在全球范围内普遍存在。在大多数情况下,它会导致心脏病、肾病和失明等严重后果。及时且准确诊断糖尿病对于采取干预措施并改善患者预后至关重要。机器学习方法为医疗保健领域提供了有效的预测建模解决方案,但目前的大部分研究由于数据集不平衡、仅采用单一的训练测试划分方式以及模型可解释性较差,其临床应用价值受到限制。本文基于通过Kaggle获取的皮马印第安人糖尿病数据集,引入了一种强大且具有可解释性的机器学习模型来预测糖尿病。该数据集包含768名患者的相关信息,包括8个临床变量和二元响应值。为解决类别不平衡问题,本文采用了合成少数类过采样技术,生成少数派糖尿病患者的合成样本,从而在不破坏特征之间相关性的前提下实现平衡学习。研究中对逻辑回归、朴素贝叶斯、AdaBoost和XG Boost四种分类器进行了训练和测试。与仅使用单一数据划分不同,本文采用了分层10折交叉验证方法,以确保模型性能的稳定性和泛化能力。评估指标包括准确率、精确率、召回率和F1分数,尤其关注少数派糖尿病类别的性能。通过逻辑回归系数和SHAP(Shapley加性解释)值,可以更清晰地了解对预测结果起关键作用的临床特征。实验结果表明,所提出的框架在未见过的数据集上能够达到约94%的总体准确率,且少数派类别的精确率和召回率都很高,这证明了通过类别平衡、交叉验证以及可解释性机器学习的结合,可以得出可靠且具有临床参考价值的预测结果。所有性能评估都在未经处理的原始测试集上进行,而SMOTE技术则仅在交叉验证过程中使用,以避免数据泄漏。与许多现有研究不同,所提出的框架实现了无泄漏的验证、稳健的交叉验证以及具备临床意义的综合可解释性。虽然合成采样有助于改善少数类数据的学习效果,但模型仍需经过严格测试,以确保其在真实世界数据上的泛化能力。本文表明,在机器学习方法的开发中,严谨的研究方法和良好的可解释性对于构建用于医疗决策支持的机器学习解决方案至关重要,而这正是将机器学习应用于糖尿病风险评估的实际途径。
生物通微信公众号