评估机器学习和深度学习模型用于阿尔茨海默病和帕金森病的早期检测:一项关于临床泛化性的可解释双数据集研究

《Big Data and Cognitive Computing》:Evaluating Machine Learning and Deep Learning Models for Early Detection of Alzheimer’s and Parkinson’s Disease: An Explainable Dual-Dataset Study on Clinical Generalizability

【字体: 时间:2026年08月12日 来源:Big Data and Cognitive Computing 5.3

编辑推荐:

  神经退行性疾病如阿尔茨海默病(AD)和帕金森病(PD)因早期诊断困难而构成显著的全球医疗负担。本研究调查了机器学习(ML)和深度学习(DL)模型在跨多种数据模态下的早期AD和PD分类的临床泛化性。研究人员采用了双数据集框架,将全球基准(ADNI、PPMI、OA

  
神经退行性疾病如阿尔茨海默病(AD)和帕金森病(PD)因早期诊断困难而构成显著的全球医疗负担。本研究调查了机器学习(ML)和深度学习(DL)模型在跨多种数据模态下的早期AD和PD分类的临床泛化性。研究人员采用了双数据集框架,将全球基准(ADNI、PPMI、OASIS和UCI语音)与沙特阿拉伯费萨尔国王大学医院(KFHU)的当地临床数据相结合。研究人员评估了集成方法、支持向量机(SVM)、神经网络、卷积神经网络(CNN)和长短期记忆网络(LSTM)。在结构化全局数据上,树集成表现最佳,随机森林(RF)对PD达到88.24%的准确率,梯度提升(GB)对AD达到94.44%的准确率。对于神经影像,基于CNN特征的LSTM在精选MRI数据集上达到98.68%的准确率。一个关键发现是显著的泛化差距:在全局数据上表现优异的模型在局部KFHU数据上性能显著下降,受试者工作特征曲线下面积(AUC)值介于0.50和0.77之间。这种退化归因于真实世界临床挑战,包括严重的类别不平衡、电子健康记录(EHR)中的诊断不确定性和异质性特征表示。结果强调,数据质量和模态往往比算法复杂性更具决定性。本研究提供了一个可重复的验证框架,强调了机构特定评估的必要性,为沙特医疗保健建立了性能基准(需注意局部样本量仍然较小,结果应视为探索性),并展示了使用可解释人工智能(XAI)来验证临床相关性。
**研究背景与问题**
神经退行性疾病如阿尔茨海默病(AD)和帕金森病(PD)因进行性神经元丧失导致认知和运动功能衰退,构成全球健康危机。早期准确诊断对延缓疾病进展至关重要,但现有方法依赖晚期症状或单一模态神经影像(如MRI或PET),导致诊断碎片化且干预延迟。人工智能(AI),特别是机器学习(ML)和深度学习(DL)模型,在分析复杂生物医学数据方面展现出潜力,但现有模型大多在精心筛选、类别平衡的全球基准数据集(如ADNI、PPMI)上开发验证,其在真实世界、异质性临床数据(尤其是特定人群)上的泛化性尚未被充分探索。沙特阿拉伯面临老龄化人口、有限专业诊断中心及与西方人群的遗传和人口差异,而大多数AI模型基于西方数据集,其准确性在沙特临床数据上能否保持尚不明确。此外,沙特高发的糖尿病、肥胖和心血管疾病可能加速或改变AD和PD的进展,亟需人群特异性验证。本研究旨在通过系统量化基准性能与真实临床效用之间的“泛化差距”,并采用严格的双数据集策略,对ML和DL模型进行早期AD和PD分类的综合评估。论文发表在《Big Data and Cognitive Computing》。

**主要结论与意义**
研究得出三项主要结论:(1)树集成模型(随机森林RF、梯度提升GB)在结构化全局数据上表现最优,RF对PD准确率达88.24%,GB对AD达94.44%;(2)深度学习架构,特别是基于CNN特征的LSTM模型,在精选神经影像数据上达到98.68%的准确率;(3)存在显著的泛化差距:模型在全局数据上表现优异,但在沙特当地临床数据(KFHU)上性能大幅下降(AUC 0.50–0.77),主要归因于类别不平衡、诊断不确定性和特征异质性。这些发现强调数据质量和模态比算法复杂性更具决定性,并为沙特医疗保健背景下的神经退行性疾病AI建立了性能基准,同时指出当地样本量较小,结果应视为探索性。

**关键技术方法**
研究人员采用双数据集框架:全局数据集包括UCI帕金森病语音数据集(1195例,23个声学特征)、OASIS阿尔茨海默病MRI数据集(809个MRI会话)以及ADNI和PPMI方法学基准;当地数据集来自沙特阿拉伯费萨尔国王大学医院(KFHU)的电子健康记录(EHR),包括KFHU-AD(44例,9例确诊AD,35例“AD未明确”)和KFHU-PD(114例,70例确诊PD,9例AD,35例“AD未明确”),分别含165和186个临床实验室特征。统一预处理流程:剔除缺失>30%的特征,中位数填充,移除零方差特征,Z-score标准化,并使用合成少数类过采样技术(SMOTE,k近邻=5)处理不平衡。模型包括ML模型(随机森林RF、梯度提升GB、极限梯度提升XGBoost、支持向量机SVM、k-近邻k-NN、自适应增强AdaBoost、多层感知机MLP)和DL模型(CNN基线、基于CNN特征的LSTM,用于2D MRI切片分类,采用患者级分层80:20划分)。评估指标为准确率、精确率、召回率、F1分数和AUC-ROC,对KFHU-PD使用宏平均,对局部严重不平衡数据强调AUC。

**研究结果**
**4.1 全局数据集上的性能**
- **帕金森病(语音数据)**:随机森林(RF)表现最佳,准确率88.24%,敏感性85.84%,特异性90.40%,显著优于复现的基线临床算法(NNge、AdaBoost,准确率提高约20%)。
- **阿尔茨海默病(OASIS数据)**:梯度提升(GB)达到最高准确率94.44%,树模型(RF、GB)一致优于SVM和MLP。
- **神经影像(MRI数据)**:基于CNN特征的LSTM模型表现卓越,准确率98.68%,三种类别(健康、AD、PD)的F1分数接近完美,证明DL在精选高质量影像数据上的强大能力。

**4.2 泛化差距:局部KFHU数据上的性能**
- **KFHU-AD数据集(探索性分析)**:最佳模型(RF)交叉验证AUC仅0.568(区分确诊AD与“AD未明确”),所有算法AUC接近随机水平(0.486–0.600),通过自举法(1000次迭代)估计95%置信区间(CI)为0.486–0.650,宽度0.164,反映小样本(n=44)的低统计功效。
- **KFHU-PD数据集**:三层分类任务中,MLP表现最佳,宏平均AUC仅0.766(95% CI 0.710–0.822),模型在少数类“AD”上区分困难。
- 泛化差距量化:全局AD(OASIS)AUC为0.96,局部KFHU-AD最佳AUC为0.568,差距0.392;全局PD(语音)AUC为0.91,局部KFHU-PD宏平均AUC为0.766,差距0.144。

**4.3 比较分析与关键发现**
- **模型稳健性**:树模型(RF、GB)在全局和局部数据上提供最一致且稳健的性能,因其对特征缩放和异常值自然鲁棒、通过替代分裂处理缺失值、集成方法减轻过拟合,并提供内置特征重要性,适合高维小样本数据。
- **数据模态影响**:性能高度依赖数据模态,DL在精选影像上优异,传统ML在结构化声学/临床特征上优异,但所有模型在原始聚合EHR数据上表现挣扎。
- **主要挑战**:严重类别不平衡、诊断标签不确定性(“未明确”诊断)和小样本量是驱动泛化差距的主要因素,而非算法固有局限。
- **统计显著性**:DeLong检验显示,全局PD中RF显著优于SVM(p<0.01)和k-NN(p<0.001);全局AD中GB显著优于MLP(p<0.001);局部KFHU-PD中RF、MLP、SVM之间无显著差异(p>0.05),与宽置信区间一致。

**总结与结论**
讨论部分指出,本研究强调泛化差距是AI健康研究中常被忽视的现实:基准性能不能保证临床效用。性能退化归因于标签噪声(EHR中“未明确”诊断)、特征异质性(常规实验室值缺乏区分力)以及数据稀缺和不平衡(44–114例患者)。可解释AI(XAI)技术(SHAP和Grad-CAM)定性验证了模型在高质量数据上的决策与临床知识一致(如PD语音中短时扰动MDVP:PPQ和非线性复杂度指标RPDE、DFA;AD影像中内侧颞叶和海马注意力),但在局部数据上特征重要性不稳定,表明可解释性本身依赖于模型稳健性和数据质量。局限性包括局部样本量小(KFHU-AD仅44例,9例确诊)导致结果应视为探索性,以及XAI缺乏定量验证(如忠实度分析、稳定性测试、临床验证)。研究结论(翻译自Section 6):本研究对ML和DL模型进行了一次严格的、双数据集评估,用于早期AD和PD检测。研究人员承认当地KFHU-AD队列(n=44,9例确诊AD)样本量过小,无法得出确定性结论;这些结果是探索性和假设生成的,需要更大规模的多中心研究进行验证。研究人员证明了,虽然复杂模型能在精选全局数据上达到高准确率,但其性能在应用于沙特医院真实临床数据时显著下降,揭示了一个实质性的泛化差距。本研究得出结论:通向临床影响力的AI工具之路不仅在于算法进步,更在于对数据质量、代表性采样和严格机构特定验证的协同关注。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号