基于无监督与监督机器学习方法解读记忆门诊队列中阿尔茨海默病血液生物标志物的研究

《Frontiers in Aging Neuroscience》:Application of unsupervised and supervised machine learning approaches to blood-based biomarkers of Alzheimer’s disease in a memory clinic cohort

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Aging Neuroscience 5.2

编辑推荐:

  摘要 引言: 血液生物标志物(blood-based biomarkers,BBMs)是促进阿尔茨海默病(Alzheimer's Disease,AD)生物学诊断的有前景工具。建立可靠的BBMs临界值是实现临床落地应用的关键问题,且对联合BBM策略的探索仍然有

  
摘要 引言: 血液生物标志物(blood-based biomarkers,BBMs)是促进阿尔茨海默病(Alzheimer's Disease,AD)生物学诊断的有前景工具。建立可靠的BBMs临界值是实现临床落地应用的关键问题,且对联合BBM策略的探索仍然有限。本研究旨在测试不同机器学习(machine learning,ML)模型用于BBMs解读,以已确立的金标准体内生物标志物——即脑脊液(cerebrospinal fluid,CSF)生物标志物为参照,从而提升其单独及联合诊断AD的价值。 方法: 研究人员选取了434例因自觉认知下降就诊于佩鲁贾大学医院的患者,这些患者均具有可用的CSF Aβ42/40、pTau181和tTau以及血浆Aβ42、Aβ40、pTau217、pTau181和NfL数据。研究人员比较了多种无监督聚类算法用于临界值确定,以及有监督分类模型用于预测由CSF A+/T+谱定义的AD。 结果: 不同的无监督聚类模型获得的临界值在预测AD CSF谱方面具有较高性能(准确度>0.85)。研究人员测试了每种临界值组合,最佳组合在BBM阳性亚组中实现A+/T+ CSF谱患病率>0.9。最佳有监督ML模型在10折交叉验证中准确度高达0.88。 讨论: 研究结果证明,即使在缺乏CSF金标准参照的情况下,聚类方法也有助于识别可靠的AD诊断BBMs临界值,且结合多种BBMs的ML方法能够显著增强其诊断准确性。

机器学习赋能阿尔茨海默病血液生物标志物的诊断价值:来自记忆门诊队列的证据

一、研究背景与问题提出

阿尔茨海默病(Alzheimer's Disease,AD)的生物学诊断近年来取得了重大进展。随着脑源性生物标志物在血液中被识别,血液生物标志物(blood-based biomarkers,BBMs)因其可扩展性和临床可及性,被视为补充甚至替代脑脊液(cerebrospinal fluid,CSF)和核医学生物标志物进行AD诊断的最具规模化潜力的候选标志物。在众多BBMs中,磷酸化Tau异构体(phosphorylated Tau isoforms,pTaus)尤其是pTau217及其与β-淀粉样蛋白片段1-42(Aβ42)和1-40(Aβ40)的比值,被认为是最有前景的独立BBMs,其与CSF和核医学AD生物标志物的一致性最佳。
然而,当前BBMs的临床应用面临关键瓶颈:临界值(cutoff)的确定高度依赖金标准生物标志物的可及性。现有的实施策略多基于临床驱动,采用基于AD金标准生物标志物的三层次临界值系统,以分别最大化敏感性和特异性。但此类方法受AD病例与对照在中间浓度区间重叠的影响,且全身性混杂因素(如肾脏疾病)可削弱BBMs的诊断准确性。虽有研究提出根据年龄、慢性健康状况、共病病理或认知损害程度制定个体化临界值,但这可能降低可解释性和操作简便性,限制其规模化临床推广。
在此背景下,机器学习(machine learning,ML)方法为BBMs的解读提供了新思路。无监督聚类算法已被应用于在缺乏神经病理学参照的情况下定义AD CSF生物标志物的临界值,而更复杂的有监督分类算法(如支持向量机、梯度提升方法和神经网络)已被用于优化复杂病例的诊断流程。本研究旨在真实世界队列中评估多种无监督聚类算法定义AD BBMs可靠临界值的性能,并测试每种临界值单独及联合用于识别AD(即CSF A+/T+谱)的能力,同时评估多种有监督ML算法利用大panel BBMs识别潜在AD病理的能力。

二、研究设计与技术方法

研究人员回顾性选取了2013至2025年间因自觉认知下降就诊于佩鲁贾大学医院神经内科的434例患者。所有患者均接受了临床和神经心理学评估(至少包括简易精神状态检查(MiniMental State Examination,MMSE)和临床痴呆评定量表(Clinical Dementia Rating Scale,CDR)),并采集了CSF和血浆样本。诊断依据现行诊断标准结合每位患者的临床-生物学谱确定。诊断组包括:临床前AD(preAD)、AD所致轻度认知障碍(AD-MCI)、AD痴呆(ADdem)、帕金森病(PD)伴或不伴MCI、PD痴呆/路易体痴呆(PDD/DLB)、额颞叶痴呆(FTD)以及认知正常和MCI对照组。
研究采用的关键技术方法包括:七种无监督聚类算法(高斯混合模型(Gaussian Mixture Model,GMM)、K-Means、MiniBatch K-Means、Ward连接凝聚聚类、Complete连接凝聚聚类、谱聚类(Spectral Clustering)和Birch)用于临界值确定;基于拟合高斯分布交点及95%敏感性和95%特异性目标确定三种临界值;127种临界值组合测试;十一种有监督分类算法(SVM-RBF、SVM-Linear、Logistic Regression、Random Forest、Gradient Boosting、AdaBoost、Extra Trees、KNN、Gaussian Naive Bayes、Decision Tree和Multilayer Perceptron)用于AD与非AD分类,采用分层10折交叉验证评估性能。

三、研究结果

3.1 聚类算法比较

去除离群值后(1.5×四分位距规则),379例患者纳入聚类分析。七种算法均被强制将数据集划分为两个聚类。Ward连接凝聚聚类产生最均衡的划分(189例AD样,190例非AD样),而Birch获得最不均衡的划分(119例AD样,260例非AD样)。聚类质量指标显示,谱聚类具有最高的轮廓系数(Silhouette Score,0.4351),K-Means紧随其后(0.4336),而K-Means获得最高的Calinski-Harabasz指数(395.19)。GMM的轮廓系数(0.3404)和Calinski-Harabasz指数(272.40)均最低。

3.2 临界值定义

每种聚类算法为七种血浆生物标志物各定义了三种临界值。单标志物诊断准确度评估显示,GMM来源的pTau217/Aβ40临界值准确度最高(0.873±0.046),其次为pTau217(0.862±0.057)和pTau217/Aβ42(0.860±0.055)。对于K-Means、MiniBatch K-Means和凝聚聚类(Complete),pTau217/Aβ40获得最佳准确度(0.798±0.070)。Ward聚类中pTau217准确度最高(0.823±0.069)。

3.3 临界值组合

组合不同BBMs临界值显著提升了血浆生物标志物作为AD诊断工具的可靠性。各算法最佳组合在BBM阳性亚组中实现AD CSF谱患病率从0.923(GMM:pTau181+pTau217/Aβ40)到0.952(谱聚类:pTau217+pTau181+NfL+pTau217/Aβ40+pTau181/Aβ40)。K-Means和MiniBatch K-Means获得可比的顶级性能(AD患病率0.946)。在排除AD CSF谱方面,GMM表现最佳,其最佳组合的非AD CSF患病率达0.949,而Birch最差(0.838)。

四、讨论与结论

研究结果证明,聚类方法能够在缺乏CSF金标准参照的情况下识别可靠的BBMs临界值,为金标准生物标志物不可及的环境提供了潜在的可扩展框架。组合多种BBMs的ML方法能够显著增强诊断准确性,最佳有监督ML模型在10折交叉验证中准确度高达0.88。这一发现对于AD的规模化生物学诊断具有重要意义,尤其是在即将到来的疾病修饰治疗时代,可靠的血液检测有望扩大AD生物学诊断的可及性,为更广泛人群的早期诊断和干预提供支持。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号