《Brain and Behavior》:Routine Blood Indicators Combined With Sleep Questionnaires for the Identification of Cognitive Impairment in Parkinson's Disease: A Cross-Sectional Study With a Leakage-Free Nested Modeling Framework
编辑推荐:
摘要
背景:认知障碍(cognitive impairment, CI)是帕金森病(Parkinson's disease, PD)常见的非运动并发症,但目前可获得且可靠的筛查辅助工具仍然有限。本横断面研究旨在采用严格无泄漏的模型开发流程,量化常规血液指标联
摘要
背景:认知障碍(cognitive impairment, CI)是帕金森病(Parkinson's disease, PD)常见的非运动并发症,但目前可获得且可靠的筛查辅助工具仍然有限。本横断面研究旨在采用严格无泄漏的模型开发流程,量化常规血液指标联合标准化睡眠问卷与PD中现患CI的关联强度及横断面分类价值。
方法:共纳入347例PD患者,并根据蒙特利尔认知评估(Montreal Cognitive Assessment, MoCA < 26)分为PD-CI组(n = 143)和PD-NCI组(n = 204)。研究人员首先通过分层抽样将队列分为训练集(70%,n = 242)和测试集(30%,n = 105);所有后续特征选择与调参均限定于训练集数据。在训练集内,使用L1惩罚逻辑回归(L1-penalized logistic regression, LASSO)并以lambda.1se准则筛选20个候选预测变量,获得10个变量。研究人员构建了四个嵌套逻辑回归模型(基线临床、基线加血液、基线加睡眠、全模型),同时训练随机森林(random forest, RF)和梯度提升机(gradient boosting machine, GBM)分类器。判别性能通过受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)及DeLong置信区间和模型间DeLong检验评估;校准通过校准斜率、截距和带bootstrap置信区间的Brier评分评估;决策曲线分析(decision curve analysis, DCA)用于评估临床效用;未触碰的测试集仅评分一次,并通过重复5 × 2交叉验证估计泛化性能。结局定义的稳健性通过教育校正和替代MoCA截断值检验。
结果:训练集LASSO保留10个预测变量:教育年限、病程、Hoehn–Yahr分期、血小板与淋巴细胞比值(platelet-to-lymphocyte ratio, PLR)、单核细胞与淋巴细胞比值(monocyte-to-lymphocyte ratio, MLR)、同型半胱氨酸、C反应蛋白(C-reactive protein, CRP)、匹兹堡睡眠质量指数(Pittsburgh Sleep Quality Index, PSQI)、Epworth嗜睡量表(Epworth Sleepiness Scale, ESS)和REM睡眠行为障碍筛查问卷(REM Sleep Behavior Disorder Screening Questionnaire, RBDSQ)。在未触碰的测试集中,全逻辑回归模型的AUC为0.943(95% CI: 0.896–0.990),高于基线模型(0.844),与基线加血液模型(0.937)和基线加睡眠模型(0.889)相当;相对于基线的增量具有统计学显著性(DeLong p = 0.009)。重复交叉验证给出的AUC更为保守,为0.921(SD = 0.029)。随机森林(0.956)和梯度提升(0.944)未优于逻辑回归。校准可接受(斜率1.18,截距0.03;测试集Brier 0.086,95% CI 0.057–0.120),且在替代MoCA截断值下结果稳定(AUC 0.909–0.931)。
结论:常规血液指标与睡眠问卷联合与PD中现患CI存在横断面关联,并在单纯临床变量之外增加信息。由于该研究设计为横断面、单中心且仅进行内部验证,该模型应被视为候选筛查辅助工具,在任何临床应用前需进行外部验证,最好是外部多中心、前瞻性验证。
论文解读:常规血液指标联合睡眠问卷用于识别帕金森病认知障碍
帕金森病(Parkinson's disease, PD)是一种进行性神经退行性疾病,除运动症状外,认知障碍(cognitive impairment, CI)是最常见且致残性较高的非运动并发症之一,报告患病率为20%–57%。早期识别PD患者中已有或存在CI风险者,对及时干预和个体化管理至关重要。然而,蒙特利尔认知评估(Montreal Cognitive Assessment, MoCA)和简易精神状态检查(Mini-Mental State Examination, MMSE)等神经心理筛查工具较为耗时、受教育背景影响,并存在练习效应。外周血液炎症指标、代谢指标以及睡眠障碍均分别被报道与PD-CI相关,但联合两类指标并采用严格变量选择和防信息泄漏验证的研究仍较少。该研究发表于《Brain and Behavior》,旨在通过横断面设计,量化常规血液指标联合标准化睡眠问卷对PD患者现患CI的关联强度和分类价值。
研究人员在首都医科大学附属北京中医医院神经内科2021年1月至2023年12月连续纳入512例原发性PD患者,按排除标准剔除后共347例进入分析。依据MoCA < 26将患者分为PD-CI组(n = 143)与PD-NCI组(n = 204)。研究采用严格无泄漏的建模流程:先按分层抽样将队列划分为训练集(70%,n = 242)和测试集(30%,n = 105),随后仅在训练集内完成特征选择与调参。借助L1惩罚逻辑回归(LASSO)的lambda.1se准则,从20个候选变量中筛选出10个预测变量,并构建四个嵌套逻辑回归模型以及随机森林(random forest, RF)和梯度提升机(gradient boosting machine, GBM)分类器。结果显示,全模型在测试集上的AUC达0.943,显著优于仅含临床变量的基线模型(0.844,DeLong p = 0.009),且与RF(0.956)和GBM(0.944)相当;重复5 × 2交叉验证得到更保守的AUC为0.921。该研究强调了无泄漏设计对获得真实且可泛化性能估计的重要性,并提示血液与睡眠问卷组合可作为PD-CI的候选筛查工具,但需外部验证。
关键技术方法方面,研究人员采用了以下主要方法:在单中心神经内科连续纳入PD患者;将队列以70%/30%分层划分为训练集与测试集,且划分先于任何特征选择与调参;仅在训练集内进行LASSO特征选择(lambda.1se准则);构建四个嵌套逻辑回归模型(基线临床、基线+血液、基线+睡眠、全模型)及RF和GBM分类器;使用AUC、DeLong检验、校准曲线、Brier评分和决策曲线分析(DCA)评估模型;通过重复5 × 2交叉验证估计泛化性能,并计算方差膨胀因子(VIF)评估多重共线性。
研究结果部分报告如下。
3.1 基线特征:通过比较PD-CI与PD-NCI两组基线资料发现,PD-CI组年龄更大、教育年限更少、病程更长、Hoehn–Yahr分期更高;血液指标中中性粒细胞与淋巴细胞比值(NLR)、PLR、MLR、同型半胱氨酸和C反应蛋白(CRP)显著升高,血红蛋白、白蛋白、尿酸和淋巴细胞计数显著降低;PSQI、ESS、RBDSQ和失眠严重程度指数(ISI)四类睡眠问卷得分均显著更高。这些属于横断面同期比较,不代表时间预测。
3.2 相关性分析:对14个血液和睡眠变量进行Spearman秩相关分析,整体呈弱至中等相关。睡眠问卷之间及炎症比值之间相关较强,而血液与睡眠跨域相关性较弱,提示两类指标捕获的信息大体独立。
3.3 LASSO变量选择:在训练集内采用10折分层交叉验证LASSO,并按lambda.1se准则最终保留10个变量:教育年限、病程、Hoehn–Yahr分期、PLR、MLR、同型半胱氨酸、CRP、PSQI、ESS和RBDSQ;年龄、NLR、血红蛋白、RDW、白蛋白、尿酸、淋巴细胞计数、血糖、HbA1c和ISI均被剔除。各交叉验证折内选择频率较高,表明选择结果稳定。
3.4 多变量逻辑回归与多重共线性:基于筛选后的10个变量建立多变量逻辑回归,PSQI(OR = 2.50)、MLR(OR = 2.40)、PLR(OR = 1.86)、病程(OR = 1.69)、Hoehn–Yahr分期(OR = 1.67)和RBDSQ(OR = 1.62)与CI显著相关;ESS和同型半胱氨酸方向为正但未达到显著;CRP在校正后效应减弱;教育年限呈保护性方向。所有VIF均在1.2–1.6之间,不存在严重多重共线性。
3.5 模型性能比较:嵌套模型比较显示,全逻辑回归模型测试AUC为0.943,显著优于基线模型(0.844,p = 0.009)和基线+睡眠模型(0.889,p = 0.041),但与基线+血液模型(0.937)差异未达显著(p = 0.73),提示在本样本中血液指标提供了大部分增量信息。RF和GBM未表现出优于逻辑回归的判别能力。重复5 × 2交叉验证的AUC为0.921,且嵌套模型呈单调递增排序。
3.6 模型校准:测试集校准斜率为1.18、校准截距为0.03,Brier评分为0.086(95% bootstrap置信区间:0.057–0.120),提示校准可接受,但由于测试集较小,估计精度有限,仍可能存在轻度过拟合。
3.7 决策曲线分析:DCA显示所有模型在0.10–0.60阈值概率范围内均比“全部治疗”和“不治疗”参考策略具有更高净获益。全模型的净获益最高或接近最高,但95% bootstrap置信带较宽并与其他模型重叠,临床效用的差异应谨慎解读。
3.8 机器学习模型中的特征重要性:RF和GBM的特征重要性排序显示,PSQI和RBDSQ在两个模型中均位于前列,血液指标中CRP和同型半胱氨酸也显示出较高重要性。研究强调这些基于不纯度减少的排序为描述性结果,不代表因果效应。
3.9 结局定义的敏感性分析:为处理MoCA受教育影响的问题,研究采用教育校正MoCA、MoCA < 25、MoCA < 24以及近似MDS Level II PD-MCI定义四种替代结局,结果显示AUC范围为0.909–0.931,与主分析0.943重叠,表明结果稳健,教育相关测量伪影难以完全解释主要发现。
讨论部分指出,本研究的核心方法学优势在于无泄漏验证流程和嵌套模型比较。严格将特征选择、标准化和超参数调参限制在训练集内,并在每次交叉验证折内重新推导选择过程,使测试集结果更为可信。单一分割AUC(0.943)与重复交叉验证AUC(0.921)之间的差异也提示,即使去除信息泄漏,残余乐观性仍可能存在。所选炎症标志物与