MIL-O-PD:面向非配对多模态帕金森病诊断的两阶段多示例学习与启发式优化框架

《Frontiers in Aging Neuroscience》:MIL-O-PD: a two-stage multiple instance learning and heuristic optimization framework for unpaired multimodal Parkinson's diagnosis

【字体: 时间:2026年09月09日 来源:Frontiers in Aging Neuroscience 5.2

编辑推荐:

  帕金森病(Parkinson's disease, PD)是一种常见神经退行性疾病。近期研究利用脑电图(EEG)与语音信号等非侵入性生物标志物进行PD诊断。然而,多数方法在实例级优化模型,而临床诊断属于受试者级决策过程。研究人员提出MIL-O-PD,一种面向P

  
帕金森病(Parkinson's disease, PD)是一种常见神经退行性疾病。近期研究利用脑电图(EEG)与语音信号等非侵入性生物标志物进行PD诊断。然而,多数方法在实例级优化模型,而临床诊断属于受试者级决策过程。研究人员提出MIL-O-PD,一种面向PD诊断的新型两阶段受试者级多模态框架。第一阶段采用多示例学习(MIL),使用模态专用编码器与基于注意力的聚合机制;第二阶段引入基于灰狼优化(Grey Wolf Optimization, GWO)的事后特征优化模块与最终受试者级分类器,并在严格受试者无关条件下支持表征级多模态融合。该框架取得最高70.5%受试者级准确率与69.7% F1分数,优于其他池化机制;注意力权重分析揭示模态特异性行为,增强模型可解释性。该研究为面向非配对多模态数据的PD受试者级分析提供了原则性框架,使学习目标与现实诊断流程对齐。
《Frontiers in Aging Neuroscience》刊发的该文针对帕金森病(Parkinson's disease, PD)诊断中长期存在的训练目标与临床决策不一致问题展开研究。PD是神经退行性运动相关障碍,传统临床依赖患者自述症状,非运动症状早期出现但常规查体难以系统捕捉,因此亟需可量化生物标志物。EEG与语音因非侵入、低成本、易获取而被广泛研究;但现有方法多在段/帧等实例级训练,再用投票或概率聚合得到受试者判断,学习目标与受试者级诊断脱节。同时,EEG与语音在受试者无关设定下的联合建模、以及非配对多模态数据的受试者级学习,均属研究空白。研究人员据此提出MIL-O-PD,把每名受试者的多段信号视为一个包(bag),以包级标签监督,直接服务临床受试者级判别。
为开展研究,研究人员使用公开队列:EEG来自OpenNeuro-ds004584(100 PD / 49 HC)与OpenNeuro-ds003490(25 PD / 25 HC,取服药期);语音来自MDVR-KCL(16 PD / 21 HC,英文)与IPVS(28 PD / 57 HC,意大利语)。关键技术方法包括:多示例学习(MIL)把受试者表示为实例集合;模态专用卷积实例编码器分别处理PSD谱图与梅尔谱图;Bahdanau式注意力池化得到受试者嵌入;非配对数据通过加模态指示项的表征级融合构成1001维联合空间;以灰狼优化(GWO)作事后特征选择,并用5次独立运行与Jaccard稳定性指数(JSI)形成自适应共识掩码;下游用多层感知机(MLP)分类,全程受试者无关划分训练60%、验证20%、测试20%。
研究结果如下。
单模态评估:EEG全空间1000维经MLP仅44.6%准确率,GWO优化至246维后升至59.5%准确率、53.2% F1、0.512 ROC-AUC;语音全空间66.2%准确率,优化至274维后达71.8%准确率、69.6% F1。说明单模态在严格受试者无关下性能有限,但GWO可压缩冗余、提升判别性。
多模态融合表征结果:原始1001维联合空间准确率66.9%、F1 64.0%、ROC-AUC 0.637;GWO共识掩码保留729维后,准确率70.5%(95% CI: 0.586, 0.810)、F1 69.7%、ROC-AUC 0.740,且置信区间下界上移,证明互补模态融合比单模态更稳。
优化稳定性分析:GWO在EEG、语音、融合的成对JSI分别为0.3624、0.3884、0.4585;融合空间稳定性最高,共识协议把随机性收敛为确定性掩码(K=729)。
与标准选择基线比较:ANOVA F检验63.4%、互信息(MI)63.6%、递归特征消除结合逻辑回归(RFE-LR)68.7%;GWO以70.5%准确率与0.740 AUC最优,显示全局种群搜索更适配非线性潜空间。
元启发式消融:粒子群优化(PSO) JSI 0.2443、准确率53.1%;和声搜索(HS) JSI 0.3309、准确率61.8%;GWO JSI 0.4585居首,故选GWO为主模块。
第一阶段注意力池化分析:EEG中100%受试者高注意力段平均能量更低,模型抑制眼动/肌电等高能伪迹,关注结构化神经活动;语音中约69%受试者高注意力段能量更高,符合发音、基频扰动等诊断信息集中于高能段的声音学原理,证明注意力权重具生理与声学可解释性。
讨论部分总结:研究人员指出,MIL-O-PD把EEG与语音建成包级问题,用注意力池化对齐临床受试者级目标,并以数据驱动自适应共识控制GWO随机性。融合空间经第二阶段正则后,准确率70.5%、F1 69.7%、AUC 74.0%,置信下界抬升,说明互补生理证据降低诊断不确定性。注意力跨模态异质性进一步验证模型并非随机:EEG抑高能伪迹、语音取高能音段。局限包括语音样本少、跨站点/跨语言分布偏移、非配对致无法建跨模态交互。未来应扩配对队列、加归因可解释方法、做严重度估计与生物标志物发现。
结论部分翻译:本研究中,研究人员提出MIL-O-PD这一面向受试者级PD诊断的原则性两阶段框架,利用EEG与语音信号取得最高70.5%准确率。通过将两种模态纳入MIL范式,该方法在严格受试者无关评估下,显式修正实例级学习与受试者级临床诊断间的错位。所学受试者级表征稳定且可解释;注意力分析揭示与两模态已知特性一致的模态特异性行为;表征级融合为非配对异质模态整合提供实用方案,并产生适于下游分析的稳健受试者嵌入。相较于传统池化,该框架可解释性更好且避开其系统偏差。总之,本研究强调对齐学习目标与临床决策需求的重要性,并确立其作为受试者级神经疾病分析有效框架的地位。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号