《Frontiers in Neuroscience》:A proof-of-concept application of gene set enrichment analysis principles to olfactory phenotyping in Parkinson’s disease
编辑推荐:
引言:尽管基因集富集分析(gene set enrichment analysis,GSEA)框架被广泛用于转录组学或蛋白质组学数据,但其在“组学”数据之外的应用尚未得到广泛探索。其基本原理使其能够应用于任何可以将变量合理分类为类别或集合的数据集。本研究将GS
引言:尽管基因集富集分析(gene set enrichment analysis,GSEA)框架被广泛用于转录组学或蛋白质组学数据,但其在“组学”数据之外的应用尚未得到广泛探索。其基本原理使其能够应用于任何可以将变量合理分类为类别或集合的数据集。本研究将GSEA框架应用于临床嗅觉表型数据,展示了其在传统用途之外的新应用。
方法:研究人员将GSEA框架应用于来自帕金森病(Parkinson’s disease,PD)患者和健康对照者的宾夕法尼亚大学嗅觉识别测试(University of Pennsylvania Smell Identification Test,UPSIT)结果。气味被划分为七个不同的功能类别,并使用基于秩的累计和来识别这些类别中的协调变化。
结果:该方法揭示了帕金森病患者“柑橘/清新”气味类别中的探索性负富集模式。计算流程与合成阳性对照、阴性对照以及基于排列的健全性检查一起进行了系统评估。
讨论:类别特异性的嗅觉丧失模式可能为神经退行性过程提供额外见解,提示其在帕金森病更精细的嗅觉表型分型中具有潜在价值。这一概念验证凸显了既定的基因组算法如何能够直接适应于变量可进行有意义分组的临床工具、问卷或认知数据。然而,此处的结果应被视为探索性的。
基因集富集分析原理在帕金森病嗅觉表型分析中的概念验证应用
——一项发表于《Frontiers in Neuroscience》的探索性研究解读
一、研究背景与目的
解读基因组或蛋白组等高维数据时,基因集富集分析(gene set enrichment analysis,GSEA)是一种识别预定义变量集内协调变化的有效框架,其优势在于捕捉孤立分析难以发现的系统性模式。自提出以来,GSEA被广泛应用于转录组学与蛋白质组学领域,随后也扩展到代谢组学研究。从原理上讲,GSEA并不限于“组学”数据,任何能将变量理性归入类别或集合的数据集均可适用,但目前其在传统组学之外的应用鲜有探索。
帕金森病(Parkinson’s disease,PD)以运动迟缓、僵硬与震颤等运动症状为主要特征,但嗅觉丧失同样是既定的临床生物标志物,常通过宾夕法尼亚大学嗅觉识别测试(University of Pennsylvania Smell Identification Test,UPSIT)评估。一个悬而未决的问题是:PD患者的嗅觉功能障碍究竟是跨气味的均匀损伤,还是存在特定气味类别的选择性易感?既往研究关于哪些气味能最佳区分PD患者与健康对照的报告并不一致。由于气味可依据功能分类,将GSEA框架迁移至临床嗅觉数据,为检测协调性的嗅觉亚域模式提供了新颖的计算视角。
该研究以PD嗅觉表型数据为模型,首次在“组学”数据之外演示了GSEA框架的适用性,旨在验证“既定的基因组算法可直接改造用于临床量表、问卷或认知数据”的构想。论文发表在《Frontiers in Neuroscience》。
二、主要技术方法与数据来源
本研究使用了Zenodo公开存储库(DOI: 10.5281/zenodo.13323913)中的渥太华试验(Ottawa Trial)队列数据,包含PD患者(n=69)与年龄匹配健康对照(HC,n=118)的完整UPSIT评分。关键流程包括:研究人员对每种气味分别计算两组识别率、log
2倍数变化(FC)与Fisher精确检验p值,并构造秩分(RS=log
2(FC)×(?log
10(p值)))作为排序依据;利用大语言模型Gemini 3.1 Flash-Lite将40种气味初始分类为七个功能类别(化学/工业、柑橘/清新、花香、果香、咸味食物、辛香/木质、甜味),并经研究团队人工验证;使用R语言fgsea包执行预排序GSEA,最小类别大小为3,以自适应多重分裂估计p值,Benjamini-Hochberg校正多重检验(p-adjusted<0.25视为显著);设计合成阳性和阴性对照类别实施健全性检查;进行5,000次排列检验评估随机性;最后在Jamovi中执行二项逻辑回归验证类别判别力。
三、研究结果
3.1 GSEA分析结果:富集模式的识别
基于UPSIT数据构建气味类别与秩分后,研究人员比较了PD组与HC组的差异富集类别。除人工设计的阳性对照外,“柑橘/清新”类别达到显著富集,归一化富集得分(normalized enrichment score,NES)为?1.63,校正后p值(p-adjusted)为0.04;阳性对照类别NES为?1.76,p-adjusted为0.01;阴性对照类别未达显著(NES=?0.77,p-adjusted=0.81)。运行富集得分图显示,“柑橘/清新”与阳性对照类别呈相似的集中式命中模式,表明气味存在协调性变化;而非显著的“甜味”类别与阴性对照的气味则沿排序轴分散,无协调性变化。使用GSEA桌面软件独立重复分析,“柑橘/清新”类别获得p-adjusted=0.039,与主分析保持一致,但所有结果均界定为探索性。
3.2 排列检验验证
为排除流程本身的技术假象,研究人员将秩分在40种气味间随机打乱5,000次并重新运行GSEA。结果显示大多数随机置换产生的“柑橘/清新”类别FDR校正p值超过0.25,极少出现显著富集,证实原始结果显著超出随机预期,进一步支持发现的技术可靠性。
3.3 二项逻辑回归分析
为评估各气味类别对PD与HC分类的判别力,研究人员进行了二项逻辑回归。唯一显著的类别为预先设计的阳性对照(p<0.001;OR=0.039,95%CI [0.009, 0.157]),阴性对照无显著判别力。“柑橘/清新”类别在GSEA中表现显著,但在逻辑回归中未达显著。研究人员指出两种方法的权重机制不同是差异主因:逻辑回归对类别内每个气味给予相同权重,可能稀释类别内局部效应;而GSEA按秩分加权,使组间差异较强的气味对结果产生更大影响,因而能够捕获协调而不均匀的微弱信号。
四、讨论与结论
本研究证实GSEA原理可成功迁移至临床嗅觉表型数据,并提出PD嗅觉丧失可能倾向于特定气味质量而非均匀发生的假设。阳性对照类别在两种方法中均显著,提示当潜在效应足够强且在各条目间一致时,两种方法能够收敛;而“柑橘/清新”类别未获逻辑回归支持,应被视为探索性和假设生成性的结果,需在更大规模独立数据集中验证。研究采用了原始GSEA建议的p-adjusted<0.25阈值,该宽松阈值有增加假阳性风险的可能,因此研究人员设置了阳性和阴性对照、排列模拟以及独立的逻辑回归分析加以补充,这些努力虽然不能取代外部验证,但从多个角度为富集结果提供了支撑。
在临床意义上,嗅觉功能障碍往往先于PD运动症状数年出现,气味类别特异性的损伤模式或可用于开发早期、无创的筛查途径;单维度的UPSIT总分无法反映嗅觉损伤的定性维度,而这种类别层面的信息可作为疾病诊断和监测的补充指标。此外,不同气味激活不同的嗅觉受体家族与下游信号通路,类别水平损伤的定位可能为疾病机制研究提供切入点。更重要的是,GSEA的重构思路不应局限于嗅觉数据,还可延伸至生活质量问卷、认知功能评估等结构化临床工具,以识别个体亚临床表现并观察受影响的交互维度。
研究局限性方面:本文的初始气味分类依赖生成式人工智能模型,虽可重复性高,但可能无法完全捕捉真实感官体验和跨文化嗅觉差异;作为概念验证样本量有限,需要在更大的纵向队列(如帕金森进展标志物倡议)中进一步验证。未来可用专家人工共识或化学结构聚类替代AI分类,并应系统优化统计检验、秩分计算、集合规模与置换次数等参数。
结论:将GSEA等基因组算法适应于临床数据集为数据复用开辟了一条有前景的途径。该框架高度灵活,可轻松扩展到神经心理学成套测验、运动症状量表或生活方式问卷等其他结构化临床工具。通过关注协调模式而非孤立条目,临床医生和研究人员可从已经收集的数据中提取更深层次的系统级见解。虽然早期检测仍是帕金森病研究的优先事项,但本研究所观察到的亚域富集代表的是分析性概念验证,而非经过验证的临床筛查工具。