《International Journal of Molecular Sciences》:MCOF: A Multi-Channel Attention-Based Omics Fusion Framework for Cancer Subtyping and Candidate Biomarker Prioritization
编辑推荐:
多组学分子分型因小样本量、异质性数据层以及对数据划分和特征选择的敏感性而变得复杂。研究人员开发了多通道注意力组学融合(MCOF),这是一个端到端框架,结合了组学特异性投影、一维卷积和集成梯度(IG)用于候选生物标志物优先排序。MCOF与六种基线方法进行了比较,
多组学分子分型因小样本量、异质性数据层以及对数据划分和特征选择的敏感性而变得复杂。研究人员开发了多通道注意力组学融合(MCOF),这是一个端到端框架,结合了组学特异性投影、一维卷积和集成梯度(IG)用于候选生物标志物优先排序。MCOF与六种基线方法进行了比较,使用了四个多组学数据集上的五次重复分层保留法。在限制的四类乳腺浸润癌任务中,MCOF在所有五个指标上均获得了最高的观测均值,包括准确率0.900±0.022和宏平均受试者工作特征曲线下面积(macro-AUC)0.982±0.003。在限制的三类胃腺癌任务中,MCOF取得了最高的观测宏F1值(0.786±0.035)、宏AUC(0.934±0.020)和加权AUC(0.930±0.016),而支持向量机(SVM)在准确率和加权F1上略高。在两个非癌症数据集上,MCOF也达到了最高或接近最高的AUC。与MOGONET相比,MCOF在两个癌症任务中使用的可训练参数减少了30.6%。敏感性分析表明,多组学融合的贡献因数据集和指标而异。排除保留的BRCA RNA面板中存在的28个预测分析微阵列50(PAM50)基因后,宏AUC仅从0.982±0.003适度下降至0.978±0.004。对20个训练好的检查点进行的实现测试未检测到批次顺序效应或跨样本梯度,而IG排名在重复保留法中保持中等稳定,并在不同类别加权方案和25至100个积分步数下数值一致。MCOF为多组学分类和候选优先排序提供了一个实用框架。
研究背景与问题
癌症等疾病的分子亚型很少由单一生物学层面决定。基因组、转录组、表观基因组、蛋白质组和代谢组测量捕捉了塑造肿瘤特性、进展和治疗敏感性的互补过程。整合这些层面可以改善分子分层,并揭示在单一模态中微弱或不可见的信号。然而,实际挑战在于多组学队列通常相对于其维度较小,而各模态在尺度、噪声、冗余和生物学意义上差异显著。统计整合方法和传统机器学习分类器在性能上往往依赖于数据集,而深度学习方法虽然能联合学习任务表征,但如图模型等引入了额外的建模选择和计算成本。因此,需要一个能够平衡性能、效率与可解释性的紧凑型端到端框架。
研究内容与结论
为解决上述问题,研究人员提出了多通道注意力组学融合(MCOF)框架。该框架将每个组学层视为独立的信息通道,通过通道注意力机制学习模态权重并进行重校准,随后利用轻量级的一维卷积分类器进行融合表征学习,并采用集成梯度(IG)方法进行候选生物标志物的优先排序。研究评估了MCOF在四个多组学数据集上的表现,包括两个癌症亚型分类任务和两个疾病二元分类任务。结果表明,MCOF在乳腺癌(BRCA)和胃癌(STAD)的分子亚型分类任务中展现出最明显的优势,在BRCA的所有五个指标上均取得最高均值,在STAD的三个指标上最优。在非癌症任务中,MCOF保持了竞争力,尤其在AUC指标上表现良好。严格的消融实验证实了通道注意力和卷积模块在不同数据集上的互补作用。效率分析显示,MCOF比图模型基线MOGONET减少了约30.6%的可训练参数,并在三个数据集上推理更快。集成梯度产生的特征排名在重复实验中表现出中等稳定性,且排名在类别聚合方式和积分步数选择上具有鲁棒性。该研究的重要意义在于提供了一个实用、可解释且相对高效的多组学分类与候选生物标志物发现框架,但其性能并非普遍优越,且仍需独立队列验证和功能后续研究。
主要关键技术方法
- 1.
数据集与预处理:使用了来自TCGA的乳腺癌(BRCA)和胃腺癌(STAD)的RNA和miRNA数据,以及来自ROSMAP研究的阿尔茨海默病(AD)相关数据和另一项研究的精神分裂症(SCZ)数据。对数据进行缺失值处理、标准化和固定特征面板构建。采用五次重复的分层80:20保留法进行评估。
- 2.
MCOF模型架构:包含三个核心模块。多通道注意力模块:每个组学层通过特异性投影映射到公共潜在空间,然后通过压缩和激励机制学习样本特异性的通道权重,并将加权后的表征求和得到融合表征。卷积分类器模块:融合表征经线性投影后输入一维卷积神经网络,包含卷积、激活和池化层,最终输出类别预测。集成梯度解释模块:使用集成梯度方法计算每个输入特征对预测类别的归因分数,用于候选生物标志物的优先排序。
- 3.
比较与评估方法:与六种基线方法比较,包括K近邻(KNN)、支持向量机(SVM)、高斯朴素贝叶斯(NB)、随机森林(RF)、统计整合方法DIABLO和图深度学习方法MOGONET。评估指标包括准确率、F1分数、AUC和马修斯相关系数(MCC)。
研究结果
2.1 跨癌症与跨疾病分类任务的性能
通过五次重复分层保留法比较MCOF与六种基线方法的性能。在BRCA任务中,MCOF在所有五个指标上均获得最高均值,包括准确率0.900±0.022和宏AUC 0.982±0.003。在STAD任务中,MCOF取得了最高的宏F1(0.786±0.035)、宏AUC(0.934±0.020)和加权AUC(0.930±0.016),而SVM在准确率和加权F1上略高。在非癌症的ROSMAP和SCZ数据集上,MCOF在AUC指标上保持竞争力。
2.2 对组学组成、PAM50重叠和特征预算的敏感性
单组学和留一组学分析显示,融合的贡献因数据集和指标而异。在BRCA中,仅RNA模型的宏F1和宏AUC略高于完整模型,表明RNA携带大部分癌症标签信号。移除与PAM50重叠的28个基因后,BRCA的宏AUC仅从0.982±0.003小幅降至0.978±0.004。训练集内的特征预算分析表明,更紧凑的特征面板并未在所有数据集中提供一致优势。
2.3 类别特异性性能
MCOF的类别特异性结果显示,基底样BRCA亚型的灵敏度和AUC达到完美值1.000±0.000,而HER2富集型和管腔B型变异性较大。在STAD中,基因组稳定(GS)亚型的F1低于染色体不稳定(CIN)和微卫星不稳定(MSI)亚型。
2.4 严格消融分析
通过比较完整MCOF与移除通道注意力或卷积模块的变体。在BRCA上,完整模型取得了最高准确率和宏AUC。在STAD上,移除通道注意力导致所有指标下降,而移除卷积模块虽提高了准确率和F1但降低了宏AUC,表明两个模块具有互补且依赖数据集的作用。
2.5 计算效率
效率测量显示,在两个癌症任务中,MCOF比MOGONET少约30.6%的可训练参数。在STAD上,MCOF的完整测试集前向推理快2.30倍。但MOGONET在BRCA上推理更快,且在三个数据集上峰值内存分配更低,表明这是一种数据集相关的性能-效率权衡。
2.6 候选优先排序、实现检查与归因鲁棒性
集成梯度生成的跨五次重复的特征排名表现出中等稳定性,BRCA和STAD的平均Spearman相关性约为0.47。数值检查确认50步积分已足够。实现测试未检测到批次顺序效应或跨样本梯度。BRCA中最稳定的候选物包括hsa-miR-4664、PPP1R14C和VGLL1等已知与乳腺癌亚型相关的基因。STAD中的BCL2L10和MLH1等也与已知亚型生物学一致。
讨论与结论
讨论总结:MCOF旨在解决多组学分类中的实际问题。其在癌症分子亚型任务中优势最明显,尤其是在不平衡队列中保持类别间区分度方面。非癌症数据集的结果表明MCOF具有广泛的可迁移性,但并非普遍最优。严格的消融分析支持了模块的互补性和数据集依赖性。效率分析显示了有利的参数缩放和前向推理速度。集成梯度结果提供了生物学有效性,重复识别的候选物如BRCA中的PPP1R14C、VGLL1和FOXC1,以及STAD中的BCL2L10和MLH1,均与已知亚型生物学一致。研究局限性包括缺乏独立外部队列验证、默认均衡特征预算可能非最优、仅纳入一个深度学习基线、未评估生存或治疗反应结局以及无湿实验室验证。
研究结论翻译:MCOF在一个统一框架中整合了多通道注意力、卷积表征学习和集成梯度,用于多组学分类和候选生物标志物优先排序。该模型在BRCA和STAD分子亚型分型中展现出最强优势,在二元任务中保持竞争力,并在三个数据集上提供了有利的推理速度。在移除28个PAM50重叠基因后,性能依然保持高位,同时实现测试确认了无跨样本信息流,且归因排名对类别聚合和积分步数选择具有鲁棒性。这些结果支持MCOF作为一个实用且可解释的多组学分子分层框架,但独立的队列验证和功能后续研究仍然至关重要。