《Molecular & Cellular Proteomics》:Pretrained spectrum representations for diverse tandem mass spectrometry proteomics tasks
编辑推荐:
质谱(mass spectrometry)是蛋白质组学(proteomics)领域的主导技术,能够对复杂生物样品中的蛋白质含量进行高通量分析。由于仪器和所得数据的复杂性,处理和解释所采集质谱图需要先进的计算方法。机器学习(machine learning, M
质谱(mass spectrometry)是蛋白质组学(proteomics)领域的主导技术,能够对复杂生物样品中的蛋白质含量进行高通量分析。由于仪器和所得数据的复杂性,处理和解释所采集质谱图需要先进的计算方法。机器学习(machine learning, ML)在改进质谱数据分析方面展现出巨大前景,许多为改进数据采集和分析流程中特定步骤而专门构建的方法已被广泛采用。这些任务均依赖于对质谱图中信息所共有的基础性理解。在此,研究人员提出一种迁移学习(transfer learning)框架CasanovoTL,其利用预训练谱图表示(pretrained spectrum representations),这些表示来源于在大型蛋白质组学数据集上训练的de novo测序(de novo sequencing)模型,而非为每项任务从头训练谱图编码器(spectrum encoder)。研究人员表明,使用这些预训练谱图表示显著提升了四个下游任务(downstream tasks)的性能:谱图质量预测(spectrum quality prediction)、嵌合性预测(chimericity prediction)、磷酸化预测(phosphorylation prediction)和糖基化状态预测(glycosylation status prediction)。最后,研究人员进行端到端微调(end-to-end finetuning)以及多任务训练(multi-task training),发现微调后的谱图表示进一步提升每个单独任务的性能。总体而言,该工作表明,一个用于串联质谱(tandem mass spectrometry, MS/MS)蛋白质组学、在de novo测序上预训练的谱图编码器可学习谱图的泛化表示,提升训练数据有限时下游任务的性能,并最终增强蛋白质组学实验中的数据采集和分析。
论文解读:预训练谱图表示用于多样化串联质谱蛋白质组学任务
质谱(mass spectrometry)是蛋白质组学(proteomics)领域的主导技术,其中串联质谱(tandem mass spectrometry, MS/MS)是系统分析生物样品完整蛋白质含量的高通量方法,推动了疾病生物标志物发现、药物开发以及翻译后修饰(post-translational modifications, PTMs)分析。标准MS/MS实验将蛋白质消化为短肽,离子化并碎裂,测量碎片离子的质荷比(mass-to-charge ratio, m/z),得到由一系列峰组成的MS/MS谱图,每个峰包含特定离子的m/z和强度。一次典型质谱运行可收集数万张谱图,通常经数据库搜索算法为每张谱图分配生成肽段,但也涉及谱图聚类和de novo测序等下游任务。机器学习方法可分为输入肽段序列和输入谱图两类。前者预测肽段性质,如碎裂模式和保留时间,以提升数据库搜索灵敏度;后者以谱图为输入,最基本任务是de novo肽段测序,此外还包括预测谱图是否由可识别肽段产生、是否包含多分析物混合信号、是否携带特定PTM等。当前领域缺乏统一分析框架,许多下游任务训练数据不足且训练标签有噪声,单独为每个任务学习丰富谱图理解较困难。已有研究尝试有限:DIA-BERT面向数据独立采集(data-independent acquisition, DIA)数据中的肽段检测;yHydra用于数据依赖采集(data-dependent acquisition, DDA)数据,但下游任务与数据库搜索密切相关,通用性不清楚;代谢组学中LSM1-MS2、PRISM、DreaMS等使用无监督掩码峰建模学习小分子质谱表示。研究人员因此探索学习到的谱图嵌入能否作为蛋白质组学多种下游任务的起点。由于能够进行de novo测序的模型必须隐式编码肽段在质谱仪中碎裂并产生观测谱图的知识,研究人员提取Casanovo的谱图编码器,构建迁移学习框架CasanovoTL,并在谱图质量预测、嵌合性预测、磷酸化预测和糖基化状态预测四项任务上评估。结论是,预训练谱图表示信息丰富且可泛化,能提升下游任务性能,尤其在训练数据有限时;端到端微调可进一步提升性能,并最终增强蛋白质组学实验的数据采集和分析。
关键技术方法:研究人员使用Casanovo 4.0.0的谱图编码器,其在MassIVE-KB的3000万条高质量标记串联质谱(MS/MS)上通过de novo测序任务监督预训练。CasanovoTL冻结该编码器,取单个峰嵌入均值获得512维谱图表示,并训练两层稠密网络任务头。端到端微调训练整个编码器与预测头;多任务微调同时优化谱图质量、嵌合性、磷酸化预测及de novo测序损失,并使用32倍降采样磷酸化数据。基线包括m/z分箱嵌入结合XGBoost、DepthCharge端到端transformer、GlyCounter结合XGBoost、AHLF及m/z 138/144比值。样本来源包括:质量任务随机选取20个人Orbitrap HCD PRIDE数据;嵌合性任务使用人、小鼠、酵母样本Orbitrap Fusion Lumos数据;磷酸化任务使用ProteomeXchange PXD012174人磷酸化蛋白质组101种细胞/组织类型;糖基化任务使用PXD052447小鼠脑48个HCD运行;实验设置预测使用同实验室同样本配对实验。
3.1 de novo肽段测序作为预训练任务。研究人员指出,准确de novo测序需捕获分析物与观测信号关系,并理解肽段色谱、离子化和碎裂。通常迁移学习先无监督预训练再监督学习,但蛋白质组学中每轮约40–60%谱图可高置信自动注释,因此研究人员探索以监督de novo肽段测序作为预训练。Casanovo是基于transformer的编码器–解码器模型,在MassIVE-KB的3000万张高质量标记串联质谱上训练。CasanovoTL使用其预训练谱图编码器,将谱图视为峰包,每个峰由m/z位置嵌入和学习强度嵌入表示,整体谱图表示取峰嵌入逐元素均值。冻结该编码器后,训练任务特异性稠密预测头,并与分箱嵌入、端到端transformer等基线比较。
3.2 谱图质量预测。该任务预测MS/MS谱图能否被数据库搜索成功注释。动机包括提前剔除低质量谱图、发现数据库搜索漏检、实时调整仪器采集。研究人员随机选取20个人高分辨率质谱运行,按10/5/5划分训练、验证和测试集,分别约1.2M、190k和315k张谱图;1%后验错误概率(posterior error probability, PEP)匹配为高质量,未匹配为低质量,高低质量约40%/60%。采用受试者工作特征曲线下面积(AUROC)评价。CasanovoTL达到AUROC 0.802,优于端到端transformer的0.773和分箱嵌入的0.701,说明预训练表示捕获了质量预测任务单独难以学习的性质,也反映de novo预训练任务更丰富且使用了更多数据。
3.3 谱图嵌合性预测。该任务检测一张MS/MS谱图是否由多个肽段同时碎裂产生。研究人员使用人、小鼠、酵母样本分别作为训练、验证和测试,经FragPipe宽窗口搜索,1%肽段-谱图匹配(PSM)错误发现率(FDR)过滤,多肽匹配为嵌合,单肽匹配为非嵌合。每个划分约60,000张至少匹配一个肽段的谱图,约45%为嵌合。以AUROC评价,CasanovoTL达到0.780,优于两个基线的0.714和0.725。
3.4 翻译后修饰检测。该任务检测携带PTM的肽段谱图。磷酸化预测使用人磷酸化蛋白质组数据集PXD012174,包含19.2百万张标记谱图,54%为磷酸化,并采用AHLF相同训练、验证和测试划分。CasanovoTL的AUROC为0.948,优于分箱基线0.861,但低于端到端transformer的0.965;在25个测试数据集中,CasanovoTL在19/25数据集上优于AHLF,但端到端transformer在F1上19/25、AUROC上17/25更优。学习曲线显示,当训练数据少于约1百万张谱图时,CasanovoTL优于端到端transformer;仅用7,615张谱图时,CasanovoTL AUROC为0.881,而分箱和端到端transformer分别为0.639和0.635。糖基化状态预测使用小鼠脑糖蛋白组数据集DQGlyco,含252,970个糖肽鉴定,其中25,757个为O-糖基化,占10.2%;任务区分N-糖基化与O-糖基化。域特异基线m/z 138/144比值AUROC为0.872,GlyCounter结合XGBoost为0.951;分箱和端到端transformer分别为0.950和0.959;CasanovoTL最高,AUROC为0.976,AUPR为0.914,高于其他方法的0.753、0.860、0.811和0.867。
3.5 实验设置预测。该任务预测采集谱图时使用的碎裂类型和质量分析器,用于大规模重分析中补充难以获得的实验元数据,也衡量表示是否捕获与肽段序列关联较弱的信号。研究人员在同实验室、同样本配对的实验上训练和测试模型,预测Orbitrap与飞行时间(TOF)质量分析器,以及碰撞诱导解离(CID)与高能碰撞解离(HCD)碎裂。分箱基线在质量分析器任务AUROC为0.963,transformer为0.995;碎裂任务两基线分别为0.978和0.983。CasanovoTL分别达到0.996和0.988,表明其表示捕获了生成肽段序列之外的谱图属性。
3.6 评估替代谱图表示。研究人员比较yHydra谱图编码器。yHydra通过CLIP式对比学习共嵌入肽段和谱图。其在下游任务AUROC分别为:质量预测0.763、嵌合性预测0.702、磷酸化检测0.757、糖基化状态预测0.888。CasanovoTL在四项任务上均明显更好。研究人员指出差异可能来自预训练任务、训练数据、模型大小或架构,但两个不同任务训练的谱图编码器都能泛化到新任务,支持预训练谱图表示这一方向。
3.7 端到端与多任务训练策略的微调。研究人员进一步探索微调预训练Casanovo编码器。任务特异端到端微调提升三项任务:质量预测AUROC从0.802升至0.836,嵌合性预测从0.780升至0.829,磷酸化预测从0.948升至0.983;磷酸化预测超过在完整磷酸化数据上训练的任务特异transformer,并在25个测试数据集中17个取得最佳。该微调模型收敛很快,研究人员使用32倍降采样磷酸化数据,即总训练数据仅为竞争方法的1/32。多任务微调同时优化质量、嵌合性和磷酸化预测及de novo测序损失,结果与单任务微调差异小:质量0.837、嵌合性0.821、磷酸化0.988;但在未参与训练的糖基化任务上,多任务表示AUROC为0.968,低于非微调编码器的0.976,de novo测序测试损失从0.23升至0.27。研究人员认为,多任务训练未带来额外数据多样性优势,也未发现明显跨任务共享信息帮助泛化。主成分分析显示,预训练嵌入中各类别重叠严重,微调后磷酸化数据第一主成分明显分离,其他任务也更清晰。总体而言,任务特异端到端微调性能最佳,但计算成本高:MassIVE-KB预训练在4块RTX 2080 Ti上耗时8天,线性预测头训练少于15分钟且只需CPU,任务特异微调在单块A100 80G上需1–3天。
讨论部分总结:研究人员证明,de novo测序模型谱图编码器学到的预训练表示具有通用性。冻结谱图嵌入训练的小模型在广泛下游任务中表现良好,端到端微调可进一步提升,CasanovoTL在所有应用的下游任务上达到先进性能。这显示基础模型可作为蛋白质组学质谱中的灵活起点,无需大规模任务特异标签数据。局限包括:未测试涌现行为或零样本能力;预训练使用监督任务且数据相对同质,而基础模型通常使用无监督目标以利用更大更多样数据;下游任务存在重叠,PTM和嵌合性影响可识别性;依赖GPU等计算资源;预训练和基线超参数优化有限。未来工作可开发适合质谱的无监督预训练,纳入未鉴定谱图、PTM、其他物种和仪器平台数据,并探索更依赖生成肽段之外信息的下游任务。研究结论翻译为:总体而言,该工作表明,一个用于串联质谱(tandem mass spectrometry, MS/MS)蛋白质组学、在de novo测序上预训练的谱图编码器可学习谱图的泛化表示,提升训练数据有限时下游任务的性能,并最终增强蛋白质组学实验中的数据采集和分析。