《Nature Communications》:ProFormer: generalizable classification of single-cell and plasma proteomes using deep learning
编辑推荐:
蛋白质是细胞功能和疾病的主要驱动因素,使蛋白质组学成为生物标志物发现和定义细胞身份的强大技术。当前技术可分析数千种蛋白质并达到单细胞灵敏度,但有限通量限制了诸如大型生物学或临床队列的稳健分类等应用。为弥补这一差距,研究人员提出一种深度学习(deep learn
蛋白质是细胞功能和疾病的主要驱动因素,使蛋白质组学成为生物标志物发现和定义细胞身份的强大技术。当前技术可分析数千种蛋白质并达到单细胞灵敏度,但有限通量限制了诸如大型生物学或临床队列的稳健分类等应用。为弥补这一差距,研究人员提出一种深度学习(deep learning, DL)方法,用于直接分析质谱(mass spectrometric, MS)数据,将蛋白质组谱分配给样本身份。具体而言,研究人员引入 ProFormer,一种 transformer 流程,其通过源自肽离子的表格化 MS1 水平特征对样本进行分类,从而消除耗时数据解析的需求。ProFormer 优于传统机器学习(machine learning, ML)和基于图像的卷积神经网络(convolutional neural networks, CNNs),在超过14种评估架构中表现出增强的分类和泛化能力。研究人员进一步提供关于 ProFormer 如何动态聚合 MS1 数据的详细见解,同时保留信号贡献,并在单肽分辨率实现可解释人工智能(explainable AI)。应用于多样 LC-MS 数据集时,ProFormer 准确分类单细胞蛋白质组(single-cell proteomes)的细胞类型、细胞周期阶段或分化轨迹,以及血浆蛋白质组(plasma proteomes)的患者疾病状态。因此,ProFormer 为蛋白质组数据分类提供通用且快速框架,对患者分层、早期检测和单细胞分析具有重要意义。
蛋白质几乎控制细胞所有生化过程,其表达动态调节,蛋白质组密切反映细胞功能表型。基于自下而上的蛋白质组学通常先酶切为肽,经液相色谱(liquid chromatography, LC)分离,再由质谱(mass spectrometry, MS)测定质荷比(mass-to-charge, m/z)并积分肽离子信号(MS
1水平),随后碎裂生成序列信息以推断蛋白身份(MS
2水平)。该策略广泛用于生物学和临床,但存在两个主要限制:MS
2迭代测序耗时,限制分析速度;肽鉴定依赖若干假设,可能限制对蛋白质组分析所产生信号图的观察。许多问题可能只需简单判别,MS
1保留时间、m/z和强度特征可定义样本肽离子谱。现有分类器多依赖经MS
2鉴定肽或蛋白的处理数据,跨实验泛化差;基于MS
1的肽不可知分类可能更稳健。图像化卷积神经网络将MS
1转为热图,但分箱可能造成信息损失,固定特征限制离子淌度等新维度,且缺少独立测试,可能过拟合。Transformer自注意力机制适合学习无空间关系模式。该研究发表于《Nature Communications》,提出ProFormer,为患者分层、早期检测和单细胞分析提供快速通用框架。
关键技术方法(≤250字):研究人员培养HeLa S3细胞并进行IFN-γ处理,构建内部数据;使用timsTOF Pro与diaPASEF LC-MS/MS采集,经DIA-NN或MaxQuant提取MS
1特征。ProFormer以表格化肽离子特征为输入,经可学习patch merger生成tokens,加入CLS token,通过transformer编码器与分类头输出二分类。比较传统ML、CNN和Vision Transformer;用SHAP解释,浓度系列测试泛化,并重新分析近期发表单细胞数据集及COMBAT血浆蛋白质组队列(490名参与者)。
研究结果:
Creation of a transformer-based model for peptide-level classification of proteome samples:研究人员构建ProFormer,允许m/z、保留时间、离子淌度和强度等任意数量MS
1特征,patch merger学习性聚合,无位置编码,transformer自注意力,二分类。
Batch-robust classification and dose-dependent generalization by the ProFormer:用HeLa IFN-γ数据,训练142次注射,测试71次注射时隔约六个月。传统ML最佳logistic regression仅64.7% AUC;ProFormer 4D达84.0% AUC,3D达83.4%,优于CNN和ViT,验证与测试差异小。ResNet_v2_50达79.9% AUC,但验证测试下降20–28个百分点。多重复测试中4D-ProFormer AUC约97%。浓度系列中Spearman相关系数+0.72,R
2=0.77,检测限为9.44 ng/mL。
A learnable patch merger preserves information content while reducing peptide dimensionality:注意力权重显示patch聚焦特征空间不同区域,非随机选择;聚类形成八个主要簇;用patch merger输出训练random forest达80.3% AUC,表明其保留高信息内容。
Enabling peptide-level classification of single cells:重新分析多个单细胞数据集,ProFormer分类细胞类型、周期、迁移、mESC分化及IFN-γ处理,AUC从94.2–100%到73.6%不等;高维时优于ML,低维时wavelet加logistic regression可例外。过滤低丰度信号、使用60%最高丰度肽可提高mESC至约86%;仅10个训练样本仍达约85%和75%;对10%高斯噪声稳健,而ResNet在10%噪声下接近随机。
DL-driven plasma proteome diagnostics for effective determination of patient disease states:COMBAT血浆490人,MaxQuant平均鉴定1336个肽离子。三特征AUC为72.7%/70.7%;拆分mass和charge后验证AUC 81.3%、测试AUC 86.3%,F1为76.7%;阈值略低于0.5时达100%灵敏度、46%特异性。对mild COVID-19、sepsis和其他重症感染AUC分别为80.6%、87.5%和98.3%。
Decisions of ProFormer-derived models are explainable at single-peptide resolution:SHAP显示保留时间、mass、charge和强度均显著,mass影响最高。肽离子SHAP和可解释;高影响肽训练random forest达到与DL相当约80–85%,全部肽仅约55%。高SHAP肽对应补体C3、C4A,凝血SERPINC1、FGA、FGB、FGG;C3肽567–592位于C3-beta-c起始,提示补体激活裂解。
讨论部分总结:ProFormer利用MS
1表格数据,无需肽或蛋白身份,速度快、可解释、跨实验可比。与依赖MS
2鉴定的丰度分类器不同,它避免跨实验处理偏差;与图像CNN相比,patch merger避免刚性分箱和空间相关性假设,动态加权并保留信号。轻量transformer自注意力减少过拟合。离子淌度特征可提升性能。单细胞应用需高质量输入和较大数据集。血浆COVID-19分类具高灵敏度,SHAP揭示补体与凝血相关肽。当前仍依赖MS
2信息提取MS
1特征,未来可朝无数据库搜索、MS
2-free及优化MS
1采集发展。
研究结论翻译:总体而言,ProFormer为从血浆到bulk蛋白质组及单细胞的蛋白质组样本准确分类提供了一种创新方法。研究人员预期,这将是推动蛋白质分析迈向临床应用的关键一步,因为它能够实现对血浆和单细胞蛋白质组学中大型样本队列的快速注释。