无标记靶向蛋白质组学数据分析工作流选择——基于人工智能与数据驱动方法的基准评测

《Molecular & Cellular Proteomics》:LABEL-FREE TARGETED PROTEOMICS DATA ANALYSIS WORKFLOW SELECTION – BENCHMARKING AI-BASED AND DATA-DRIVEN APPROACHES

【字体: 时间:2026年07月24日 来源:Molecular & Cellular Proteomics 6.3

编辑推荐:

  随着全局蛋白质组学持续发展,可鉴定蛋白质数量大幅增加,但这并不天然保证最优定量性能。虽然可利用同位素标记肽段开发靶向检测,无标记策略因成本高效仍具吸引力。然而针对无标记靶向蛋白质组学数据分析工作流(尤其含人工智能工具者)的系统评测仍有限。研究人员旨在基准评测多

  
随着全局蛋白质组学持续发展,可鉴定蛋白质数量大幅增加,但这并不天然保证最优定量性能。虽然可利用同位素标记肽段开发靶向检测,无标记策略因成本高效仍具吸引力。然而针对无标记靶向蛋白质组学数据分析工作流(尤其含人工智能工具者)的系统评测仍有限。研究人员旨在基准评测多种无标记靶向蛋白质组学数据分析方法,作为全局分析结果的方法学验证框架。研究评估了缺失数据插补(MDI)策略(包括无MDI、k近邻(kNN)、数据驱动、MSstats及人工智能(AI)方法),以及整合与检验框架如数学加和、最优峰选择、AI标度化结合单变量统计、p值整合、MSstats TMP或线性模型及多变量检验。数据驱动MDI联合p值整合在准确度、精密度、特异性和错误发现率(FDR)上持续表现最强,优于其余策略。结果表明,相较于简单数学加和等常用方法,审慎选择数据分析工作流可显著改善定量结果;尽管结论基于3种酵母蛋白加入恒定人源背景、单一靶向方式的受控基准数据集,仍可推广为无标记生物标志物验证的默认工作流。
研究背景方面,全局蛋白质组学依托离子淌度与高性能质谱分析仪快速发展,数据依赖采集(DDA)与数据独立采集(DIA)成为发现研究主力,无标记策略免去稳定同位素标记(SIL)肽段需求但带来大数据的质控难题与多重检验惩罚。针对限定蛋白集的精准定量,选择/多/平行反应监测(SRM/MRM/PRM)仍为主流,结合SIL肽段可获高重现性但通量与成本受限;无标记靶向PRM凭借先验知识引导与低成本成为全局发现后生物标志物验证的实用替代,然而其专用数据分析工作流(含AI工具)缺乏系统基准。多数研究沿用"数学加和+单变量检验",未充分利用PRM中完整的MS2峰色谱信息。研究人员假设:利用碎片离子比例进行缺失数据插补(MDI)并联合考虑依赖关系的p值整合,将优于常规加和流程,因而开展此项基准评测。
主要关键技术方法上,研究人员构建受控基准数据集:以人直肠腺癌组织(G2,T3N0M0,含10%黏膜、30%肌层、50%黏膜下层、10%癌细胞)酶解物为恒定背景,掺入已知浓度(0.4–3.97 ng/5 μL注射量)的三种酵母蛋白ADH1、HXKB、ENO1,各浓度5次技术重复,采用Bruker timsTOF Pro的prmPASEF(平行累积-串行碎裂)采集,Skyline提取TIC归一化转移离子峰面积后入R环境。MDI方法比对无MDI、经典kNN(k=3)、数据驱动(碎片比常数法)、MSstats加速失效时间模型、AI法(调Koina仓库ms2pip_timsTOF2024模型,NCE=31)。整合与检验比对数学加和+曼-惠特尼检验、全局/局部最优峰选择、AI标度化后加和、布朗(Brown) p值整合(EmpiricalBrownsMethod包,校正碎片间依赖)、PERMANOVA多变量检验、MSstats Tukey中位数抛光(TMP)及线性模型。性能以Pearson r、RMSE及混淆矩阵衍生的PPV、精度、准确度、特异性、FDR衡量,显著性取BH校正后FDR 5%。
研究结果部分,"基准数据集表征"小节中,研究人员通过分段线性近似确定线性区间(0.4–3.97 ng/5 μL),空白3σ/10σ定LOD/LOQ,三酵母蛋白平均决定系数r2=0.98。"缺失数据插补方法比较"小节显示,在0.33%原始缺失及随机注入1%/5%/10%缺失的百次迭代中,无MDI的Pearson r最低、RMSE最高且方差最大;数据驱动MDI获最高r(如HXKB: 0.9903±0.0002)与最小方差,优于kNN、MSstats与AI MDI;AI MDI在>0.33%缺失时优于无MDI但整体弱于数据驱动。"数据整合与统计检验方法比较"小节表明,不论前置MDI如何,布朗p值整合的PPV、精度、准确度、特异性均最高(FDR约10%中最低),数学加和常最差,MSstats TMP次之、线性模型第三;AI标度化与最优峰选择性能接近中等,多变量检验与p值整合均只输出单p值无合并丰度。
讨论部分总结:数学加和适用于SIL绝对定量但在无标记验证中统计效能不足;数据驱动MDI利用碎片比恒定特性契合PRM的MNAR(非随机缺失)机制,优于为全局DDA/DIA设计的肽/蛋白级插补。布朗p值整合因校正同源碎片依赖而优于Fisher法,虽不输出合并丰度需辅以加和可视化,仍是最佳统计终点;MSstats作为通用工具TMP表现尚可但非PRM专用。AI模型(ms2pip_timsTOF2024)在PRM中未显增益,因其训练于全局胰蛋白酶肽且含免疫肽/弹性酶消化数据,难覆盖靶向方法学与仪器细节,当前更适过渡预测而非采集后校正。研究局限含仅单批次、单仪器(prmPASEF/timsTOF Pro)、3掺入+30背景蛋白、无生物变异、缺失率低,结论主要适用"已检出肽组内转移级缺失"。结论翻译:研究人员证实,数据驱动MDI接续布朗p值整合相较其他基准方法在无标记prmPASEF分析中具多项优势,超越简单数学加和等常用流程,为靶向蛋白质组学定量验证提供原则性框架;未来需开发专门面向靶向约束与优势的AI模型。论文发表于《Molecular & Cellular Proteomics》。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号