多肽语言语用学分析及面向治疗性多肽预测的两阶段分层学习框架

《BMC Biology》:Peptide language pragmatic analysis and two-stage hierarchical learning framework for therapeutic peptide prediction

【字体: 时间:2026年08月14日 来源:BMC Biology 5.4

编辑推荐:

  治疗性多肽在多种生物过程中发挥关键作用,近年来在生物医学领域备受关注。然而,现有多数方法往往未能充分捕获氨基酸残基间的复杂相互作用及多肽序列内的上下文依赖关系,制约了深度语义表示的提取并限制预测性能。此外,多功能治疗性多肽(multi-functional t

  
治疗性多肽在多种生物过程中发挥关键作用,近年来在生物医学领域备受关注。然而,现有多数方法往往未能充分捕获氨基酸残基间的复杂相互作用及多肽序列内的上下文依赖关系,制约了深度语义表示的提取并限制预测性能。此外,多功能治疗性多肽(multi-functional therapeutic peptides, MTPs)预测任务固有地受限于长尾分布导致的多标签分类不平衡挑战。研究人员提出名为TPpred-PepPA的两阶段分层深度学习框架,基于语用分析预测MTPs。具体而言,采用ProtT5提取捕获残基级上下文信息的深度语义表示;第一阶段利用基于Transformer的网络进行共享表示学习,编码器捕获残基间复杂交互以刻画序列上下文语义;第二阶段通过引入任务特定分类器并结合非对称损失(Asymmetric Loss, ASL)优化分类决策,进而采用动态阈值策略应对长尾分布问题,提升MTPs预测准确性。研究人员采用SHAP分析与基序识别分别解释特征贡献与识别关键功能片段。实验表明TPpred-PepPA在识别MTPs方面显著优于现有基线方法,并对稀有功能类别具备鲁棒识别能力。研究人员开发了基于ProtT5预训练大语言模型的两阶段分层深度学习框架TPpred-PepPA,相较已有方法取得最优预测性能,并为MTPs发现提供可解释性,相关Web服务器发布于http://bliulab.net/TPpred-PepPA。
研究背景方面,治疗性多肽(通常短于50个氨基酸)具有抗癌、抗炎、抗菌、降糖及免疫调节等活性,在疾病防治中价值突出。现有计算识别方法多依赖手工理化特征或单一深度学习模型,难以建模残基级语言上下文(linguistic context)与长程依赖,且面对15类功能标签的长尾分布(训练集MeanIR=21.31,最频类AMP与最稀类QSP的IRLbl达89.68)时多数类主导优化,稀有功能识别乏力。为此,研究人员开展基于多肽语言语用学分析的两阶段分层预测框架研究,论文发表于《BMC Biology》。
关键技术方法上,研究人员整合PEPred-Suite、SATPdb、DRAMP 2.0、AntiCP 2.0等公开库构建10237条非冗余多功能治疗性多肽基准集(CD-HIT去冗余>90%,长度>5,按15功能分训练8190/验证1023/独立测试1024),以ProtT5(3B)提取残基级上下文语义,拼接one-hot与PSSM(position-specific scoring matrix)形成多视图输入;第一阶段Transformer编码器经BCE(binary cross-entropy)损失学习共享表示,第二阶段任务特定分类头以ASL联合动态阈值微调;并以SHAP、注意力图、t-SNE及Jaccard相似度辅助解释。
研究结果各节结论如下:在独立测试集性能比较中,TPpred-PepPA于ACCexample与F1label等五项指标均优于TPpred-CMvL、TPpred-LE、MLBP、PrMFTP,验证两阶段渐进学习有效。模块消融研究表明,移除第一阶段共享表示(Model C)或第二阶段微调(Model B)均致性能下降,动态阈值(相对Model A)进一步提升,证明分层与阈值机制必要。八类单功能二分类对比中,TPpred-PepPA在QSP、PBP等稀有标签的MCC与F1上超越PEPred-Suite、PPTPP、TPpred-ATMV。PLM对比显示ProtT5在ACCexample、F1label及时延权衡上优于ESM-2、ESM-3、TAPE、ProtBERT;SHAP分析指明ProtT5嵌入贡献最大,PSSM与one-hot为辅。损失函数分析中,第一阶段BCE+第二阶段ASL组合最优,ASL较Focal、Varifocal、Dice更适配长尾多标签;五折t检验得TPpred-PepPA对TPpred-LE的p=0.0134~0.0150,对MLBP/PrMFTP p<0.0001。基序可解释性上,注意力热图无监督锁定AGK、FLP、LKK等已知功能基序,多功能肽可跨功能聚焦不同区段。t-SNE显示两阶段后AIP、ABP、CCC三类聚类紧致、边界清晰,印证表示解耦。
讨论部分指出,该框架虽精度占优,但ProtT5大规模参数带来百万级肽库推理时延,未来需引入并行可扩展策略并拓展至肽-蛋白互作等任务。结论部分翻译为:本研究引入TPpred-PepPA,一种基于语用分析、以ProtT5捕获残基级上下文的两阶段分层架构,借Transformer编码器建模残基交互,通过功能特定分类器、ASL与动态阈值缓解不平衡,融合SHAP与基序识别实现最优性能与可解释性;面向治疗性多肽高通量标注需求,后续将借鉴分布式并行计算加速大规模处理,并将框架适配肽-蛋白相互作用等更广任务。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号