《Journal of Advanced Research》:pLM-HP: Peptide hormone prediction using pre-trained protein language model representations
编辑推荐:
摘要专业翻译
pLM-HP被提出作为一个基于蛋白质语言模型(PLM)的肽激素预测框架,该框架将基于ESM2的上下文表征与双向长短期记忆网络(BiLSTM)序列建模相结合。
引入了一种代价敏感学习策略,通过在损失函数中加入类别权重来应对类别不平衡问题,从而减少对
摘要专业翻译
pLM-HP被提出作为一个基于蛋白质语言模型(PLM)的肽激素预测框架,该框架将基于ESM2的上下文表征与双向长短期记忆网络(BiLSTM)序列建模相结合。
引入了一种代价敏感学习策略,通过在损失函数中加入类别权重来应对类别不平衡问题,从而减少对多数类别的偏向并提高对少数类别肽激素的识别能力。
ESM2表征在手写描述符上表现出更好的判别性能,而基于BiLSTM的序列建模进一步提升了潜在特征空间中类别的可分性。
在独立测试集上,pLM-HP实现了95.64%的平衡准确率、94.48%的灵敏度和96.79%的特异性,马修斯相关系数(MCC)为0.824,AUC为0.991。与现有方法相比,pLM-HP在所有评估指标上均表现出更优的性能,并展现出更好的判别能力和泛化能力。
论文解读
一、研究背景与问题
肽类化合物相较于小分子药物具有更多氢键供体和受体,能够以更高的特异性结合靶标,从而减少非特异性副作用,且易于被体内酶降解、代谢毒性低、生物相容性好。肽激素是一类重要的生物活性分子,在多种生物体中调节代谢、生长发育和稳态,其失调与多种疾病密切相关,已成为药物开发的重要靶点。准确识别肽激素不仅具有重要的生物学意义,对肽类药物设计和发现也具有较高的实用价值。
传统肽激素鉴定主要依赖质谱、亲和纯化和活性筛选等实验技术,过程复杂且耗时。随着计算生物学的发展,基于计算方法的肽激素预测逐渐成为重要补充手段。早期研究主要依赖序列相似性搜索或基序识别算法,但在同源序列稀少时性能受限。随着Hmrbase2和HORDB等数据库的完善,大量经实验验证的肽激素及其受体序列被系统整理,为构建和评估肽激素预测模型提供了可靠的数据基础。
近年来,机器学习方法在肽激素识别中取得进展。例如,HOPPred模型整合了BLAST相似性、MERCI基序和逻辑回归,在独立测试集上取得了AUROC为0.96、MCC为0.80的优异性能。mHPpred采用多视图特征表示和元建模策略构建了更稳健的集成框架。尽管已有研究取得一定进展,但仍存在挑战:许多方法依赖手工特征或预定义基序,限制了其序列表征能力;同时,真实数据中普遍存在类别不平衡问题,容易使模型在训练时偏向多数类,降低对肽激素的识别敏感性。
深度学习的发展进一步推动了肽功能预测。神经网络能够直接从原始序列中学习上下文依赖和潜在生化模式。近年来,蛋白质语言模型(PLM)显著改变了序列建模范式。代表性模型包括ProtBERT、ProtT5和ESM2,这些模型在大规模未标记蛋白质序列上通过掩码语言建模进行预训练,学习了编码蛋白质进化、结构和理化性质的高维上下文嵌入,并已成功应用于翻译后修饰预测、肽结构建模和功能肽分类等下游任务。但在肽激素预测中,蛋白质语言模型的应用仍较为有限,缺乏系统性研究。
二、研究内容与方法
针对上述问题,研究人员开发了pLM-HP,一种结合蛋白质语言模型与双向长短期记忆网络(BiLSTM)的肽激素预测深度学习框架。该模型采用ESM2蛋白质语言模型对肽序列进行单次全局编码,生成具有上下文信息的残基级高维嵌入,随后输入BiLSTM进一步建模残基间的长程依赖关系,最终通过全连接层进行激素与非激素肽的二分类。为应对类别不平衡,研究在损失函数中加入类别权重,降低对多数类别的偏向,提升对少数激素肽的敏感性。
三、主要结果
3.1 数据构建与氨基酸组成分析
研究人员从Hmrbase2数据库收集了5729条植物和动物来源的肽激素序列,通过CD-HIT以60%相似度阈值去冗余后得到1174条阳性样本。阴性样本取自PeptideAtlas数据库,同样经CD-HIT去冗余后得到11740条非激素肽。数据集按8:2随机划分为训练集(10362条序列,其中942条阳性、9420条阴性)和独立测试集(2552条序列,其中232条阳性、2320条阴性)。氨基酸频率分析显示,肽激素与非激素肽的氨基酸组成整体相似,但芳香族残基F和W以及部分小极性残基在肽激素中相对富集,而T、D、V等残基在非激素肽中更常见,表明肽激素可能具有与疏水性、电荷和构象偏好相关的特征性组成模式。
3.2. ESM2模块
ESM2是Meta AI(FAIR)开发的蛋白质语言模型升级版本,基于Transformer编码器架构,在UniRef50(UR50/D)序列上通过掩码语言建模目标进行预训练。模型采用多头自注意力机制捕获氨基酸间的长程依赖关系,结合前馈网络进行非线性特征变换,产生具有丰富生物学意义的高维嵌入。对于输入序列,注意力操作可描述为公式(1)所示,多头注意力机制如公式(2)所示。
3.3. BiLSTM模块
双向长短期记忆网络(BiLSTM)在ESM2嵌入基础上进一步建模序列残基间的双向长程依赖关系,通过前向和后向两个方向的信息传播,增强对序列上下文的理解,提升类别特征在潜在特征空间中的可分性。
3.4. 类别不平衡处理
采用成本敏感学习策略,在损失函数中加入类别权重,对少数类别赋予更高权重,减少训练过程中对多数类别的偏向,提升对少数类别(肽激素)的识别能力。
3.5. 性能评估与对比
在独立测试集上,pLM-HP实现了95.64%的平衡准确率、94.48%的灵敏度、96.79%的特异性、0.824的马修斯相关系数(MCC)和0.991的AUC。与现有方法相比,pLM-HP在所有评估指标上均表现更优,显示出更强的判别能力和泛化能力。
四、讨论与结论
讨论部分指出,ESM2预训练语言模型能够自动学习蛋白质序列中的上下文特征和生化模式,相比手工特征描述具有更好的判别能力;BiLSTM进一步建模序列长程依赖,提升了潜在特征空间中的类别可分性;成本敏感损失策略有效缓解了类别不平衡带来的偏向,提高了对少数类别的识别灵敏度。研究表明,pLM-HP框架在肽激素预测任务中取得了优异性能,为肽激素识别和肽药物设计提供了可靠的计算工具。
研究结论表明,pLM-HP结合ESM2与BiLSTM的深度学习框架能够准确预测肽激素,在独立测试集上实现了优异的平衡准确率、灵敏度、特异性和AUC值,优于现有方法,显示出良好的判别能力和泛化能力,具有重要的生物学意义和实际应用价值。