BLOSSOM-Kcr:一种基于结构信息的深度学习框架,用于赖氨酸巴豆酰化位点预测

《Journal of Molecular Graphics and Modelling》:BLOSSOM-Kcr: A Structure-informed Deep Learning Framework for Lysine Crotonylation Site Prediction

【字体: 时间:2026年09月09日 来源:Journal of Molecular Graphics and Modelling 3

编辑推荐:

   摘要:赖氨酸巴豆酰化(Kcr)是一种重要的翻译后修饰(PTM),参与多种生物学过程,包括染色质调控、蛋白质功能调节和细胞信号传导。尽管基于质谱的蛋白质组学已大幅扩展了Kcr位点的鉴定范围,但实验筛选仍然耗工费力、成本高昂,且难以在蛋白质组学规模上应用。计算方法为筛选候选Kcr

  

摘要:

赖氨酸巴豆酰化(Kcr)是一种重要的翻译后修饰(PTM),参与多种生物学过程,包括染色质调控、蛋白质功能调节和细胞信号传导。尽管基于质谱的蛋白质组学已大幅扩展了Kcr位点的鉴定范围,但实验筛选仍然耗工费力、成本高昂,且难以在蛋白质组学规模上应用。计算方法为筛选候选Kcr位点提供了一种高效的策略。然而,现有的大多数预测器主要依赖基于序列的表征,未能充分利用蛋白质的结构上下文。在本研究中,我们提出了BLOSSOM-Kcr,一种用于Kcr位点预测的结构感知深度学习框架。BLOSSOM-Kcr将基于BLOSUM62的序列替换特征与残基水平的结构描述符相结合,包括二级结构、溶剂可及性、骨架几何和空间邻近信息。融合后的残基水平表征进一步通过残差卷积块、通道注意力、双向长短期记忆(BiLSTM)层和注意力池化进行处理,以捕获候选赖氨酸残基周围的局部基序模式、信息性特征维度和上下文依赖性。采用五折交叉验证进行模型优化和比较分析,并使用独立测试集对现有Kcr位点预测器进行最终评估。在独立测试集上,BLOSSOM-Kcr的AUC达到0.9023,MCC达到0.6479,F1分数达到0.8336,优于代表性的Kcr位点预测器。这些结果表明,BLOSSOM-Kcr提供了一种有效的结构感知框架用于Kcr位点预测。

引言

赖氨酸巴豆酰化(Kcr)是一种进化保守的翻译后修饰(PTM),发生在组蛋白和非组蛋白的赖氨酸残基上[1]。通过改变赖氨酸侧链的化学性质,巴豆酰化可以影响染色质调控、蛋白质相互作用、酶活性和广泛的细胞过程[1]。因此,准确鉴定Kcr位点对于理解巴豆酰化介导的调控机制以及进一步探索其在细胞生理学和疾病相关过程中的潜在作用至关重要。
基于质谱的蛋白质组学已大幅扩展了Kcr位点的目录[2]。然而,实验鉴定仍然耗工费力、耗时且成本高昂。此外,蛋白质组中存在的大量赖氨酸残基使得实验验证所有潜在修饰位点在操作上不可行[3]。因此,计算预测方法可以为优先筛选候选Kcr位点和指导后续实验验证提供一种高效且互补的策略[3]。
早期的Kcr位点预测计算方法主要依赖手工构建的序列描述符和传统机器学习分类器。例如,iKcr-PseEns使用伪成分和集成学习来鉴定组蛋白中的Kcr位点[4]。随着深度学习的快速发展,基于神经网络的预测器越来越多地被应用于该任务。基于卷积神经网络(CNN)的模型,如Zhao等人[5]提出的方法和iKcr_CNN[6],展示了从赖氨酸为中心的肽段窗口中自动提取局部序列模式的能力。其他架构,包括胶囊网络和循环神经网络,也被引入以改进特征表征和上下文依赖建模,例如DeepCap-Kcr[7]、CapsNh-Kcr[8]和ATCLSTM-Kcr[9]。这些研究共同表明,基于深度学习的模型可以通过从赖氨酸为中心的肽段窗口中自动学习信息性序列表征来提高Kcr位点的判别能力。
最近,蛋白质语言模型和基于嵌入的策略为Kcr位点预测提供了新的机遇。BERT-Kcr应用了基于预训练BERT模型的迁移学习[10],而LMCrot使用基于变压器的蛋白质语言模型生成的窗口级嵌入来表征局部Kcr相关序列模式[11]。EDS-Kcr进一步将深度监督与大型语言模型衍生的表征相结合,用于多种物种的Kcr位点预测[12]。同时,针对特定生物的预测器,如PlantNh-Kcr[13]、Fungi-Kcr[14]和DeepNhKcr[15],已被开发以应对不同物种和蛋白质上下文之间的生物学异质性。这些研究凸显了特征表征在改进Kcr位点预测中的核心作用。
尽管取得了这些进展,现有的大多数Kcr位点预测器仍然主要依赖线性序列信息、手工构建的序列描述符或基于序列的嵌入[11]。然而,赖氨酸巴豆酰化不太可能仅由局部氨基酸序列决定。赖氨酸残基的修饰状态还可能受其结构环境的影响,包括溶剂可及性、二级结构、骨架几何以及与邻近残基的空间关系[16]。这些结构因素可能提供仅靠基于序列的特征无法完全捕获的互补信息。例如,残基-残基接触信息已被报告为Kcr位点预测中有用的结构描述符[17],表明残基之间的空间关系可能提供超越线性序列模式的信息。此外,近期的一些模型表明多特征融合策略可以改善候选Kcr位点的表征[18]。然而,如何有效地将残基水平的结构描述符与序列替换信息相结合用于Kcr位点预测,仍然缺乏充分的研究。
为了弥补这一不足,我们开发了BLOSSOM-Kcr,一种用于Kcr位点预测的结构感知深度学习框架。本研究做出了三个主要贡献。首先,我们使用蛋白质水平分割、冗余消除和平衡负采样构建了一个源自HeLa细胞的Kcr基准数据集,以减少潜在的数据泄露并提高模型评估的可靠性。其次,我们引入了一种残基水平的序列-结构表征,该表征保留了局部空间组织,而不是将结构描述符压缩为全局特征向量[19]。第三,我们设计了一种紧凑的CNN-BiLSTM架构,结合通道注意力和注意力池化,以学习判别性的序列和结构表征。通过特征消融分析、融合策略比较、序列编码比较、基线模型评估以及与现有Kcr位点预测器的独立测试评估,我们证明BLOSSOM-Kcr可以作为识别Kcr位点的有效且可解释的框架。

章节摘录

基准数据集

HeLa Kcr基准数据集从公开的基于质谱的蛋白质组学数据中整理而来,原始Kcr记录来源于对CDYL调控的同源重组介导的DNA修复中RPA1巴豆酰化的全局巴豆酰组研究[20]。相应的蛋白质序列从UniProt检索[21],所有注释的修饰位点均经过验证,以确保报告的位置与检索序列中的赖氨酸残基相匹配。无效的、重复的

结果与讨论

除非另有说明,所有用于模型优化和比较分析的实验均在训练集上使用五折交叉验证进行。这些分析包括特征消融、融合策略比较、序列编码比较和基线模型评估。独立测试集在模型开发过程中严格保持不可见状态,仅用于与现有Kcr位点预测器的最终比较。对于最终评估,所有比较的模型均经过训练

结论

在本研究中,我们提出了BLOSSOM-Kcr,一种用于Kcr位点预测的结构感知深度学习框架。BLOSSOM-Kcr将基于BLOSUM62的序列替换信息与从AlphaFold预测结构推导的残基水平结构描述符相结合,并采用带有注意力机制的CNN-BiLSTM架构来捕获候选赖氨酸残基周围的局部序列模式和结构上下文。实验结果表明,序列和结构特征

CRediT作者贡献声明

郑冉冉: 撰写 – 原稿,可视化,验证,软件,方法论,调查研究,形式分析,数据管理。王春华: 撰写 – 审阅与编辑,监督,项目管理,资金获取。刘太钢: 撰写 – 审阅与编辑,监督,项目管理,方法论,概念构思

利益冲突声明

作者声明他们没有已知的竞争性经济利益或个人关系可能会影响本文所报告的工作。

数据可用性

本研究中使用的数据集、源代码、训练好的模型和脚本可在GitHub上获取:https://github.com/rrzheng1/BLOSSOM-Kcr。该仓库包含数据预处理脚本、特征提取程序、模型训练代码和评估脚本。

利益冲突声明

? 作者声明他们没有已知的竞争性经济利益或个人关系可能会影响本文所报告的工作。

致谢

本研究由国家自然科学基金(项目编号 11601324)资助。
Taigang Liu|Ranran Zheng|Chunhua Wang
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号