
-
生物通官微
陪你抓住生命科技
跳动的脉搏
DeepGreenGO:基于ProtBERT嵌入与结构接触图的植物蛋白质功能预测深度学习框架及其在水稻种子发育蛋白鉴定中的应用
《BMC Bioinformatics》:DeepGreenGO: a graph neural network-based deep learning model for plant-specific protein function prediction
【字体: 大 中 小 】 时间:2026年10月02日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要背景自动化蛋白质功能预测在植物中仍具有挑战性,因为实验支持的注释有限,尤其是对于作物和非模式植物物种。将深度学习技术整合到植物分子生物学中可以为创新研究和促进可持续农业提供一个变革性的机会。但实验注释的植物蛋白质在用于训练功能预测模型的大多数多分类数据集中代表性不足,限制
自动化蛋白质功能预测在植物中仍具有挑战性,因为实验支持的注释有限,尤其是对于作物和非模式植物物种。将深度学习技术整合到植物分子生物学中可以为创新研究和促进可持续农业提供一个变革性的机会。但实验注释的植物蛋白质在用于训练功能预测模型的大多数多分类数据集中代表性不足,限制了它们在植物特定用途中的性能可转移性。本研究引入了DeepGreenGO,一种深度学习多标签分类器,将ProtBERT-BFD残基嵌入与从蛋白质结构推导出的接触图集成在一起。残基表示通过GCN和GATv2层顺序处理,然后通过注意力池化来预测特定于模型训练本体的基因本体术语。该模型在绿植物界的蛋白质上进行了训练。随后将该方法部署用于预测参与水稻(Oryza sativa)种子发育的蛋白质,以展示其功能。
经过整理的绿植物界数据集包含7,534个实验注释的蛋白质结构,并使用序列相似性感知的聚类方法划分为训练集、验证集和测试集,分别包含6,026、754和754条PDB链。ProtBERT-BFD嵌入的集成提供了大部分的预测信号。DeepGreenGO与其他基于序列同源性的工具以及其他最近的基于序列和结构的深度学习方法进行了比较评估。DeepGreenGO表现出色,尤其是在生物过程本体方面,实现了最高的蛋白为中心\(\:{F}_{max}\)值0.227和最低的\(\:{S}_{min}\)值19.73。特别是,它在生物过程方面获得了最高的信息含量加权精确率-召回率曲线下面积,相比所有其他方法,表明其对罕见且信息丰富的功能预测能力有所提升。将该模型应用于43,649个水稻蛋白质,识别出372个与种子发育相关的候选蛋白质。功能富集和转录组分析表明,许多预测蛋白质与种子发育相关的生物过程有关,并在子房、胚胎和胚乳组织中表现出升高的表达,支持了预测的生物学相关性。
本研究引入了DeepGreenGO,一个专注于分类学预测植物蛋白质功能的框架。其最强的优势在于生物过程本体、信息丰富的注释以及与训练集可检测相似性有限的蛋白质。消融结果进一步表明,预训练的序列表示是其性能的核心,同时识别出了改进结构信息整合的机会。其在预测水稻种子发育蛋白质方面的应用突显了支持植物生物学研究和可持续农业的潜力。
自动化蛋白质功能预测在植物中仍具有挑战性,因为实验支持的注释有限,尤其是对于作物和非模式植物物种。将深度学习技术整合到植物分子生物学中可以为创新研究和促进可持续农业提供一个变革性的机会。但实验注释的植物蛋白质在用于训练功能预测模型的大多数多分类数据集中代表性不足,限制了它们在植物特定用途中的性能可转移性。本研究引入了DeepGreenGO,一种深度学习多标签分类器,将ProtBERT-BFD残基嵌入与从蛋白质结构推导出的接触图集成在一起。残基表示通过GCN和GATv2层顺序处理,然后通过注意力池化来预测特定于模型训练本体的基因本体术语。该模型在绿植物界的蛋白质上进行了训练。随后将该方法部署用于预测参与水稻(Oryza sativa)种子发育的蛋白质,以展示其功能。
经过整理的绿植物界数据集包含7,534个实验注释的蛋白质结构,并使用序列相似性感知的聚类方法划分为训练集、验证集和测试集,分别包含6,026、754和754条PDB链。ProtBERT-BFD嵌入的集成提供了大部分的预测信号。DeepGreenGO与其他基于序列同源性的工具以及其他最近的基于序列和结构的深度学习方法进行了比较评估。DeepGreenGO表现出色,尤其是在生物过程本体方面,实现了最高的蛋白为中心\(\:{F}_{max}\)值0.227和最低的\(\:{S}_{min}\)值19.73。特别是,它在生物过程方面获得了最高的信息含量加权精确率-召回率曲线下面积,相比所有其他方法,表明其对罕见且信息丰富的功能预测能力有所提升。将该模型应用于43,649个水稻蛋白质,识别出372个与种子发育相关的候选蛋白质。功能富集和转录组分析表明,许多预测蛋白质与种子发育相关的生物过程有关,并在子房、胚胎和胚乳组织中表现出升高的表达,支持了预测的生物学相关性。
本研究引入了DeepGreenGO,一个专注于分类学预测植物蛋白质功能的框架。其最强的优势在于生物过程本体、信息丰富的注释以及与训练集可检测相似性有限的蛋白质。消融结果进一步表明,预训练的序列表示是其性能的核心,同时识别出了改进结构信息整合的机会。其在预测水稻种子发育蛋白质方面的应用突显了支持植物生物学研究和可持续农业的潜力。