
-
生物通官微
陪你抓住生命科技
跳动的脉搏
GenPTM:一种通用的蛋白质翻译后修饰信息抽取工具
《BMC Bioinformatics》:GenPTM: a generalizable framework for protein post-translational modification information extraction from the scientific literature
【字体: 大 中 小 】 时间:2026年09月25日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要背景蛋白质翻译后修饰(PTM)在细胞活动和生物过程中发挥着关键作用。尽管已有多个数据库整理了PTM信息,但大多数仅涵盖有限数量的修饰类型。虽然科学文献持续积累了大量与PTM相关的知识,但这些数据库并未定期更新。这一不断扩大的信息差距凸显了需要开发自动化信息抽取(IE)系统
蛋白质翻译后修饰(PTM)在细胞活动和生物过程中发挥着关键作用。尽管已有多个数据库整理了PTM信息,但大多数仅涵盖有限数量的修饰类型。虽然科学文献持续积累了大量与PTM相关的知识,但这些数据库并未定期更新。这一不断扩大的信息差距凸显了需要开发自动化信息抽取(IE)系统的紧迫性,这些系统能够直接从文献中识别被修饰的蛋白质及其特定的氨基酸位点。尽管科学文章中已报道了大量PTM,但现有工具大多仅针对少数特定修饰类型设计,而为每种PTM开发独立系统是不切实际的。
为应对这一挑战,我们开发了GenPTM,一种通用且可适配的信息抽取工具,能够利用统一的文本表示策略从PubMed摘要中识别被修饰的蛋白质和修饰位点。GenPTM将特定于PTM的修饰描述和化学基团提及替换为通用占位符,使模型能够专注于表达修饰事件的共同文本模式。基于BiomedBERT的分类器经过微调,用于判断候选蛋白质或位点是否确实被修饰,后处理模块则负责组装最终的蛋白质、位点或蛋白质-位点对预测结果。
GenPTM在五种主要PTM类型(例如泛素化、磷酸化)上进行训练,并在另外八种PTM上进行评估,其中包括不常被提及的修饰类型(例如瓜氨酸化、AMP化)。在三个不同的评估类别中,GenPTM在所有PTM上的F1分数均达到92%至96%。
这些结果表明,GenPTM具有强大的泛化能力,为PTM无关的信息抽取以及蛋白质组学中自动化的PTM知识发现提供了一套可行的解决方案。
蛋白质翻译后修饰(PTM)在细胞活动和生物过程中发挥着关键作用。尽管已有多个数据库整理了PTM信息,但大多数仅涵盖有限数量的修饰类型。虽然科学文献持续积累了大量与PTM相关的知识,但这些数据库并未定期更新。这一不断扩大的信息差距凸显了需要开发自动化信息抽取(IE)系统的紧迫性,这些系统能够直接从文献中识别被修饰的蛋白质及其特定的氨基酸位点。尽管科学文章中已报道了大量PTM,但现有工具大多仅针对少数特定修饰类型设计,而为每种PTM开发独立系统是不切实际的。
为应对这一挑战,我们开发了GenPTM,一种通用且可适配的信息抽取工具,能够利用统一的文本表示策略从PubMed摘要中识别被修饰的蛋白质和修饰位点。GenPTM将特定于PTM的修饰描述和化学基团提及替换为通用占位符,使模型能够专注于表达修饰事件的共同文本模式。基于BiomedBERT的分类器经过微调,用于判断候选蛋白质或位点是否确实被修饰,后处理模块则负责组装最终的蛋白质、位点或蛋白质-位点对预测结果。
GenPTM在五种主要PTM类型(例如泛素化、磷酸化)上进行训练,并在另外八种PTM上进行评估,其中包括不常被提及的修饰类型(例如瓜氨酸化、AMP化)。在三个不同的评估类别中,GenPTM在所有PTM上的F1分数均达到92%至96%。
这些结果表明,GenPTM具有强大的泛化能力,为PTM无关的信息抽取以及蛋白质组学中自动化的PTM知识发现提供了一套可行的解决方案。