新技术专栏 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通 | 新技术专栏
生物通首页  >  新技术专栏  >  正文

Seq2DomML:基于序列的机器学习方法预测细菌蛋白质结构域边界

《BMC Bioinformatics》:Seq2DomML: Protein domain boundary prediction from bacterial protein sequences using a machine learning framework

【字体: 大 中 小 】 时间:2026年10月07日 来源:BMC Bioinformatics 4.4

编辑推荐:

   摘要目的蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐

摘要

目的

蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐标或同源结构域分配作为输入。

方法

来自结构域进化分类(ECOD)数据库的结构域注释被转换为二值残基标签,包括注释结构域内的残基以及结构域边界、连接子和末端侧翼区域的残基。每个残基最初使用 2389 个氨基酸身份、位置、物理化学和相互作用特征进行编码。特征空间通过基于相关性的剪枝和多目标进化特征选择进行缩减,选定的特征用于训练双向长短期记忆(LSTM)模型。

结果

在与训练集共享至少 35% 全局序列同一性的序列被移除后,Seq2DomML 在保留测试集上进行了评估,并与现有工具(包括 InterPro、Pfam 和 NCBI CDD)进行了比较。分类指标显示,Seq2DomML 优于对比工具,宏 F1 分数为 0.734,结构域内 F1 分数为 0.924。其结构域数量平均绝对误差为 0.952,为仅次于 Pfam 的第二低值。Seq2DomML 还实现了最高平均结构域交并比(IoU)为 0.846,表明在评估的方法中,与 ECOD 衍生的结构域区域具有最强的空间一致性。

结论

Seq2DomML 证明,序列衍生的残基特征可以在没有直接结构输入的情况下支持结构定义的结构域划分的预测。该模型为保守结构域注释工具提供了补充方法,并可能有助于为构建体设计优先排序候选拼接区域,尤其是在结构或同源证据有限的情况下。

图形摘要

该图像解释了进化特征选择的三步过程。第一步,初始化,包括在种群规模内随机分配活动特征数量,并创建 100 个具有该活动特征数量的独特特征向量。第二步,交叉和变异,随机配对父母,应用两点交叉生成每对两个后代,并使用位翻转变异处理后代以保持多样性。第三步,生存者选择,对三个目标——宏 F1、标签 1 预测和标签 1 召回——训练和评估所有父母和后代,然后使用非支配排序算法根据个体在这些目标上的最佳分数进行排名。与前一代种群数量相等的最优秀个体存活到下一代。第二步和第三步重复 50 代。该图像包括以二进制值序列表示的特征向量示例,并展示了交叉和变异如何改变这些序列。

目的

蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐标或同源结构域分配作为输入。

方法

来自结构域进化分类(ECOD)数据库的结构域注释被转换为二值残基标签,包括注释结构域内的残基以及结构域边界、连接子和末端侧翼区域的残基。每个残基最初使用 2389 个氨基酸身份、位置、物理化学和相互作用特征进行编码。特征空间通过基于相关性的剪枝和多目标进化特征选择进行缩减,选定的特征用于训练双向长短期记忆(LSTM)模型。

结果

在与训练集共享至少 35% 全局序列同一性的序列被移除后,Seq2DomML 在保留测试集上进行了评估,并与现有工具(包括 InterPro、Pfam 和 NCBI CDD)进行了比较。分类指标显示,Seq2DomML 优于对比工具,宏 F1 分数为 0.734,结构域内 F1 分数为 0.924。其结构域数量平均绝对误差为 0.952,为仅次于 Pfam 的第二低值。Seq2DomML 还实现了最高平均结构域交并比(IoU)为 0.846,表明在评估的方法中,与 ECOD 衍生的结构域区域具有最强的空间一致性。

结论

Seq2DomML 证明,序列衍生的残基特征可以在没有直接结构输入的情况下支持结构定义的结构域划分的预测。该模型为保守结构域注释工具提供了补充方法,并可能有助于为构建体设计优先排序候选拼接区域,尤其是在结构或同源证据有限的情况下。

图形摘要

该图像解释了进化特征选择的三步过程。第一步,初始化,包括在种群规模内随机分配活动特征数量,并创建 100 个具有该活动特征数量的独特特征向量。第二步,交叉和变异,随机配对父母,应用两点交叉生成每对两个后代,并使用位翻转变异处理后代以保持多样性。第三步,生存者选择,对三个目标——宏 F1、标签 1 预测和标签 1 召回——训练和评估所有父母和后代,然后使用非支配排序算法根据个体在这些目标上的最佳分数进行排名。与前一代种群数量相等的最优秀个体存活到下一代。第二步和第三步重复 50 代。该图像包括以二进制值序列表示的特征向量示例,并展示了交叉和变异如何改变这些序列。

订阅生物通快讯

订阅快讯:
免费订阅退订

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号