
-
生物通官微
陪你抓住生命科技
跳动的脉搏
Seq2DomML:基于序列的机器学习方法预测细菌蛋白质结构域边界
《BMC Bioinformatics》:Seq2DomML: Protein domain boundary prediction from bacterial protein sequences using a machine learning framework
【字体: 大 中 小 】 时间:2026年10月07日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要目的蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐
蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐标或同源结构域分配作为输入。
来自结构域进化分类(ECOD)数据库的结构域注释被转换为二值残基标签,包括注释结构域内的残基以及结构域边界、连接子和末端侧翼区域的残基。每个残基最初使用 2389 个氨基酸身份、位置、物理化学和相互作用特征进行编码。特征空间通过基于相关性的剪枝和多目标进化特征选择进行缩减,选定的特征用于训练双向长短期记忆(LSTM)模型。
在与训练集共享至少 35% 全局序列同一性的序列被移除后,Seq2DomML 在保留测试集上进行了评估,并与现有工具(包括 InterPro、Pfam 和 NCBI CDD)进行了比较。分类指标显示,Seq2DomML 优于对比工具,宏 F1 分数为 0.734,结构域内 F1 分数为 0.924。其结构域数量平均绝对误差为 0.952,为仅次于 Pfam 的第二低值。Seq2DomML 还实现了最高平均结构域交并比(IoU)为 0.846,表明在评估的方法中,与 ECOD 衍生的结构域区域具有最强的空间一致性。
Seq2DomML 证明,序列衍生的残基特征可以在没有直接结构输入的情况下支持结构定义的结构域划分的预测。该模型为保守结构域注释工具提供了补充方法,并可能有助于为构建体设计优先排序候选拼接区域,尤其是在结构或同源证据有限的情况下。

蛋白质结构域边界的识别对于设计用于蛋白质结构测定的稳定单结构域构建体至关重要。对于没有实验测定的结构的蛋白质,边界选择通常依赖于保守结构域注释、预测结构或迭代截断筛选。Seq2DomML 是一个基于序列的机器学习框架,用于预测细菌蛋白质的残基水平结构域划分,无需结构坐标或同源结构域分配作为输入。
来自结构域进化分类(ECOD)数据库的结构域注释被转换为二值残基标签,包括注释结构域内的残基以及结构域边界、连接子和末端侧翼区域的残基。每个残基最初使用 2389 个氨基酸身份、位置、物理化学和相互作用特征进行编码。特征空间通过基于相关性的剪枝和多目标进化特征选择进行缩减,选定的特征用于训练双向长短期记忆(LSTM)模型。
在与训练集共享至少 35% 全局序列同一性的序列被移除后,Seq2DomML 在保留测试集上进行了评估,并与现有工具(包括 InterPro、Pfam 和 NCBI CDD)进行了比较。分类指标显示,Seq2DomML 优于对比工具,宏 F1 分数为 0.734,结构域内 F1 分数为 0.924。其结构域数量平均绝对误差为 0.952,为仅次于 Pfam 的第二低值。Seq2DomML 还实现了最高平均结构域交并比(IoU)为 0.846,表明在评估的方法中,与 ECOD 衍生的结构域区域具有最强的空间一致性。
Seq2DomML 证明,序列衍生的残基特征可以在没有直接结构输入的情况下支持结构定义的结构域划分的预测。该模型为保守结构域注释工具提供了补充方法,并可能有助于为构建体设计优先排序候选拼接区域,尤其是在结构或同源证据有限的情况下。
