基于上下文的蛋白质结构预测分析与复合物化学计量推断的MultimerMapper工具

《Frontiers in Bioinformatics》:Context-dependent protein structure prediction analysis and complex stoichiometry inference with MultimerMapper

【字体: 大 中 小 】 时间:2026年10月08日 来源:Frontiers in Bioinformatics 3.6

编辑推荐:

  人工智能(AI)的进步已经变革了结构生物学领域,尤其是AlphaFold在蛋白质结构预测方面达到的精度水平。尽管云实现拓宽了这些方法的可及性,但在系统性地解释和分析由此产生的数据方面,尤其是在多变的建模背景下,仍然缺乏非AI工具。在此,研究人员提出Multim

人工智能(AI)的进步已经变革了结构生物学领域,尤其是AlphaFold在蛋白质结构预测方面达到的精度水平。尽管云实现拓宽了这些方法的可及性,但在系统性地解释和分析由此产生的数据方面,尤其是在多变的建模背景下,仍然缺乏非AI工具。在此,研究人员提出MultimerMapper,一个旨在生成、提取、整合、分析和可视化多聚体系在重叠蛋白质结构预测集成中行为的流程和软件套件。它利用统计学、图论和新颖算法来解释蛋白质-蛋白质界面和蛋白质构象在不同建模背景下如何变化,其前提是它们根据引入预测中的组分而变化。从输入序列列表出发,一个化学计量空间探索算法引导研究人员生成信息量极高的结构预测集成。通过交互式可视化,MultimerMapper突出高阶亚组装、推断化学计量、并识别与特定蛋白质伙伴存在或缺失统计学相关的替代相互作用模式和构象变化。MultimerMapper为预测蛋白质复合物结构的动态性质提供了新视角,支持研究人员探索功能机制和组装路径。

MultimerMapper:基于上下文的蛋白质结构预测分析与复合物化学计量推断

研究背景与问题

人工智能的进步已深刻变革结构生物学领域。AlphaFold2(AF2)将蛋白质结构预测精度提升至前所未有的水平,使研究人员无需实验测定即可获得可靠的结构信息。AF2-multimer(AF2m)进一步将该能力扩展至蛋白质复合物和蛋白质-蛋白质相互作用预测。随后,云平台实现使这些方法在科学社区中得到普及。基于类似原理,RoseTTAFold(RF)、RoseTTAFold2(RF2)、RoseTTAFoldNA(RFNA)及最新发布的AlphaFold3(AF3)等模型相继涌现,持续提升预测精度并扩展至多肽以外的分子类型。
然而,当前AI模型仍难以捕捉蛋白质相互作用的动态性质和构象多样性。涉及少数模型的小型复合物预测易于处理和解释,但对于大型未知复合物的结构集成进行系统性分析和解释仍然困难,尤其是当系统唯一信息仅为蛋白质序列列表时。瞬时或动态相互作用、构象变化以及竞争性结合场景进一步增加了模型解释的复杂性,使得提取生物学相关的化学计量或相互作用模式变得困难。尽管已有一些方法学尝试,但在缺乏先验实验数据或模板的情况下,化学计量系数的预测仍未解决。
一个启发本研究的相关方法是CombFold,它通过重叠亚复合物预测组装大型复合物。但该方法通常需要复合物化学计量的先验知识,且最终生成静态模型,未提供相互作用动力学和构象变异性的明确解释。研究人员假设这些重叠结构数据集也可用于探索预测的相互作用和构象如何随建模背景而变化,这一过程被称为"基于上下文的结构预测分析",可作为获取有意义生物学信息的补充方法。在此前提下,研究人员开发了一种系统采样化学计量空间以捕捉和解释这些变异的方法。

研究目的与意义

本研究最初旨在预测未知锥虫(trypanosomatid)复合物的结构,以设计湿实验。研究人员很快面临已提及的挑战,包括大型组装复杂性、瞬时/动态和竞争性相互作用、构象变化及化学计量系数推断,这启发了MultimerMapper的开发——一种在不同建模条件下分析预测蛋白质复合物结构变异性的方法,特别关注蛋白质界面。锥虫因其作为致病生物的重要性、研究人员对其复合物的专业知识及其与模式生物的高度进化分歧而被保留作为训练和验证背景。这种分歧体现在与模式生物相比的低蛋白质序列同一性,但保守了核心真核复合物的结构特征,为验证方法的稳健性提供了极佳机会。研究人员还使用非锥虫复合物进一步测试该方法,获得定量证据证明其普遍适用性,同时描绘其优势和改进领域。

关键技术方法

研究人员采用的主要技术方法包括:使用AlphaFold3服务器和本地AlphaFold2-multimer v3实例进行蛋白质结构预测,输入使用Bryant等人描述的比对(MSA),不使用模板;对每个N链模型进行成对分解并提取指标,包括最小链间PAE值(miPAE)和预测对接系数(pDockQ);基于miPAE和模型数量阈值进行蛋白质-蛋白质相互作用(PPI)和残基-残基接触(RRC)预测;使用基于图论的社区聚类算法进行蛋白质分割和结构域检测;构建均方根偏差(RMSD)伪轨迹并计算伙伴分布偏差(BPD);通过多价链分数(FMC)检测多价相互作用;以及接触矩阵聚类算法用于识别替代相互作用模式。

研究结果

蛋白质结构预测与模型分解

研究人员使用AF3服务器和本地AF2m v3进行结构预测。对于AF2m,使用修改后的Discoba数据库生成MSA以提高锥虫分类群内的比对覆盖度,并与ColabFold MSA服务器生成的MSA串联。每个蛋白质组合生成5个模型,最多20次循环。每个N链模型被分解为所有可能的成对组合,提取原子坐标、每个残基的pLDDT值、链间PAE子矩阵,并计算miPAE和pDockQ值,同时提取pTM和ipTM值并按ipTM排序。

PPI和RRC预测

PPI检测基于miPAE阈值和模型数量标准进行。对于二聚体,若至少4个模型满足miPAE≤miPAEcutoff(AF2m为9.7 ?,AF3为7.5 ?),则判定为阳性PPI。对于N聚体,采用类似标准但基于分解的链对。在检测到PPI的情况下,计算链间质心距离矩阵,距离≤8 ?且miPAE≤阈值的残基对被定义为RRC,并以布尔接触矩阵表示。

蛋白质分割和结构域检测

研究人员通过处理参考结构的链内PAE矩阵,使用改良的图基社区聚类算法将蛋白质分割为紧凑且结构良好的区段。使用Leiden聚类算法识别残基社区,分辨率参数以1/100缩放以控制域粒度。通过2D PAE热图和3D骨架可视化交互式微调域分配。

RMSD伪轨迹和BPD

对于每个蛋白质实体,研究人员从所有预测中分离其所有链的原子坐标,使用Kabsch算法与参考结构比对并计算RMSD值,按RMSD升序排序形成伪轨迹。记录每帧的pLDDT、平均pLDDT和回旋半径(ROG)。BPD参数衡量伙伴沿伪轨迹的局部富集或贫化程度,通过计算全局频率和滑动窗口局部频率的归一化差异获得。最终使用核心残基进行结构比对以平滑无序环造成的波动。

多价性检测

研究人员使用FMC参数评估蛋白质对的多价相互作用。从包含3个P和Q亚基的N聚体预测中,统计每条P链接触的Q链数量及反之。接触≥2条链的为多价链(C2),接触≤1条的为单价链(C1)。FMC定义为C2观测数除以C1和C2观测数之和,FMC≥0.2时判定为多价对。

接触矩阵聚类算法

对于以多价方式相互作用的蛋白质对,研究人员使用接触矩阵聚类算法分析替代相互作用模式。该算法基于布尔接触矩阵的相似性对亚模型进行聚类,结合原子坐标信息识别不同的相互作用界面和构象状态。

讨论与结论

MultimerMapper提供了一种新视角来理解预测蛋白质复合物结构的动态性质。通过系统采样化学计量空间并分析不同建模背景下的结构变异,该方法能够突出高阶亚组装、推断化学计量、识别替代相互作用模式和构象变化。该方法特别适用于具有未知化学计量和高度动态性的复合物体系。研究人员在锥虫复合物上进行了训练和验证,并在非锥虫复合物上获得定量证据证明其普遍适用性。MultimerMapper支持研究人员探索功能机制和组装路径,为设计湿实验提供指导,弥补了当前AI结构预测工具在系统解释和分析方面的不足。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号