分子对接与共折叠在蛋白-肽构象预测中的比较:蛋白质柔性与训练集重叠的影响

《Digital Discovery》:Molecular docking versus co-folding for protein–peptide pose prediction: effects of protein flexibility and training set overlapOpen Access

【字体: 大 中 小 】 时间:2026年09月25日 来源:Digital Discovery 7.1

编辑推荐:

  合成肽因其高特异性、易于合成以及适用于靶向蛋白质界面,作为治疗和诊断制剂日益重要。然而,准确预测肽结合构象仍是一个重大挑战,特别是对于构象灵活的蛋白质靶点和从头设计的肽。基于深度学习的共折叠方法,包括AlphaFold-Multimer(AFM)、AlphaF

  
合成肽因其高特异性、易于合成以及适用于靶向蛋白质界面,作为治疗和诊断制剂日益重要。然而,准确预测肽结合构象仍是一个重大挑战,特别是对于构象灵活的蛋白质靶点和从头设计的肽。基于深度学习的共折叠方法,包括AlphaFold-Multimer(AFM)、AlphaFold3(AF3)和Boltz-2,通过同时预测蛋白质-肽复合物结构,无需预先定义结合构象,为传统肽对接提供了一种替代方案。在本研究中,研究人员使用PepPro数据集,将这三种共折叠方法与两种针对肽优化的分子对接方法AutoDock-CrankPep(ADCP)和HADDOCK进行了系统基准测试。该成熟数据集包含构象灵活的蛋白质-肽复合物,这些复合物存在于所有共折叠方法的训练集中。为了评估共折叠方法的泛化性能,研究人员构建了一个独立测试集,并根据其与训练集的冗余水平进行分类。基准测试结果表明,当相关复合物存在于训练集中时,共折叠方法在构象预测准确性和排序性能方面优于对接方法。然而,在没有此类表示的情况下,HADDOCK优于所有评估的共折叠方法。Boltz-2在PepPro数据集上取得了最高准确性,但在非冗余复合物上泛化能力降低,表明其对训练集覆盖度的强烈依赖。相比之下,AFM和AF3表现出更稳健的泛化能力,并在独立的蛋白质-肽复合物上保持了一致的性能,突显了它们更适合从头肽结合物设计。此外,对评分指标的广泛分析显示,界面预测模板建模(ipTM)提供了强大的早期富集性能,而肽特异性预测局部距离差异测试(pLDDT)与结构准确性密切相关,表明它们在候选优先级排序中具有互补价值。这些发现表明,稳健的肽结合物预测需要仔细考虑训练集冗余、靶标构象灵活性以及互补的置信度指标,以选择从头候选优先级排序的计算方法。
蛋白-肽构象预测是计算结构生物学的重要挑战,尤其是当蛋白质靶点具有构象柔性或肽为从头设计时。合成肽因其高特异性和易于合成成为治疗和诊断的重要分子,但准确预测其结合构象仍依赖计算方法的进步。传统分子对接(molecular docking)通常基于静态蛋白结构,难以应对apo到holo的构象变化。近年来,基于深度学习的共折叠(co-folding)方法如AlphaFold-Multimer(AFM)、AlphaFold3(AF3)和Boltz-2,直接从序列预测复合物结构,不需要预定义结合构象,为肽构象预测提供了新途径。然而,这些方法高度依赖训练集,可能存在数据泄漏,其在柔性靶标和全新肽上的泛化能力尚未被系统评估。为此,研究人员系统比较了三种共折叠方法与两种优化肽对接方法——AutoDock-CrankPep(ADCP)和HADDOCK——在构象柔性基准和独立测试集上的性能。

研究人员使用了PepPro数据集(包含57个构象柔性蛋白-肽复合物,对应有apo结构)和构建的独立测试集(57个外部复合物,按结构与训练集冗余程度分类)。评估指标包括DockQ、Spearman ρ、Kendall τ、ROC-AUC、PR-AUC和BEDROC。结论显示,共折叠方法在训练集有相关数据时占优,但HADDOCK在非冗余数据上胜出;Boltz-2在熟悉数据上最强,但泛化能力弱于AFM和AF3;ipTM和肽pLDDT具有互补价值。

关键技术方法方面,研究团队从Zou实验室网站获取PepPro数据集;独立测试集来自RCSB PDB,选取2023年6月1日后释放的5-30残基肽复合物,经TM-align聚类(TM-score≥0.9)和冗余分类构建。对接方法中,ADCP使用CRANKITE蒙特卡洛采样和Go型势函数;HADDOCK采用信息驱动对接并允许有限柔性。共折叠方法中,AFM采用不变点注意力网络,AF3和Boltz-2为扩散模型,Boltz-2还包括物理启发的“Boltz-steering”机制。所有方法均生成多个模型并用内部置信度指标排序。评估使用DockQ分类构象质量,并通过自举重采样估计95%置信区间。

结果部分,首先,独立测试集中的大多数复合物与训练集无或低冗余:结构冗余分析显示57个复合物中,11个受体无训练集同源结构,27个低肽界面泄漏,仅有2个高度泄漏,表明独立集能有效检验泛化能力。其次,基准数据集主要包含进化远缘蛋白质:系统发育分析显示多数蛋白质序列距离大于1替换/位点,仅有少数相同蛋白对,且性能与进化距离无关。第三,共折叠方法在构象柔性蛋白质上优于对接:在PepPro上,共折叠方法在中等和高构象变化类别中成功率更高,而ADCP产生大量错误预测,HADDOCK在可接受质量上接近共折叠。第四,共折叠构象预测质量在非冗余复合物上大幅下降:在独立数据上,HADDOCK以82.5%的高质量top-3成功率超越所有方法,而共折叠方法在非冗余子集上的中等质量成功率降至33-48%,高质量降至10-30%,其中AFM泛化最强,Boltz-2下降最大。第五,共折叠方法在排序性能上优于对接:在PepPro上,Boltz-2的复合物ipLDDT和置信度分数达到最高PR-AUC(0.92)和BEDROC(0.99),AFM的肽pLDDT相关性最高(Spearman ρ=0.73),而ADCP评分为负相关且无富集。第六,AlphaFold架构在独立数据集上表现更佳,Boltz-2性能下降:在独立数据上,AFM和AF3的ipTM和肽pLDDT相关性提高,而Boltz-2的置信度分数相关性降低,肽pLDDT成为其最佳指标。

讨论部分指出,Boltz-2的优势源于其更宽的训练集截止日期(2023年6月),但这也导致对训练数据更强的依赖。AFM和AF3在非冗余复合物上更稳健,更适合从头肽设计。HADDOCK在有实验apo/holo结构时具有实用价值,可与共折叠方法互补。ipTM在早期富集上表现突出,而肽pLDDT与结构准确性强相关,两者结合可提高候选优先级排序。研究局限性包括独立测试集缺少apo结构,无法完全区分数据泄漏与构象变化的影响。结论翻译为:本研究表明,共折叠性能在非冗余复合物上大幅下降,尤其是缺乏肽信息时;然而,共折叠方法在处理明显apo-holo构象变化时优于对接方法;肽特异性pLDDT与结构准确性强相关,并补充ipTM以支持稳健排序和早期富集;计算方法和排序指标的选择应与研究目标一致,以支持稳健的肽设计。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号