折叠稳定性选择预测蛋白质数据库中蛋白位点间的协同变异

《Journal of Molecular Evolution》:Selection for Folding Stability Predicts Observed Covariation Between Protein Positions in the PDB

【字体: 大 中 小 】 时间:2026年09月25日 来源:Journal of Molecular Evolution 2.0

编辑推荐:

  蛋白质位点间的统计耦合已极大地推动了蛋白质结构预测,然而关于产生这些耦合的选择压力仍存在争议。本研究明确地预测了同时针对去折叠与错误折叠的蛋白质折叠稳定性选择所产生的耦合,并通过稳定性约束蛋白质演化模型(Stability constrained model

  
蛋白质位点间的统计耦合已极大地推动了蛋白质结构预测,然而关于产生这些耦合的选择压力仍存在争议。本研究明确地预测了同时针对去折叠与错误折叠的蛋白质折叠稳定性选择所产生的耦合,并通过稳定性约束蛋白质演化模型(Stability constrained model of protein evolution,SCPE)对其进行建模。SCPE基于接触相互作用,并借助接触矩阵空间中的随机能量模型(Random Energy Model,REM)预测针对错误折叠的稳定性。研究人员采用最小选择原则,假设多元氨基酸分布相对于不受蛋白质折叠稳定性影响的位点非特异性分布具有最小Kullback-Leibler散度。研究人员在一阶近似下预测耦合,假设其较小(小耦合近似,small coupling approximation,SCA),并获得一个显式公式,将该耦合与接触相互作用矩阵以及位点对的结构性质(是否存在天然接触、序列距离和位点埋藏程度)联系起来。研究人员在蛋白质数据库(Protein Data Bank,PDB)的一个代表性数据集上检验了这些预测。对于存在接触的位点对,预测和观测到的耦合均与氨基酸对的接触能呈负相关;而对于不存在接触的位点对,该关系为正,即负向设计使高概率形成错误接触的短程位点对中的氨基酸对被去稳定化。研究结果表明,最强的耦合对应于天然接触,但数量更多的耦合受负向设计影响。有趣的是,信息量最大的位点对由表面位点组成,提示蛋白质-蛋白质相互作用和功能性运动的作用。研究人员将不受蛋白质折叠稳定性选择影响的位点非特异性耦合解释为蛋白质演化所在谱系间全局突变或选择性力量变化的结果。与此一致的是,最强的全局耦合是相同氨基酸之间的自耦合。形成二硫键的半胱氨酸-半胱氨酸(Cys-Cys)表现出最强的全局耦合,其次是代谢代价高的氨基酸对(Trp-Trp、Tyr-Tyr、Trp-Tyr)以及倾向于与核酸相互作用的带正电荷氨基酸(Lys-Lys、Arg-Arg)。Ser、Thr、Asn和Gln形成一个全局相关的极性氨基酸簇。
论文解读:折叠稳定性选择与蛋白质位点协同变异的定量预测

一、研究背景与问题

蛋白质序列的进化通常被建模为替换过程,即描述蛋白质某位点氨基酸随时间被另一氨基酸替换的随机过程。这一形式化方法在系统发育推断中极为强大,但传统替换过程通常假设各位点独立演化,忽略了位点间的相关性。然而,已知被忽略的位点间成对相关正是预测蛋白质结构相互作用的关键,基于这些进化相关性训练的神经网络已在蛋白质结构预测中取得显著成功。大量进化相关性被认为源于维持蛋白质功能结构和折叠稳定性的选择压力。尽管统计耦合已被广泛用于蛋白质结构预测,关于何种选择力量产生这些耦合仍存在争论。此前发展的稳定约束蛋白质演化模型(SCPE)及其结构约束版本(SSCPE)虽能预测位点特异性氨基酸分布,但均假设位点独立演化。因此,研究人员在本研究中放松该假设,在成对近似下研究折叠稳定性选择如何产生位点间耦合,并通过小耦合近似(SCA)获得解析公式,在蛋白质数据库(PDB)大规模数据上进行系统检验。

二、研究内容与结论

研究人员建立了成对近似的SCPE模型,基于最小选择原则,要求多元氨基酸分布相对于不受折叠稳定性影响的全局分布具有最小Kullback-Leibler散度,同时约束蛋白质相对去折叠和错误折叠的折叠自由能。通过SCA近似,推导出预测位点间耦合的显式公式,该公式将耦合与接触相互作用矩阵、天然接触存在与否、序列距离及位点埋藏程度联系起来。研究人员利用PDB中37108条非冗余蛋白质链进行检验,将位点对按天然接触类型、序列接触范围、位点埋藏程度及蛋白质类型分类。结果发现:对于形成天然接触的位点对,预测与观测到的耦合均与氨基酸接触能负相关,即稳定相互作用的氨基酸对被偏好;对于不形成天然接触的短程位点对,耦合与接触能正相关,即负向设计使不稳定氨基酸对被偏好。预测与观测的耦合总体一致,加权相关系数大多大于0.5。最强耦合对应天然接触,但更多耦合受负向设计影响。令人意外的是,表面-表面接触位点对的信息量高于核心-核心接触位点对,暗示蛋白质-蛋白质相互作用和功能性运动的作用。全局耦合不受折叠稳定性选择影响,被解释为不同谱系间全局突变或选择性力量变化的结果,最强全局耦合为相同氨基酸的自耦合,其中Cys-Cys(二硫键)最强,其次为代谢代价高的氨基酸对和带正电荷氨基酸对。

三、主要技术方法

研究人员采用以下关键技术方法:(1)SCPE模型:通过接触相互作用表示蛋白质结构,用随机能量模型(REM)在接触矩阵空间中预测错误折叠态自由能,并采用最小选择原则确定位点特异性分布;(2)小耦合近似(SCA):在耦合较小的一阶近似下推导耦合解析公式,使预测仅依赖于局部位点对性质;(3)从PDB代表性数据集(70%序列同一性聚类、X射线晶体结构、>40残基,共37108条链)中采样位点对,按接触类型、接触范围(5组)、位点埋藏程度(核心/表面)分为45类位点对,并区分四种蛋白质类型(长/短、疏水/极性);(4)通过正则化拟合估计全局氨基酸分布参数;(5)用对数似然、加权均方误差和加权Pearson相关系数评估预测质量,并拟合选择强度参数Λ。

四、研究结果

(1)错误折叠模型的影响:优化REM温度参数T后发现,考虑错误折叠态自由能的模型显著优于仅考虑天然态去折叠的模型,表明错误折叠选择不可忽略。(2)倾向性与接触能的相反关系:观测到的对数倾向性与零平均接触能的相关性因接触类型而异——天然接触位点对呈强负相关(正设计),短程非接触和间接接触位点对呈正相关(负设计),长程非接触位点对则主要受全局倾向性决定。(3)接触范围和埋藏程度的依赖:接触位点对的倾向性-接触能负相关随接触范围增大而增强,核心-核心位点对的效应强于表面-表面位点对;非接触位点对的正相关随接触范围减小而增强,长程非接触位点对的负相关主要源于全局倾向性。(4)预测质量评估:SCA预测的加权相关系数大多高于0.5,长程天然接触预测最佳,间接接触和短程接触预测较差,短极性蛋白质预测最差。(5)互信息差异:天然接触位点对的互信息随接触范围增大而增加,非接触和间接接触位点对则在短程最强;表面-表面接触位点对的互信息意外高于核心-核心接触位点对。(6)长蛋白质承受更强选择:长蛋白质的选择参数Λ普遍大于短蛋白质,负向设计分数也更强;而短极性蛋白质在仅考虑单体蛋白质时表现出与理论预期更一致的Λ值。(7)全局氨基酸相关:全局倾向性中自耦合最强,Cys-Cys最高(0.312),其次为Trp-Trp(0.152)、Lys-Lys(0.100)等,Ser、Thr、Asn和Gln形成极性氨基酸聚类。

五、总结与讨论

研究表明,蛋白质位点间的协同变异主要源于三类选择力量:全局非特异性突变和选择性力量的变化、稳定天然态的正向设计(主要作用于天然接触位点对)以及去稳定错误折叠态的负向设计(主要作用于短程非接触位点对)。SCA近似虽简单,但能定性乃至半定量再现耦合的主要模式,支持折叠稳定性选择与全局进化力量共同产生观测协同变异的假说。预测不足主要体现在间接接触位点对(SCA忽略间接耦合)和短极性蛋白质(多为多聚体复合物或NMR结构)上。研究结论强调,负向设计影响的耦合数量超过正向设计,表面位点接触对的互信息优势提示功能相关选择的存在,而全局耦合反映了进化谱系间突变过程和全球性选择压力的差异。该研究为连接蛋白质进化统计耦合与物理折叠稳定性提供了可解析的理论框架,深化了对蛋白质序列-结构-进化关系的理解。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号