《Chemical Science》:A unified predictor of protein stability changes across all mutation types via implicit structure learningOpen Access
编辑推荐:
由氨基酸替换或插入缺失(indels,即插入/缺失)引起的蛋白质稳定性变化的预测对于蛋白质工程至关重要。虽然当前模型在单点替换方面表现出色,但由于简单的加性假设以及无法模拟骨架构象变化,它们在多点突变和插入缺失方面存在困难。为了解决这些局限性,研
由氨基酸替换或插入缺失(indels,即插入/缺失)引起的蛋白质稳定性变化的预测对于蛋白质工程至关重要。虽然当前模型在单点替换方面表现出色,但由于简单的加性假设以及无法模拟骨架构象变化,它们在多点突变和插入缺失方面存在困难。为了解决这些局限性,研究人员引入了UniStab,一个用于预测所有突变类型稳定性变化的端到端框架。通过利用预训练折叠模型的隐式几何推理,UniStab有效捕获了非加性上位相互作用(epistatic interactions)和局部骨架重排,而无需显式结构生成的高昂成本。在一个综合基准测试中评估,UniStab展示了最先进的性能,尤其是在多点突变和插入缺失的挑战性场景中。除了预测准确性,UniStab还提供了可解释的结构洞察,并有效指导了稳定变体的设计,促进了其在理性蛋白质工程中的潜在应用。
**研究背景与问题**
蛋白质稳定性是维持蛋白质折叠结构以执行生物学功能的基础,也是设计稳健工业酶和下一代治疗药物的前提。突变效应通常以稳定性变化(ΔΔG)量化,但实验测量(如深度突变扫描)成本高且条件特异,覆盖序列空间极小。现有计算方法分为物理基础(如FoldX、Rosetta)和数据驱动(深度学习)两类。数据驱动方法中,序列模型仅依赖一级序列,结构模型则需固定骨架或显式生成突变体结构。然而,当前模型在单点替换上表现优异,却因简单加性假设(忽略上位相互作用)和无法模拟骨架构象变化,难以处理多点突变和插入缺失(indels)。此外,显式结构生成计算成本高,且多数方法缺乏可解释性。为此,研究人员开发了UniStab,一个统一框架,旨在端到端预测所有突变类型(单点、多点、插入缺失)的稳定性变化。该研究发表在《Chemical Science》。
**研究内容与结论**
UniStab通过预训练折叠模型(ESMFold)的隐式结构表示,结合低秩适应(Low-Rank Adaptation, LoRA)高效适配,无需显式生成突变体3D结构,即可捕获非加性上位效应和局部骨架重排。在MegaScale数据集(含470,995个高质量突变测量值,按25%序列同一性聚类划分训练/验证/测试集)和独立PTMUL基准上评估,UniStab在单点突变(斯皮尔曼等级相关系数SCC=0.67)、双点突变(SCC=0.60)和插入缺失(SCC=0.78)上均取得平衡且领先的性能,尤其对插入缺失和多点突变提升显著(相比现有方法分别提高19%和11%)。消融实验证实了结构模块、加权注意力池化和高容量LoRA的关键作用。特征距离分析表明,UniStab的隐式表示能反映突变诱导的局部结构扰动,且与独立预测模型(Chai-1)计算的局部RMSD正相关。注意力机制突出突变位点及其邻近残基的相互作用重连,提供了微观可解释性。结合光束搜索(Beam Search)优化,UniStab对蛋白谷氨酰胺酶(PG)设计了稳定变体(如L1M+A129C),经100 ns分子动力学模拟验证,变体显示出更低的RMSD、RMSF、更高的天然接触保持率和更紧凑的回转半径,证实了预测可靠性。
**主要关键技术方法**(不超过250字)
研究采用以下关键技术:①ESM2-3B语言模型提取残基级序列嵌入;②ESMFold折叠主干(trunk)的隐式结构表示,通过48个改进Evoformer模块联合更新序列和配对表示;③低秩适应(LoRA)仅微调折叠主干的选定线性层,冻结预训练参数;④结构感知融合模块(3块),通过多头注意力整合序列和配对特征;⑤可学习加权注意力池化,将残基级特征聚合为蛋白质级表示;⑥回归头(MLP)基于野生型与突变体池化表示的差值预测ΔΔG。样本来源:MegaScale数据集(cDNA display proteolysis高通量实验,776,000+测量值,经质量过滤后保留470,995个突变,按25%序列同一性聚类划分);PTMUL数据集作为独立外部基准(含536个双突变和339个多突变样本)。
**研究结果**
**2.1 UniStab概述**:研究人员设计了UniStab架构,以野生型和突变体序列为输入,通过ESM2-3B编码、折叠主干隐式表示、结构模块和注意力池化,端到端预测ΔΔG,覆盖所有突变类型。
**2.2 基准数据集与比较评估**:采用MegaScale和PTMUL数据集,与ThermoMPNN-D、SPURS、MutateEverything、FoldX、Rosetta等方法比较,使用回归(SCC,PCC,RMSE,MAE)和分类(AUROC,AUPRC,F1,MCC)指标。
**2.3 UniStab在MegaScale测试集上取得强且平衡的性能**:插入缺失最佳(SCC=0.78,PCC=0.78),单点次之(SCC=0.67),双点较难(SCC=0.60)。分类性能受类别不平衡影响,但整体均衡。基于溶剂可及表面积(SASA)和Cα距离的分层分析表明,模型对表面残基和近距离突变捕获更好,对核心残基和远距离突变性能下降。
**2.4 UniStab在基准数据集上优于现有方法**:在MegaDouble、MegaIndel、PTMULMulti上SCC排名第一(分别为0.595、0.780、0.713),在PTMULDouble上略低于ThermoMPNN-D(0.555 vs 0.566),但在分类(AUROC=0.792)和多突变场景下优势明显。
**2.5 消融分析识别关键架构与微调组件**:结构模块(3块最优)、加权注意力池化、高容量LoRA(rank=8, alpha=16)组合性能最佳。移除结构模块使单点SCC从0.668降至0.466。
**2.6 特征距离与预测准确度相关并捕获局部结构扰动**:特征距离随突变数增加而增大,与预测准确性正相关(SCC与特征距离相关系数r=0.751)。特征距离与Chai-1预测的局部RMSD弱相关,且优于ESM2-3B基线。直接预测多突变效应(上位模型)略优于加性叠加。
**2.7 注意力突出突变为中心的相互作用重连并与局部结构变化一致**:以1RGG蛋白为例,注意力差异图显示I70D突变引起T18和Y81附近注意力集中,对应实验观察到的相互作用重连。另一α-螺旋蛋白案例中,注意力变化集中在突变位点邻近残基。
**2.8 光束搜索引导优化与分子动力学验证**:对蛋白谷氨酰胺酶(PG)进行光束搜索优化,得到三个双突变变体(L1M+A129C等)。100 ns MD模拟显示,变体RMSD和RMSF更低,天然接触保持率更高(89.80-90.56% vs 野生型87.75%),回转半径更紧凑,验证了稳定化效果。
**讨论与结论**
UniStab利用蛋白质折叠模型的隐式结构表示,通过LoRA适配,实现了可扩展的稳定性变化预测,并具备结构可解释性。其注意力模式集中在突变位点及相互作用伙伴,特征距离与局部构象变化相关,为预测提供了支持性证据。然而,隐式表示仍比显式3D模型粗糙,对远距离双突变性能有限;且数据驱动方法受数据集偏差(如MegaScale的蛋白覆盖和动态范围)影响,泛化需谨慎。未来可整合循环或显式残基相互作用约束,并利用更大标准化数据集和结构信息合成数据改进。总结而言,UniStab证明折叠模型的隐式结构表示可适配为可扩展的稳定性变化预测,通过将单点、多点和插入缺失统一在一个序列到ΔΔG框架中,为稳定性导向的蛋白质工程提供了实用途径。