用ProteinDPO将蛋白质生成模型与实验适应性对齐

《Nature Methods》:Aligning protein-generative models to experimental fitness with ProteinDPO

【字体: 时间:2026年08月15日 来源:Nature Methods 28.3

编辑推荐:

  生物生成模型能够在不依赖任务特定训练数据的情况下预测生物功能,但其性能往往不及专门化模型。这源于一个根本性的“对齐差距”(alignment gap),即无监督训练期间学到的规则与所关注的功能之间缺乏关联。本研究展示了如何在不丢失预训练期间获得的一般性知识的前

  
生物生成模型能够在不依赖任务特定训练数据的情况下预测生物功能,但其性能往往不及专门化模型。这源于一个根本性的“对齐差距”(alignment gap),即无监督训练期间学到的规则与所关注的功能之间缺乏关联。本研究展示了如何在不丢失预训练期间获得的一般性知识的前提下提供任务特定信息:采用直接偏好优化(Direct Preference Optimization, DPO)将一个结构条件蛋白质语言模型对齐,使其倾向于生成稳定的蛋白质序列。研究人员的对齐模型ProteinDPO在稳定性预测上达到了与任务特定模型竞争的水平,并持续优于无监督版本和微调版本的模型。值得注意的是,ProteinDPO能够泛化至训练数据之外,实现对大型多链蛋白质复合物的稳定化以及结合亲和力预测的改进。当将该方法应用于流感疫苗主要组分血凝素三聚体的稳定化时,约80%的设计相较于天然血凝素表现出增加或相似的稳定性,并且针对新近出现的哺乳动物毒株可实现高达32°C的稳定性提升。研究结果展示了如何为生成模型注入生物物理信息,并更广泛地为生物基础模型的对齐提供了一种通用框架。
**论文解读:基于直接偏好优化的蛋白质生成模型实验适应性对齐**

**研究背景与问题**

近年来,生物大分子结构与功能预测的机器学习模型因大规模无监督训练而快速发展,例如基于UniProt和蛋白质数据银行(Protein Data Bank, PDB)训练的模型。其中,结构信息语言模型(又称反折叠模型)能够生成与给定结构相容的蛋白质序列。这类模型在无需显式生物物理信息训练的情况下,已展现出引导结合亲和力改进、提升蛋白表达、溶解性和稳定性的潜力。然而,演化选择并非仅针对稳定性进行优化,因此无监督模型在稳定性评分上的表现仍逊于有监督模型,如ThermoMPNN。这种无监督模型所学信息与特定蛋白质适应性定义之间的不一致被称为“对齐差距”。有监督微调(Supervised Fine-Tuning, SFT)虽可提供任务特定信息,但仅最大化阳性样本似然,易致过拟合并丢失预训练通用知识。因此,如何更有效将实验适应性信息融入蛋白质生成模型是亟待解决的重要问题。

**研究目标与研究内容**

研究人员提出利用直接偏好优化(Direct Preference Optimization, DPO)算法,将结构条件蛋白质语言模型ESM-IF1与实验稳定性数据对齐。DPO原本用于自然语言模型的人类偏好对齐,研究人员将其改造用于蛋白质序列生成:以蛋白质骨架为“提示”,序列生成为“响应”,实验稳定性为“偏好”数据。基于“Megascale”稳定性数据集(约66万条突变体,覆盖403个蛋白质结构域),研究人员训练了对齐模型ProteinDPO,并系统评估其在突变稳定性预测、结合亲和力评分、抗体热稳定性评估与序列生成等方面的表现。研究还将该方法应用于H5N1流感血凝素(hemagglutinin, HA)前融合构象的稳定化实验,验证了其实际应用价值。

**主要技术方法**

研究使用了以下关键技术:第一,直接偏好优化算法,包括成对(paired)排名、排序(ranked)和加权(weighted)三种DPO训练目标,其中加权目标是研究人员新推导的,可直接利用标量标签。第二,基于FoldSeek的结构聚类方法,用于划分训练集以避免数据泄漏。第三,大规模实验稳定性数据“Megascale”的筛选与预处理,过滤不可靠ΔΔG测量值并去除重复序列。第四,以ESM-IF1为基础模型,计算全序列对数似然作为评分依据,用于突变效应预测和序列生成。第五,实验验证采用差示扫描荧光法(Differential Scanning Fluorimetry, DSF)测量解链温度、生物层干涉法(Biolayer Interferometry, BLI)测定抗体结合亲和力、圆二色光谱(CD)验证二级结构保持。样本来源包括公开数据库SKEMPIv2、AB-Bind、FireProt、S669以及来自Shehata等和Jain等的临床及天然单克隆抗体热稳定性数据集;实验所用的H5N1 HA序列取自A/Vietnam/1203/04、A/Texas/dairycattle/Texas/24009367011/2024和A/British_Columbia/PHL-2032/2024毒株。

**研究结果**

**Megascale训练与相对稳定性预测性能**
研究人员在Megascale留出集上评估了模型对单或双突变稳定性的预测能力。结果显示,ProteinDPO的序列似然与实验ΔΔG的平均相关系数(Pearson R=0.72–0.73,Spearman ρ=0.69–0.72)显著优于vanilla ESM-IF1(Pearson R=0.55,Spearman ρ=0.53)和SFT模型(Pearson R=0.59,Spearman ρ=0.57)。在区分稳定/去稳定突变的AUROC指标上,ProteinDPO同样最高(0.82–0.84)。在双突变变体评分中,所有模型表现均比单突变差,但ProteinDPO采用全序列似然求和时超越了受限于“加和”机制的ThermoMPNN,表明其能捕获多突变的非线性效应。

**与其他相对稳定性预测方法的比较**
在S669和FireProt外部数据集上,ProteinDPO与有监督及基于物理的ΔΔG预测器相比排名靠前,并达到与ThermoMPNN竞争的水平。值得注意的是,SFT模型在外部数据集上比vanilla模型更差,而ProteinDPO的改进则能泛化至S669和FireProt,说明SFT过拟合而ProteinDPO学到了可泛化的稳定性信息。

**向多样化设计任务的泛化**
在SKEMPIv2和AB-Bind结合亲和力数据集上,尽管ProteinDPO仅以小型蛋白单体的ΔΔG训练,它对大型蛋白复合物结合亲和力评分仍有适度提升,对抗体-抗原复合物的提升更为明显。在483个临床及人源抗体的热解链温度排序任务中,ProteinDPO比vanilla ESM-IF1的相关系数提升0.08–0.12;而ThermoMPNN无法处理多链抗体。作为生成模型,ProteinDPO在三个不同大小和折叠类型的天然骨架上生成的序列,经Rosetta力场评估比vanilla、SFT及天然序列更为稳定,且生成的序列具有高ESMFold置信度(pLDDT>80)和结构自洽性。

**H5流感HA前融合构象的稳定化**
针对H5N1 HA,ProteinDPO仅基于2004年越南毒株结构即零样本识别出文献中已知的H1和H3亚型稳定突变,包括构成“pH开关”的关键残基H26、K51和E103。实验验证中,45个设计中80%实现了稳定或更优的热稳定性,单个替换最多提升17°C,九个替换的组合变体平均提升9.8°C,其中DPO-16在2024年得克萨斯和英属哥伦比亚毒株上分别带来13°C和32°C的Tm提升。这些变体保留了与广谱中和抗体13D4和CR6261的纳摩尔级亲和力,且CD光谱显示其二级结构未受破坏。

**讨论与结论**

研究表明,DPO能有效地将生物物理信息注入无监督结构条件语言模型,所得ProteinDPO在突变稳定性评分和稳定序列生成方面均优于原始预训练模型和SFT模型。从训练所学的小型单体稳定性信息能够泛化至更大、未见过的折叠、多链抗体和大型复合物,而SFT则过拟合于训练分布。HA稳定化实验展示了该方法应对快速演化病原体的实用性,提示ProteinDPO通过基本结构原理而非毒株特异性修饰实现稳定化。虽然ProteinDPO并非全面超越所有有监督回归模型,但它保留了生成能力,可同时用于评分和序列设计,这是监督模型无法结合的。研究认为,基于特定性质的对齐可改善其他相关任务,因为不同生物物理性质共享内在物理原理。未来工作可探索其他性质的对齐以及显式阻止非目标构象等方向。研究人员已将ProteinDPO开源至https://github.com/evo-design/protein-dpo。该工作为生物生成模型的对齐提供了一种通用框架。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号