# 拓扑几何等变神经网络TopoFormer用于高精度蛋白质溶解度预测

《Digital Discovery》:TopoFormer: a topological-geometric neural network for accurate protein solubility predictionOpen Access

【字体: 大 中 小 】 时间:2026年09月25日 来源:Digital Discovery 7.1

编辑推荐:

  蛋白质溶解度是工业规模蛋白质生产的关键考量因素。由于蛋白质溶解度背后的物理过程具有复杂性和非线性特征,现有模型的预测性能不佳,因此需要昂贵的试错实验。研究人员引入了TopoFormer,一种新颖的组合拓扑-几何等变神经网络,可从OpenFold预测的三维结构数

  
蛋白质溶解度是工业规模蛋白质生产的关键考量因素。由于蛋白质溶解度背后的物理过程具有复杂性和非线性特征,现有模型的预测性能不佳,因此需要昂贵的试错实验。研究人员引入了TopoFormer,一种新颖的组合拓扑-几何等变神经网络,可从OpenFold预测的三维结构数据中预测二元蛋白质溶解度。为训练TopoFormer模型,研究人员根据文献中的实验蛋白质溶解度测量值,利用OpenFold预测创建了3DProtSolDB结构数据集。同时,研究人员从RCSB PDB中的对应结构组装了3DProtSolDB-Expt数据集。3DProtSolDB-Expt数据集用于训练TopoCoder,一种可捕获二级结构形状信息的拓扑嵌入模型。所得嵌入及对应的3DProtSolDB结构被用于训练TopoFormer模型。训练后的TopoFormer模型在随机分割(81.4%)和去冗余分割(84.1%)的留出测试集上均达到了最先进的准确率。此外,模型可解释性分析表明,TopoFormer模型获得了关于溶剂化行为的关键物理见解。研究人员使用这些技术分析了文献中碳酸酐酶突变体的溶解度。研究发现,TopoFormer模型的度量指标与分子动力学模拟的水存活概率相关性良好,突显了训练后的模型在指导可溶性突变体理性设计方面的实用性。
## 研究背景与意义

蛋白质溶解度是重组蛋白在工业应用中的核心制约因素,直接关系到蛋白药物的生产、酶催化剂的工业应用以及新型生物材料的开发。然而,由于蛋白质-溶剂平衡态在实验表征上的困难,以及不溶性蛋白常以错误折叠的无定形二级结构形式存在并暴露疏水区域,传统实验方法确定蛋白质溶解度需要耗费大量时间、精力和材料。尽管已有多种基于序列的溶解度预测模型(如PROSO II、PaRSnIP、DeepSol、ProteinSol、SOLar等),但现有模型在预测性能上仍存在明显不足,且多数模型未能充分利用蛋白质三维结构信息。近年来,ESMFold和AlphaFold2等高精度蛋白质结构预测模型的普及使得预测结构易于获取,这为开发能够利用预测结构作为输入的溶解度预测模型提供了新机遇。但预测结构本身存在几何不确定性,尤其在低置信度区域,这种不确定性会作为输入噪声降低下游模型的预测精度。为解决这一问题,研究人员提出结合等变神经网络和拓扑数据分析两种前沿技术:等变神经网络可保持输入几何数据的旋转等变性,具有更高的数据效率;拓扑条形码则利用全局形状信息进行推断,对输入扰动具有良好鲁棒性。

## 研究内容概述

基于上述背景,研究人员开发了TopoFormer——一种结合拓扑和几何信息的统一等变神经网络模型,用于从OpenFold预测的蛋白质三维结构预测蛋白质二元溶解度。研究首先从SoluProt数据集的14,536条氨基酸序列出发,利用OpenFold生成14,175个预测三维结构,构建了3DProtSolDB数据集;同时通过RCSB PDB序列相似性搜索,构建了包含8,021个实验结构的3DProtSolDB-Expt数据集。随后,研究人员开发了基于RipsNet架构的拓扑嵌入模型TopoCoder,在3DProtSolDB-Expt上训练以生成蛋白质结构的拓扑条形码嵌入。最后,将拓扑嵌入与三维结构信息共同输入到SE(3)等变Transformer架构的TopoFormer模型中,通过不变交叉注意力机制融合拓扑与几何表征,实现蛋白质溶解度的二元预测。该模型在随机分割的留出测试集上达到81.4%的准确率,在SoluProt原始去冗余分割的测试集上达到84.1%的准确率,均优于现有最先进方法。此外,模型的可解释性分析揭示了其学习的物理化学见解,并在碳酸酐酶突变体的溶解度分析中,发现模型注意力权重与分子动力学模拟的水存活概率高度相关(R2=0.76),展示了模型在指导可溶性突变体理性设计中的实用价值。

## 主要技术方法

研究人员在开展研究时使用了以下几项关键技术方法:一是利用OpenFold结构预测软件和Fireworks工作流编排工具,通过MMseqs2生成多序列比对后批量生成蛋白质三维结构预测;二是采用持久同调理论与Atol向量化方法生成拓扑条形码,并基于RipsNet架构(采用DeepSets排列不变神经网络)构建了TopoCoder拓扑嵌入模型;三是构建了融合不变交叉注意力机制的SE(3)等变Transformer架构TopoFormer,将拓扑嵌入作为查询向量与等变模块的标量节点特征进行交叉注意力融合;四是在图构建中综合了肽键、疏水相互作用、氢键、二硫键、离子相互作用、芳香相互作用和阳离子-π相互作用等多类边特征,并引入ESM2-650M预训练模型生成节点嵌入。在数据层面,研究使用了公开的SoluProt数据集(含11,436条训练序列和3,100条测试序列)以及从RCSB PDB中通过BLAST搜索获取的实验晶体结构数据。

## 研究结果

### 蛋白质结构数据库的生成与验证

研究人员利用OpenFold为SoluProt数据集中的全部氨基酸序列生成了三维结构预测,经过筛除361个失败结构后,3DProtSolDB最终包含14,175个预测结构(7,099个可溶性,7,076个不可溶性)。通过与RCSB PDB中实验结构的序列相似性搜索,构建了包含8,021个实验结构的3DProtSolDB-Expt数据集,其中71%的SoluProt训练集序列具有对应的实验晶体结构。统计验证显示,可溶与不可溶蛋白的OpenFold平均pLDDT分布几乎一致(Cohen's d值为0.04),预测结构与实验结构间的平均RMSD为2.78 ?,且pLDDT置信度与结构精度呈正相关,表明OpenFold对不可溶蛋白的结构预测同样可靠。

### 拓扑条形码嵌入的生成

研究人员开发了TopoCoder模型,通过在3DProtSolDB-Expt上训练来学习从α-碳坐标预测拓扑条形码嵌入。对低置信度预测结构(平均pLDDT为57.38)的测试表明,TopoCoder生成的嵌入与实验结构计算得到的条形码嵌入之间的归一化误差(5.1%)比传统计算方法(10.3%)降低约一半,证明TopoCoder能够有效去除预测结构中低质量区域带来的噪声,保持对二级结构形状信息的稳定捕获。

### 等变蛋白质溶解度预测模型的训练与评估

研究人员将TopoCoder生成的1D/2D/3D拓扑嵌入与3DProtSolDB结构信息共同输入到TopoFormer模型中训练。模型采用5层TopoFormer架构,每层包含等变注意力操作和一个不变交叉注意力模块,使用最大阶数为2的球谐函数表示、每阶32通道和每个注意力层2个头。在随机分割(80:10:10)的测试集上达到81.4%的准确率、81.5%的F1分数和0.63的马修斯相关系数(MCC),ROC-AUC为0.88;在SoluProt原始去冗余分割的测试集上达到84.1%的准确率、86.2%的F1分数和0.71的MCC,ROC-AUC为0.91。消融实验表明,拓扑嵌入、等变几何表示和ESM-2嵌入三个组件对于最佳预测精度缺一不可;仅用拓扑嵌入的GAT模型准确率为57.7%,仅用ESM嵌入为52.6%,不含条形码的等变Transformer为58.2%,而完整模型达到74.3%。对正确预测样本的分析发现,可溶与不可溶蛋白的相对暴露亲水性(REH)存在显著差异(Cohen's d=0.59),表明模型在训练中自主学习了残基亲疏水性对溶解度的影响规律。

### 碳酸酐酶突变体溶解度分析

研究人员将训练好的TopoFormer模型应用于文献中两种碳酸酐酶突变体的溶解度预测,模型准确预测了CA1-TaCA(Themovibrio ammonificans来源,实验不可溶)和CA7-PabCA(Pyrococcus abyssi来源,实验可溶)的溶解度。通过提取模型交叉注意力权重并与分子动力学模拟的残基水存活概率对比,发现线性拟合的R2仅为0.15,但随机森林替代模型实现了R2=0.76的相关性,表明TopoFormer的注意力权重与MD模拟结果存在显著关联,模型无需先验信息即可捕获蛋白质-水分子相互作用的物理特征。这一发现提示,注意力权重可用于识别对溶解度影响最大的氨基酸残基区域,从而指导后续突变设计的靶向选择。

## 讨论与结论

研究讨论指出,传统序列基溶解度预测方法(如Protein-Sol和SOLpro)准确率分别仅为58%和74%,且无法提供残基层面的重要性信息,限制了其在蛋白质设计中的应用。相比之下,TopoFormer不仅实现了更高的预测精度,还通过注意力机制提供了可解释的残基重要性图谱。结合MD模拟的水存活概率分析,研究人员提出了一种整合的注意力权重-水存活概率分析策略:聚焦于注意力权重高但水存活概率低的氨基酸区域,可优先确定突变靶点,实现蛋白质溶解度的精准调控。研究结论表明,TopoFormer模型能够从预测蛋白质结构出发,实现高精度的溶解度二元分类,并通过注意力机制揭示溶剂相互作用的关键结构区域,为工业蛋白质的理性设计和可溶性改造提供了一种准确、可解释的计算工具。模型和代码已在GitHub上公开,便于领域内研究者使用和进一步开发。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号