《Protein Science》:Persistent sheaf Laplacian analysis of protein stability and solubility changes upon mutation
编辑推荐:
遗传突变经常破坏蛋白质结构、稳定性和溶解性,是多种疾病的主要驱动因素。尽管这些分子改变至关重要,但现有的计算模型通常缺乏可解释性,且未能整合必要的物理化学相互作用。为克服这些限制,研究人员提出SheafLapNet,一种基于拓扑深度学习(Topological
遗传突变经常破坏蛋白质结构、稳定性和溶解性,是多种疾病的主要驱动因素。尽管这些分子改变至关重要,但现有的计算模型通常缺乏可解释性,且未能整合必要的物理化学相互作用。为克服这些限制,研究人员提出SheafLapNet,一种基于拓扑深度学习(Topological Deep Learning, TDL)和持久层拉普拉斯(Persistent Sheaf Laplacian, PSL)数学理论的预测框架。与标准的拓扑数据分析(Topological Data Analysis, TDA)工具(如持久同源性)不同,后者通常对异质信息不敏感,PSL直接将特定物理化学信息(如部分电荷)编码到拓扑分析中。SheafLapNet将这些层论不变量与先进的蛋白质Transformer特征及辅助物理描述符协同结合,以多尺度和机制性方式捕获内在分子相互作用。为验证该框架,研究人员对回归和分类任务均采用严格的基准测试。对于稳定性预测,研究人员使用全面的S2648数据集,以及独立的S350和严格非冗余的S669盲测集,以确保鲁棒评估和热力学一致性。对于溶解性预测,研究人员使用PON-Sol2数据集,该数据集提供了增加、减少或中性溶解性变化的注释。通过整合这些多视角特征,SheafLapNet在这些不同基准测试中均达到最先进性能,证明层论建模显著增强了预测突变诱导的结构和功能变化方面的可解释性和泛化性。
**研究背景与问题**
基因突变频繁破坏蛋白质结构、稳定性和溶解性,是多种疾病(如神经退行性疾病、癌症)的主要驱动因素。尽管这些分子变化至关重要,现有计算模型常缺乏可解释性,且未能整合关键物理化学相互作用(如氢键、范德华力、静电作用)。传统拓扑数据分析(TDA)工具(如持久同源性)对异质信息不敏感,而持久层拉普拉斯(PSL)能直接编码部分电荷等理化信息。为克服这些局限,研究人员提出SheafLapNet,基于拓扑深度学习(TDL)和PSL理论,旨在同时预测突变诱导的蛋白质稳定性和溶解性变化。该研究发表在《Protein Science》。
**主要技术方法**(不超过250字)
研究人员采用三类关键特征:1) 持久层拉普拉斯(PSL)拓扑特征,通过构建突变位点周围原子子复合体,计算层拉普拉斯谱(谐波与非谐波),编码多尺度原子间相互作用;2) 进化序列嵌入,从预训练蛋白质Transformer模型ESM-2提取;3) 辅助物理化学描述符,包括部分电荷、静电溶剂化自由能、库仑相互作用、pKa偏移及突变位点邻域氨基酸组成。三类特征拼接后输入任务特定神经网络,分别进行回归(稳定性预测)或分类(溶解性变化分类)。数据来源:稳定性预测使用S2648数据集(131个蛋白质,2648个单点突变)、S350(350个突变)和S669(1338个严格非冗余变体,与训练集序列同一性<25%);溶解性预测使用PON-Sol2数据集(77个蛋白质,6328个突变样本,分三类:增加、减少、中性)。
**研究结果**
**2.1 SheafLapNet概述**
通过整合序列特征、PSL拓扑特征和辅助物理化学描述符,构建多尺度分子表示,经神经网络输出预测结果。
**2.2 突变诱导的蛋白质稳定性变化预测**
- **2.2.1 S669数据集独立盲测**:在S669盲测集上,SheafLapNet总皮尔逊相关系数(PCC)为0.66,均方根误差(RMSE)为1.43 kcal/mol,反对称相关性r
f-r=-0.99,反对称偏差?δ?=-0.01,表明近乎完美的热力学一致性。正向突变PCC 0.50,反向突变PCC 0.48,性能优于多个现有方法。
- **2.2.2 S2648和S350的交叉验证与盲测**:在S2648五折交叉验证中,PCC达0.82,RMSE为0.84 kcal/mol,相较TNet-MP-2(PCC 0.77,RMSE 0.94)提升6.49%和9.6%。在S350盲测中,PCC为0.82,RMSE为0.90 kcal/mol。残基-残基矩阵显示预测与实验趋势一致,其中突变至异亮氨酸(Ile)常导致正ΔΔG值。模型在不同理化性质组(疏水、极性、带电等)及结构区域(内部/表面)均表现稳健,内部区域PCC 0.81,表面区域PCC 0.84。
**2.3 突变诱导的蛋白质溶解性变化分类**
在PON-Sol2数据集独立盲测中,SheafLapNet达归一化正确预测比率(CPR)0.638,归一化广义平方相关系数(GC
2)0.254,优于PON-Sol2(CPR提升17.06%,GC
2提升61.78%)和TopGBT(CPR提升13.52%,GC
2提升38.04%)。10折交叉验证中,归一化CPR 0.689,归一化GC
2 0.362。极性到极性残基突变分类准确率最高,而极性到特殊残基及疏水内部突变准确率较低。
**讨论与结论**
讨论部分强调,PSL框架通过整合拓扑、序列及物理化学特征,实现了高精度、可解释性及热力学一致性,克服了传统TDA对异质信息不敏感的局限。模型在稳定性与溶解性预测中均达到最先进性能,且层论建模显著增强了泛化能力。研究结论为:通过整合多视角特征,SheafLapNet在这些不同基准测试中均达到最先进性能,证明层论建模显著增强了预测突变诱导的结构和功能变化方面的可解释性和泛化性。