《Frontiers in Genetics》:BioMutation: a portable graphical user interface for mutagenesis and feature analysis in proteins, nucleic acids, and their complexes
编辑推荐:
这篇综述系统介绍了BioMutation,一款集成了UCSF ChimeraX功能、面向高通量系统化计算机模拟诱变的图形用户界面(GUI)。它支持用户自定义和类别化的氨基酸替换(蛋白质)以及核苷酸替换组合(DNA/RNA),自动生成标准格式(PDB, MOL2, mmCIF)突变体结构库,并包含基于Google Colab的结构分析模块,为结构生物学、生物分子工程和药物发现领域提供了自动化、灵活且易用的高效平台。
引言
生物分子的结构完整性和功能从根本上由其基本构成单元的序列和排列决定。任何改变都可能显著影响分子的结构、行为和生物学作用。在核酸(DNA和RNA)中,基本的单体单元是核苷酸。蛋白质则由氨基酸构成,其侧链(R基团)的差异产生了功能各异的蛋白质。这些序列的改变,统称为突变,可以自然发生或人为引入,其结果可能带来功能的获得或丧失,影响广泛,从研究和工业中的有益应用到严重的病理学后果,如遗传性疾病。为了探索和理解突变的影响,开发能够进行计算机模拟诱变的计算工具至关重要。这一过程允许研究人员系统地探索多种修饰,并评估特定修饰如何影响生物分子的结构功能特性。诱变在农业、畜牧业、生物技术和医学研究等多个科学领域都显示出重要价值。然而,实验性诱变研究通常存在耗时、资源密集、技术要求高等局限性。此外,突变的结构后果,特别是在复杂的生物分子复合体中,由于分辨率、时间和资源限制,通常难以通过实验进行解析。这些挑战凸显了对能够进行高通量突变建模和分析的计算机模拟工具的迫切需求。虽然UCSF Chimera、PyMOL、VMD等现有平台提供了基础的视觉化和有限的诱变功能,但它们并不适合高通量应用,且缺乏集成的工作流程、批量处理能力和直观的界面。其他计算诱变工具,如Rosetta、FoldX、MODELLER、AlphaFold等,主要集中于蛋白质,对核酸的支持有限或需要大量脚本编程。商业套件如MOE、BIOVIA Discovery Studio等虽然提供了更友好的界面,但其核酸突变能力有限,且价格昂贵。为了克服这些限制,本文介绍了BioMutation。
方法
BioMutation是一个用户友好的图形界面,旨在通过直观的逐步工作流程简化生物分子诱变过程。它迭代地利用了UCSF ChimeraX的诱变引擎,即用于核酸点突变的swapna和用于氨基酸点突变的swapaa。它基于现代网络技术(HTML, CSS, JavaScript)构建,重量轻,可在标准系统本地运行,除了ChimeraX外无需额外安装。其架构和操作流程如图1所示:
工作流程概述:BioMutation工作流程始于输入PDB格式的生物分子三级结构,可通过PDB代码从RCSB PDB网络服务器获取或本地上传。用户通过直观的图形界面定义突变参数,例如生物分子类型、突变方案(单点、多点、类别化、或二/三/四核苷酸替换)、链ID、残基或核苷酸位置以及期望的输出格式。基于这些输入,BioMutation会自动生成兼容ChimeraX的Python脚本,执行基于替换的突变,并以PDB、MOL2或mmCIF格式生成突变体结构库。产生的突变体结构可以直接通过集成的BioMutation结构分析模块进行分析,该模块提取理化特征,进行三维结构可视化,并促进突变引起变化的比较评估,从而实现高通量计算机模拟诱变和分析的端到端流程。
安装:在本地系统安装BioMutation工具需要用户从GitHub存储库下载并解压BioMutation_codes.zip文件,然后运行start.html文件即可启动。所有HTML文件都已链接,可引导用户完成后续步骤。主页还提供教程供用户了解工具的整体操作。
执行突变:用户首先选择生物分子类型(核酸或蛋白质),然后选择期望的突变方案。支持的突变类型包括单点或多点点突变,以及基于类别或组合的诱变,例如DNA中的二、三或四核苷酸替换,或蛋白质中残基类别特异性替换(如疏水性、极性、芳香族、酸性、碱性)。该工具接受PDB ID或本地PDB文件作为输入,并允许用户指定突变参数,如链ID、残基ID以及替换的碱基或氨基酸。输出可按用户需求生成为PDB、MOL2或mmCIF格式。动态摘要表实时显示用户输入,并可在执行前修改。确认后,BioMutation会生成一个兼容UCSF ChimeraX的自定义Python脚本,自动化突变过程并将产生的突变体结构保存到指定的本地目录。突变体结构可用于进一步的计算研究。表1总结了与不同生物分子兼容的所有支持的突变类型。
特征分析:计算机模拟评估突变不仅需要生成改变后的结构,还需要定量评估残基或碱基替换如何扰动生物分子的理化景观。在BioMutation结构分析器模块中,系统性地预测了一组定义的理化特征,包括序列、长度、分子量、等电点(pI)、芳香性、不稳定指数、平均柔性、亲水性(GRAVY)、二级结构比例、消光系数和近似熔点(Tm),以量化基于替换的突变的结构后果,并比较野生型和突变型生物分子。这个基于Google Colab的模块用于比较通过BioMutation引入突变的结构与其原始结构,也可作为独立模块用于从多个输入的PDB文件中提取特征。该模块支持从输入结构中存在的蛋白质和核酸中提取特征。特征提取通过一个Google Colab笔记本实现,它整合了BioPython、pandas、py3Dmol和ipywidgets等库。等电点(pI)捕获了由替换酸性、碱性或中性残基引入的净电荷变化。芳香性量化了芳香族残基含量的变化。不稳定指数提供了替换对蛋白质稳定性影响的经验估计。柔性指标反映了残基替换引起的局部和全局构象迁移率的变化。亲水性(GRAVY)衡量了由替换导致的整体疏水或亲水特性的变化。二级结构比例(α-螺旋、β-折叠、无规卷曲)能够评估替换是否使结构整体偏向更有序或无序的构象。消光系数估计了由芳香族残基组成或环境改变引起的紫外吸光度变化。近似熔点(Tm)作为相对热稳定性的指标。对于核酸,估算的熔点使用Wallace规则计算[Tm(°C) = 2 × (A + T) + 4 × (G + C)]。所有提取的特征都被组织到结构化的pandas DataFrame中,然后导出为CSV文件。同时,三维结构使用py3Dmol以卡通表示法和光谱着色进行可视化。图2展示了BioMutation结构分析器Google Colab的主页:
结果与讨论
案例1:为了评估与大肠杆菌复制DNA聚合酶复合物冷冻电镜结构结合的DNA链中的位点特异性突变,使用了BioMutation GUI。在链P的残基位置1、2和3引入突变,将每个残基替换为胞嘧啶(C)。BioMutation工具生成了在目标位点掺入胞嘧啶的突变结构,同时通过基于Dunbrack旋转异构体库的标准(如最小原子冲突、最高概率、最大氢键数或与密度图的最佳拟合)为给定位置选择最优旋转异构体,保留了原始结构的天然空间几何结构和原子连通性。所得模型以.mmCIF格式保存。原始复合物和突变复合物的比较结构表示如图3A所示。此突变工作流程展示了BioMutation在核酸工程中的应用价值。
案例2:为了研究序列依赖性对DNA结构和相互作用的影响,选择了DnaA domainIV与DnaAbox DNA复合物的晶体结构,靶向链B的残基ID 113、112、111以及互补链C的残基ID 201、202、203。使用BioMutation GUI,生成了所有可能的三碱基对组合,包括互补对。BioMutation成功生成了64个不同的PDB文件。产生的结构叠加与参考结构如图3B所示。
案例3:为了探索蛋白质链内的多位点特异性氨基酸替换,选择了与DNA结合的大肠杆菌DNA聚合酶的冷冻电镜结构。靶向蛋白质链A,其中残基1被替换为组氨酸(His),残基2被替换为异亮氨酸(Ile)。BioMutation工具用于生成Python脚本,随后在ChimeraX环境中执行以应用指定的突变。所得结构在保持侧链几何结构和原子连通性的同时反映了两个氨基酸替换。突变模型以PDB格式保存。原始结构和突变结构的比较可视化如图3C所示。
案例4:为了执行基于生化特性的类别化突变,再次选择了与DNA结合的大肠杆菌DNA聚合酶的冷冻电镜结构。靶向蛋白质的链A,将残基ID 2和3分别突变为芳香族类(苯丙氨酸、酪氨酸、色氨酸)的所有成员。此外,将残基ID 5突变为酸性氨基酸(天冬氨酸、谷氨酸)。BioMutation成功生成了所有期望的类别化突变排列,总共产生了8个独特的PDB结构。原始结构和突变结构的叠加如图3D所示。图3集中展示了这四个用例的BioMutation GUI生成的突变体结构及其参考结构:
这些测试案例共同证明了BioMutation工具在核酸和蛋白质结构中用户定义的单个或多个残基位置引入基于替换的计算机模拟突变的多样性和灵活性。突变后的生物分子结构可以整合到一系列下游计算流程中。然而,BioMutation产生的是初始的、未优化的计算机模拟结构,不执行突变后能量最小化、结构优化或稳定性评估。该工具仅支持替换突变,不允许插入或删除。
验证:为了验证BioMutation在不同生物分子系统中的准确性,进行了四个案例研究。从RCSB PDB中选择四个PDB结构,并为每个案例使用BLAST算法导出一个序列相似的结构。使用BioMutation GUI,将相似结构在不同残基位置进行突变,以匹配最初选择的PDB结构的序列。将结构进行叠加,并计算全原子均方根偏差(RMSD)值以显示现有结构残基和突变的PDB残基之间的相似性。在第一个验证案例(V1)中,将蛋白质-RNA复合物中12-mer siRNA第12位残基A的一个核苷酸突变为U,并与RCSB PDB中现有的相似结构进行叠加。结构叠加显示显著重叠,包括突变位点(全局RMSD: 0.18 ?,局部RMSD: 0.04 ?)。在第二个验证案例(V2)中,将蛋白质-肽复合物中的肽结构在两个位置(6和8)分别突变为ALA和TYR,以匹配已知的肽序列。比对显示突变残基与参考结构残基匹配良好(全局RMSD: 0.43 ?,局部RMSD: 0.33 ?)。在第三个验证案例(V3)中,突变整个RNA链以匹配参考结构。突变链及其残基与参考结构紧密对齐(全局RMSD: 0.74 ?,局部RMSD: 0.71 ?)。在第四个验证案例(V4)中,在两个DNA链的末端引入多个突变以与已知参考序列对齐。结构比较显示突变残基与参考残基重叠。图4展示了所有验证案例中实验衍生结构与BioMutation GUI生成的突变体结构的叠加:这些验证案例共同确立了BioMutation作为一种可靠工具,可用于在RNA、DNA和肽系统中应用所需的单点和多点突变。
结构分析器:BioMutation结构分析器模块为用户提供了一个平台,用于理解引入所需突变后整体结构中不同的物理化学变化。通过验证案例3来展示执行所需突变后特征的变化。将Pumilio-Nos-hunchback RNA复合物的RNA成分通过替换RNA结构的4个残基,突变为参考序列。使用结构分析器模块比较参考RNA结构和突变后的RNA结构,结果报告在表2中。对原始结构和其突变对应物的RNA片段的比较分析揭示了由基于替换的突变引起的明显理化变化,序列长度保持在12个核苷酸不变。GC含量从16.67%降至8.33%,表明鸟嘌呤或胞嘧啶残基被腺嘌呤或尿嘧啶取代,导致分子量从3868.3 Da降至3823.21 Da。这种组成变化伴随着估算的熔点从28°C降至26°C,这反映了由于AU碱基配对相对于GC相互作用较弱而导致的双链体稳定性降低。
结论
BioMutation是一个易于使用的GUI,旨在诱导蛋白质、肽、核酸及其复合物中的突变。它通过提供一个便携式、自动化、以用户为中心的图形用户界面,在广泛的生物分子(包括DNA、RNA、蛋白质及其复合物)中执行定向和组合突变,为用户友好的计算机模拟诱变提供了平台。它基于UCSF ChimeraX诱变引擎(用于核酸点突变的swapna和用于氨基酸点突变的swapaa)的迭代使用,通过一个交互式、自包含的基于HTML的平台简化了突变工作流程,无需额外安装或配置。该GUI使用户能够通过精心设计的Python脚本利用UCSF ChimeraX的突变能力生成位点特异性或类别化突变。它通过PDB ID或本地文件位置容纳结构输入,并支持以广泛使用的结构格式(PDB、MOL2、mmCIF)导出,允许直接应用于分子动力学模拟、计算机模拟适体优化技术、对接研究、机器学习流程和结构功能分析等最先进的计算技术。该工具还为用户提供了使用BioMutation的结构分析器模块比较和分析物理化学特征变化的机会。值得注意的是,BioMutation专注于结构突变生成和特征比较,不执行能量最小化或稳定性评分。BioMutation已通过多个实际案例研究得到验证,展示了其在建模多样化突变场景中的灵活性和效率。其直观的设计弥合了计算复杂性和生物实用性之间的差距,同时服务于新手用户和经验丰富的研究人员。通过实现高通量、可重复的诱变且只需最少的人工干预,BioMutation为结构生物学、蛋白质工程和合成生物学研究提供了一个强大的平台。作为一个开放获取资源,BioMutation以可移植格式分发,并附有全面的用户教程以促进广泛采用。该GUI有望加速假设驱动的实验,指导合理的生物分子设计,并增进对突变诱导的结构动力学的理解。