综述:人工智能驱动的生物铸造厂用于蛋白质工程和代谢工程

《Current Opinion in Biotechnology》:Artificial intelligence–powered biofoundries for protein engineering and metabolic engineering

【字体: 时间:2025年11月07日 来源:Current Opinion in Biotechnology 7.8

编辑推荐:

  合成生物学正通过人工智能(AI)与自动化生物铸造厂的集成而迅速发展。这一融合加速了设计-构建-测试-学习(DBTL)循环,将蛋白质工程和代谢工程从劳动密集型的手动实验转变为自主实验。本综述总结了工作流开发、AI模型及其与生物铸造厂集成用于自动化或自主蛋白质工程

  
合成生物学正通过人工智能(AI)与自动化生物铸造厂的集成而迅速发展。这一融合加速了设计-构建-测试-学习(DBTL)循环,将蛋白质工程和代谢工程从劳动密集型的手动实验转变为自主实验。本综述总结了工作流开发、AI模型及其与生物铸造厂集成用于自动化或自主蛋白质工程和代谢工程的最新进展。特别地,研究人员强调了AI驱动的生物铸造厂在加速合成生物学科学发现和创新方面的潜力。
**Introduction**
生物研究的节奏和通量长期受限于手动实验的时间与劳动强度,以及高质量假设生成的认知需求。在合成生物学中,这些约束体现在设计-构建-测试-学习(DBTL)框架中,该框架用于系统地工程化生物系统。DBTL循环是一个迭代过程,其中设计被实现、实验测试并根据结果进行优化。每个阶段都为技术加速提供了机会,从而提升效率、准确性和整体通量。前沿人工智能/机器学习(AI/ML)工具正越来越多地应用于学习与设计阶段,提高了假设生成的严谨性和效率。虽然概念简单,但将AI/ML工具应用于DBTL循环是一个复杂且多方面的挑战,解决方案通常针对具体问题背景。AI/ML方法已被开发用于工程化多种功能蛋白,以及优化代谢途径、培养基组成和次生代谢物发现,每种都需要独特的、目标导向的策略。同时,生物铸造厂作为机器人实验平台,通过减少手动劳动需求,同时提高精度、可重复性和通量,正在转变构建与测试阶段。现代生物铸造厂将液体处理机器人、多种外围设备和高通量分析仪器集成到由调度软件管理的连接管道中。先进的液体处理器可将数周的手动工作压缩至数天。例如,Beckman Coulter Echo声波液体处理器可分配低至2.5 nL的液体,在数周内筛选数百万种化合物。高通量质谱平台如Sciex Echo-MS可在八分钟内分析384孔板,提供前所未有的分析速度。调度软件和工作流编排器实现了无需人工干预的自动化,使实验能够在长时间内以最小监督运行。利用这些工具,已实现了多种自动化工作流,用于工程化大肠杆菌(*Escherichia coli*)和谷氨酸棒杆菌(*Corynebacterium glutamicum*)、高通量酶发现与工程化、在酿酒酵母(*Saccharomyces cerevisiae*)中表达多基因文库、生物合成基因簇的高通量基因组挖掘以及更多合成生物学目的。将AI/ML与生物铸造厂自动化相结合,可实现自主实验和自驱动实验室,其中算法的学习与设计阶段与机器人的构建与测试协同作用。单独来看,生物铸造厂和AI加速了科学过程的不同阶段。它们共同正在改变科学家在实验室中的角色。未来几年,对分子生物学的深刻理解加上扎实的实验室技能可能不再足以让科学家保持在合成生物学的前沿;相反,最具影响力和生产力的研究人员将是那些精通生物学、机器人学和AI/ML的人。在本综述中,研究人员审视了将AI/ML和生物铸造厂自动化应用于合成生物学的最新进展,重点关注蛋白质工程和代谢工程。研究人员还涵盖了这两个领域新兴的AI/ML工具,并讨论了这些技术如何融合到下一代自驱动实验室中。

**AI-powered biofoundries for protein engineering**
AI/ML工具与机器人学的融合正在改变蛋白质工程。AI/ML工具可以探索广阔的蛋白质适应度景观,而机器人学则通过自动化的高通量实验实现卓越的效率和可重复性。简单的机器人平台可以处理复杂的蛋白质工程任务,如一项最近研究所示,使用低成本液体处理机器人自动执行96孔板中聚对苯二甲酸乙二醇酯(PET)降解酶的表达、纯化和筛选。下一波进展有望实现需要最少人工干预的自主蛋白质工程平台。SAMPLE平台通过高斯过程驱动的自主代理显著提高了糖苷水解酶的热稳定性,该代理在20次迭代中设计和执行实验,同时探索了不到2%的序列空间。该平台将基于云的实验室自动化与高斯决策相结合,展示了自主DBTL循环。类似地,BO-EVO系统将贝叶斯优化与机器人实验相结合,工程化RhlA酶,将其对一种鼠李糖脂同系物生物合成的特异性提高了4.8倍,同时仅检查了1%的可能变体。蛋白质语言模型(pLMs)的最新进展使得能够比贝叶斯设计方法更广泛、更细致地探索蛋白质适应度景观。许多近期研究报道了通过将pLMs与生物铸造厂的机器人实验基础设施集成,实现了先进的自主蛋白质工程能力。例如,Singh等人和Zhang等人展示了如何将先进的生物铸造厂机器人与最先进的pLMs集成,加速蛋白质工程活动。PLMeAE平台利用自动化生物铸造厂执行DBTL循环,结合pLM ESM-2和监督学习模型进行变体预测,在10天内完成tRNA合成酶的四个循环,实现了约2.4倍的活性提升。与依赖细胞培养测量绿色荧光蛋白(GFP)报告基因的PLMeAE不同,Singh等人优化并自动化了传统的细胞表达与基于细胞裂解液的酶测定相结合的方法,拓宽了自主蛋白质工程平台的适用性。该工作将ESM-2、EVmutation和监督机器学习模型与在伊利诺伊生物铸造厂先进生物制造平台(iBioFAB)上实现的模块化、自动化蛋白质工程工作流集成。基于聚合酶链反应(PCR)的诱变、转化和蛋白质表达的自动化流程得到了优化,使每个筛选循环能够在一周内完成。作为案例研究,该自主工作流在四次迭代中将中性pH下植酸酶的活性提高了约26倍,并将卤代甲基转移酶的乙基转移酶活性提高了约16倍。对于两种蛋白,仅筛选了不到500个变体,同时探索了每种酶约75个位置的变体,代表了巨大的理论设计空间(2075)。虽然量化实验室自动化相对于手动实验的优势并不直接,但一些先前的工作已提供了这方面的比较。由于研究人员很少报告蛋白质工程活动的时间和成本,因此很难基准化并量化自动化相对于手动工作流的作用。然而,少数研究提供了有用的比较。Romero及其同事估计,20轮自动化驱动的DBTL循环可以在不到两个月内完成,而类似的手动工作将需要近一年。Zhao及其同事在一周内完成了一个完整的蛋白质工程迭代,这比需要大量纳升到微升液体转移(跨越384孔板和96孔板)的手动工作流快大约两到三倍。最近,Lee及其同事报告,在构建步骤中,自动化相比手动操作减少了84%的时间需求。通过引入AI/ML工具,这些工作流消除了变体设计中人类判断的需要,而生物铸造厂则促进了自动化实验。Landwehr等人使用无细胞DNA组装和表达系统,绕过了传统基于细胞方法中耗时的步骤。他们的无细胞平台能够在一天内筛选数千个变体,而不是数周。该平台在迭代了1217个变体(共10,953个独特反应)后,对九种化合物实现了McbA(一种ATP依赖的酰胺键合成酶)活性的1.6至42倍提升。在一项类似研究中,Godin等人通过消除基于细胞的克隆并利用无细胞蛋白表达,实现了加速的高通量活动。尽管这些研究没有利用自动化实验,但将此类策略与机器人自动化相结合可能代表该领域的变革性转变。现代生物铸造厂与AI/ML最新进展的集成使其非常适合需要穿越广阔且复杂蛋白质适应度景观的蛋白质工程任务。正如上述案例研究所展示的,将AI/ML工具与高通量实验方法(无论是通过机器人平台还是无细胞系统)相结合,显著加速了迭代过程。当AI/ML工具的数据分析和假设生成能力与先进的生物铸造厂结合时,可以实现自主实验,其中DBTL迭代需要最少的人类判断和监督。

**AI-powered biofoundries for metabolic engineering**
与蛋白质工程类似,AI/ML工具越来越多地用于代谢工程,为复杂生物合成途径的设计和优化提供系统框架。相比之下,代谢工程需要协调细胞网络内的多基因途径,面临前体平衡、辅因子利用、副产物积累和宿主适应性等挑战。这些复杂性要求超越单目标优化的整合策略,强调了对自动化、AI驱动工作流的需求。AI驱动的生物铸造厂将资源集中在最具信息量的设计上以探索景观,并且通过完全集成所有组件,它们可以生成和分析大量高维数据,实现更高效的途径优化。HamediRad等人将iBioFAB与贝叶斯优化相结合,建立了BioAutomata作为合成生物学中首个概念验证的自主实验。应用于大肠杆菌番茄红素途径,BioAutomata筛选了三个途径基因不到1%的可能启动子/核糖体结合位点(RBS)组合,但识别出了全局最优。性能最佳的菌株产生的番茄红素比通过随机文库筛选获得的顶级突变体多1.77倍,模拟表明,这种贝叶斯优化所需的实验次数至少比基于回归的方法少八倍。与BioAutomata类似,Zhang等人也集成了高斯过程回归用于学习阶段,以及上置信界多臂赌博机用于设计阶段,以推荐RBS序列进行测试。实验室自动化处理了构建和测试阶段,提高了速度和可重复性。使用该工作流,他们在四个循环中评估了450个RBS变体,并识别出翻译起始速率等于或超过一个强基准序列(最多高出34%)的RBS。两个平台都展示了如何系统优化小的遗传元件(如启动子和RBS),可以有效地调节代谢通量并显著提高产品产量。Pandi等人开发了一个名为METIS(机器学习引导的系统改进实验试验)的多功能主动学习框架,能够处理分类和连续变量,从而实现对不同酶、辅因子和化学组分(如缓冲液)及其浓度的系统评估。METIS旨在优化遗传和代谢网络,提供了一个易于访问的Google Colab界面用于实验设计、主动学习循环和数据分析。METIS采用XGBoost(极端梯度提升),因其即使在数据量有限的情况下也能良好表现而被选中。METIS已应用于多种系统:一个无细胞基因电路、一个体外无细胞转录-翻译(TXTL)系统,以及包含27个变量的巴豆酰辅酶A/乙基丙二酰辅酶A/羟基丁酰辅酶A(CETCH)CO2固定途径。在基因电路中,METIS解决了资源竞争问题,使性能翻倍;它还将TXTL蛋白产量提高了10倍,并在仅1000次实验中将CETCH生产力提高了10倍。除了产量提升,METIS还识别了关键因素、相互作用和瓶颈,以进行针对性优化。最近,Deng等人开发了一种瓶颈化与去瓶颈化策略,将目标酶与干扰因素隔离,随后基于机器学习的启动子优化增强途径通量。该方法通过ProEnsemble实现,该工具微调单个途径基因的转录以实现平衡的通量分布。自动化实验室工作流执行了构建和测试阶段,提高了速度和可重复性。利用该策略,工程化了一个具有进化和平衡途径基因的大肠杆菌底盘,实现了3.65 g L-1的柚皮素。值得注意的是,该框架能够在短短六周内沿可预测的进化轨迹并行进化所有途径酶,这相比传统方法代表了显著的加速。Li等人开发了一个用于哺乳动物细胞的完全自动化高通量基因组编辑平台,该平台整合了染色质可及性启发的学习模型(CAELM)。该平台还采用XGBoost对胞嘧啶碱基编辑器的性能进行建模,准确预测了数千个基因组位点的原位碱基编辑结果。CAELM还输出特征重要性分数,揭示了DNA可及性对目标序列上下文预测的相对贡献约为1:6。通过将染色质状态感知建模与自动化编辑相结合,该系统实现了可重复的大规模哺乳动物基因组扰动。在细菌和哺乳动物系统中,AI/ML和机器人驱动的DBTL框架正在改变代谢工程和基因组工程。这些平台减少了实验负担,提高了精度,并揭示了原本隐藏的约束。在HamediRad等人进行的番茄红素优化研究中,贝叶斯优化与高通量筛选相结合,能够指导设计并平衡番茄红素途径的通量,从而产生更高产量的变体。相比之下,传统的代谢工程方法通常依赖于线性模型和基于约束的框架,如通量平衡分析和基于强制目标通量的通量扫描,来预测靶基因,然后需要劳动密集型的实验验证。相比之下,AI/ML策略从高通量实验反馈中迭代学习,从而能够发现传统方法常常忽略的非线性和上下文依赖关系。随着现代生物铸造厂的出现,大规模、数据驱动的复杂生物系统工程将变得更快、更高效,并越来越常规化。

**Emerging AI/ML tools for protein engineering and metabolic engineering**
如上所示,AI/ML工具已成为蛋白质工程和代谢工程中自动化和生物铸造厂流程的组成部分。通过将高通量实验平台与预测计算模型相结合,这些技术加速了DBTL循环,同时减少了手动干预的需求。现有AI/ML工具的范围持续扩大,新方法不断扩展生物铸造厂的能力。在蛋白质工程中,主要目标是提升“适应度”,包括催化效率、底物特异性、稳定性和其他功能特性。大规模深度突变扫描数据集为训练稳健的预测模型提供了基础,而深度学习框架如ECNet整合了进化背景以改进适应度预测。强化学习应用于EvoPlay,利用AlphaFold2衍生的结构代理指导蛋白质设计。新方法如EvoAI采用深度学习和大型语言模型从锚点压缩和重构蛋白质序列空间,而EVOLVEpro将蛋白质语言模型(pLMs)与基于回归的少样本主动学习相结合,以最小实验数据加速优化。主动学习辅助的定向进化(ALDE)进一步利用不确定性量化,在迭代工作流中高效探索蛋白质搜索空间。AiCE(人工智能引导的蛋白质工程约束)使用通用蛋白质逆折叠模型,整合结构和进化约束,识别高适应度的单突变和多突变。当集成到自动化生物铸造厂框架中时,这些AI/ML工具可以在闭环实验循环中运行,实现快速的DBTL迭代,并解锁更高效、可扩展和数据驱动的蛋白质工程。在代谢工程中,一系列先进的机器学习模型和算法已被用于优化复杂的细胞途径以实现高效化合物生产。BioAutomata利用贝叶斯优化系统优化番茄红素生物合成途径的启动子组合。自动化推荐工具(ART)将机器学习与实验设计相结合,建议新的遗传变体和过程条件,从而系统减少实验迭代并实现代谢途径设计的针对性改进。METIS作为一个多功能主动学习工作流,利用XGBoost等算法基于上置信界高效优化遗传和代谢网络。相比之下,van Lent等人开发了一种基于梯度赌博机算法的机器学习辅助推荐策略,进一步强调了探索与利用之间的平衡。BioAutoMATED作为一个端到端的自动化机器学习工具,旨在用于生物序列的解释和从头设计,对各种代谢工程应用非常有益。然而,与通常受益于大量突变数据集和明确定义的功能测定的蛋白质工程不同,代谢工程面临独特的挑战:途径复杂性、多基因相互作用以及稀疏的结构化数据集。因此,研究人员正尝试利用ChatGPT从文献中提取数据、利用基因组规模代谢模型生成通量特征,以及利用机器学习进行预测。另一种策略是使用机械模型,如动力学和基因组规模模型,来模拟关联数据集。模拟DBTL循环被用于代谢工程中机器学习方法的一致性比较,提供了评估新算法的标准化方式。

**Future perspectives**
一个关键的未来方向涉及基础模型和生物大语言模型的发展,这些模型旨在跨多个生物尺度操作并整合信息。在DNA水平,像Evo和AlphaGenome这样的模型有望推进从分子到基因组规模的序列建模和设计,并改进调控变异效应预测;而在蛋白质水平,ESM-3、AlphaFold3和RoseTTAFold-All Atom可以模拟进化、预测生物分子相互作用,并实现通用生物分子建模和设计。该概念扩展到途径甚至单细胞水平,如STATE模型,旨在创建一个虚拟细胞,能够预测基因扰动的影响。这些模型可以作为未来自驱动实验室的“大脑”,能够设计复杂的生物系统,彻底改变药物发现、先进材料和可持续生物制造。研究人员还预计会出现基于云的生物铸造厂和多AI代理支持的生物铸造厂操作。这一趋势表明,未来对先进合成生物学能力的获取将不再局限于大型、资本密集型的集中设施。一方面,云基础设施可以提供可扩展的计算能力、数据存储和AI模型访问,使先进工具的获取民主化。协作努力,如涉及美国国家科学基金会全球生物铸造厂应用中心(GCBA)和全球生物铸造厂联盟的工作,正在朝着共同标准和共享操作协议努力,以实现跨生物铸造厂的协调。GCBA是一个国际性努力,包括来自美国、芬兰、日本、韩国和英国五个国家政府资助机构的七个生物铸造厂。这一合作解决了合成生物学中的一个关键挑战:缺乏标准化的数据、工作流、本体和监管框架,这目前阻碍了生物铸造厂在全球生物制造中的广泛采用。这些协调的倡议旨在建立稳健的标准、指标和最佳实践,以实现生物铸造厂之间的互操作性和可重复性。通过开发这些技术和监管框架,该倡议旨在为全球整合的生物经济奠定基础。同样,英韩生物铸造厂倡议体现了国际合作在技术转让和最佳实践协调方面的典范,而敏捷生物铸造厂(包括七个美国能源部国家实验室)则展示了通过共享数字基础设施和协调的菌株工程管道实现分布式创新的潜力。这些努力共同为全球连接的生物铸造厂网络建立了技术、组织和文化基础。这不仅仅是一个技术细节,而是生物铸造厂成熟和广泛采用的基本前提。另一方面,整个工作流可以由多个AI代理驱动。Swanson等人展示了由多个AI代理扮演不同专家角色协作设计新型SARS-CoV-2纳米抗体的虚拟实验室。未来新兴的大语言模型和代理AI的发展可以实现自然语言和远程编程自主生物铸造厂,使生物铸造厂对更广泛的科学界可及。这种先进AI与机器人学的融合代表了未来的实验室,其中人类干预在所有研究阶段变得真正最小化。

**Conclusions**
合成生物学正在经历一场重大变革,从缓慢的、手动实验和纯粹由人类生成的假设,转向一种新的统一研究范式,该范式结合了高通量机器人实验与强大的AI驱动的假设制定、数据生成与分析、以及实验建议与执行。虽然新的通用AI模型正以前所未有的速度发布和完善,但生物铸造厂将变得不可或缺,用于快速生成大量可靠、可复制的数据,以训练针对特定挑战的模型。这些技术共同将重新定义生物研究的方式,从手动试错方法转向自主、数据驱动的发现,并加速蛋白质设计、代谢优化及其他领域的突破。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号