《Synthetic and Systems Biotechnology》:Engineering short-sequence elements for condensate-like assemblies by de novo design
编辑推荐:
生物分子凝聚体通过相分离(phase separation)形成,在细胞组织和基因调控中发挥关键作用。然而,天然凝聚体元件通常具有高分子量和序列冗余,限制了它们在原核系统中的应用。为解决这一问题,研究人员建立了一个整合生成式人工智能(generative ar
生物分子凝聚体通过相分离(phase separation)形成,在细胞组织和基因调控中发挥关键作用。然而,天然凝聚体元件通常具有高分子量和序列冗余,限制了它们在原核系统中的应用。为解决这一问题,研究人员建立了一个整合生成式人工智能(generative artificial intelligence)、计算预测和实验验证的集成框架。研究人员首先构建了一个来源于真核生物的相分离元件在大肠杆菌(Escherichia coli)中的基准数据集。该数据集用于构建PSVAE模型用于从头序列设计,以及LMPsPred分类器用于高通量筛选。最终,研究人员鉴定了13个低分子量(16-26 kDa)且最小冗余的短序列元件。实验验证证实这些元件在大肠杆菌中形成凝聚体,并且与天然元件相比具有增强的蛋白质招募能力。本研究强调了人工智能引导设计生成类凝聚体组装的潜力,并扩展了原核系统中候选相分离元件的库。
**研究背景、问题与动机**
生物分子凝聚体(biomolecular condensates)是通过相分离(phase separation)形成的无膜亚细胞结构,在细胞组织(cellular organization)和基因调控(gene regulation)中发挥关键作用。然而,天然凝聚体元件(如RGGRGG、MaSpI16、R32、A-IDPs等)通常具有高分子量(可达50 kDa以上)和高度序列冗余,在原核系统(如大肠杆菌Escherichia coli)中的应用面临瓶颈:克隆表达困难、对靶蛋白结构活性产生负面影响(如融合FUSN至VioE后酶活性显著降低)、降低细胞生物量(约20%),限制了工业规模应用。此外,现有基于算法的相分离序列设计多集中于体外可控条件,而复杂细胞内环境存在诸多不确定性。因此,迫切需要开发短序列、低分子量、低冗余的相分离元件,以满足多样化应用需求,并扩展原核系统中候选元件库。
**研究内容、结论与意义**
研究人员建立了一个整合生成式人工智能(generative artificial intelligence)、计算预测和实验验证的集成框架。首先构建了真核来源相分离元件在大肠杆菌中的基准数据集,用于训练PSVAE(Phase-Separation Variational Autoencoder)模型进行从头序列设计,以及LMPsPred分类器进行高通量筛选。最终鉴定了13个短序列元件(分子量16-26 kDa,最小冗余),实验验证表明这些元件在大肠杆菌中形成类凝聚体组装(condensate-like assemblies),且蛋白招募能力优于天然元件(最大提高约6.3倍)。该研究展示了AI引导设计生成类凝聚体组装的潜力,并扩展了原核系统中候选相分离元件的库,为合成生物学中可编程细胞内组装提供了基础。论文发表在《Synthetic and Systems Biotechnology》。
**关键技术与方法**(不超过250字)
研究人员主要运用了以下关键技术方法:
1. **PSVAE模型**:基于变分自编码器(Variational Autoencoder, VAE)框架,使用长短期记忆网络(LSTM)作为编码器和解码器,从相分离蛋白序列中学习潜在空间分布,生成具有新颖序列但保留关键理化性质的短序列元件。
2. **LMPsPred分类器**:基于预训练蛋白语言模型ESM1b提取序列的1280维特征向量,结合自动机器学习框架AutoGluon构建二分类器,用于高通量筛选候选序列。在独立测试集上表现优异(AUC-ROC 0.85–0.98,精度0.91–0.99),显著优于现有预测工具(Droppler、LLPhyScore、PSPredictor)。
3. **体内实验验证**:构建EGFP融合表达载体,在大肠杆菌中表达候选元件,利用荧光显微镜观察凝聚体形成,并通过尿素处理验证其可逆性和类液体性质;定量分析极区与胞质荧光强度比。样本队列来源:从LLPSDB、DrLLPS、PhaSePro、PhaSepDB等公共数据库收集582条非冗余相分离蛋白序列(正集),并从PDB(结构蛋白)和DisProt(非相分离内在无序蛋白)收集3307条序列(负集)。
**研究结果**(保留每个小标题,简要说明通过什么研究得出什么结论)
**2.1 天然凝聚体元件在大肠杆菌中的体内验证**
通过荧光显微镜观察14种天然真核相分离元件(如FMRP的LCD、eIF4GII的IDR等)与EGFP融合蛋白在大肠杆菌中的表达,发现大多数元件形成明亮的点状荧光信号,与EGFP单独表达的弥散分布形成对比;尿素处理后点状信号分散,表明具有类液体可逆性;定量分析显示分布系数(极区/胞质荧光强度比)为1–5,最高提高4.3倍,证明天然元件成功招募蛋白。但SYN2和Std1未能形成凝聚体,说明真核环境与原核环境存在差异,凸显了在E. coli中验证的必要性。由此构建了基准数据集,用于后续模型训练。
**2.2 天然生物分子凝聚体序列的理化性质分析**
比较相分离蛋白与非相分离蛋白(包括DisProt内在无序蛋白和PDB结构蛋白)的10种生物物理描述符:相分离蛋白具有更高的内在无序区(IDR)含量(通过IUPred3评估)、富含甘氨酸(G)、丝氨酸(S)、丙氨酸(A)、脯氨酸(P)、亮氨酸(L)、精氨酸(R);分子量更大、长度更长;等电点(pI)显著更高(p<0.001),但pH 7时净电荷无显著差异(p=0.34),表明相分离依赖局部电荷斑块而非全局净电荷;稳定性更低、亲水性更低,与凝聚体的瞬态和亚稳态性质一致。
**2.3 通过VAE从头设计类凝聚体组装序列**
开发PSVAE框架,基于LSTM编码器和解码器,通过最大化证据下界(ELBO)优化,从基准数据集学习连续潜在空间。采样生成的新序列通过BLAST比对UniProt数据库,平均最佳同源性约34%,多数序列高度新颖(同源性<30%)或中等新颖(30–50%)。生成序列在序列长度、分子量、酸性残基比例、亲水性(GRAVY指数)和稳定性指数等关键理化性质上与天然相分离蛋白分布相似,且与天然序列相比具有低分子量(平均约606个氨基酸的天然数据集相比),表明模型学到了相分离的底层物理化学原理,而非简单记忆序列模体。
**2.4 类凝聚体组装筛选平台的开发**
构建LMPsPred分类器,利用ESM1b提取1280维特征,结合AutoGluon自动机器学习框架。在测试集I(自然序列,106正/120负)上AUC-ROC为0.85,精度0.91;在更具挑战性的测试集II(人工设计相分离蛋白,124正/150负)上AUC-ROC为0.98,精度0.99,显著优于Droppler、LLPhyScore、PSPredictor等现有预测器。对PSVAE生成的1000条序列进行高通量筛选,优先选出13条候选短序列(平均成对同源性仅10.91%,但共享中等亲水性、近中性净电荷、高比例无序促进残基),进行体内验证。
**2.5 新型类凝聚体组装元件在大肠杆菌中的体内验证**
将13条PSVAE设计的新型元件与EGFP融合表达于大肠杆菌,荧光显微镜显示所有元件均形成明亮点状荧光信号,类似天然元件,与EGFP单独表达的弥散分布形成鲜明对比。尿素处理下V1和V2形成的点状信号分散,支持可逆类液体性质。定量分析显示分布系数显著高于阴性对照,最大提高约6.3倍,优于天然元件(最大4.3倍)。此外,近半数选择序列对细胞生长无负面影响,部分甚至促进生长(Supplementary Fig. 6)。因此,PSVAE模型可生成具有类凝聚体组装功能的新型蛋白序列。
**总结讨论与研究结论**
研究讨论部分指出:本工作从“序列优化”跨越到“从头创造”,PSVAE模型学习天然元件理化特征,生成高度新颖且功能性的短肽,挑战了“相分离能力严格依赖长序列重复”的假设,揭示了短序列中关键理化特征的精妙排列即可驱动有效细胞凝聚。AI设计元件(13条短肽)具有低分子量、低重复性,规避了天然大分子元件的细胞毒性和代谢负担。尽管这些人工凝聚体可能不表现典型液-液相分离特征,但可能形成亚稳态或凝胶状结构,在药物释放、生物粘合剂等场景中具有特殊应用潜力。但FRAP、临界饱和浓度、体外重构及聚集标记共定位等分析尚未进行,其材料属性需进一步研究。未来需探索AI设计序列倾向于形成非典型液凝聚体的原因,以及细胞环境与设计序列之间的相互作用。
**研究结论翻译**:本研究强调了人工智能引导设计生成类凝聚体组装的潜力,并扩展了原核系统中候选相分离元件的库,为未来可编程细胞内组装的研究提供了基础。