scYeast:一种基于生物知识引导的酿酒酵母(Saccharomyces cerevisiae)单细胞转录组学基础模型

《Synthetic and Systems Biotechnology》:scYeast: a biological-knowledge-guided foundation model on yeast single-cell transcriptomics

【字体: 时间:2026年07月21日 来源:Synthetic and Systems Biotechnology 4.8

编辑推荐:

  尽管大规模预训练模型对于基础细胞建模至关重要,但大多数模型聚焦于人类或小鼠系统,对酿酒酵母(Saccharomyces cerevisiae)等模式生物的关注较少,且未能有效利用现有的生物学先验知识。在此,研究人员提出scYeast,这是首个针对酿酒酵母单细胞

  
尽管大规模预训练模型对于基础细胞建模至关重要,但大多数模型聚焦于人类或小鼠系统,对酿酒酵母(Saccharomyces cerevisiae)等模式生物的关注较少,且未能有效利用现有的生物学先验知识。在此,研究人员提出scYeast,这是首个针对酿酒酵母单细胞转录组学的、有效嵌入生物先验的基础细胞模型。scYeast采用一种新颖的非对称并行架构,将转录调控信息注入Transformer的注意力机制,在训练期间利用生物学知识。scYeast在大规模酿酒酵母单细胞转录组学数据上进行预训练,展现出强大的泛化能力和生物学可解释性。其在零样本任务(如推断调控关系)中表现出能力。微调后,scYeast在多种任务中表现良好,包括细胞状态分类、生长倍增时间预测和基因扰动响应预测。此外,利用迁移学习,scYeast可适用于其他组学数据集(如蛋白质组学),从而拓宽其用途。总体而言,scYeast是酿酒酵母单细胞生物学研究的一个有前景的工具,并为整合基础模型与生物先验提供了一个新框架,加速了酿酒酵母合成与系统生物学领域的发现,并为其他生物提供了一个可复制的框架。
论文发表在《Synthetic and Systems Biotechnology》。
研究背景方面,目前基于Transformer架构的基础模型虽在自然语言处理和生命科学领域取得显著进展,能够提取大规模复杂数据的抽象表征以模拟细胞代谢活动,且单细胞测序技术的普及积累了海量单细胞转录组学数据,催生了如scBERT、scFoundation、Geneformer等模型。然而,现有方法在生物学先验知识的深度整合上存在不足,多数仅将先验知识作为多模态输入进行拼接,未能深层融入模型计算机制,导致模型可解释性与知识利用效率有限。同时,现有基础模型主要面向人类或小鼠系统,而酿酒酵母(Saccharomyces cerevisiae)作为系统生物学、代谢工程及合成生物学的重要模式生物,积累了丰富的先验知识与组学数据,却缺乏专用的基础模型。因此,开发专为酿酒酵母设计的基础模型具有重要科学价值。
研究人员开展了scYeast的构建与研究,这是一种基于先验知识与大规模单细胞及批量转录组数据集深度融合的酿酒酵母基础模型。scYeast引入非对称并行Transformer架构,将转录调控先验知识(以邻接矩阵形式)深度整合至注意力计算机制,在约21万个无标签单细胞转录组谱上进行自监督预训练。研究表明,scYeast具备强泛化与生物学可解释性,在零样本推断调控关系及微调后的细胞状态分类、生长倍增时间预测、基因扰动响应预测等任务中表现优异,并能通过迁移学习拓展至蛋白质组学数据预测。该研究为酵母单细胞生物学提供了新工具,也为基础模型与生物知识深度整合提供了框架。
主要关键技术方法包括:构建源自YEASTRACT数据库的转录调控先验知识邻接矩阵(约17万条调控关系);利用泛转录组数据计算基因Spearman相关系数(阈值0.5)推断共表达关系并生成基因名称嵌入(Word2Vec,200维);采用表达Token嵌入策略(连续嵌入,两层MLP与LeakyReLU激活)处理单细胞转录组数据(约21万个细胞,源自GSE125162与GSE242556);设计非对称并行编码器(动态标准QKV注意力分支与静态先验知识注意力分支),通过可学习门控融合单元整合输出,采用掩码重建自监督预训练(Huber损失,15%随机掩码);下游任务应用包括固定参数生成嵌入用于调控关系推断(余弦相似度阈值0.9)、微调用于表型预测(生长倍增时间回归、应激状态分类)、适配GEARS框架预测基因扰动响应(结合GO图网络)、迁移学习至蛋白质组学数据(零填充与坐标对齐,Extra Trees回归预测生长速率、核糖体占用率、蛋白质半衰期)(样本队列来源涵盖GSE210032衰老数据、GSE201386应激数据、IDEA时序扰动数据及4699个单基因敲除株蛋白质组数据)。
研究结果如下:
2.1. Framework of scYeast。研究人员设计了基于Transformer的非对称并行架构,动态编码器捕获数据驱动的基因表达依赖,静态编码器注入转录因子-靶基因邻接矩阵先验,通过门控融合输出,经MLP重构输入实现自监督预训练,双输入为表达嵌入与基因名称嵌入(含共表达关系)。
2.2. scYeast can analyze condition-specific transcriptional regulatory relationships。研究人员利用不同年龄阶段(年轻、早老、晚老)单细胞转录组数据,通过细胞内基因嵌入余弦相似度(>0.9)及跨细胞一致性筛选,发现高龄阶段高相关基因对数减少(年轻160725对,晚老99608对),年龄特异性基因数随衰老递减(年轻292个,早老39个,晚老38个),平均余弦相似度下降(0.68至0.44),GO富集显示年轻阶段特异基因富集于“外部封装结构”;ASP3案例显示其调控网络随衰老简化,转录因子调节减少。
2.3. scYeast enables the prediction of various yeast phenotypes and identification of the related key genes。研究人员通过固定预训练参数接MLP预测生长倍增时间与应激状态,含先验知识的模型优于无先验及传统机器学习(如随机森林、SVM);生长预测中SUL1、SNQ2、BNA7、RPL32梯度显著,与生长适应性相关;四类应激(等渗、低渗、葡萄糖饥饿、氨基酸饥饿)分类中,含先验模型ROC更优,关键基因集GO富集于核糖体相关过程(P=1.17×10-28)与氨基酸代谢过程(P=1.17×10-16)。
2.4. scYeast can predict temporal responses to gene perturbations。研究人员适配GEARS框架,结合scYeast与GO图网络预测单转录因子(TF)扰动下基因时序响应,十个目标基因测试集R2介于0.70至0.97;以AQY2为例,严格剔除GLN3、FZF1、STE12三种扰动训练后,测试集R2达0.7295,预测轨迹与实验一致(GLN3、STE12呈逆S形,FZF1无显著响应),符合YEASTRACT先验(GLN3、STE12调控AQY2,FZF1无直接关系)。
2.5. scYeast can be transferred to proteomics data for growth prediction。研究人员通过零填充与坐标对齐将蛋白质组学数据(4699个敲除株,1850个蛋白)输入scYeast迁移学习,加载转录组预训练参数比随机初始化重建误差更低;池化蛋白嵌入接Extra Trees回归预测生长速率、核糖体占用率、蛋白质半衰期均获高R2,特征重要性基因GO富集分别关联假菌丝生长(P=0.006)、TORC1信号正调控(P=0.005)、蛋白质单泛素化(P=0.016)等已知生物学过程。
讨论部分总结:研究人员指出scYeast是首个深度整合调控先验知识的酵母单细胞基础模型,通过非对称并行架构生成融合先验与数据特征的基因嵌入,在调控关系推断、表型预测、扰动响应及蛋白质组迁移学习中验证有效。当前模型采用静态关系矩阵,未来可纳入动态多组学先验;架构可扩展至更大参数规模及其他真菌(如S. pombe、C. albicans),需物种特异性调控先验与直向同源基因词汇;除所示场景外还可适配更多计算任务。scYeast为解析酵母转录调控提供工具,也为整合多样生物数据集建立框架,助力酵母细胞代谢机制理解。
研究结论部分翻译:在本研究中,研究人员介绍了scYeast——首个深度整合先验调控知识的酿酒酵母基础单细胞模型。scYeast利用非对称并行架构将先验转录调控信息深层嵌入Transformer注意力机制,为每个样本生成明确结合先验知识与数据驱动特征的基因嵌入。基于这些基因嵌入,可推断条件特异性转录调控关系并提取生物学见解。消融研究表明,整合调控先验的预训练模型能有效从大规模无标签单细胞转录组数据中学习特征信息,进而提升细胞表型(如倍增时间与状态分类)预测精度,同时分析与识别影响这些表型的关键基因集。scYeast作为基础模型的潜力在基因扰动响应预测中得到验证,能准确模拟不同扰动下基因的动态变化。最后,通过将scYeast迁移学习应用于蛋白质组学数据,进一步确认了预训练模型的有效性,成功应用于基于蛋白质组学的生长预测与关键基因发现。当前实现中,scYeast利用静态关系矩阵作为机制约束,为调控潜力提供稳定拓扑骨架;虽酵母转录调控具内在动态性,但通过可学习门控整合静态骨架,模型能成功推断条件特异性调控重塑(如衰老案例所示)。未来可通过纳入动态多组学先验使先验分支随输入转录组数据调整,提升复杂调控景观模拟分辨率;虽scYeast高精度捕获核心酵母生物学特征,其架构具固有可扩展性,随酵母单细胞数据积累可支持更大参数规模以细化复杂或罕见细胞状态分辨率;虽重点展示典型应用场景,作为预训练基础模型,scYeast可适配诸多其他计算任务供酵母学界探索。本研究聚焦S. cerevisiae中scYeast构建与评估,尚未系统评估跨物种直接迁移及与其他生物基础模型的广泛基准测试;扩展至其他真菌(如S. pombe、C. albicans)及建立更广泛跨模型基准测试是未来重要方向,需直向同源基因词汇、物种特异性调控先验与目标物种数据集。总之,scYeast作为首个深度整合生物先验知识的酵母大规模预训练模型,在转录组与蛋白质组任务中展现良好泛化性与实用价值;该基础模型不仅为解析酵母转录调控提供有效工具,也建立了无缝整合多样生物数据集的框架,有助于深入理解酵母细胞代谢机制。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号