《Cell》:Predicting cellular responses to perturbation across diverse contexts with State
编辑推荐:
摘要:尽管机器学习模型在预测扰动转录组效应方面具有潜力,但目前它们难以在不同细胞情境间泛化。在此,研究人员介绍了State,一种在实验中及实验间均能考虑细胞异质性并预测扰动效应的机器学习模型。State使用单细胞基因表达数据进行训练,以预测细胞集合上的扰动效应
摘要:尽管机器学习模型在预测扰动转录组效应方面具有潜力,但目前它们难以在不同细胞情境间泛化。在此,研究人员介绍了State,一种在实验中及实验间均能考虑细胞异质性并预测扰动效应的机器学习模型。State使用单细胞基因表达数据进行训练,以预测细胞集合上的扰动效应。State将大数据集上的效应区分能力提升了超过30%,并在遗传、信号传导和化学扰动中识别差异表达基因方面,与基线方法相比取得了显著更高的准确性。其细胞嵌入基于1.67亿细胞的观测数据训练而成,能够在训练期间未观察到任何扰动的细胞情境中识别强扰动效应。研究人员还进一步介绍了Cell-Eval,一个可用于评估未来模型的综合性评估框架。总体而言,State的性能和灵活性为规模化开发细胞状态AI模型奠定了基础。
论文解读:State模型——多情境细胞扰动响应预测的规模化框架
一、研究背景与问题
准确预测细胞扰动效应对于靶向治疗、靶点鉴定和药物开发具有重要意义。遗传扰动(如CRISPR)和化学扰动(如小分子化合物)能够在基因、通路与细胞功能之间建立因果关系。尽管现有的功能基因组学方法已能够在特定细胞情境中进行大规模扰动筛选,但将这些实验扩展到多种情境仍然成本高昂。计算预测方法虽发展迅速,但其泛化能力并未随数据规模同步提升。当前深度学习方法在跨细胞情境泛化扰动效应时,往往不能稳定超越线性模型。研究人员认为,主要原因在于两类噪声干扰了真实扰动信号的识别:一是研究群体内部无法由实验协变量解释的生物学异质性;二是不同扰动数据集之间的技术或实验变异性。此外,单细胞RNA测序会破坏细胞,使得扰动前的状态无法直接观测,这进一步增加了区分生物学异质性与真实扰动效应的难度。已有方法或假设群体内异质性可忽略,或依赖生成模型和最优传输(Optimal Transport, OT)框架,但往往受限于强假设和较差的可扩展性。单细胞基础模型虽能跨数据集学习细胞表征,但通常针对细胞类型等宽泛类别进行优化,难以区分遗传扰动引起的细微变化。针对上述挑战,研究人员开发了State模型。
二、研究方法概述
State是一种多尺度机器学习架构,包含两个互补模块:状态转移模型(State Transition model, ST)和状态嵌入模型(State Embedding model, SE)。ST采用基于Transformer的神经网络,对协变量匹配的细胞集合执行双向自注意力操作,以灵活建模已知协变量之外的细胞异质性。SE是一个稠密双向Transformer编码器,通过预测基因表达进行自监督预训练,从大规模观测数据中学习信息丰富的细胞嵌入。State在训练中整合了来自Tahoe-100M、Parse-PBMC、Replogle-Nadig等数据集的超过1亿个扰动细胞数据,以及来自Arc scBaseCount、CZ CELLxGENE和Tahoe-100M的1.67亿人类细胞观测数据。为全面评估扰动预测模型,研究人员构建了Cell-Eval评估框架,涵盖基因表达计数、差异表达(differential expression, DE)统计和扰动效应大小三类可解释指标。
三、主要研究结果
(一)构建ST用于预测细胞集合上的扰动效应
ST的核心动机是对已知协变量(如细胞类型、扰动标签)之外的细胞异质性进行建模。训练时,细胞按已知协变量分层,构成固定大小的细胞集合,与等大小且协变量匹配的未扰动对照集合配对。ST采用最大均值差异(Maximum Mean Discrepancy, MMD)损失训练,最小化预测与观测扰动转录组之间的分布差异。实验结果表明,增大细胞集合大小(在一定阈值内)可显著降低验证损失;去除自注意力机制则导致性能大幅下降,表明建模集合内细胞间交互对扰动响应预测至关重要。
(二)State在跨细胞情境预测扰动效应方面优于基线方法
研究人员在3个大型数据集上评估了State的性能:Tahoe-100M化学扰动数据集、Parse-PBMC细胞因子信号扰动数据集和Replogle-Nadig遗传扰动数据集。在低代表性情境泛化任务中(测试情境中30%扰动用于训练),State在扰动区分评分方面较基线方法绝对提升66%(Tahoe-100M)、29%(Parse-PBMC)和10%(Replogle-Nadig);在表达变化的Pearson相关方面分别提升91%、48%和10%。在差异表达基因(differentially expressed genes, DEGs)预测的精确率-召回率曲线下面积上,State在所有数据集中持续优于基线方法。在预测扰动效应大小排序方面,State在Tahoe-100M上达到0.9的Spearman相关,较基线方法相对提升118%。值得注意的是,State在数据规模更大、情境更多样化的数据集上的增益最为显著,而在中等规模的Replogle-Nadig遗传筛选上,增益相对温和,这反映了预测微弱遗传扰动效应的固有难度。
(三)State嵌入增强跨情境零样本扰动预测
SE通过在大规模观测和干预性单细胞数据上训练,学习对技术变异具有鲁棒性且针对扰动效应检测优化的细胞表征。在完全未见情境的零样本任务中(训练期间无该情境的任何扰动数据),使用ST+SE相比直接使用高变基因(ST+HVG)在大多数指标上取得显著改进。研究人员进一步测试了State在未见情境中模拟药物作用机制的能力:在A549细胞中模拟1137种药物处理效应后,对trametinib(MEK通路抑制剂)的模拟结果中,该通路核心成员PTPN11、RAF1和SHOC2被识别为最相似的遗传扰动,与实验测量数据高度一致。此外,在跨数据集迁移学习任务中,使用Tahoe-100M预训练的ST+SE模型在5个查询数据集的34个细胞情境上,对扰动效应大小的排序能力持续优于基线和直接基于基因表达训练的ST+HVG模型。
(四)State能够检测细胞类型特异的扰动响应
以Tahoe-100M中5个完全留出的细胞系为对象,研究人员评估了State识别细胞类型特异性DEG的能力。以trametinib(0.5 μM)为例,该药物在C32细胞中的预测DEG显著性和log2差异倍数均与真实值高度一致,而均值基线与真实值几乎无相关。State在预测扰动相似性图谱方面取得超过0.7的调整兰德指数(Adjusted Rand Index, ARI),而扰动均值基线低于0.1。研究人员还基于State预测的基因表达谱训练回归模型预测细胞存活率,预测值与实验测量的存活率平均Pearson相关系数达0.52,而情境均值和扰动均值基线分别为0.2和0.31。
(五)State支持情境特异的计算机模拟实验
研究人员首先验证了State能捕捉生物学上有意义的调控模式。在RPE1细胞中鉴定出细胞系特异基因程序后,State对每个扰动影响这些程序的方式与实验观测高度一致,显著优于均值基线。在逆向扰动设计任务中,State在3个数据集上均优于基线方法,表明情境依赖的预测能更准确地识别诱导期望转录状态的最优扰动。State还能模拟新的情境——将药物扰动细胞状态作为输入,通过连续前向传递预测组合药物扰动效应,其预测的药物组合非加性效应与DrugComb数据库的协同性指标显著相关。最后,研究人员将遗传扰动嵌入近似为药物扰动嵌入的线性组合,实现了无需重新训练的零样本模拟。该模拟在50个细胞系上的结果表明,功能相关基因(如蛋白酶体亚基PSMB2、PSMA2、PSMC1)展现出相似的扰动模式,且所有KRAS-G12C突变细胞系在热图中聚集在一起,显示出独特的扰动响应特征。模拟遗传扰动的存活率预测与DepMap的CRISPR必需性数据在3个细胞系中均呈现显著相关。
四、讨论与结论
本研究的核心贡献在于提出了一个可扩展的细胞状态和行为建模方法。ST在保持单细胞分辨率预测的同时学习跨细胞群体的扰动效应,并通过排列不变的Transformer架构直接建模细胞分布间的扰动效应,避免了基于OT方法中预先设定的分布假设。理论分析表明,在温和的正则条件下,连接未扰动和扰动细胞群体的唯一连续OT映射可证明包含在State模型的解空间内。Cell-Eval评估框架从基因表达计数、差异表达和扰动效应大小三个维度全面评估模型性能,已被用于首届虚拟细胞挑战赛的评测。SE嵌入的引入使模型在全新细胞情境中实现更有效的零样本预测,符合模块化虚拟细胞架构的理念。State预测的生物学意义已在多个层面得到验证,包括细胞类型特异DEG、细胞周期特征保留以及非转录表型如细胞存活率的预测。但本研究仍存在局限:State目前仅在高变基因集合上预测扰动效应而非全基因空间;对于完全未见的数据集,零样本性能因实验条件间大量协变量差异而受限;此外State不利用扰动的通用表示,限制了其对训练情境中未观察到的扰动的预测能力。总体而言,State为规模化利用不断增长的单细胞扰动数据提供了坚实的架构基础,向虚拟细胞的宏观愿景迈出了重要一步。