基于单细胞基础模型的表型逆转与靶点优先排序用于细胞炎症研究

《Digital Discovery》:Phenotypic reversion and target prioritization for cellular inflammation via representation learning with foundation modelsOpen Access

【字体: 大 中 小 】 时间:2026年10月05日 来源:Digital Discovery 7.1

编辑推荐:

  本研究提出了一种概念验证框架,利用单细胞基础模型(single-cell foundation models, scFMs)和大规模Perturb-seq数据集,对细胞炎症的表型逆转进行靶点优先排序。研究人员同时纳入了基础状态和促炎信号条件,特别是白细胞介素-

本研究提出了一种概念验证框架,利用单细胞基础模型(single-cell foundation models, scFMs)和大规模Perturb-seq数据集,对细胞炎症的表型逆转进行靶点优先排序。研究人员同时纳入了基础状态和促炎信号条件,特别是白细胞介素-1β(interleukin-1 beta, IL-1β)和肿瘤坏死因子α(tumor necrosis factor alpha, TNF-α)刺激,以评估动脉粥样硬化疾病相关刺激是否能改善对疾病进展关键基因和通路的识别。该数据集包含864?115个内皮细胞,经历了1?740种独特的遗传扰动。通过设置两种条件,研究人员识别出在不同细胞状态下对基因表达产生差异性效应的靶点。利用scFMs,研究人员将单细胞转录组嵌入高维潜在空间,并根据扰动将炎症转录组谱向未处理对照状态转移的能力对其进行排序。通过与注释基因集和专家精选靶点的基准比较,研究人员发现这些模型虽然事先不了解这些靶点的信息,但仍能显著富集已知的炎症调控因子和生物学相关靶点。重要的是,同时纳入基础和促炎条件比仅使用基础条件更能改善炎症相关靶点的识别。这强调了在扰动实验中纳入疾病相关刺激的价值。研究结果突显了scFMs在数据驱动的靶点提名中的实用性,强调了细胞状态在调控反应中的作用,并为机器学习引导的靶点发现提供了一种可扩展、模型无关的方法。这项工作为推动炎症相关疾病的生物学理解提供了宝贵的社区资源。
研究背景、现存问题与研究动机
转录组学是了解组织生物学状态的基础领域,而单细胞测序技术则以单细胞分辨率提供了转录组的精细快照。将该技术与CRISPR等遗传扰动手段结合,为研究疾病生物学以及不同扰动如何可能提供修复作用带来了前所未有的机遇。Perturb-seq技术能够在单细胞水平测量扰动后的转录组,兼具可扩展性和检测细微表型变化的分辨率,为药物发现提供了独特机会。其中一个引人关注的研究方向是“表型逆转”(phenotype reversion),即探索某些扰动能否将疾病状态的表型恢复至接近健康状态。在早期药物发现中,确定哪些遗传扰动能够诱导与健康状态相似的转录组特征,可作为靶点提名的第一步。
然而,目前存在以下问题:首先,关联特定靶点的敲低与理想表型仍是评估靶点治疗潜力的初始且关键任务,但这一领域尚待深入探索。其次,传统的差异表达(differential expression, DE)分析方法高度依赖通路注释,而注释本身存在稀疏性、偏向于研究充分的基因、且不断演变等问题,缺乏针对特定细胞背景的粒度。第三,尽管单细胞基础模型(single-cell foundation models, scFMs)在细胞类型注释、预测扰动后转录组等领域展现出潜力,但其辅助靶点提名的能力尚未得到充分研究。
因此,研究人员开展此项研究,旨在利用大规模Perturb-seq数据集和scFMs,开发一种基于表型逆转的靶点优先排序框架,并以细胞炎症作为研究案例,重点考察纳入疾病相关刺激(IL-1β和TNF-α)对于识别炎症相关靶点的价值。
主要关键技术方法
研究人员构建了一个大规模Perturb-seq数据集,使用hTERT永生化人动脉内皮细胞(TeloHAEC),在基础条件和炎症条件(IL-1β和TNF-α刺激)下进行培养。数据集包含864?115个细胞、38?606个基因和1?740种独特的遗传扰动。研究采用了三种主要的靶点排序方法:一是基于差异表达(DE)结合基因集富集分析(gene set enrichment analysis, GSEA)的传统方法,分为仅使用基础条件的DE(Basal)和使用两种条件的DE(Inflammatory);二是基于潜在相似性的表征学习方法,利用scFMs(包括SCimilarity、scGPT和STATE)以及非机器学习方法(如原始整数计数、主成分分析PCA、均匀流形近似与投影UMAP)将细胞嵌入高维潜在空间,通过计算处理条件下各扰动表征与未处理安全靶向对照表征之间的余弦相似度进行排序;三是基于英语的大语言模型(LLM)方法,即直接提示ChatGPT根据实验背景和目标生成靶点排名。
研究结果
大规模Perturb-seq数据集模拟细胞炎症
研究人员成功构建了大规模Perturb-seq数据集。UMAP可视化显示,炎症细胞因子对转录组表达产生了强烈影响,形成了易于区分的表型。59%的基因靶点在一个处理条件下表现出高差异表达,而在另一条件下则不然,表明细胞因子处理显著影响了不同靶点诱导的转录组变化。数据集具有较高的敲低效率(平均72%,中位80%)和测序深度(每细胞中位UMI数为16?373)。
潜在相似性方法富集阳性对照靶点
研究人员采用潜在相似性方法,将处理条件下的扰动表征与未处理对照进行比较,并按余弦相似度排序。初步测试表明,除随机表征外,所有表征的潜在空间均保留了真实的生物学信号,即相同靶点的细胞在潜在空间中具有较高的簇内相似性。
排序比较
不同排序方法之间存在一定的一致性。DE(Inflammatory)方法与scFM潜在相似性方法的排序具有中等一致性(与STATE的秩偏重叠RBO为64%,与scGPT为52%,与SCimilarity为48%)。DE(Basal)方法与其他所有方法的RBO仅为0-1%,表现最差。UMAP和ChatGPT的排序也与scFM和DE(Inflammatory)方法不一致。
阳性对照富集
研究人员使用一组具有强文献支持的阳性对照基因(TNFRSF1A、TRADD、JUNB、JUND、NFKB1、NFKB2)来评估排序的生物学合理性。通过计算曲线下面积(AUC)进行富集分析,scGPT的潜在相似性方法表现最佳(AUC=0.79),其次是PCA(AUC=0.77)、原始整数计数(AUC=0.73)和ChatGPT(AUC=0.70)。DE(Inflammatory)方法也表现良好,而DE(Basal)方法表现最差。
顶级靶点揭示相关通路富集
研究人员通过Enrichr对每个排序的前n个靶点进行通路富集分析。scGPT的潜在相似性方法在相关通路富集方面表现最优(AUC=0.95),从n=30到n=100可恢复100%的相关通路。相比之下,PCA虽在靶点富集中表现良好,但在通路富集中表现较差。DE方法产生的显著富集通路与生物学背景无关,而scGPT的顶级靶点则富集了与TNF-α和IL-1β信号传导直接相关的合理通路。
讨论与结论
讨论部分指出,该研究释放的数据集对基础模型基准测试和新模型训练具有重要价值,尤其是同时包含炎症细胞因子条件和匹配遗传扰动的设置较为罕见,有助于研究状态依赖性调控效应。研究强调,对于早期靶点发现而言,“金标准”靶点通常是未知的,因此需要更准确的预测。阳性对照靶点在无先验信息的机器学习排序中被优先检出,证明了机器学习引导靶点提名的可行性。DE(Basal)方法的糟糕表现表明,仅依赖基础条件数据难以识别疾病特异性靶点,凸显了纳入疾病相关条件的必要性。ChatGPT的表现源于其直接利用了文献知识,而scGPT等基于数据的潜在相似性方法在不依赖人类知识的情况下仍能超越ChatGPT,增加了其在新型靶点发现中的可信度。然而,并非所有scFM都表现优异,表明表征选择至关重要。值得注意的是,简单的原始整数计数表征在某些任务上超过了部分scFM。
研究结论部分的核心发现包括:(1)同时包含刺激条件和基础条件的Perturb-seq数据集对于识别与疾病相关刺激驱动基因表达变化的靶点具有巨大价值;(2)潜在相似性方法能够与DE方法和强大的英语LLM(如ChatGPT)一样好甚至更好地识别生物学相关基因,且无需依赖人工衍生的通路注释或文献知识。该研究希望未来能在体内对机器学习排名的顶级靶点进行验证,并希望此概念验证能为其他疾病相关表型的表型逆转和靶点提名活动奠定基础,同时促进新的生物学探究和机器学习训练能力的提升。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号