《Machine Learning with Applications》:SCOPE-LM: Single Cell Context-Conditioned and Pathway-Enhanced Language Model for cell type annotation
编辑推荐:
生物大语言模型已改善了细胞类型注释,这一点已由Geneformer等最先进模型所证实。然而,在新研究中进行微调可能会产生可变的敏感性和特异性,且预测背后的生物学证据往往难以检视。为解决这些局限性,研究人员引入了单细胞上下文条件化和通路增强语言模型(SCOPE-
生物大语言模型已改善了细胞类型注释,这一点已由Geneformer等最先进模型所证实。然而,在新研究中进行微调可能会产生可变的敏感性和特异性,且预测背后的生物学证据往往难以检视。为解决这些局限性,研究人员引入了单细胞上下文条件化和通路增强语言模型(SCOPE-LM),该模型将预训练语言模型同时条件化于基因表达和通路水平信号之上。SCOPE-LM由三个组件构成。基因到令牌投影器(Gene-to-Token Projector)将每个细胞的表达向量映射为紧凑的细胞令牌,同时保留基因身份和表达量级。查询变换器(QFormer)对这些令牌进行注意力运算,在语言模型隐藏空间中生成细胞上下文表示。功能影响模块(Functional Influence Module)根据来自Reactome和KEGG等精选资源的通路-基因成员关系聚合基因水平梯度归因,以计算功能影响评分(FIS)。这些评分在表达衍生的细胞上下文之外提供了通路水平的证据。该设计具有三个实际优势:(i)通过上下文条件化提高了模型跨数据集的鲁棒性;(ii)无需昂贵的大规模预训练即可获得强劲性能;以及(iii)每个细胞可获得可解释的通路归因。研究人员在五个公共数据集上,采用统一的3×3重复种子和不确定性感知协议,将SCOPE-LM与Geneformer、GenePT、CellPLM、LangCell和scCello进行了评估。SCOPE-LM达到了87.38%的准确率和82.61%的宏F1分数,在平均性能上优于所有五种基准方法。这些结果表明,结构化的细胞上下文和通路条件化能够提供强大的细胞类型注释性能,同时展现生物学可解释的证据,且无需大规模的单细胞特异性骨干网络预训练。
**论文解读:SCOPE-LM——面向单细胞类型注释的上下文条件化与通路增强语言模型**
**一、研究背景与问题提出**
单细胞RNA测序(scRNA-seq)技术使得在单细胞水平大规模测量基因表达成为可能,揭示了组织内细胞类型的高度异质性。细胞类型注释是解析单细胞数据的关键步骤,对于基础生物学研究、疾病机制探索和精准医学应用至关重要。然而,传统的人工注释依赖专家知识,难以扩展到日益庞大的数据集。自动注释方法经历了从参考图谱映射、经典监督分类器到基于Transformer的生物基础模型的发展。尽管以Geneformer为代表的大规模预训练模型在注释性能上表现优异,但其在新数据集上的微调可能产生不稳定的敏感性和特异性,且预测背后的生物学证据难以直观检视。同时,此类模型通常需要大规模计算资源和海量单细胞数据进行预训练,限制了其可复现性和实际应用。基于通用大语言模型的零样本注释方法虽灵活,但高度依赖人工精选的标记基因列表,且难以结构化整合通路水平信息。当前方法在实用性、跨研究鲁棒性和生物学可解释性之间存在持续的权衡。因此,有必要开发一种轻量级且可解释的条件化框架,既能直接编码细胞特异性表达信号,又能提供通路水平的生物学支持证据。
**二、研究目标与关键技术方法**
针对上述问题,研究人员提出了单细胞上下文条件化和通路增强语言模型(SCOPE-LM)。该模型受BLIP-2启发,采用任务条件化桥接模块而非单体式生物学预训练骨干。核心设计为三阶段流水线:(1)基因到令牌投影器(Gene-to-Token Projector)将每个细胞的高维基因表达谱通过多层感知机(MLP)映射为6×768的紧凑细胞令牌;(2)查询变换器(QFormer)桥接模块通过固定数量的可学习查询令牌对细胞令牌进行自注意力和交叉注意力运算,生成8×768的细胞上下文嵌入;(3)功能影响评分(FIS)模块通过梯度归因计算基因水平敏感性,并依据Reactome和KEGG等通路数据库的通路-基因成员关系,利用L2范数聚合为通路水平的功能影响评分,再将Top-3高评分通路编码为FIS上下文嵌入。骨干模型采用文本到文本迁移变换器(T5-base),联合微调所有条件化模块。评估涵盖五个公共人类scRNA-seq数据集(共约155,563个细胞),包括人胰腺(训练集与验证/测试集来自不同研究)、胸主动脉、乳腺癌、肾透明细胞癌和肝细胞癌,并与Geneformer、GenePT、CellPLM、LangCell和scCello五种基准方法在统一预处理和3×3重复种子不确定性协议下进行对比。
**三、主要研究结果**
**1. SCOPE-LM在评估基准中取得最强平均性能**
在五个数据集的统一评估中,SCOPE-LM的平均准确率为87.38%,平均宏F1为82.61%,均优于所有五种基准方法。与最强基准scCello相比,平均准确率提升4.19个百分点,宏F1提升1.30个百分点。在数据集层面,SCOPE-LM在主动脉、人胰腺、肾脏和肝脏四个数据集上取得最高准确率,并在人胰腺、肾脏和肝脏上取得最高宏F1。其中跨研究的人胰腺数据集增益最大,准确率提升16.35个百分点,宏F1提升9.10个百分点。
**2. FIS在Reactome和KEGG通路来源下均保持有效**
将FIS模块分别实例化为Reactome-derived和KEGG-derived通路掩码,在完全相同条件下比较。KEGG-FIS的平均准确率为87.58%,略高于Reactome-FIS的87.38%;平均宏F1为83.05%对82.61%。两种通路来源在特定数据集上呈现互补优势,表明FIS机制是通路数据库无关的。
**3. QFormer和FIS提供互补的上下文条件化增益**
在主动脉数据集上的消融研究中,同时禁用QFormer和FIS时准确率仅为39.90%,宏F1为23.34%。仅启用QFormer后准确率大幅提升至93.55%(+53.65个百分点),宏F1提升至84.88%(+61.54个百分点)。在QFormer基础上进一步启用FIS,准确率再提升1.72个百分点至95.27%,宏F1提升5.61个百分点至90.49%。结果表明QFormer是主要的表达条件化接口,而FIS提供补充性的通路水平生物学信号。
**4. FIS优先改善稀有和易混淆的细胞群体**
在主动脉数据集上按支持度分层分析显示,FIS使稀有细胞群体的准确率从89.39%提升至94.34%(+4.95个百分点),而非稀有群体仅从93.88%提升至95.36%(+1.48个百分点)。混淆矩阵分析表明,FIS有效减少了SMC2→SMC1、SMC1→Fibroblast等间充质-平滑肌轴的错误,以及B细胞→T细胞、肥大细胞→T细胞等淋巴谱系错误,但对某些间充质状态(如MSC)的歧义未能完全解决。
**5. SCOPE-LM的FIS模块提供具有生物学相关性的通路归因**
在主动脉数据集的11种细胞类型中,对33个Top-3通路归因进行外部文献一致性评分,其中30个(90%)获得直接或间接文献支持。11种细胞类型中有8种被评定为高支持水平(所有3条通路均获支持),其余3种为中等支持(至少2条通路获支持)。每种细胞类型在Top-3归因中至少包含两条获支持的通路。
**四、讨论与结论总结**
讨论部分指出,SCOPE-LM通过将注释任务分解为表达汇总和通路生物学条件化两个互补的模块化流,实现了对预训练语言模型的有效适配。QFormer建立了表达特征空间与语言模型之间的主要接口,FIS则贡献了通路级辅助信号,尤其在稀有细胞类别和谱系相近群体的区分上发挥关键作用。重复种子不确定性评估协议提供了比单次运行更可靠的性能视图。研究结论部分强调,SCOPE-LM在无需大规模单细胞特异性骨干预训练的条件下,通过结构化细胞上下文和通路条件化,实现了强大的平均注释性能、跨数据集稳定性和生物学可解释性,为通用预训练语言模型在单细胞注释领域的应用提供了一种实用、可复现且可解释的路径。