《Briefings in Bioinformatics》:scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data
编辑推荐:
尽管细胞类型注释已成为单细胞分析流程中的重要环节,但计算注释结果的评估仍然具有挑战性。许多注释工具将标签从已注释的参考数据集迁移到目标查询数据集,但这种跨数据集盲目迁移存在固有难题,尤其在从健康参考图谱向疾病状态发现研究迁移时,数据集之间往往缺乏完美对齐。研究
尽管细胞类型注释已成为单细胞分析流程中的重要环节,但计算注释结果的评估仍然具有挑战性。许多注释工具将标签从已注释的参考数据集迁移到目标查询数据集,但这种跨数据集盲目迁移存在固有难题,尤其在从健康参考图谱向疾病状态发现研究迁移时,数据集之间往往缺乏完美对齐。研究人员提出 scDiagnostics,一个开源软件包,用于发现复杂或歧义注释案例,弥补当前单细胞分析流程中的关键空白。该包具备可兼容所有主流细胞类型注释工具的诊断方法,包括投影(projection)、对齐(alignment)与异常检测(anomaly detection)。利用模拟数据与真实世界单细胞数据,研究人员证明 scDiagnostics 能可靠识别会系统性扭曲下游分析与解释的误导性注释,这些注释在常规流程中不会被发现。
研究背景方面,单细胞RNA测序(scRNA-seq)使细胞异质性研究发生转变,细胞类型注释为下游细胞互作、差异表达与通路富集提供基础。传统人工注释依赖专家根据已知细胞类型特异性标记基因判断,但耗时、主观且可重复性低。自动化方法分为标记基因驱动方法与参考基准方法,后者如 SingleR、CellTypist、CHETAH、scmap、Azimuth、scDeepSort、scArches 等。核心问题是参考与目标数据常因技术批次效应与生物差异而错位,健康图谱迁移到疾病状态时,查询集中可能存在参考未涵盖的细胞状态,被强制归入最相似已有类型,导致新型或中间态细胞被掩盖。现有置信度评分、深度学习分布外(OOD)检测等多为任务特定或架构绑定,缺少工具无关的系统诊断。
研究人员开展的研究是构建 scDiagnostics(R/Bioconductor 包),以查询集预测标签与已注释参考集为输入,通过三大组件系统评估注释:其一是将查询细胞投影到参考低维空间(如 PCA 或判别分析)做探索性数据分析;其二是用全局分布指标与标记基因对齐评估参考与查询的兼容性,包括 Spearman 相关、Wasserstein 距离、Bhattacharyya 系数、Hellinger 距离、Cramér 检验、Hotelling T2 检验;其三是异常检测,采用隔离森林(isolation forest)与 PCA 重构误差识别偏离参考流形的查询细胞,并将异常归因为技术伪影、参考不完整、注释歧义或生物漂移(biological drift)。
论文发表在《Briefings in Bioinformatics》。重要意义在于,scDiagnostics 把人类审核环节引入自动注释流程,避免高置信度错误注释流入下游,对参考迁移、疾病状态发现、空间转录组与未来单细胞基础模型/大语言模型(LLM)注释起到定量护栏作用。
关键技术方法上,研究人员使用 splatter 模拟三类型(A、B、C)数据并构造参考缺失 C 的错位场景;使用 Zeisel 小鼠脑参考图谱,剔除星形胶质细胞、锥体 SS 神经元亚型、小胶质细胞等群体并加入标签噪声、类别不平衡与批次偏移以评性能;COVID-19 外周血单个核细胞(PBMC)数据来自 Stephenson 等,健康供者作参考、COVID-19 患者作查询,用 Azimuth 迁标签并计算 I 型干扰素(IFN)签名;结肠炎数据来自 Cadinu 等的 DSS 诱导小鼠结肠 MERFISH 空间转录组,Day 0 健康切片作参考、Day 9 炎症切片作查询,计算细胞外基质(ECM)稳态签名并做邻域富集与配体受体互作分析。
研究结果如下。Overview of the scDiagnostics package:研究人员说明包接受 SingleCellExperiment 对象,支持 DelayedArray 磁盘后端,兼容 SingleR、Azimuth、CellTypist、scArches;通过投影、对齐、异常检测三类功能系统审计注释。scDiagnostics detects out-of-reference populations in simulated single-cell data:在参考含 A、B、C 且查询同构成时异常分低;参考删去 C 后,查询 C 被误注为 A/B,但 scDiagnostics 用投影与异常分双峰分布把其隔离出来;Zeisel 场景下对缺失胶质系、稀有小胶质、神经亚型及标签噪声/不平衡/批次效应均保持高 AUROC 与 AUPRC。scDiagnostics facilitates the identification and characterization of a disease-associated cell state in COVID-19:Azimuth 把 COVID-19 中 IFN 激活 CD14+ 单核细胞注为普通单核,scDiagnostics 在 PC 空间标出偏移群,伪批量差异表达显示 IFI6、LY6E、ISG15 等 IFN 签名基因上调;SingleR、CellTypist、scArches 下同样可复现,且高置信度不排斥高异常分。scDiagnostics facilitates the identification and characterization of a disease-associated cell state in colitis:MERFISH 中健康成纤维细胞与炎症相关成纤维细胞(IAF)被标准注释混为一类;scDiagnostics 用 ECM 签名与异常分找出炎症成纤维细胞,邻域富集显示其靠近浸润中性粒细胞与炎症上皮,细胞互作网络里失去 Wnt 稳态信号、获得 Il1b-Il1r1、Cxcl5-Cxcr2 等炎症互作;该结果在 SingleR、Azimuth、CellTypist、scVI/scArches 下均可复现。
讨论部分总结:研究人员指出自动参考映射常假设查询结构镜像参考,会掩盖疾病相关偏移;scDiagnostics 的投影、对齐、异常检测可发现被强行并入健康流形的病理状态。异常分与注释工具置信分互补,高置信误注正是常规流程漏洞。解释异常应结合标记对齐、QC、跨工具一致性、参考覆盖情况,分为技术伪影、生物漂移、缺失参考状态或模型失败。该包也可作为单细胞基础模型与 LLM 注释的量化护栏,并可向测序空间转录组解卷积、成像空间分割、CITE-seq 等多模态异常检测拓展。
研究结论部分译为:scDiagnostics 包实现了细胞类型注释评估与异常细胞状态识别的计算框架。随着单细胞数据增至百万级,研究者越来越依赖自动参考映射,但这些方法常假定查询数据在结构上镜像参考。研究人员将 scDiagnostics 用于模拟与真实案例表明,严格持此假定会掩盖关键生物偏移。通过把投影映射、数据对齐与异常检测引入标准注释流程,研究人员提供了识别疾病相关细胞状态的简明机制,这些状态原本会被强行整合进健康流形,从而弥补了病例对照场景下自动评估策略的关键空白。准确注释与区分真生物变异和技术效应紧密相连;scDiagnostics 能发现整合方法把疾病单核合并进健康单核式的过度校正。异常分与置信分互补,跨工具一致签名指向真生物漂移,无匹配参考群体则为参考外状态。该框架把新型或偏移细胞状态与注释失败区分开,并提供透明的人机协同流程。scDiagnostics 还可作为基础模型与 LLM 注释的护栏;对空间数据可发现表达谱与空间背景冲突的炎症成纤维细胞;未来可拓展至解卷积、细胞分割及 CITE-seq 多模态不一致诊断。单细胞多模态时代,跨模态不一致正可从干扰变为发现来源。