《Nature Methods》:Beyond benchmarking: an expert-guided consensus approach to spatially aware clustering
编辑推荐:
空间组学技术通过整合分子谱与空间定位,革新了组织架构和细胞异质性的研究。在空间分辨转录组学(spatially resolved transcriptomics, SRT)中,描绘高阶解剖结构对于理解细胞组织如何影响功能至关重要。然而,当前空间感知聚类(spa
空间组学技术通过整合分子谱与空间定位,革新了组织架构和细胞异质性的研究。在空间分辨转录组学(spatially resolved transcriptomics, SRT)中,描绘高阶解剖结构对于理解细胞组织如何影响功能至关重要。然而,当前空间感知聚类(spatially aware clustering, SAC)方法基准测试的可靠性因其狭窄聚焦于Visium和脑组织数据集以及将手动注释错误解释为金标准(ground truth, GT)而受到削弱。研究人员在此提出SACCELERATOR,一个社区驱动的、可扩展的框架,它标准化了数据格式化、方法集成和指标评估,使得新方法和数据集能够快速纳入。研究人员的分析揭示了SAC方法在泛化性和可重复性方面的显著局限性,并表明通常用作金标准的解剖学标签往往存在偏倚、易出错且不适合基准测试。研究人员并非对方法进行排名,而是提出了一种共识引导的工作流程,其中描述性空间指标突出方法分歧的高熵区域,从而为组织专家提供定向反馈。将该方法应用于脑和癌症数据集,揭示了被单个SAC方法和手动注释忽略的具有生物学意义的模式,突显了迭代性、专家在环(expert-in-the-loop)评估的必要性。
## 论文解读:超越基准测试——一种专家引导的共识方法用于空间感知聚类
### 研究背景与问题
空间组学技术(spatial omics technologies)通过整合分子谱与空间定位,为研究组织架构和细胞异质性提供了新视角。在空间分辨转录组学(spatially resolved transcriptomics, SRT)中,准确描绘高阶解剖结构(如组织区域和器官分区)对于理解细胞组织如何影响功能至关重要。自2020年以来,已有超过50种空间感知聚类(spatially aware clustering, SAC)方法被开发用于从SRT数据中划分空间区域。然而,现有SAC方法的基准测试(benchmarking)存在严重问题:大多数研究仅聚焦于Visium和脑组织数据集,且将手动注释错误地视为金标准(ground truth, GT)。手动注释受限于人类主观偏差和知识局限,缺乏标准化的本体定义,导致基准测试结果不可靠。此外,不同研究之间报告的方法性能存在显著不一致,例如,同一方法(BayesSpace)在相同数据集上的调整兰德指数(ARI)在不同研究中波动巨大。这些矛盾促使研究人员开发一种更系统、可扩展且反映真实研究流程的评估框架。
### 研究内容与结论
研究人员开发了SACCELERATOR——一个社区驱动、模块化且可扩展的框架,用于标准化数据格式、方法集成和指标评估,并支持快速纳入新方法和数据集。通过元分析(meta-analysis)和广泛实验,研究人员发现SAC方法的泛化性和可重复性严重不足,且GT标签存在偏倚、易出错,不适合作为基准。研究人员提出了一种共识引导(consensus-guided)的工作流程,结合描述性空间指标(如交叉方法熵CME)来突出方法分歧的高熵区域,从而为组织专家提供定向反馈。该框架应用于脑和癌症数据集,揭示了被单个SAC方法和手动注释忽略的生物学模式,证明了迭代性、专家在环(expert-in-the-loop)评估的必要性。论文发表在《Nature Methods》。
### 主要关键技术方法
研究人员开发了SACCELERATOR框架,基于Snakemake工作流构建,包含独立模块用于数据集、SAC方法、指标和共识聚类。数据集模块涵盖15个公开数据集,总计170多个组织样本,来源包括Visium、Visium HD、Slide-seqV2、Stereo-seq、Xenium、CosMx、STARmap PLUS和MERFISH等技术。方法模块实现了22种SAC方法,每种方法有1-5种参数配置。指标模块包括17种指标,分为空间无关(如ARI、NMI)和空间感知(如空间混沌评分CHAOS、异常斑点百分比PAS、平滑度熵SE)两类。共识聚类模块实现了三种方法:K-modes、潜在类别分析(LCA)和权重基础共识(weight-based consensus),用于整合多个聚类结果。
### 研究结果
**报告的SAC方法性能在不同研究间不一致**
研究人员对13项研究进行了元分析,发现同一方法(BayesSpace)在相同数据集(LIBD DLPFC)上的ARI值存在巨大波动(如切片151669的ARI变化剧烈)。方法论文自报性能通常高于后续竞争者报告的性能,且不同中性基准研究对同一方法的排名矛盾(如BayesSpace在Yuan等研究中排名第4,在Hu等研究中排名第13)。这表明传统基准测试效果有限。
**一个用于运行和评估SAC方法的可扩展框架**
SACCELERATOR框架实现了模块化设计,可无缝集成新数据集、方法和指标。在15个数据集上运行22种方法(61种参数组合)后,基于准确性和空间连续性的指标(如ARI和SE)总体呈正相关。参数配置间的性能差异有时超过不同方法间的差异,某些方法(如STAGATE)对参数高度敏感,而另一些(如SEDR)则相对稳定。
**很少有方法能扩展到现代数据集**
新技术(如Visium HD、Xenium、CosMx)产生数百万个细胞/斑点,而大多数SAC方法无法处理超过200,000个空间观测点。在最大数据集(CosMx肝癌,>460,000细胞)上,仅5/22种方法能在2天内完成。在Visium HD结直肠癌数据集中,仅CellCharter能处理2μm bin大小,其他方法均因内存或时间限制失败。
**过度依赖GT标注使方法评估复杂化**
GT标签通常基于多模态信息(如H&E染色和标记基因表达),但仅凭转录组数据难以区分精细结构(如皮层分层)。GT标注具有主观性,例如,在Xenium小鼠脑数据集中,GT将整个等皮层标注为一个区域,而SAC方法可检测到更细的分层结构,但按GT计算ARI反而较低。此外,GT的粒度偏差导致方法在不同于GT的聚类数下达到峰值ARI。在Stereo-seq小鼠肝脏数据集中,GT的九层分区与方法结果不匹配,而将九层合并为三层后ARI显著提高。部分GT标签由计算生成(如Leiden聚类),导致循环论证问题。
**方法之间往往比与GT更相似**
在LIBD DLPFC数据集中,不同SAC方法间的成对ARI高于方法与GT间的ARI。通过选取高一致性和高空间连续性的方法,利用LCA构建共识聚类,得到的共识结果与GT具有较高一致性。交叉方法熵(CME)可识别方法分歧的高熵区域,例如,未在个体聚类中出现的皮层L4层在高熵图中被突出显示,表明该区域难以正确注释。
**专家在环的共识分析**
**案例1:小鼠丘脑MERFISH数据集**
八个SAC方法的结果高度不一致,但共识聚类和熵分析揭示了与解剖学边界对应的高熵区域。专家评估发现,共识聚类在腹侧后内侧核(VPM)区域划分出两个亚群,与多基因表达梯度相符,而参考解剖学标签(CCFv3)存在对齐误差。通过扫描聚类数(16-24),稳定在20个聚类时产生生物学有意义的划分。
**案例2:结直肠癌Visium HD数据集**
专家初始注释了肿瘤区域,但SAC方法(如SEDR)将肿瘤区域进一步分为两个簇,对应肿瘤和异型增生组织。专家对方法的排名与ARI得分不一致,表明全局指标(如ARI)可能忽略小尺度生物学结构。通过共识聚类(K-modes),识别出六个区域,包括肿瘤、异型增生、粘蛋白信号热点、肿瘤基质等。差异表达基因分析支持了从异型增生到肿瘤的转变特征(如LGR5高表达、CXCL2/3低表达)。
### 讨论与结论
**讨论总结**:现有SAC基准测试过于狭窄,依赖不可靠的GT标注,且大多数方法无法扩展到现代数据集。SACCELERATOR框架通过共识聚类和空间熵图,更真实地反映研究流程,帮助识别可重复性区域和分歧热点。案例研究显示,高熵区域对应生物学梯度(如结直肠癌异型增生-肿瘤转变)和解剖亚结构(如VPM核)。与之前专门优化GT对齐的共识方法不同,SACCELERATOR将共识作为探索性指南,为用户和方法开发者提供反馈。
**研究结论**:尽管本研究聚焦于SAC,但SACCELERATOR提供了一个通用框架,用于可重复评估基因组学工具,连接了计算分析与协作性、迭代性的生物学解释。