基于变分推断的微生态位分析(VIMA)实现空间分子数据的准确且高功效病例?对照分析

《Nature Methods》:Accurate and well-powered case–control analysis of spatial molecular data

【字体: 大 中 小 】 时间:2026年10月07日 来源:Nature Methods 28.3

编辑推荐:

  随着空间分子数据(spatial molecular data)规模扩大,亟需识别疾病相关空间结构(disease-associated spatial structures)。当前方法通常作出限制性假设,例如以离散细胞类型(discrete cell typ

随着空间分子数据(spatial molecular data)规模扩大,亟需识别疾病相关空间结构(disease-associated spatial structures)。当前方法通常作出限制性假设,例如以离散细胞类型(discrete cell types)的丰度表示组织区域、以离散生态位(discrete niches)的丰度表示样本;这可能忽略重要信号。在此,研究人员提出基于变分推断的微生态位分析(variational inference-based microniche analysis, VIMA),一种将深度学习(deep learning)与有原则的统计(principled statistics)相结合的方法,以更高灵活性和精度发现疾病相关空间特征(disease-associated spatial features)。VIMA 训练变分自编码器(variational autoencoder, VAE)集成,通过数值“指纹”(fingerprints)概括数据集中每个小组织补片(tissue patch)的内容。研究人员利用这些指纹定义许多数据依赖的、重叠的“微生态位”(microniches),并对其进行荟萃分析(meta-analyze),以识别其丰度与病例?对照状态(case?control status)显著相关的微生态位。研究人员在模拟中确认 VIMA 的校准(calibration)、功效(power)和空间准确性(spatial accuracy)。随后,研究人员将 VIMA 应用于涵盖三种疾病和空间模态(spatial modalities)的空间数据集,重现已知生物学(known biology)并识别疾病的新空间特征。
该研究发表在《Nature Methods》。空间分子数据(spatial molecular data)分析已成为生物医学研究的重要支柱,现代空间模态可高分辨率检测数十种蛋白和数千个基因,但数据丰富性使系统分析复杂化。传统方法在肿瘤等研究中常依赖人工构建评分系统,限制发现范围并随标志物增加而扩展性差。既有空间组织注释方法多基于离散细胞类型丰度、空间约束聚类、空间分解、图神经网络等,虽可识别颗粒化组织结构,但在统计病例?对照分析中,若组织注释表达力不足、硬聚类掩盖病例?对照差异或注释对样本特异特性过敏感,则功效可能不足。因此,研究人员提出 VIMA(variational inference-based microniche analysis,基于变分推断的微生态位分析),用于空间分子数据的统计病例?对照分析,结合深度学习与严谨统计,以更高灵活性和精度发现疾病相关空间特征,并在模拟中确认校准、功效和空间准确性,随后应用于三种疾病与空间模态,重现已知生物学并识别新空间特征。

主要关键技术方法:VIMA 对样本栅格化并进行像素级预处理和 Harmony 批次校正,滑动窗口生成重叠组织补片;训练 10 个条件变分自编码器(conditional variational autoencoder, cVAE)集成学习补片指纹;基于最近邻图定义重叠微生态位,构建样本×微生态位×自编码器的微生态位丰度张量(microniche abundance tensor, MAT);对表型进行相关分析、自适应加权荟萃分析和置换检验,输出全局 P 值、局部错误发现率(false discovery rate, FDR)和方向效应量。样本队列来源:RA 七标记免疫荧光(immunofluorescence, IF)数据 S=27、N=22;UC 52-marker CODEX 数据 S=42、N=34(29 UC,5 健康);dementia 140-gene MERFISH 数据 S=75、N=27(15 痴呆);模拟使用 SEA-AD 队列。

方法概述:VIMA 基于三个核心概念:以深度学习架构将每个组织补片表示为数值“指纹”;利用神经网络训练随机性生成十套指纹;定义许多小、重叠微生态位作为关联检验基本单元。输入为多样本空间分子数据、病例?对照状态及年龄或性别等协变量;输出 MAT、全局 P 值以及指定 FDR 下驱动关联的组织补片及方向效应量。VIMA 无需预训练,参数调优少,单 GPU 上三个数据集总运行时间分别约 2 h、2 h 和 8 h。

利用免疫荧光显微镜数据识别类风湿关节炎亚型的空间特征:研究人员将 VIMA 应用于来自 Accelerating Medicines Partnership Rheumatoid Arthritis and Systemic Lupus Erythematosus consortium 的七标记 IF 滑膜活检数据。自编码器重构组织补片平均均方误差为 0.57,优于基线 1.00 和 0.75。指纹的样本混合 perplexity 高于其他方法。微生态位显示 CD34、CLIC5、DAPI(4′,6-diamidino-2-phenylindole,核染料)、CD90 等一致生物特征。对 MAT 做主成分分析(principal-component analysis, PCA),前两个主成分几乎完美区分 stromal 与 immune 样本。局部与全局检验发现强病例?对照差异,P=2.0×10?4,10,345 个补片中 5,222 个在 FDR 10% 显著;stromal 相关补片 CLIC5 高,immune 相关补片 CD3、CD68、DAPI 高。其他基准方法的离散组织注释未检测到该差异。免疫标记样本内常同时含空间分隔的 stromal 和 immune 区域。对免疫相关和 stromal 相关补片 Leiden 聚类各得两个亚型,并与 cell-type abundance phenotype(CTAP,细胞类型丰度表型)关联:M CTAP 中 cluster 1 较 cluster 2 更常见,TM CTAP 中较少;stromal 相关 cluster 3 在 M CTAP 更常见,TM 中较少。结论:VIMA 用空间信息揭示 RA 亚型和样本内异质性。

利用 CODEX 数据识别 TNF 抑制对溃疡性结肠炎淋巴聚集的影响:研究人员分析 52-marker CODEX 结肠活检。UC 与 healthy 比较,全局 P=1.7×10?3,21,359 个补片中 11,839 个在 FDR 10% 显著;UC 相关补片位于上皮层深处,CD3、CD19、CD45 等免疫标记高。VIMA 比 UTAG 和 Harmony 后补片平均表达更显著,且唯一检测到 UC 相关补片。在 UC 相关补片内比较 prior/chronicTNFi 与 never/newTNFi,全局 P=1.5×10?3,4,146 个中 2,307 个显著;每样本相关补片比例呈 TNF 暴露剂量反应梯度。prior/chronicTNFi 相关补片 B、T 细胞标记较低,而 CD54、CD90、CD34、MMP12 等成纤维、巨噬和间充质标记较高;空间上 never/newTNFi 相关补片显示 B 细胞聚集伴 T 细胞,chronic/priorTNFi 相关补片显示间充质标记杂乱与少量淋巴细胞。结论:TNF 抑制可能长期重塑结肠结构,减少淋巴聚集并增加间充质和成纤维活性。

利用空间转录组学数据识别痴呆相关组织结构:研究人员分析 140-gene MERFISH 内侧颞回数据。dementia 与 control 比较,全局 P=5.4×10?3,70,898 个补片中 27,072 个在 FDR 5% 显著;每样本 dementia 与 control 相关补片比例几乎分离。其他空间方法未检测到,非空间细胞类型比例分析也为空。控制相关补片与皮质层 2/3 共定位,提示痴呆中这些层变薄;痴呆相关补片定位最深皮质层 6b,且非均匀分布。与其他 6b 补片相比,痴呆相关补片富集 oligodendrocytes 1.33 倍,缺失 L6 IT Car3 神经元 0.40 倍;手动注释高 L6b 神经元和 oligodendrocyte 补片重现富集。结论:存在一个未识别的 L6b 少突胶质细胞富集微生态位,在痴呆中更丰富。

消融实验和样本水平整合评估:研究人员构建三种简化变体:无样本 ID 的 ResNet AE、两层 ConvNet 加微生态位、两层 ConvNet 加聚类。四个表型中去除组件后性能下降;粗 RA 和 UC 信号中神经网络架构和微生态位分析最重要;细微 TNFi 和痴呆信号中去除样本特异偏倚进一步改善功效。合成表型消融显示补片表示丰富度降低会降低全局与局部功效和空间准确性;用聚类替代微生态位进一步降低。整合评估中 VIMA cVAE 平均最高,其次 CANVAS、CellCharter、TissueMosaic;弱化变分惩罚降低功效和空间准确性。结论:高功效病例?对照分析需要丰富补片嵌入、强样本整合和超越离散簇的丰富样本表示。

讨论部分总结:讨论部分指出 VIMA 可跨低内容蛋白质组学到空间转录组学进行统计病例?对照分析,输出 MAT、全局 P 值、指定 FDR 相关补片及效应量;考虑样本特异伪影,支持协变量,参数调优少,可高效运行。VIMA 不同于数字病理中需数千或数百万患者样本并聚焦患者级预测的深度学习。对三个数据集发现新生物信号,基准显示当前最先进方法大多无法检测这些信号。消融证明关键成分必要。基准方法为组织注释设计,仍表现良好。VIMA 将空间数据视为图像,无需分割,可整合模态。使用 VAE 而非对比学习或 transformer。十 cVAE 集成捕获互补表示。局限包括需 GPU、补片大小选择影响信号、结果解释需下游分析、靶向方法在假设匹配时可能优于 VIMA。结论翻译:尽管存在这些局限,VIMA 通过将深度学习与严谨且灵活的统计框架相结合,是跨多种空间模态识别疾病相关空间特征的灵敏且准确的方法。随着空间数据集规模和维度增长,捕获样本水平变异的方法将越来越重要,以将这些数据转化为对疾病理解的进展。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号