《Frontiers in Oncology》:Continuous spatially informed microenvironment programs show cross-cohort concordance and context-dependent spatial organization in diffuse large B-cell lymphoma
编辑推荐:
摘要专业翻译
背景: 空间转录组学(Spatial transcriptomics)可解析弥漫性大B细胞淋巴瘤(diffuse large B-cell lymphoma,DLBCL)中的组织组织结构,而大多数具有临床注释的队列仍为批量转录组数据集(bulk
摘要专业翻译
背景: 空间转录组学(Spatial transcriptomics)可解析弥漫性大B细胞淋巴瘤(diffuse large B-cell lymphoma,DLBCL)中的组织组织结构,而大多数具有临床注释的队列仍为批量转录组数据集(bulk transcriptomic datasets)。
方法: 研究人员在不假设离散生态系统分类(discrete ecosystem taxonomy)的前提下,在批量、单细胞和空间数据集中评估了六个基于文献的精选复合程序(curated composite programs)。这些程序包括巨噬细胞富集(Macrophage-rich)、T细胞炎症(T cell-inflamed)、抗原呈递(Antigen-presentation)、基质/纤维化(Stromal/fibrotic)、免疫冷/排斥(Immune-cold/exclusion)和增殖/细胞周期(Proliferative/cycling),每个程序包含22个成员基因(132个成员关系,121个独特基因和11个共享成员关系)。
结果: 在498例GSE31312肿瘤中,主成分1和主成分2(PC1和PC2)分别解释了48.6%和20.8%的评分方差。没有候选离散分类表现出足够的稳定性以供保留;k=2满足轮廓系数(silhouette)和规模标准,但未通过两个自举稳定性阈值。GSE10846(rho=0.936)和GSE181063(rho=0.982)的历史15边一致性(historical 15-edge concordance)较高,而最严格的GSE10846边排除敏感性分析(同时移除共享基因和增殖相关边)将rho降至0.690。对来自四名患者和八个样本的14,368个DLBCL细胞的单细胞分析提供了描述性谱系背景。在Visium V2区域中,抗原呈递系列被视为AP残差(HLA未测量)(AP-residual,HLA-unmeasured),因为22个程序基因中仅13个可测量,且所定义程序中的全部9个HLA基因均不可用。匹配随机基因集支持广泛但非普遍(24/30 DLBCL,18/24背景/对照,42/54总体;25/32主要加探索性),而两个深度调整残差终点在30/30 DLBCL区域-程序组合中均获得支持。
结论: 这些发现支持连续程序层面的解释,同时保留明确的来源、稳定性、检测方法、分析方法和采样局限性。
论文解读文章
研究背景与科学问题
弥漫性大B细胞淋巴瘤(diffuse large B-cell lymphoma,DLBCL)是一种生物学高度异质性的恶性肿瘤。细胞起源(cell-of-origin,COO)分类和基因组分类虽能捕捉重要的肿瘤内在变异,但免疫、基质和增殖相关的转录特征在不同肿瘤及组织区域间同样存在显著差异。近年来,空间转录组学(spatial transcriptomics)、单细胞和数字病理学研究为肿瘤微环境的组织架构提供了日益精细的视角,然而大多数具有临床结局注释的大型队列仍为批量转录组数据集(bulk transcriptomic datasets),缺乏空间坐标信息。
将空间信息驱动的生物学知识迁移至批量队列面临关键的方法学挑战。批量基因集评分是丰度与状态加权的转录组测量值,既不能重建空间结构,也不能直接估计细胞比例或证明细胞间相互作用。相关程序评分可能形成连续轴而非稳定类别,且空间数据中不完整的基因检测可能改变评分解释。既往研究多采用离散生态系统分类框架,但离散分类的稳定性缺乏系统评估。此外,不同研究间程序基因来源不一、共享基因重叠、检测平台差异等因素均可能影响跨队列可比性。因此,亟需建立一个以连续程序为核心、明确模型形式判定和敏感性分析框架的研究体系。
研究设计与核心方法
研究人员评估了六个基于文献的精选复合程序(curated composite programs),涵盖巨噬细胞富集(Macrophage-rich)、T细胞炎症(T cell-inflamed)、抗原呈递(Antigen-presentation)、基质/纤维化(Stromal/fibrotic)、免疫冷/排斥(Immune-cold/exclusion)和增殖/细胞周期(Proliferative/cycling)程序,每个程序含22个成员基因,共132个成员关系、121个独特基因和11个共享成员关系。
研究使用了多个公开数据集:GSE31312(n=498)作为发现队列,用于连续程序评分、COO比较、主成分分析和候选k值判定;GSE10846(414例临床活检及6例分选谱)和GSE181063(n=1,310)用于外部结构一致性验证;GSE182434(含14,368个DLBCL细胞,来自四名患者八个样本)用于单细胞背景描述;GSE276542(九个捕获区域,其中五个为主要DLBCL区域)用于空间分析。
关键技术方法包括:单样本基因集富集分析(single-sample gene set enrichment analysis,ssGSEA)和UCell评分用于程序打分;主成分分析(principal component analysis,PCA)刻画低维连续几何结构;ConsensusClusterPlus共识聚类结合四项绝对保留标准(平均轮廓系数>0.25、最小簇规模≥25、最小簇中位自举Jaccard≥0.60、总体中位自举Jaccard≥0.75)进行候选离散分类判定;Hartigan峰度检验(dip test)、高斯混合模型贝叶斯信息准则(Gaussian-mixture Bayesian information criterion,BIC)比较、10,000次特征值置换和Hopkins聚类性统计量作为模型形式补充诊断;MCP-counter v1.2.0用于正交丰度基准验证;Moran's I、Geary's C和双变量Moran's I用于空间自相关评估;匹配随机基因集检验和深度调整残差分析用于空间敏感性控制;Cox比例风险模型用于探索性生存分析。
研究结果
程序来源与COO相关变异: 六个程序在GSE31312的498个样本中均完成评分。直接来源核心基因数从0到17不等:巨噬细胞富集17/22、T细胞炎症15/22、抗原呈递8/22、基质/纤维化16/22、免疫冷/排斥0/22、增殖/细胞周期9/22。所有六个程序的分布在不同COO组间存在差异,Benjamini-Hochberg校正后错误发现率(false discovery rate,FDR)均低于0.05,eta-squared估计值范围为0.0114至0.0664,效应量小至中等。MCP-counter正交基准显示,基质/纤维化程序与成纤维细胞评分在三个队列中相关性最强(r=0.829-0.926),但去除全部121个程序基因后该关系因标记物不足而不可评估。多变量丰度模型的校正R2范围为0.338-0.771。
连续几何结构与无保留分类: PC1和PC2分别解释了GSE31312评分方差的48.6%和20.8%。在修订期间预先定义的四项绝对保留标准下,k=2满足平均轮廓系数标准(0.262>0.25)和最小规模标准,但未通过两个自举稳定性阈值(最小簇中位Jaccard为0.545对0.60;总体中位Jaccard为0.669对0.75)。k=3-6均未通过全部四项绝对标准。峰度检验未拒绝PC1(P=0.804)和PC2(P=0.904)的单峰性,而高斯混合BIC倾向两个分量(delta BIC=30.3)。PC1和PC2均超过10,000次置换特征值零分布(经验P<0.001)。Hopkins统计量为0.999535,提示强聚类信号,但需与峰度检验、自举稳定性和预设保留标准联合解读。最终未选择k值,未分配分类学标签。
批量一致性及评分敏感性: 历史主分析中,GSE10846(n=420)和GSE181063(n=1,310)的15边相关向量与GSE31312的Spearman rho分别为0.936和0.982。仅排除两个共享基因边时rho降至0.907;排除五个增殖/细胞周期相关边时rho降至0.830;同时排除两类边时rho进一步降至0.690。历史GSE10846绝对边差异均值为|delta r|=0.154,最大值为0.438。在新协调的n=414未分选临床活检敏感性分析中,完整评分rho为0.957和0.975,去重叠为0.946和0.950,共同检测基因评分为0.950和0.979。协调化并未一致改善绝对边一致性,但边秩结构得到实质性保留。
描述性单细胞背景: GSE182434全数据集含28,416个细胞,其中DLBCL细胞14,368个来自四名患者八个样本,保留九个CellType注释。基质/纤维化评分在单核细胞/巨噬细胞区室中最高,但成纤维细胞和内皮细胞注释缺失,无法直接检验基质谱系定位。因包含B细胞分选和非分选样本,细胞类型比例和阈值分数仅具描述性,不能解释为无偏组织组成。
空间组织及敏感性分析: 在30个DLBCL区域-程序组合中,Moran's I范围为0.090至0.928(中位数0.639),24个背景区域组合范围为0.241至0.802(中位数0.486)。空间自相关并非DLBCL组织所独有。Cap.area6 T细胞炎症组合具有最低的Moran's I(0.090)和最弱的评分方法一致性(rho=0.190),被判定为弱效应、方法不稳定、低置信度结果。在108个方法比较中,中位Spearman rho为0.878,18/108低于0.7,其中17个涉及ssGSEA。匹配随机基因集在Moran和Geary两个终点均获得支持的有24/30 DLBCL组合、18/24背景组合、42/54总体组合和25/32主要加探索性组合。深度调整残差两个终点在30/30 DLBCL区域-程序组合中均获支持。直接来源核心敏感性在21/30组合中可评估,9个组合不可评估。在所有Visium V2区域中,抗原呈递系列仅保留13/22基因且缺少全部9个HLA基因,因此报告为AP残差(HLA未测量),不能解释为完整抗原呈递程序。
探索性连续程序生存分析: 在24个程序-模型结果中,4个名义P<0.05,无一达到BH-FDR≤0.05。分析集包括233例R-CHOP样完整病例(60个事件)、182例临床校正完整病例(47个事件)和181例正时间完整病例(46个事件)。无生存关联通过多重校正,结果呈探索性/阴性,不支持预后验证或风险分类器。
表达型配体-受体支持: 十个精选配体-受体轴的同一斑点及邻域指标保留了阳性、阴性、不显著和不可评估结果,仅表明空间表达相容性,不建立直接信号传导、细胞间通讯或因果关系。
讨论与结论
研究人员强调核心结果是模型形式的转变:六个相关程序和两个连续轴捕捉了GSE31312的主要变异,但无候选离散分类通过稳定性标准。外部证据支持程序关系的限定性跨队列一致性而非类别标签。正交基准显示广泛群体评分解释了实质性但不完整的程序变异。单细胞结果提供谱系背景而非细胞起源证明。空间捕获区域是分析性组织单位而非独立患者,空间自相关支持切片内组织但非疾病特异性。程序来源不对称性(直接来源核心从0到17个基因)支持程序特异性解释而非将六个复合程序视为同等来源基础的已发表特征。
研究结论为:六个基于文献的精选复合程序提供了约束感知的连续表示,涵盖DLBCL相关的免疫、基质和增殖变异。其关系在独立批量队列中表现出限定性跨队列一致性,描述性单细胞数据提供了有限谱系背景,空间分析展示了非随机的切片内组织,并明确了背景、检测方法、覆盖率、方法和采样边界。无候选离散分类表现出足够稳定性以供保留,可能的k=2结构仍受稳定性限制。最终未选择k值,未分配分类学标签。