《Nature Biotechnology》:Bonsai reconstructs tree representations for distortion-free visualization and exploration of high-dimensional data
编辑推荐:
单细胞组学方法提供了高维细胞状态的稀疏、噪声测量,其潜在分布仍知之甚少,迫切需要探索性分析和可视化方法。然而,当前方法是临时的且不可解释,并扭曲了数据中的结构。研究人员通过将数据表示为树结构克服了这些挑战,并提出了Bonsai,一种重构与任意高维对象集合相关的
单细胞组学方法提供了高维细胞状态的稀疏、噪声测量,其潜在分布仍知之甚少,迫切需要探索性分析和可视化方法。然而,当前方法是临时的且不可解释,并扭曲了数据中的结构。研究人员通过将数据表示为树结构克服了这些挑战,并提出了Bonsai,一种重构与任意高维对象集合相关的最大似然树的方法,该树可处理任意异质测量噪声。Bonsai自动正则化噪声,准确恢复分化轨迹,保留高维距离并改进最近邻识别。当应用于血细胞数据时,Bonsai不仅准确恢复了已知的谱系关系,还发现了一种源自髓系谱系的自然杀伤细胞(NK细胞)亚型,指出了区分髓系NK细胞与淋巴系NK细胞的基因。Bonsai没有可调参数,通过Bonsai-scout整合了下游探索性分析方法,并可扩展到大型数据集,使其适用于可视化任何高维对象集合中的结构。
单细胞组学方法(如scRNA-seq和scATAC-seq)提供了高维细胞状态的稀疏、噪声测量,但其潜在分布仍不明确,现有可视化方法(如t-SNE和UMAP)严重扭曲数据结构,导致虚假结构推断。为解决这一难题,研究人员提出基于树结构表示高维数据,并开发了Bonsai方法。Bonsai从最小假设出发,构建无参数可调的贝叶斯模型,通过最大化似然重建以细胞为叶节点的树,准确反映基因表达空间中的分化轨迹,同时保留全局距离关系。该研究发表在《Nature Biotechnology》。
主要技术方法方面,Bonsai采用Sanity算法对原始计数进行预处理,获得每个基因在每个细胞中的表达估计(log转录商,LTQ)及其误差棒。基于马尔可夫过程的假设,利用连续版本的Felsenstein修剪算法递归计算树似然,并通过贪婪添加内部节点、子树剪枝重接(SPR)和最近邻交换(NNI)等局部搜索策略优化树结构。针对大规模数据集,Bonsai提供基于骨干树的加速版本,先对随机细胞子集重建骨干树,再逐步添加其余细胞。此外,Bonsai整合了Cellstates算法进行细胞状态聚类,并开发了交互式可视化工具Bonsai-scout,支持多种布局、基因表达叠加和标记基因检测。样本队列来源包括脐带血细胞(CITE-seq数据集)、视网膜图谱(1.2M细胞)、Tabula Muris和Tabula Sapiens等公共数据集。
研究结果部分:
**1. 模拟数据上,Bonsai树表示准确恢复所有尺度上的细胞间距离**
通过构建六组模拟scRNA-seq数据集(包括不平衡树、随机分支长度、基因相关性等复杂性),Bonsai几乎完美恢复真实分化轨迹,而PCA、UMAP、PHATE和DTNE等方法严重失真。Bonsai的细胞间距离与真实欧氏距离的相关系数接近1,显著优于其他方法。
**2. 维度祝福**
即使数据并非源自树结构(如随机散点或伪批量聚类),Bonsai树仍能准确保留高维空间中的成对距离。随着维度增加(从2维到10,000维),树表示的准确性持续提升,表明高维空间中几乎所有方向相互正交,使得距离沿树的分支求和,从而实现无失真表示。
**3. Bonsai在最近邻识别上优于现有方法**
在模拟和真实数据上,Bonsai通过树结构正则化,改善了单个细胞的估计位置,其最近邻识别准确率显著高于Sanity、PCA、UMAP等。随着测量点数增加,Bonsai的估计精度进一步提高,而其他方法则下降。
**4. Bonsai可扩展至大型细胞图谱**
标准Bonsai算法处理≤30,000细胞的数据集耗时<1天,骨干树模式可处理超过100万细胞(如视网膜图谱1.2M细胞),计算时间近似为C
1.15,内存占用可控。
**5. 交互式可视化与下游探索分析(Bonsai-scout)**
Bonsai-scout支持等日光布局、树的重心移动、分支翻转、细胞类型注释叠加、基因表达展示等。提供无监督(基于最小化配对距离的迭代切枝)和监督(基于归一化互信息NMI最大化的切枝)聚类方法,在Bgee数据库测试中与Leiden/Louvain聚类结果相当。此外,可识别区分不同枝系的标记基因,通过计算细胞对间表达差异的概率实现。
**6. Bonsai自动识别前体状态或不同发育阶段的细胞**
在模拟数据中,将前体细胞作为内部节点加入时,Bonsai通过短末端分支将其连接到正确位置,根到细胞的距离与发育阶段高度相关。在秀丽隐杆线虫发育数据集上,Bonsai树的分支时间顺序与注释的发育阶段一致。
**7. Bonsai推断血细胞类型的分化轨迹**
对脐带血单核细胞(7,509细胞,含CITE-seq表面蛋白标记)进行分析,Bonsai树准确重建了已知的造血分化层次(HSC→髓系/淋巴系,红细胞、巨核细胞、T细胞、B细胞、NK细胞等),仅巨核细胞被置于髓系分支而非红细胞分支(与部分文献一致)。值得注意的是,Bonsai发现NK细胞分为两个枝系:一个位于淋巴系分支(924个细胞),另一个位于髓系分支(155个细胞)。通过表面标记(CD56、CD16)和mRNA标记(NKG7)验证,确认髓系NK细胞表达髓系标记CD11c和NK标记,排除双细胞假象。该结果在骨髓数据集(~30,000细胞)中得到复现,且标记基因分析揭示髓系NK细胞上调与识别外来分子模式、金属离子螯合和抗菌颗粒释放相关的基因,而淋巴系NK细胞上调与细胞裂解和抗病毒/肿瘤相关的基因(如MHC I类分子)。
**总结讨论部分**,研究人员指出Bonsai通过树表示实现了无失真可视化,在模拟和真实数据上显著优于现有方法,并发现了髓系来源的NK细胞亚型。Bonsai的树结构为下游分析(如基因表达变化量化、共调控网络推断、分化事件定位)提供了新途径。未来扩展方向包括:整合基因表达相关性改进概率模型;处理批次效应(已实现简单修正);应用于多模态数据(如scATAC-seq);结合谱系追踪数据(如条形码突变)进行联合重建;以及推广至其他生物高维数据(如流式细胞术、宏基因组学等)。研究结论部分翻译如下:Bonsai方法成功实现了scRNA-seq数据结构的无失真可视化,利用“维度祝福”效应准确保留高维距离,在血细胞数据中恢复了已知分化层次并发现新的髓系NK细胞亚型,且无参数调整,可扩展至大规模数据集,为高维数据探索提供了强大工具。