编辑推荐:
RNA序列、表达、剪接、异构体、结构和修饰的相关知识对于理解和靶向细胞过程至关重要。革命性的单细胞和空间转录组学技术——例如人类细胞图谱(Human Cell Atlas)等联盟所部署的技术——部分捕获了这一多样性,并生成每年以拍字节(petabyte)规模扩
RNA序列、表达、剪接、异构体、结构和修饰的相关知识对于理解和靶向细胞过程至关重要。革命性的单细胞和空间转录组学技术——例如人类细胞图谱(Human Cell Atlas)等联盟所部署的技术——部分捕获了这一多样性,并生成每年以拍字节(petabyte)规模扩展的细胞图谱1,2,3,4,5。然而,研究人员目前无法跨这些数据集搜索序列:标准分析流程不具备可扩展性或依赖参考基因组,仅保留基因或异构体计数,而访问原始序列则需要收集、下载和处理数百万个大文件。本文介绍了Malva,一个计算平台,能够实现超快速、物种无关且无需参考基因组的原始序列空间查询,支持搜索任何序列、突变、剪接连接或病原体,以及任意转录本的空间位置。持续扩展的Malva索引(Malva Index)目前包含来自健康和疾病状态下数千个实验的约7400万个细胞。Malva实现了无需参考基因组的发现——例如,研究人员可以直接从序列组成中识别细胞类型并预测细胞间相似性。基于Malva的速度和准确性,研究人员展示了如何将Malva灵活连接到最先进的神经网络,以及如何执行复杂搜索和实现自动化分析。Malva将单细胞图谱从静态的基因计数表转变为动态的、序列解析的资源,这可能有助于弥合人类与机器对生物学推理之间的鸿沟。
**Malva:实现单细胞图谱超快速、无参考序列查询的开创性计算平台**
**一、研究背景与问题**
RNA作为生命活动的基础分子,其序列、表达水平、剪接模式、异构体、结构和修饰信息对于理解和靶向细胞过程具有核心意义。过去十年间,新一代测序技术使得在单细胞水平乃至组织切片中进行RNA测序(RNA sequencing, RNA-seq)成为可能。细胞作为生命的基本单位,这些技术深刻改变了生命科学研究,包括医学与临床研究,每年从数亿个细胞中产生拍字节(petabyte)规模的序列信息
1,6,7,8,9。例如,人类细胞图谱(Human Cell Atlas, HCA)联盟系统性地量化健康人体细胞中的RNA
2,3,10,同时研究人员也将这些技术应用于疾病研究
11。此外,大量数据也从类器官等模型系统中产生,并有望应用于研究整个地球的生物多样性
12,13。
面对如此庞大的数据,开发能够将这些碎片化数据集整合为统一资源并实现高效查询的工具至关重要。三十五年前,BLAST为序列数据库开创了这一原则,通过在大规模基因组序列集合中准确定位目标核苷酸序列,以空前的效率革新了生物学研究
14。然而,目前尚无现有的计算工具——如细胞图谱(CELLxGENE, STOmicsDB, Single Cell Expression Atlas等
15,16,17,18,19,20,21)——能够使研究人员高效地在近期产生的大规模单细胞、单细胞核或空间转录组学(single-cell/single-nuclei or spatial transcriptomics, SC/ST)数据中搜索特定RNA序列。这些平台最多仅提供预先计算的、反映比对到参考基因组上的RNA序列聚合数量的基因计数。因此,关键信息缺失:例如无法比对到参考基因组的转录本(如癌细胞中由遗传病变产生的转录本或无法比对到参考单倍型的转录本)、RNA序列编辑、突变、细胞内存在的病原体等。
标准的单细胞和单细胞核分析流程仍然以参考基因组为中心:它们通过将测序读段比对到用户提供的参考基因组来处理数据
22,23,24,25,26。在图谱规模上应用这些方法需要下载和重新处理拍字节级别的原始文件,这超出了大多数实验室的计算资源。相比之下,以样本为中心、直接从数据中索引短子序列(k-mers)的批量化方法,将数据集本身视为可搜索单元,而非强制每个读段通过参考基因组比对。这些方法能够在大规模测序集合中实现超快速搜索(如MetaGraph, REINDEER, Sequence Bloom Tree, Mantis, Fulgor, Themisto和Logan等
27,28,29,30,31,32,33)。这些方法已被证明非常有用:多项研究发现了新的塑料降解酶
33、塑造肿瘤身份的novel RNAs
34,35,36、大型癌症队列中的序列变异
37、基于比对方法无法检测的疾病相关序列
38、共享k-mer模式但缺乏序列同源性的功能相关长链非编码RNA(long non-coding RNAs, lncRNAs)
39,甚至新生命形式
40。然而,这些工具是为批量样本集合(数百到数十万个基因组或实验)设计的。它们的构建通常需要一个从所有输入数据并集构建的压缩de Bruijn图,该操作在添加新数据时必须至少部分重复。注释以标签宽矩阵或倒排列表存储,其大小随标签总数增加而增长;在两种情况下,高效查询通常需要索引驻留在内存中,这在单细胞规模(数千万到数亿个细胞)下将需要太字节(terabyte)级别的随机存取存储器(RAM)。这些特性使得现有工具在此场景下不实用。
为此,研究人员开发了Malva(https://malva.mdc-berlin.de),一个统一SC/ST数据并使其在核苷酸分辨率下高效可搜索的计算平台。Malva包含序列搜索算法、持续扩展的可搜索语料库(Malva索引)和公共应用程序编程接口(API)。正如BLAST的成功依赖于速度和准确性,Malva使序列搜索和分析在图谱规模上变得实用。Malva搜索可以从核苷酸序列、基因标识符或自然语言提示开始,在数秒内对数百万个细胞进行分析,从病毒基因组、种系变异到异构体使用。除了搜索,Malva还可以执行无参考的细胞类型聚类
41,42,43和细胞类型特异性序列的从头组装。Malva不取代基于参考的定量分析流程,后者仍适用于基因水平分析;相反,它通过启用序列水平查询来扩展它们,这些查询在极大规模下否则无法访问,在参考基因组不易获得的情况下也至关重要
13。据研究人员所知,Malva是第一个在单细胞分辨率下进行大规模无参考序列搜索和分析的平台。
**二、研究技术与方法**
研究人员开发了Malva平台,其核心是适应单细胞数据特点的k-mer索引算法。该算法采用非重叠k-mer采样策略,避免了构建压缩de Bruijn图;通过为每个k-mer存储稀疏倒排列表(仅记录表达该k-mer的细胞标识符),将查询成本与总索引大小解耦;并采用独立的每样本索引和增量合并策略,生成了支持内存高效查询和持续语料库扩展的磁盘布局。索引构建通过一个持续爬取公共数据库(主要来自HCA数据门户,同时兼容NCBI SRA、GEO、ENA和CNGBdb)的爬虫实现,提取主要协议的条形码或空间坐标,将每个读段索引并合并到Malva索引中。此外,平台整合了元数据标准化流程(基于text2term v4.5.0映射到标准本体),以及基于标记基因和语言模型的两阶段自动细胞类型注释流程。通过公共RESTful API提供交互式(自然语言查询)和程序化访问,并预计算常用基因的表达矩阵以加速查询。
**三、研究结果**
**单细胞分辨率下的快速序列搜索。** 研究人员解决了三个挑战:在大型数据集中保留核苷酸级分辨率、跨研究标准化元数据、通过API提供去中心化访问。Malva搜索算法将每个读段分解为k-mers(长度为k的子序列),并与来源细胞条形码一起存储,实现无需比对的常数时间查找。在一个包含约610亿读段的Stereo-seq小鼠肝脏图谱上,Malva在24个CPU小时内完成索引,比其他预处理算法快4到25倍,峰值内存占用8GB。查询性能方面,单个k-mer搜索延迟为70毫秒,1kb转录本搜索为0.9秒,单个CPU核心上1000个转录本约需1分钟。定量准确性方面,伪计数(pseudocounts)在细胞和基因水平与参考计数高度相关。细胞类型特异性富集分析与参考方法强相关,聚类结果保留了空间组织和细胞类型分离,发育轨迹分析也紧密再现了参考计数衍生的轨迹。在细胞系混合物基准测试中,Malva索引速度比Flexiplex快4倍,查询毫秒级完成,保持高灵敏度和特异性。Malva还对测序错误具有鲁棒性,在高达2%的错误率下性能稳定。
**大规模捕获细胞多样性。** 研究人员构建了Malva索引,编译了超过140TB的公共SC/ST数据,约70小时完成,编码了来自约5100万个细胞(592项研究,7,966个样本)的超过1000亿个独特24-mers。截至2025年5月,Malva索引覆盖了约80%的人类细胞图谱数据。索引存储足迹不到源文件的10%。Malva索引涵盖所有主要器官系统的胚胎、成人和病理人类样本,具有多样化的细胞类型、供体年龄、性别比例、疾病状态和技术表示。
**超越现有门户的查询能力。** Malva索引能够检测病毒、逆转录病毒和污染序列;复现了单细胞分辨率下人类种系基因型分布,与1000 Genomes Project的等位基因频率强相关;量化了异构体使用(如Ptprc基因的CD45RA/CD45RO异构体转换),并验证了Add2基因3'UTR在空间转录组中的长度调控模式;支持交互式分析环状RNA(circRNA)表达,如CDR1as在脑中的细胞类型特异性;在泛癌规模上检测体细胞突变,在16种癌症类型的280个肿瘤样本中恢复突变阳性细胞,具有高特异性和敏感性。
**从细胞×基因到细胞×序列的分析。** 通过将序列k-mers折叠为相似性桶(bucket),研究人员实现了基于序列的细胞-细胞比较。在约3000万个健康人类细胞上,序列主成分与基因主成分具有可比性。在缺乏高质量参考基因组的非模式生物(如Placozoa门)中尤为有用。在空间转录组学样本中,基于桶的聚类识别出基因表示无法捕获的额外结构,包括与人类rRNA和细菌23S rRNA相关的特定簇。从这些簇中从头组装了标记序列,约70%注释到已知基因,29%为基因间区,约1%未比对。其中一个KLK10的截短3'UTR异构体在肿瘤角化珠结构中富集,而细菌rRNA序列则定位到组织外区域。
**四、讨论与结论**
研究人员构建Malva是为了使原始单细胞和空间转录组序列在(亚)细胞分辨率下可搜索。通过索引数百万个细胞,序列可以无需先归约为基因、转录本或预定义注释而被直接、即时地查询。这使得跨研究搜索和比较剪接连接、突变、病毒序列、合成构建体和非参考RNA成为可能,为人工智能辅助分析提供了检索层。Malva目前的限制包括支持至少24个核苷酸的查询,使用精确k-mer匹配,报告伪计数而非绝对分子计数,索引反映当前可用的公共数据,以及序列搜索可能揭示供体特异性基因型信息的隐私风险。随着单细胞和空间数据集的扩展,可搜索序列索引可能成为重用公共数据的自然方式。未来的版本可能包括更多生物体、空间测序和成像分析、长读长转录组学、染色质可及性、蛋白质组学和RNA修饰等。最终,Malva可能有助于提供一个坐标系统,将自身数据映射到全局数据集,以理解健康和疾病机制及轨迹。该研究发表在《Nature》期刊上。