基于并行门控循环单元神经网络的单细胞RNA测序数据丢失事件插补方法(IPGRU)

《Quantitative Biology》:An imputation method for single-cell RNA sequencing data based on a parallel gated recurrent unit neural network

【字体: 大 中 小 】 时间:2026年09月30日 来源:Quantitative Biology 2.2

编辑推荐:

  单细胞RNA测序(scRNA-seq)可产生高维转录组数据,但受到丢失事件(dropout events)的严重影响,这些事件会掩盖真实的基因–基因关系。这些缺失值给下游分析引入偏倚,使数据处理复杂化并降低分析效率。因此,对丢失事件进行准确插补对于恢复真实表达

单细胞RNA测序(scRNA-seq)可产生高维转录组数据,但受到丢失事件(dropout events)的严重影响,这些事件会掩盖真实的基因–基因关系。这些缺失值给下游分析引入偏倚,使数据处理复杂化并降低分析效率。因此,对丢失事件进行准确插补对于恢复真实表达信号和提高scRNA-seq研究的可靠性至关重要。在本研究中,研究人员提出了一种新的scRNA-seq数据插补方法,即基于并行门控循环单元神经网络的插补方法(imputation with a parallel gated recurrent unit neural network,IPGRU),其基于并行门控循环单元(GRU)神经网络。IPGRU将原始多特征预测问题重构为多个单特征预测任务,从而大幅降低插补过程的复杂度。通过利用表达基因与缺失基因之间的依赖关系,研究人员采用GRU隐藏状态建模基因表达模式并预测丢失事件,从而有效校正缺失值并提高数据完整性。实验结果表明,IPGRU在插补丢失事件方面达到高准确度,并显著增强scRNA-seq数据的完整性。此外,插补后的数据为下游分析提供了更可靠的输入,包括细胞聚类和分化轨迹推断。IPGRU为scRNA-seq数据插补提供了稳健且高效的解决方案,提高了下游生物学分析的准确性和可靠性。该方法具有强大潜力,可促进生物学发现并推动精准医学发展。
论文解读

scRNA-seq(单细胞RNA测序)能够在单细胞分辨率测量基因表达谱,揭示复杂组织中的细胞异质性,相比传统bulk RNA测序仅捕获异质细胞群平均表达水平,可更准确刻画单细胞水平基因表达差异。然而,scRNA-seq数据受技术限制,存在缺失、高噪声和稀疏性,零表达值即丢失事件(dropout events)可由RNA捕获和扩增低效、内源基因低表达或随机转录丢失引起。高比例丢失事件会扭曲基因–基因关系,损害聚类中的细胞类型识别,并使下游分析产生偏倚。因此,研究人员需要有效插补策略,特别是基于深度学习的策略,以恢复真实基因表达模式并提高scRNA-seq数据分析质量和可靠性。虽然基于GRU的深度学习插补方法通常优于传统统计方法,但现有模型在高丢失率scRNA-seq数据上常与生物学真相存在明显偏差。一个关键挑战是scRNA-seq表达序列固有较长且稀疏,深度学习模型难以有效捕获长程依赖,常导致选择性记忆丢失;将长序列分割为较短子序列可增强特征提取并改善模型性能。

在此背景下,研究人员提出IPGRU(基于并行门控循环单元神经网络的插补方法),将原始多特征预测问题转化为多个单特征预测任务,通过并行分割大幅降低模型复杂度并提高学习效率。与依赖全局潜在表示的自编码器方法不同,IPGRU将插补问题分解为多个局部预测任务,能更有效学习基因特异性依赖,提高高维基因依赖建模的可处理性,并在高度稀疏数据场景中增强稳健性。研究人员在多个不同规模scRNA-seq数据集上开展插补准确性和细胞聚类实验,结果表明IPGRU达到先进性能;插补后的数据为下游细胞聚类和分化轨迹推断提供更可靠输入。该研究意义在于为scRNA-seq数据插补提供稳健高效方案,提高下游生物分析准确性和可靠性,并有潜力促进生物发现和精准医学。

关键技术方法概括:研究使用五个公共插补评估数据集:PBMC_G949_21K、GTEx4tissues、MAGIC_mouse、PBMC_G949_10K、PBMC_G5561;下游分析使用human bone marrow、dentate gyrus neurogenesis、pancreas。数据来源包括10x Genomics、GTEx Portal V7、GEO GSE72857、Human cell atlas、GEO GSE95753、GEO GSE132188。方法为:表达矩阵随机分成N个300基因子集,目标基因与top 5相关基因构成预测基因;Pearson相关系数构建相关矩阵,核主成分分析选相关基因;并行sub-GRU训练,第二层768个GRU,第三层640个GRU,连接300神经元全连接层,dropout率0.5;Adam优化器,学习率0.001,batch size 32,epoch 100,早停;MSENZ为损失函数,用MSENZ、MSE和Calinski–Harabasz分数评估。

研究结果:

2.1 数据集
研究人员使用五个公共数据集评估IPGRU和其他方法。PBMC_G949_21K来自10x Genomics PBMC_G949数据集,选取949个基因和21,065个细胞,非零率为40.90%,直接作为ground truth。GTEx4tissues来自GTEx Portal V7,选取肌肉564、心脏600、皮肤1203和脂肪797个样本,非零率49.8%;因其来自bulk测序且含较多沉默基因,研究更关注MSE。MAGIC_mouse是小鼠骨髓数据集,原始数据稀疏,包含不同分化阶段造血干细胞,用MAGIC方法生成估计矩阵作为ground truth,随机选30%用于训练。PBMC_G949_10K同样来自PBMC_G949数据集,选取相同949个基因并子采样10,000个细胞,非零率33%,dropout率设为20%。PBMC_G5561来自10x Genomics PBMC,含5561个基因和21,065个细胞,非零率9.9%,用于评估高缺失率下方法性能。为验证下游分析,研究选择human bone marrow(5780个细胞、过滤后2000个基因)、dentate gyrus neurogenesis(2930个细胞、2000个基因,已知从OPL到OL的分化轨迹)和pancreas(2531个细胞、2000个基因,包含多个发育谱系)。为处理高稀疏性,研究人员开发基于逻辑回归的零模拟框架,根据非零表达值大小动态计算归零概率,保留真实零生物学意义并精确控制技术零比例,评估20%、30%和40% dropout。

2.2 实验结果
研究人员将IPGRU与MAGIC、DeepImpute、AutoImpute和DCA比较。MSENZ结果显示,IPGRU在四个数据集中持续取得最低误差,尤其在GTEx4tissues上最低误差为0.033385,表明其插补性能和数据适应性较好。MSE结果显示,IPGRU同样在四个数据集取得最低误差,在PBMC_G949_21K为0.007482,在PBMC_G949_10K为0.006923,在GTEx4tissues为0.05437,说明其在高维数据中保持稳健。MAGIC_mouse中,因该数据集由MAGIC合成,向scRNA-seq引入非零值,IPGRU无法区分基因是真实表达还是由MAGIC生成,因此在该两项结果中可能不如其他方法。研究人员还在不同dropout率下对用于轨迹推断分析的数据集进行实验:在human bone marrow中,IPGRU在20%、30%和40% dropout下MSENZ分别为0.000948、0.000952和0.000959,优于MAGIC约三至四倍,并在较高dropout率下略优于DeepImpute;在pancreas中,IPGRU在20% dropout与DeepImpute并列最低,在30%和40% dropout最低,并持续优于AutoImpute、DCA和MAGIC。总体,IPGRU在MSE和MSENZ上提供准确性和一致性最佳平衡,并随缺失比例增加保持稳健竞争性插补精度。

2.3 下游分析结果比较
scRNA-seq数据集通常由异质性细胞类型混合组成,高dropout率严重掩盖细胞间转录差异。研究人员在human bone marrow、dentate gyrus neurogenesis和pancreas三个人工注释数据集上,在模拟40% dropout条件下进行聚类分析,并用UMAP统一重建细胞群低维流形结构。原始输入数据中,细胞高度混杂、簇碎片化且重叠,细胞类型可分性差,尤其human bone marrow中HSC1和HSC2缺乏清晰边界。IPGRU插补后,三个数据集均呈现明确且紧凑的簇,主要细胞群清晰分离。在human bone marrow中,IPGRU将HSC1和HSC2分为紧凑非重叠簇,并清晰区分Ery1和Ery2与髓系(Mono1、Mono2、DCs、Mega等),其空间组织反映已知造血分化层级。在pancreas中,IPGRU对内分泌细胞群如beta、alpha、delta和epsilon细胞产生高度一致聚类,UMAP嵌入呈现与发育关系一致的平滑梯度;MAGIC错误地将alpha细胞群细分为两个簇,提示过度平滑。DeepImpute和AutoImpute表现中等,主要细胞类型部分分离但边界模糊且稀有细胞群重叠。DCA插补保守,降低噪声但未完全解决dropout导致的簇内混合。MAGIC基于扩散的平滑偶尔导致过度离散,在dentate gyrus neurogenesis中嵌入碎裂为多个小而不连通亚簇,破坏预期连续发育轨迹。轨迹推断中,研究人员在human bone marrow上用stochastic scVelo模型推断分化轨迹,原始40% dropout数据轨迹分支模糊、速度向量错位;IPGRU插补数据恢复平滑连续分化路径,分支点速度向量方向一致。cross-boundary confidence score显示,IPGRU在20%、30%和40% dropout率下均高于原始输入,甚至高于完全原始无模拟dropout数据;与其他方法比较,IPGRU产生最连贯且生物学合理的分支结构。计算效率方面,各方法总内存使用约2.34–2.38 GB;AutoImpute和DeepImpute分别有122,010和160,010个参数,平均推理时间5 ms;DCA有8106个参数,推理时间6 ms;IPGRU有788,780个参数,推理时间约14 ms。

讨论部分总结:研究人员指出,并行GRU神经网络在预测中隐式学习基因–基因依赖,产生基因相关系数矩阵,捕获基因表达模式相似性,识别高度相关基因组,促进缺失基因表达值准确插补。通过建模非线性基因依赖,该框架帮助恢复被破坏的基因关系,支持重建有生物学意义的基因共表达网络。与现有插补方法不同,IPGRU引入任务分解策略,将原始多特征预测问题分割为多个独立单特征预测子网络,降低模型复杂度并提高高维scRNA-seq数据计算效率;每个GRU模块学习依赖结构,通过循环建模识别和校正dropout事件,减轻异常值和技术噪声影响。GRU单元记忆机制使模型捕获复杂基因表达动态,反向传播逐步细化网络参数以提高前向预测准确性。局限包括:GRU架构比卷积神经网络计算需求更高,虽比LSTM模型高效,但sigmoid和tanh等非线性激活增加计算开销;区分技术dropout与生物学意义零仍具挑战;本研究未纳入scGNN等GNN方法基准,因建模范式和实现复杂度差异,未来将探索与GNN方法全面比较及图与循环架构整合。

研究结论翻译:在本研究中,研究人员开发了IPGRU,一种用于插补scRNA-seq数据中丢失事件的并行门控循环单元神经网络。通过将原始多特征预测问题分解为多个并行单特征预测任务,IPGRU有效建模基因特异性依赖,同时降低高维插补复杂性。在多个基准数据集上,IPGRU取得持续较低的MSE和MSENZ,与MAGIC、DeepImpute、AutoImpute和DCA相比达到竞争性或更优性能。此外,不同dropout率下评估显示,随着数据稀疏性增加,IPGRU保持稳健插补准确性。插补后的数据集还改善下游细胞聚类和分化轨迹推断,产生更清晰分离的细胞群和生物学一致的谱系结构。总体上,IPGRU为恢复scRNA-seq数据中缺失表达信号和提高下游生物分析可靠性提供了有效且稳健的框架。然而,该模型比若干竞争方法具有更多参数和更长推理时间,且区分技术dropout与生物学意义零仍具挑战。未来工作将关注提高计算效率、增强模型可解释性,并将循环架构与基于图的方法整合,以更好捕获细胞–细胞和基因–基因关系。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号