《International Journal of Molecular Sciences》:Integrating Mutation-Derived and Expression Features from Single-Cell RNA Sequencing: Pitfalls of Standard Cross-Validation in Small-Cohort Settings
编辑推荐:
单细胞RNA测序(single-cell RNA Sequencing, scRNA-seq)研究日益结合基于表达的信号与突变衍生信号,但来自同一生物学单元的重复运行所构成的小队列设计可能使标准交叉验证(Cross-Validation, CV)过于乐观。研究
单细胞RNA测序(single-cell RNA Sequencing, scRNA-seq)研究日益结合基于表达的信号与突变衍生信号,但来自同一生物学单元的重复运行所构成的小队列设计可能使标准交叉验证(Cross-Validation, CV)过于乐观。研究人员重新分析了PRJNA736095(来自7个GSM/供体代理的14个SRR运行),采用以GATK为中心的RNA-seq变异检出(variant-calling)与基因负荷(gene-burden)工作流程,随后在每个验证折(fold)内采用防泄露(leakage-safe)预处理评估了突变衍生、仅表达及组合特征集。运行级(run-level)重复分层交叉验证显示GATK基因负荷特征具有较高的数据集内可分离性(平衡准确率(balanced accuracy)0.973 ± 0.113),但GSM分组留一法(leave-one-GSM-out)验证将平衡准确率降至0.708,且精确的GSM级置换检验(permutation testing)不显著(p = 0.257)。仅表达与组合特征集在GSM分组的平衡准确率上未优于仅变异分支。经伪发现率(False Discovery Rate, FDR)校正后,表达–突变标记重叠不显著,且公共外部数据集仅用于定义可行性或处理的生物学背景,而非作为强有力的外部分类器验证。这些发现将该工作流程定位为一个可审计的、假设生成的框架,并强调了小队列scRNA-seq机器学习分析中标准交叉验证的陷阱。
研究背景方面,单细胞RNA测序(single-cell RNA Sequencing, scRNA-seq)已变革了对细胞异质性的研究,使复杂生物系统转录状态的高分辨率分析成为可能。近期单细胞图谱深入揭示了组织构成、疾病进展等过程,与此同时机器学习(Machine Learning, ML)技术已成为高维基因组数据分析的重要工具。然而现有计算手段多聚焦基因表达谱,突变衍生信号探索不足,且二者常独立分析而未显式建模关系,限制了跨分子层互补信号的捕获。多组学整合(multi-omics integration)虽是方向,但多适用于大队列或批量测序,直接用于小队列scRNA-seq存在过拟合风险。关键挑战在于数据泄露(data leakage):当多个样本源自同一供体或元数据组时,标准交叉验证(Cross-Validation, CV)会将相关观测拆分至训练与测试集,引入隐藏依赖并夸大性能。本研究旨在以可重复性框架整合scRNA-seq中表达相关与突变衍生特征,强调以GATK为中心的基因负荷流程、防泄露验证、精确GSM级置换检验及相同拆分下的特征集比较,将运行级CV作为可分离性对照,GSM分组验证作为首要独立性检验。该研究发表于《International Journal of Molecular Sciences》。
关键技术方法方面,研究人员使用公开数据集BioProject PRJNA736095,含7个人类供体代理的14个scRNA-seq运行(8个未受伤皮肤,6个伤口边缘)。采用STARsolo进行读段比对与细胞条形码解复用,输出BAM并经SAMtools处理。变异检出(variant-calling)采用GATK(版本4