《Nature Biotechnology》:Deep learning perturbation models can outperform baselines on calibrated metrics
编辑推荐:
近期基准测试报道称,基于深度学习的遗传扰动模型未能优于无信息基线。研究人员引入阳性对照基线与指标校准框架,在14个数据集与18个指标上表明,常用基准指标(例如均方误差(MSE)与 Pearson Δ)经常未校准,对正向模型性能的敏感性降低。在校准良好的指标下,
近期基准测试报道称,基于深度学习的遗传扰动模型未能优于无信息基线。研究人员引入阳性对照基线与指标校准框架,在14个数据集与18个指标上表明,常用基准指标(例如均方误差(MSE)与 Pearson Δ)经常未校准,对正向模型性能的敏感性降低。在校准良好的指标下,研究人员发现基于深度学习的遗传扰动模型能够优于无信息基线。此前研究人员已识别出控制偏倚(control bias)与信号稀释(signal dilution)两类假象,使均值基线(mean baseline)看似具有预测性。研究人员提出技术重复基线(technical-duplicate baseline)作为阳性对照,并在 Replogle22 K562 基因组规模 Perturb-seq(GWPS)数据中观察到其表现不稳定,根源在于每个扰动平均差异表达基因(DEG)数很少时的信号稀释。随后研究人员提出插值重复基线(interpolated duplicate),按 DEG P 值以 α=1?PDEGs 在技术与均值基线间逐基因插值。为量化指标敏感性,研究人员定义动态范围分数(dynamic range fraction, DRF)= [m(?p)?m(?n)] / [m(y)?m(?n)+ε],其中 ?n 为均值基线,?p 为插值重复基线,y 为真值。对18个指标(直接重建误差、参考基线 delta 指标、检索指标、DEG 指标)的评估显示,MSE 与 Pearson(Δctrl) 在弱扰动数据集中校准差;加权 MSE(WMSE)、加权 RΔ2、归一化逆排序(NIR)等更强调扰动特异信号,校准更高。在未见过的遗传扰动预测任务中,Replogle22 K562 与 Nadig25 HepG2 数据集下,scGPT 与 GEARS 在校准指标上大多优于无信息基线;PRESAGE、scLambda 等较新模型甚至在未校准指标上也可超越基线。在未见组合预测任务中,Norman19 因约96%效应可加且组合覆盖仅0.63%,加性基线难以被超越;Wessels23 训练集覆盖10.3%组合,PRESAGE 等在 WMSE 与加权 RΔ ctrl2 上超越加性基线。下游通路恢复与邻域结构恢复结果与校准指标排名相关。该框架不绑定特定正负对照,且仍需多类指标联合评估;研究重申遗传扰动建模在校准感知评价下具备可行性。
论文解读:《Nature Biotechnology》刊发的这项研究开发了一套面向遗传扰动响应预测的基准评测与指标校准体系。研究背景方面,遗传扰动建模旨在预测抑制或激活一个或多个基因后的转录组影响,以支撑治疗靶点发现中的可扩展计算机筛选。然而近期多项独立基准测试指出,深度学习模型在 MSE、MAE、Pearson(Δctrl) 等指标上常不优于均值基线这类无信息基线,引发该方向是否可行的争论。其背后存在两类已被识别的假象:一是控制偏倚,即控制细胞与扰动细胞间的系统性差异抬高了以控制为参照的相关性指标;二是信号稀释,即当扰动仅引起少量但显著的差异表达基因(DEG)时,全局误差指标会把有意义的生物信号稀释掉,使均值预测看起来很准。现有基准多有阴性对照而缺阳性对照,因此模型得分低既可能是模型真失败,也可能只是指标不够灵敏,这一模糊性正是本研究要解决的动机。
研究人员开展了如下工作:在14个数据集、18个指标上系统评估基准指标的校准性;提出以插值重复基线作为阳性对照、以均值基线作为阴性对照,并定义动态范围分数(dynamic range fraction, DRF)来度量指标能否区分阳性与阴性对照。结论是,常用指标如 MSE 与 Pearson(Δctrl) 常未校准,而加权 MSE(WMSE)、加权 RΔ2、归一化逆排序(NIR)等强调扰动特异信号的指标校准更好;在此类校准指标下,从 scGPT、GEARS 到 PRESAGE、scLambda、CellFlow 的多种深度学习模型都能超越无信息基线。该研究的重要意义在于把“模型不行”的部分结论重新解释为“指标不行”,为遗传扰动建模提供了更公平的评测基础,论文发表于《Nature Biotechnology》。
关键技术方法上,研究人员整合 scPerturb 及 Zenodo、Figshare、GEO 等来源的14个遗传扰动数据集,覆盖9项研究、10种细胞系与激活/抑制扰动。处理流程包括过滤低质量细胞与基因、文库量归一化至10000后取 log1p、按每扰动细胞均值平衡抽样、选取高变基因(HVG)与所有被扰基因;将每扰动细胞固定拆分为真值半与技述重复半以避免泄露。方法学核心包括:定义控制基线、均值基线、技术重复基线、插值重复基线(μi,ID=α⊙μi,TD+(1?α)⊙μall,α=1?PDEGs);以 DRF 做指标校准;用18个指标跨直接误差、参考 delta、检索、DEG 子集四类评估;对 Replogle22 K562、Nadig25 HepG2、Norman19、Wessels23 做未见单扰动与未见组合预测;以通路富集与 KNN 图秩偏重叠(RBO)做下游结构恢复;并通过细胞数、UMI 深度、HVG 数敏感性分析验证框架稳健性。
研究结果部分保留小标题如下。Evaluating the calibration of benchmarking metrics:研究人员用技术重复与插值重复基线计算 DRF,发现 MSE 在弱扰动数据集校准差,WMSE 在14个数据集上比 MSE 拥有更高动态范围分数,热图中加权与排序类指标整体校准更强,说明指标家族本身决定了对扰动特异信号的灵敏度。
Benchmarking under well-calibrated metrics for unseen genetic perturbation prediction and unseen combination prediction:在 Replogle22 K562 中,scGPT 与 GEARS 在 WMSE、加权 RΔ ctrl2 上大多显著优于均值基线;Nadig25 HepG2 复现该结论。Norman19 组合任务中加性基线很强,深度模型仅在部分指标超过它;Wessels23 组合覆盖更高,PRESAGE 在15/18指标超越加性基线,说明组合空间覆盖足够时深度学习可学非加性交互。
Metric families and downstream recovery:研究人员展示模型在不同指标族间表现分化,scGPT 低 WMSE 但 Pearson(Δpert) 接近均值基线。通路恢复与校准指标排名相关(Replogle22 K562 ρavg=0.76,Wessels23 ρavg=0.84);邻域恢复与 NIR/PDS 更相关,表明校准指标能反映下游生物网络分析价值。
讨论与结论翻译:研究人员讨论称,DRF 框架不依赖固定正负对照定义,而是相对任意合理基线评估指标敏感性;直接误差、参考 delta、加权、检索指标各捕获不同行为,应联合使用。MSE 整体比 MAE 校准略好,可作防模型不真实预测的护栏。局限包括未覆盖未见语境任务、组合数据集仍有限、结论属特定时间与模型集合的快照。总体结论为:借助校准感知评价,深度学习遗传扰动模型能够超越无信息基线,先前“模型不及简单基线”的报告部分源于未校准基准,这为遗传扰动建模建立了更乐观且严谨的基础。