《PLOS One》:High AUROC can mask decision failure in sepsis transcriptomic classifiers: Preprocessing stability outweighs post hoc calibration across cohorts
编辑推荐:
背景:高AUROC(Area Under Receiver Operating Characteristic Curve,受试者工作特征曲线下面积)常被视作转录组分类器具有前景的证据,但排序判别力可掩盖队列或平台转移后固定阈值的失败。方法:研究人员在四个GEO
背景:高AUROC(Area Under Receiver Operating Characteristic Curve,受试者工作特征曲线下面积)常被视作转录组分类器具有前景的证据,但排序判别力可掩盖队列或平台转移后固定阈值的失败。方法:研究人员在四个GEO全血队列中开展基准测试——GSE65682用于发现,GSE95233用于外部微阵列验证,GSE154918用于跨平台RNA-seq验证,GSE28750用于非感染性炎症应激测试。研究人员比较了四种逻辑回归工作流:训练集衍生标准缩放、训练集衍生稳健缩放、样本内秩归一化结合训练集衍生缩放,以及利用无监督外部队列参考统计的稳健缩放。内部性能采用五折交叉验证(含折内插补与缩放),外部不确定性采用2000次分层自助法重复抽样。结果:所有策略内部判别力均极高,但外部验证显示训练集衍生的标准与稳健缩放在固定阈值下发生阈值崩溃。在GSE154918中,尽管AUROC极高,两者在0.5阈值下平衡准确率均为0.50,等价于该固定阈值下的随机分类。严格归纳的样本秩策略在外部队列中保留了固定阈值性能(平衡准确率0.95–1.00)。稳健外部队列适应表现亦佳(0.95–1.00),但其使用了无标签外部队列分布统计,故应报告为适应而非固定单样本转移。校准与正则化敏感性未能挽救失败的训练集衍生缩放策略。在败血症对非感染性炎症应激测试中,稳健外部队列适应观测平衡准确率最高(0.80,95% CI 0.61–0.95),但与样本秩归一化的差异在配对自助分析中不确定。结论:高AUROC可掩盖败血症转录组分类器的固定阈值失败。本基准中严格归纳样本秩归一化是最稳定的固定外部策略,而稳健外部队列缩放更应被解释为无监督队列适应,其可靠性取决于外部参考样本可用性。
研究背景与动机
败血症(sepsis)被定义为由宿主对感染反应失调引起的危及生命的器官功能障碍,仍是全球死亡与危重症的主要成因。早期识别困难使全血宿主反应(host-response)谱分析成为诊断与分层研究热点。然而生物标志物落地难,部分源于队列异质性、对照选择与评估设计扭曲表观性能。现有公开数据机器学习研究多以紧凑签名(signature)和内部验证提名标志物或预后模型,未回答固定工作流在队列偏移、平台偏移或健康对照被更难炎症对照替代时是否数值稳定。核心问题在于排序判别(rank discrimination,如AUROC)与阈值行为(threshold behavior)并非同一属性:工作流可保留AUROC却在分类阈值处失效,强内部判别与外部排序可与不稳定外部分数尺度共存。从转化视角,这种隐藏的决策失败比内部交叉验证性能的另一增量更重要,因为外部转移模型以固定分数与阈值解释,而非回溯排序。多中心宿主反应研究已证血液RNA可携带可重复感染信号,但未解决数值可运输性(numerical transportability)缺口。研究人员据此不再提出新签名,而是审问分类阈值的数值可运输性。
研究概述与发表信息
研究人员在《PLOS One》发表上述研究,采用多队列全血GEO基准,测试从内部验证走向固定外部转移时AUROC是否高估分类器用途。研究刻意使用保守表型调和、基因级特征对齐、简单基线模型与固定外部评估,使可运输性失败可解释而不被建模灵活性掩盖。核心假设:外部稳定转录组分类更依赖转移下决策分数稳定性,而非名义内部判别;预处理严谨性比事后校准或模型复杂度更能保留该稳定性。
主要技术方法(≤250字)
研究人员选取四个公开GEO全血队列:GSE65682(发现,微阵列)、GSE95233(外部微阵列验证)、GSE154918(RNA-seq跨平台验证)、GSE28750(非感染性炎症应激)。表型调和至healthy、infection_non_sepsis、sepsis、septic_shock、noninfectious_inflammation五类,基因级以中位数折叠多探针对齐至基因符号。比较四种预处理×逻辑回归(L2,C=1.0,class_weight="balanced",liblinear)工作流:训练集标准缩放、训练集稳健缩放、样本内百分位秩归一化+训练集缩放、外部无标签队列稳健缩放适应。内部五折分层交叉验证含折内中位数插补与缩放;外部以GSE65682全量训练后固定转移。指标含AUROC、平均精度、平衡准确率、Brier分数、预测阳性率;不确定性用2000次分层自助(percentile CI)。校准基准另测sigmoid/isotonic能否挽救。
研究结果
队列组装与基准结构
研究人员保守调和后,主业败血症/休克vs健康分析含275样本、9508共享基因(GSE65682训93、GSE95233验73、GSE154918 RNA-seq验79、GSE28750应激30);次业败血症vs非感染性炎症147样本(GSE65682训126、GSE28750验21)。内部五折CV中所有预处理策略平衡准确率与AUROC均1.00,次业AUROC 0.948–0.950,孤立看各工作流皆成功。
外部转移下诊断阈值不稳定性
固定工作流移出发现队列后,训练集标准z分数预处理在GSE95233/154918/28750保留高AUROC(最高1.00),但0.5阈值下预测阳性率0%、平衡准确率0.50(CI退化0.50–0.50)。训练集稳健缩放亦未解此固定转移问题(GSE154918平衡准确率0.50)。中心失败模式为:排序存活,固定数值阈值在转移后不再分班,符合分数尺度位移(score-scale displacement)而非信号消失。
严格归纳与适应策略分离主要发现
严格归纳下,样本内秩归一化+训练集z缩放最稳:GSE95233平衡准确率1.00、GSE154918 0.974、GSE28750 0.95,预测阳性率近观测值。稳健外部队列适应亦佳(0.961/0.949/1.00)但用无标签外部中位数与IQR,归为自适应队列级归一化而非固定单样本转移。GSE154918跨平台转移中,两种训练集特征缩放保排序但固定0.5阈值全判负,秩与适应策略保高阈值性能。
事后校准未挽救劣质预处理
对训练集标准/稳健缩放加sigmoid或isotonic校准,未能恢复外部固定阈值性能(概率仍全低于决策阈)。校准在样本秩或适应策略后仅微调。改进来自恢复可转移分数尺度,非额外事后调参。系数向量跨预处理高度一致(Pearson 0.938–0.969,符号一致0.909–0.951),证明失败非因学到无关线性信号,而是外部样本被置于错误数值尺度。
炎症对照改变小样本应激测试中的工作流排序
次业败血症vs非感染性炎症更难:内部AUROC降至~0.95。标准z与训练集稳健缩放在21例外部样本全判负(平衡准确率0.50,AUROC 0.873/0.836)。样本秩归一化外部平衡准确率0.70(95%CI 0.55–0.85);稳健外部适应最高0.805(CI 0.614–0.950),Brier 0.158。但因仅10败血症+11炎症共21样本,配对自助差0.105(CI ?0.045~0.255)跨零,故仅为探索性,不支持策略定序。
归档固定基线模型支持可重复性
研究人员导出全部训练队列逻辑回归截距与系数表,截距近零(因balanced权重),证明系数保真仍可在预处理移尺后固定阈值失效。L2 C网格(0.01–10)未消此模式。适应参考子集敏感性:GSE154918百次5样本抽取均平衡准确率0.897(最小0.679)低于全79样本0.949,支持将稳健外部缩放视为批次/队列适应法,可靠性依参考样本量而定。
讨论总结
研究人员指出中心含义:公开全血败血症转录组研究中,可运输性少于内部判别头条,而取决于预处理是否保稳定数值分数尺度。训练集稳健缩放未复现用外部参考的稳健缩放表现;严格归纳下样本秩归一化最稳,外部稳健缩放应称无监督队列适应。外部失败非泛化校准差或判别信息失,而是队列偏移下分数尺度不稳,事后校准不救预处理错位。样本秩降绝对表达尺度依赖,解释属统计非机制。硬阴性(炎症)对照使任务变难且工作流排序可变,但21样本不足以定序。工作流治理含义:固定模型对象不足防转移失败,模型权重与预处理须作为整体工作流报告。局限含公开队列元数据不均、炎症应激外验仅21样本、未重实现Sepsis MetaScore等紧凑签名、未发现阶段用简单逻辑回归故意隔离预处理效应。
结论翻译
在公开全血败血症转录组研究中,高AUROC可掩盖队列与平台转移后的固定阈值失败。严格归纳样本秩归一化是本基准中最稳的固定外部策略,而带外部队列参考统计的稳健缩放更宜解释为无监督队列适应。优先预处理、阈值行为、不确定性报告与外部应激测试的保守基准,比另一份内部优化签名报告提供更有用证据。