《Journal of Hepatology》:Validation of a pan-ELastography Machine-learning (ELM) score to predict clinically significant portal hypertension in compensated advanced chronic liver disease
编辑推荐:
背景: 临床显著门静脉高压(CSPH, HVPG≥10 mmHg)是进展性慢性肝病(ACLD)患者发生失代偿和死亡的主要驱动因素,非选择性β受体阻滞剂(NSBB)可降低风险,但确诊需行有创肝静脉压力梯度(HVPG)测定。现行基于肝脏硬度测量(LSM)和血小板计
背景: 临床显著门静脉高压(CSPH, HVPG≥10 mmHg)是进展性慢性肝病(ACLD)患者发生失代偿和死亡的主要驱动因素,非选择性β受体阻滞剂(NSBB)可降低风险,但确诊需行有创肝静脉压力梯度(HVPG)测定。现行基于肝脏硬度测量(LSM)和血小板计数(PLT)的非侵入性Baveno VII标准存在40–50%的"灰区"(gray-zone)不确定结果,且诊断效能受病因及弹性成像技术影响。脾硬度测量(SSM)可改善Baveno VII标准,但仍有局限。研究人员开发并验证了整合泛弹性成像(pan-elastographic)LSM、SSM及临床变量的机器学习(ML)模型——ELM评分,旨在提高CSPH排除与确诊准确率并减少不确定病例。
方法: 研究人员分析1435例伴配对HVPG、LSM、SSM及临床参数的代偿期ACLD患者,LSM和SSM由振动控制瞬时弹性成像(VCTE)、二维剪切波弹性成像(2D-SWE)或点剪切波弹性成像(p-SWE)获得。模型于训练集(n=943)构建,内部验证(n=150)采用不同技术校正后的LSM/SSM及临床变量(PLT、Child-Pugh评分、年龄、性别、病因),选取阴性预测值(NPV)100%的截断值用于排除CSPH、阳性预测值(PPV)100%的截断值用于确诊CSPH。外部验证于7中心342例患者中进行,比较ML模型与Baveno VII、Baveno-SSM单/双截断标准及VCTE亚组中ANTICIPATE和NICER评分的性能。
结果: 基于随机森林(Random Forest)的模型表现最佳(外部验证AUC=0.91,Brier评分=0.13),截断值≤0.45(排除)和≥0.60(确诊)对应NPV=0.90(95%CI 0.84–0.94)、PPV=0.96(95%CI 0.92–0.98)。ML模型的灰区仅12.3%,显著低于Baveno VII的47.9%(p<0.001)、Baveno-SSM双截断的38.6%(p<0.001)及Baveno-SSM单截断的19.6%(p<0.05)。VCTE外部验证亚组(n=275)中ELM确诊性能与ANTICIPATE和NICER相当,灰区降至12.0%(二者分别为41.1%和41.8%)。
结论: ELM评分优于现行Baveno标准,跨弹性成像模态显著降低灰区,支持更广泛、安全、无创识别HVPG定义的CSPH代偿期ACLD患者,其为NSBB治疗候选人群提供筛选依据。
论文解读:泛弹性成像机器学习(ELM)评分预测代偿期进展性慢性肝病中临床显著门静脉高压(CSPH)的验证研究
研究背景与目的
临床显著门静脉高压(clinically significant portal hypertension, CSPH;定义为肝静脉压力梯度 hepatic venous pressure gradient, HVPG ≥10 mmHg)是代偿期进展性慢性肝病(compensated advanced chronic liver disease, cACLD)患者发生首次失代偿及死亡的核心决定因素。PREDESCI试验证实,对非选择性β受体阻滞剂(non-selective β-blocker, NSBB;如卡维地洛)敏感的CSPH患者可从治疗中获益,降低失代偿及死亡率。然而,HVPG测定为有创操作且普及度低,限制了其在临床筛查中的应用。现行Baveno VII共识推荐以肝脏硬度测量(liver stiffness measurement, LSM)≤15 kPa且血小板计数(platelet count, PLT)≥150×10?/L排除CSPH,以LSM>25 kPa确诊CSPH(即"rule-of-five"标准),但该策略导致约40%–50%患者落入诊断"灰区(gray zone)"无法判定,且在不同病因及弹性成像技术(如二维剪切波弹性成像 two-dimensional shear wave elastography, 2D-SWE、点剪切波弹性成像 point shear wave elastography, p-SWE)中验证不足。近期Baveno共识引入脾硬度测量(spleen stiffness measurement, SSM)以改善分层,但仍存较大灰区。为此,研究人员假设整合LSM、SSM及临床变量的机器学习(machine learning, ML)模型可克服上述局限,遂开展ELASTO-ML研究,开发并验证适用于VCTE、2D-SWE及p-SWE三种弹性成像模态的泛弹性成像ML模型——ELM评分,以提升CSPH排除与确诊准确性并最小化灰区。本研究发表于《Journal of Hepatology》。
主要关键技术方法
研究人员纳入17项研究的个体水平数据(训练/内部验证集,n=1093)及7个独立中心的外部验证队列(n=342),共1435例伴HVPG测定的cACLD(Child-Pugh≤7,无失代偿)患者,弹性成像含VCTE(50 Hz及100 Hz脾脏专用模块)、2D-SWE、p-SWE。排除缺失值>10%的变量(如BMI、MELD),采用链式方程多重插补(Multiple Imputation by Chained Equations, MICE)。对不同技术的LSM/SSM行Z-score标准化调和(harmonization)。比较Logistic回归(LR)、K近邻(KNN)、多层感知机(MLP)、极端梯度提升(XGBoost)、随机森林(Random Forest, RF)五种算法,以AUC、Brier评分、校准指标及灰区比例遴选最优模型。截断值按训练集100%敏感度(排除CSPH)和100%特异度(确诊CSPH)选取,外部验证中与Baveno VII、Baveno-SSM单/双截断标准及VCTE亚组ANTICIPATE、NICER评分比较。采用SHAP(SHapley Additive exPlanations)进行特征重要性及可解释性分析,并按弹性成像技术、病因、BMI行敏感性分析,部分中心行失代偿事件随访验证预后价值。
研究结果
3.1. Model Training and Internal Validation(模型训练与内部验证)
研究人员比较五种ML算法,Random Forest(RF)在训练集(AUC=0.95, Brier=0.10)及内部验证集(AUC=0.93, Brier=0.11)中判别与校准性能最优,灰区仅8.5%(训练)和10.6%(内部验证),显著低于LR的43.6%和36.0%(p<0.001)。特征重要性分析(基尼不纯度与互信息法)一致显示SSM、LSM及PLT为前三位预测因子。据此选定RF构建ELM评分。
3.2. Clinical Evaluation of the Best Model(最佳模型的临床评价)
训练集中ELM评分≤0.45排除CSPH(敏感度1.00, NPV 1.00),≥0.60确诊CSPH(特异度1.00, PPV 1.00),灰区8.5%。内部验证集中对应敏感度0.97、NPV 0.97及特异度0.91、PPV 0.93,灰区10.6%。同队列Baveno VII灰区达44.0%–49.0%,显著劣于ELM(p<0.001)。
3.3. External Validation of the ELM Score(ELM评分的外部验证)
外部验证队列(n=342;VCTE 275例含100 Hz SSM,2D-SWE 34例,p-SWE 33例)中RF模型AUC=0.91(95%CI),Brier=0.13。ELM≤0.45排除CSPH:敏感度0.94(0.91–0.97),NPV 0.90(0.84–0.94);ELM≥0.60确诊CSPH:特异度0.94(0.80–0.98),PPV 0.96(0.92–0.98)。灰区仅12.3%,较Baveno VII(47.9%)、Baveno-SSM双截断(38.6%)、Baveno-SSM单截断(19.6%)均显著降低(p<0.001或p<0.05)。VCTE亚组(n=275)中ELM确诊PPV与ANTICIPATE(0.89)、NICER(0.92)相当,灰区(12.0%)远低于二者(41.1%、41.8%)。
3.4. Clinical Performance of ELM Score with Missing SSM Values(SSM缺失时ELM评分的临床性能)
当SSM设为缺失值时,RF利用替代分裂仍可预测(外部验证AUC=0.87,灰区16.0%),但NPV及PPV降至0.88,未达Baveno VII推荐阈值,故在线计算工具仅部署完整变量版本。
3.5. Sensitivity Analyses(敏感性分析)
按弹性成像技术分层:VCTE-50 Hz灰区7.3%、VCTE-100 Hz 12.0%、2D-SWE 11.6%、p-SWE 12.3%,均大幅低于各技术下Baveno标准且保持高敏感度/特异度。按病因:自身免疫性肝病灰区5.0%、代谢功能障碍相关脂肪变性肝病(metabolic dysfunction-associated steatotic liver disease, MASLD)7.1%、病毒性肝炎8.0%、酒精性肝病(alcohol-associated liver disease, ALD)10.7%、混合/其他14.2%,各亚组诊断准确度良好。按BMI:BMI<30 kg/m2灰区11.6%,BMI≥30 kg/m2升至15.6%,但敏感度(0.92–0.98)与特异度(0.92–0.98)仍优。
3.6. Comparison with ANTICIPATE and NICER(与ANTICIPATE及NICER评分比较)
VCTE-100 Hz外部验证亚组(n=275)中ELM确诊特异度0.94、PPV 0.96,与ANTICIPATE(特异度0.85、PPV 0.89)及NICER(特异度0.92、PPV 0.92)相当或略优,灰区(12.0%)明显更低。
3.7. Prediction of Decompensation(失代偿事件的预测)
意大利Bologna中心190例随访队列中,ELM<0.45者3年及5年无失代偿事件发生率100%(敏感度及NPV均为1.00),提示低评分可有效识别低风险患者。
3.8. Human-Algorithmic Interaction(人机交互与可解释性)
研究人员部署了在线计算平台(https://elmscore.com/),输入弹性成像模态、LSM(kPa或m/s换算)、SSM、PLT、病因、Child-Pugh分级、年龄、性别后输出ELM评分及SHAP瀑布图展示各变量贡献方向,并对超出训练集分布极值(<5th或>>95th百分位)给出警示。
讨论与结论总结
研究人员指出,这是首个经外部验证、适用于多种弹性成像技术的ML模型用于CSPH无创诊断的研究。ELM评分(Random Forest模型整合调和后LSM、SSM、PLT、年龄、性别、病因、Child-Pugh评分)外部验证AUC达0.91,排除截断≤0.45(NPV 0.90)、确诊截断≥0.60(PPV 0.96),灰区压缩至约12%,显著优于各类Baveno标准。模型跨VCTE/2D-SWE/p-SWE、跨主要病因(含高比例MASLD人群)及不同BMI水平均保持稳健,且具一定失代偿风险分层潜力。局限性包括回顾性多中心数据可能存在的谱偏倚、部分队列SSM为50 Hz(外部验证含100 Hz)、未常规收集MELD及单独Child-Pugh组分。ELM评分目前属研究工具,需前瞻性验证及监管审批(EU MDR Class IIa及以上,AI Act高风险系统)后方可临床常规应用。
结论翻译: 研究人员提出并验证了首个跨弹性成像技术的外部验证机器学习模型(ELM评分),可无创预测CSPH的存在。该模型通过显著缩小诊断灰区优于当前Baveno VII–SSM标准,并与近期文献确认的关键预测因子一致。模型配套可解释性决策支持界面,旨在减少昂贵、有创且未广泛开展的HVPG测定需求。