《Frontiers in Physiology》:Clinically informed preoperative risk stratification for MRI-defined non gross-total resection in nonfunctioning pituitary neuroendocrine tumors: a single-center internal validation study
编辑推荐:
引言:基于术后早期磁共振成像(MRI)定义的非全切除(non-GTR)的术前评估,可为无功能垂体神经内分泌肿瘤(NF-PitNETs)术后患者咨询和术后监测计划提供支持。研究人员评估了与参考策略相比,一种基于临床信息的、可解释的术前建模策略是否能改善风险估计。
引言:基于术后早期磁共振成像(MRI)定义的非全切除(non-GTR)的术前评估,可为无功能垂体神经内分泌肿瘤(NF-PitNETs)术后患者咨询和术后监测计划提供支持。研究人员评估了与参考策略相比,一种基于临床信息的、可解释的术前建模策略是否能改善风险估计。方法:研究人员回顾性分析了来自单中心的354例首次手术患者,这些患者具有记录的术后早期基于MRI的切除状态终点;其中57例(16.1%)为non-GTR。一种预设的临床信息逻辑策略通过在基于常规术前临床和MRI变量的参考模型基础上,增加代表非线性肿瘤负荷和侵袭严重程度的变换项进行扩展。模型经过分层重复嵌套交叉验证,外层5折重复20次,内层4折调参。使用患者水平平均保留预测评估性能。结果:在模型特异性调参策略下,临床信息策略与参考策略相比判别能力变化不大(受试者工作特征曲线下面积,0.8054 vs. 0.8022;精确率-召回率曲线下面积,0.4603 vs. 0.4534),但具有更低的Brier评分(0.1100 vs. 0.1480)和更接近理想的校准(截距,0.0256 vs. ?0.3778;斜率,1.0209 vs. 2.5233)。在探索性阈值范围0.05–0.50内,该策略还显示出更大的基于模型的净获益,并分离了队列衍生的三分位组,观察到的non-GTR率分别为4.2%、8.5%和35.6%。术后病理变量提供的增量价值有限。讨论:这些发现代表了完整建模策略的单中心内部验证。由于策略在预测变量表示和调参目标上均存在差异,校准差异不能单独归因于变换后的预测变量。在应用于咨询或监测计划之前,需要使用标准化术后MRI进行独立外部验证,并同时开展统一调参和简化模型敏感性分析。
《Frontiers in Physiology》论文解读:无功能垂体神经内分泌肿瘤MRI定义非全切除的临床信息引导术前风险分层
**一、研究背景与目的**
无功能垂体神经内分泌肿瘤(NF-PitNETs)术后残留病变具有重要临床意义:术后早期影像可见的残留肿瘤携带最高的近期复发风险,而无残留患者的短期复发负担则低得多。当代管理综述强调切除程度决定术后监测、辅助治疗决策及患者咨询策略。因此,在获得术后影像结果之前,术前评估早期残留或非全切除(non-GTR)风险对于患者咨询、手术预期设定和早期随访规划至关重要。2022年世界卫生组织(WHO)分类采用垂体神经内分泌肿瘤(PitNET)术语描述腺垂体肿瘤。
既往术前预测研究主要聚焦结构性可切除性评估,如Zurich垂体评分、HACKD评分及原始至改良TRANSSPHER分级体系,这些工具临床可读性强,但主要针对手术复杂性或全切除可能性,而非校准的个体残留风险评估。机器学习研究虽已进入该领域,但系统综述显示报告质量参差不齐、校准报告频繁缺失、外部验证极为稀少。由于预期应用场景为术前咨询和围手术期规划,仅凭判别能力不足以保证有效的风险沟通,校准(calibration)对于风险沟通和决策支持至关重要,决策曲线分析可量化基于模型的跨阈值净获益。因此,本研究旨在回答一个更聚焦的临床问题:在相同单中心队列及相同外层验证划分中,一种基于临床信息、可解释的术前建模策略能否相较保留的参考策略改善MRI定义non-GTR的校准、基于模型的净获益和描述性风险分层。
**二、研究方法概述**
研究人员回顾性分析中山大学附属第一医院神经外科2020年3月至2023年12月间409例NF-PitNET记录中的354例首次手术患者(样本队列来源),57例(16.1%)存在MRI定义non-GTR。参考模型为8个预设术前变量(年龄、性别、视力模糊、视野缺损、垂体功能减退、肿瘤最大直径、Knosp分级、侵袭性)的正则化逻辑回归;临床信息策略增加4个变换项(自然对数直径、Knosp≥3与Knosp 4级指标、侵袭性×自然对数直径交互),共12项。采用分层重复嵌套交叉验证(外层5折×20次,内层4折调参);参考模型以AUROC调参,临床信息模型以负Brier评分调参。主要评价指标为受试者工作特征曲线下面积(AUROC)、精确率-召回率曲线下面积(AUPRC)、Brier评分、校准截距与斜率,并绘制校准曲线、开展决策曲线分析及三分位风险分层。
**三、研究结果**
3.1 队列特征与主要模型性能:在354例分析患者中,57例(16.1%)为MRI定义non-GTR。临床信息策略较参考策略判别能力变化很小(AUROC从0.8022升至0.8054,AUPRC从0.4534升至0.4603),但Brier评分显著更低(0.1100 vs. 0.1480),校准截距和斜率更接近理想值(分别为0.0256和1.0209 vs. ?0.3778和2.5233)。患者水平bootstrap显示Brier评分差异为?0.0380(95%置信区间,?0.0453至?0.0309)。
3.2 校准、模型净获益与风险分层:临床信息策略的预测风险与观察风险一致性更好,在探索性阈值范围0.05–0.50内表现出更大的基于模型的决策曲线净获益。队列衍生的低、中、高风险三分位各含118例患者,观察non-GTR率分别为4.2%、8.5%和35.6%,显示出清晰的风险分离。
3.3 探索性系数与领域稳定性:在100次外层训练集重拟合中,肿瘤负荷领域平均绝对系数最大(0.374),符号一致性接近完全(0.995);内分泌损害(0.980)、视觉损害(0.945)和侵袭负荷(0.912)特征方向稳定,提示预测可重复地锚定于相同临床领域。
3.4 阈值特异性性能与风险组概况:阈值0.20时,26.6%患者被分类为高风险,敏感性66.7%、特异性81.1%、阳性预测值40.4%、阴性预测值92.7%;阈值0.30时,16.1%分类为高风险,敏感性42.1%、特异性88.9%。高风险三分位中位直径33.0mm、Knosp 3-4级占83.9%、侵袭性占83.9%、视觉症状占80.5%,低风险三分位对应为18.0mm、7.6%、7.6%、27.1%。大腺瘤近乎普遍存在(351/354)限制了对较小肿瘤的推断。
3.5 病理增量价值与次要模型比较:添加术后病理变量(转录