复发临床事件预测模型区分度的评估

《Diagnostic and Prognostic Research》:Evaluating discrimination of prediction models for recurrent clinical events

【字体: 时间:2026年09月09日 来源:Diagnostic and Prognostic Research 3.9

编辑推荐:

  背景:对于涉及复发事件的临床条件的预测模型,需要针对重复结局定制的性能指标。尽管研究人员及其他人已开发了评估校准(calibration)及相关性能方面的方法,但评估区分度(discrimination)的方法仍然有限。近期贡献,包括基于一致性(concord

  
背景:对于涉及复发事件的临床条件的预测模型,需要针对重复结局定制的性能指标。尽管研究人员及其他人已开发了评估校准(calibration)及相关性能方面的方法,但评估区分度(discrimination)的方法仍然有限。近期贡献,包括基于一致性(concordance)的方法和Brier型准确度度量,部分填补了这一空白,但仍缺乏广泛采用且灵活的区分度评估框架。由于区分度是TRIPOD+AI指南推荐的核心指标,故仍需要易获取的方法和软件来评估复发事件模型对高、低风险个体的区分能力。

方法:研究人员提出了基于比较预测与观察到的累计事件计数的适应性区分度统计量,以解决传统一致性方法的局限性。使用多种重采样策略(包括delete-d刀切法)评估统计不确定性,并提供了用户友好的R代码。研究人员使用四种平局处理方法(c统计量、Kendall's τa、Somers' D、Goodman–Kruskal's γ)、四种复发事件模型(负二项、零膨胀负二项、Andersen–Gill和Prentice–Williams–Peterson总时间模型)以及两个临床数据集(SANAD癫痫试验和OPCRD哮喘队列)展示了该方法。

结果:不同模型间的区分度差异显著。在哮喘数据中,Prentice–Williams–Peterson模型显示出最强的区分度(C=0.939,95% CI 0.935–0.944),基于秩的指标(τa=0.603;Somers' D和γ=0.879)也表明区分度非常强。Andersen–Gill模型表现中等(C=0.823,95% CI 0.815–0.830),而负二项模型(C=0.573)和零膨胀负二项模型(C=0.586)的区分度较弱。在癫痫数据中,Prentice–Williams–Peterson模型再次表现最佳(C=0.943,95% CI 0.912–0.974),所有基于秩的指标均高于0.85。负二项模型、零膨胀负二项模型和Andersen–Gill模型的区分度中等。

结论:本研究为评估复发事件数据预测模型的区分度提供了实用方法和开源代码。将这些方法与现有校准工具结合使用,可支持全面的性能评估,并有助于按照TRIPOD+AI指南的建议,标准化针对复发临床事件开发的预测模型的验证和报告。
**研究背景与目的**

复发临床事件(recurrent clinical events)在医学实践中十分常见,例如哮喘患者的反复急性加重、癫痫患者的反复发作。针对此类结局构建的预测模型,需要采用适配重复结局的性能指标。当前,校准(calibration)评估方法已有所发展,但区分度(discrimination)的评估方法仍相对有限。尽管已有基于一致性(concordance)的方法和Brier型准确度度量,但学界仍缺乏被广泛接受且灵活的区分度评估框架。区分度是TRIPOD+AI指南推荐的核心指标,因此开发易用的方法学和软件来评估复发事件模型对高、低风险个体的区分能力十分必要。

为此,研究人员提出了基于比较预测与观察到的累计事件计数的适应性区分度统计量,并采用多种重采样策略量化统计不确定性。该研究将方法应用于四种平局处理方法(c统计量、Kendall's τa、Somers' D、Goodman–Kruskal's γ)和四种复发事件模型(负二项、零膨胀负二项、Andersen–Gill、Prentice–Williams–Peterson总时间模型),并在两个临床数据集(SANAD癫痫试验和OPCRD哮喘队列)中加以验证。结果表明,不同模型的区分度差异显著。研究提供了开源R代码,有助于按TRIPOD+AI指南建议标准化复发临床事件预测模型的验证和报告。论文发表在《Diagnostic and Prognostic Research》。

**主要关键技术方法**

将患者观察结局定义为指定随访期内的累计事件数,预测值为模型期望累计事件数;对所有患者两两配对,按预测与观察事件数的排序方向判定为一致、不一致或平局;采用Kendall's τa、Goodman–Kruskal's γ、Somers' D和c统计量处理平局;使用标准jackknife和delete-d分组jackknife估计不确定性,并给出delete-d方差公式;R代码利用Rcpp提高计算效率。样本来源:OPCRD为英国初级保健数据库,SANAD为多中心随机对照试验。

**研究结果**

**哮喘(OPCRD)数据集**

在哮喘数据中,负二项(NB)模型的c统计量为0.573,Somers' D和Goodman–Kruskal's γ均为0.146,Kendall's τa为0.100,区分度较弱;单例jackknife无法反映变异性,分组jackknife产生较窄的95% CI(0.562–0.584)。零膨胀负二项(ZINB)模型c=0.586,D和γ=0.172,τa=0.118,区分度略高。Andersen–Gill(AG)模型c=0.823,D和γ=0.645,τa=0.442,区分度良好。Prentice–Williams–Peterson总时间(PWP-TT)模型表现最佳,c=0.939,τa=0.603,D和γ=0.879,分组jackknife 95% CI为0.935–0.944。

**癫痫(SANAD)数据集**

在癫痫数据中,NB模型的c统计量为0.654,分组jackknife 95% CI为0.537–0.771;ZINB模型c=0.654,τa=0.298,D和γ=0.308;AG模型c=0.642,D和γ=0.285,τa=0.275;PWP-TT模型再次最高,c=0.943,τa=0.856,D和γ=0.886,分组jackknife 95% CI为0.912–0.974。

**不确定性估计的比较**

标准leave-one-out jackknife在所有模型和数据集上均产生极窄或退化的区间,而delete-d分组jackknife产生更宽且更有信息量的区间,尤其对于区分度中等或预测异质性较大的模型。在OPCRD数据中置信区间总体上窄于SANAD数据。

**讨论总结与结论**

讨论部分指出,PWP-TT模型在示例数据中区分度最高,但不意味着所有情况下都应优先选择该模型;模型选择应基于科学问题、事件过程和模型拟合。与Kim等的方法相比,本研究不假设特定模型形式,直接关注特定时间窗内预测复发事件数,并提供多种平局处理策略和公开代码。与Bouaziz的Brier类方法相比,本研究聚焦区分度而非预测准确度,两者互补。研究优点包括多指标比较和分组jackknife的使用;局限性包括仅评估表观区分度、两个数据集可能不具普遍性、未评估置信区间覆盖率等。未来需通过模拟研究比较不同重采样方法的覆盖率。

本研究结论可概括为:不同常用复发事件模型之间的区分度可能差异显著,在示例中PWP-TT模型的区分度更强。针对复发事件改编的一致性指标(包括Kendall's τ、Goodman–Kruskal's γ、Somers' D和c统计量)为模型性能提供了互补视角,并可利用公开R代码轻松实现。结果强调了在量化区分度不确定性时考虑delete-d刀切重采样的价值。标准jackknife区间常极窄或退化,而delete-d jackknife通常产生更宽的置信区间,尤其对于中等区分度或预测异质的模型。然而,jackknife区间的覆盖率未被评估。未来需设计严谨的模拟研究来确定不同复发事件模型下重采样方法相对名义水平的覆盖率。本研究提供的指南和代码为评估复发临床事件预测模型的区分度提供了实用工具,研究人员鼓励在模型开发和外部验证中采用这些方法;但建议选择与具体研究问题、数据结构和建模假设相匹配的少量指标,而非同时应用所有指标,以支持连贯且可解释的模型性能评估。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号