
-
生物通官微
陪你抓住生命科技
跳动的脉搏
一种具有不确定性感知能力的颈部淋巴结肿大超声分诊模型:一项回顾性多中心开发与外部验证研究
《BMC Medical Imaging》:An uncertainty-aware ultrasound triage model for cervical lymphadenopathy: a retrospective multicenter development and external validation study
【字体: 大 中 小 】 时间:2026年09月14日 来源:BMC Medical Imaging 3.9
编辑推荐:
摘要背景二元人工智能分类器无法指示何时应将超声病例从自动分流中扣留。我们在一个回顾性多中心队列中评估了一种开发锁定的、具有不确定性感知的选择性分流规则。方法这项回顾性多中心研究共纳入518例患者,其中开发队列206例,内部验证队列88例,两个外部验证队列各112例。每位患者分
二元人工智能分类器无法指示何时应将超声病例从自动分流中扣留。我们在一个回顾性多中心队列中评估了一种开发锁定的、具有不确定性感知的选择性分流规则。
这项回顾性多中心研究共纳入518例患者,其中开发队列206例,内部验证队列88例,两个外部验证队列各112例。每位患者分析一个靶淋巴结。融合模型整合了临床、多模态超声及结构化报告衍生信息。预处理、特征选择、模型拟合、传统二元阈值的选择(p = 0.537)以及选择性路由概率边界的选择(p = 0.320和p = 0.660)、基于开发归一化预测熵和基于自助法的概率分散度构建的复合不确定性、以及不确定性阈值(U = 0.700)的选择,均在开发队列中单独进行。锁定后的模型和路由规则随后直接应用于内部验证队列和外部验证队列,不进行重新调优。评估内容包括判别力、校准度、配对比较分析、独立于开发的分流性能、风险-覆盖率表现、错误检测、失效分析,以及一项采用交叉读者-病例自助重抽样分析的八读者研究。
融合模型的受试者工作特征曲线下面积(AUROC)在内部验证中为0.839,在外部验证队列1中为0.850,在外部验证队列2中为0.842。在锁定传统二元阈值p = 0.537处,内部验证的敏感性/特异性为0.595/0.902,外部验证队列1为0.657/0.911,外部验证队列2为0.817/0.808。独立于开发的覆盖率和选择性准确率在内部验证中分别为0.364和0.906,外部验证队列1中分别为0.384和0.953,外部验证队列2中分别为0.348和0.897。在合并的外部验证人群中,224例患者中有38例进入低风险自动路径,44例进入高风险自动路径,142例被延迟进行高级审查。自动覆盖率为0.366(95%置信区间[CI],0.306–0.431),选择性准确率为0.927(95% CI,0.849–0.966),接受的假阴性/假阳性数为2/4。被分配到低风险自动路径的38例患者中有2例为恶性,对应阴性预测值(NPV)为0.947(95% CI,0.827–0.985),残余恶性风险为0.053(95% CI,0.015–0.173)。高风险路径的阳性预测值(PPV)为0.909(95% CI,0.788–0.964)。合并外部风险-覆盖率部分风险-覆盖率曲线下面积(AURC)为0.037。在另一项逐病例错误排序分析中,复合不确定性检测二元模型错误的AUROC为0.581,精确率-召回率曲线下面积(AUPRC)为0.247。初级读者准确率提高了0.055(95% CI,0.022–0.089;p = 0.002),而中级和高级读者的变化无统计学意义。
锁定策略对约37%的外部病例进行了选择性路由,但保留了大量的延迟审查以及接受的假阴性和假阳性错误。应将其解释为一种回顾性、研究阶段的选择性路由框架,而非已确立的临床安全或工作流程工具。
二元人工智能分类器无法指示何时应将超声病例从自动分流中扣留。我们在一个回顾性多中心队列中评估了一种开发锁定的、具有不确定性感知的选择性分流规则。
这项回顾性多中心研究共纳入518例患者,其中开发队列206例,内部验证队列88例,两个外部验证队列各112例。每位患者分析一个靶淋巴结。融合模型整合了临床、多模态超声及结构化报告衍生信息。预处理、特征选择、模型拟合、传统二元阈值的选择(p = 0.537)以及选择性路由概率边界的选择(p = 0.320和p = 0.660)、基于开发归一化预测熵和基于自助法的概率分散度构建的复合不确定性、以及不确定性阈值(U = 0.700)的选择,均在开发队列中单独进行。锁定后的模型和路由规则随后直接应用于内部验证队列和外部验证队列,不进行重新调优。评估内容包括判别力、校准度、配对比较分析、独立于开发的分流性能、风险-覆盖率表现、错误检测、失效分析,以及一项采用交叉读者-病例自助重抽样分析的八读者研究。
融合模型的受试者工作特征曲线下面积(AUROC)在内部验证中为0.839,在外部验证队列1中为0.850,在外部验证队列2中为0.842。在锁定传统二元阈值p = 0.537处,内部验证的敏感性/特异性为0.595/0.902,外部验证队列1为0.657/0.911,外部验证队列2为0.817/0.808。独立于开发的覆盖率和选择性准确率在内部验证中分别为0.364和0.906,外部验证队列1中分别为0.384和0.953,外部验证队列2中分别为0.348和0.897。在合并的外部验证人群中,224例患者中有38例进入低风险自动路径,44例进入高风险自动路径,142例被延迟进行高级审查。自动覆盖率为0.366(95%置信区间[CI],0.306–0.431),选择性准确率为0.927(95% CI,0.849–0.966),接受的假阴性/假阳性数为2/4。被分配到低风险自动路径的38例患者中有2例为恶性,对应阴性预测值(NPV)为0.947(95% CI,0.827–0.985),残余恶性风险为0.053(95% CI,0.015–0.173)。高风险路径的阳性预测值(PPV)为0.909(95% CI,0.788–0.964)。合并外部风险-覆盖率部分风险-覆盖率曲线下面积(AURC)为0.037。在另一项逐病例错误排序分析中,复合不确定性检测二元模型错误的AUROC为0.581,精确率-召回率曲线下面积(AUPRC)为0.247。初级读者准确率提高了0.055(95% CI,0.022–0.089;p = 0.002),而中级和高级读者的变化无统计学意义。
锁定策略对约37%的外部病例进行了选择性路由,但保留了大量的延迟审查以及接受的假阴性和假阳性错误。应将其解释为一种回顾性、研究阶段的选择性路由框架,而非已确立的临床安全或工作流程工具。