《Diagnostics》:Diagnostic Accuracy of a Machine Learning Model for Cervical Vertebra-Based Skeletal Maturity Assessment in Pediatric and Adolescent Patients Using Cephalometric Radiographs
编辑推荐:
背景/目的:骨骼成熟度评估对于正畸生长改良治疗的时机把握至关重要。颈椎成熟(CVM)方法应用广泛,但人工分期具有主观性并易出现观察者间变异,人工智能(AI)有望提升其一致性与准确性。本研究旨在开发并外部验证一种全自动化深度学习流程用于CVM评估,并以校准专家分
背景/目的:骨骼成熟度评估对于正畸生长改良治疗的时机把握至关重要。颈椎成熟(CVM)方法应用广泛,但人工分期具有主观性并易出现观察者间变异,人工智能(AI)有望提升其一致性与准确性。本研究旨在开发并外部验证一种全自动化深度学习流程用于CVM评估,并以校准专家分期为参照,确定其三阶段与六阶段分类的诊断准确性。方法:研究人员采用横断面三阶段深度学习流程,在阿卜杜勒阿齐兹国王大学523张头影测量放射影像上训练并作内部交叉验证。图像进行CLAHE增强;YOLOv8检测C2–C4区域;ResNet-50分类器判定生长阶段(Early、Peak、Late);阶段专用二分类器判定CVM分期(CS1–CS6)。外部验证采用独立Aariz数据集(n = 150)。结果:检测器mAP@0.5 = 0.9939,平均IoU = 0.8884。外部验证中三阶段分类器准确率96.0%、宏F1 0.919、加权κ 0.951、ROC-AUC 0.998;端到端六阶段级联准确率79.3%、宏F1 0.735、加权κ 0.910、ROC-AUC 0.923。多数误差发生于相邻分期,98.7%预测与参照标准相差±1期。结论:该自动化流程在单一独立外部基准上三阶段CVM分类表现良好,六阶段分类为中等表现,尚需多中心前瞻性验证以确立泛化性与临床效用。
研究背景方面,骨骼成熟度评估是正畸治疗计划中的关键环节,用于判断生长改良干预的最佳时机。传统方法如实际年龄与手腕骨放射影像虽被使用,但与生物成熟度相关性弱,且额外放射暴露增加患者风险。颈椎成熟(cervical vertebral maturation,CVM)方法通过侧位头影测量放射影像(cephalometric radiographs)中C2–C4椎体形态评估骨骼成熟,可避免额外手腕片,但人工CVM分期耗时、存在观察者间与观察者内变异,影响可重复性与诊断准确性。已有研究证明人工智能(artificial intelligence,AI)和可深度学习方法能自动标准化评估形态学特征、降低偏倚,但已有AI模型报告准确率约0.59至0.71,且多聚焦六阶段CS1–CS6分类,对早期(Early)、高峰(Peak)、晚期(Late)三阶段分类证据有限,外部验证不足,方法学异质性大。因此,研究人员开展本研究,开发并外部验证全自动化深度学习流程,以校准专家分期为参照标准,评估其三阶段与六阶段CVM分类诊断准确性,论文发表于《Diagnostics》。
关键技术方法上,研究人员采用横断面诊断准确性与模型开发设计:机构队列为阿卜杜勒阿齐兹国王大学2023–2026年8–18岁正畸患者523张侧位头影测量片;独立外部测试集为Aariz基准的150张官方测试片。流程为三阶段级联:YOLOv8-nano检测C2–C4区域,CLAHE增强后送ResNet-50三阶段分类器判Early、Peak、Late;再用各阶段专用分类器细化CS1–CS6。内部用分层五折交叉验证,外部仅用Aariz测试分割,避免数据泄漏。
研究结果如下。3. Results中,机构队列523张标记片,有效样本因预处理略有差异;两名校准检查者专家分期几乎完全一致,百分比一致98.9%,Cohen κ 0.984–0.989,Gwet AC1 0.987,Krippendorff α序数0.994,ICC 0.989。YOLOv8检测器内部mAP@0.5 0.994,外部150张均生成边界框无失败。三阶段分类器外部准确率96.00%,宏F1 0.9191,Cohen κ 0.9236,二次加权κ 0.9511,宏ROC-AUC 0.9975;Early相灵敏度1.0000但有4例Peak误入Early,Late相精密度1.0000、灵敏度0.9785,Peak相最弱、4例漏判入Late。阶段专用分类器中,Early专用(CS1 vs CS2,n=10)准确率80.00%、AUC 1.0000但样本过小;Peak专用(CS3 vs CS4,n=47)准确率97.87%、AUC 1.0000;Late专用(CS5 vs CS6,n=93)准确率76.34%、宏AUC 0.8062,CS5–CS6混淆最明显。端到端六阶段级联外部150张中119张正确,准确率79.3%,31例误分中29例为相邻期误差,仅2例差≥2期,98.7%预测在±1期内;CS3准确率0.571、CS5 0.725、CS4 0.975、CS2 1.000;错误主要来自CS5→CS6共17例,占所有误差54.8%。复合置信度为探索性指标,高置信误判均属CS5→CS6,说明Late专用分类器对部分CS5图像系统性过判为CS6。
讨论部分中,研究人员指出三阶段表现强、六阶段尤其CS5–CS6区分弱,相位级准确不等于阶段级可靠。外部三阶段准确率96.0%高于内部出折叠77.4%,方向不典型,可能由Aariz外部子集小且不均衡、设备与人群构成差异、采样变异造成。C2–C4解剖位置稳定使检测模块极佳;分类受限因类别不平衡、相邻期形态差异细微、专家参照本身可重复性有限、级联误差传播。与Mohammad-Rahimi等、Li等结果一致,粗分类优于细分类,大数据集提升阶段级性能;与基于手动头影标志点的半自动方法比,本研究全自动化无人工标志点,更易规模部署但准确率略低。模型可作筛查或决策支持,不宜自主诊断。
结论部分翻译为:本研究开发并评估了基于侧位头影测量放射影像的全自动深度学习流程用于CVM评估。在单一独立外部基准上,该模型在三阶段广义分类表现有前景,在六阶段精细分类表现为中等。然而,内部与外部估计差异显著、类别不平衡、外部亚组小以及依赖单一外部数据集,妨碍对其泛化性和临床效用的确切结论。在临床实施前,需开展进一步多中心前瞻性验证,并在常规实践条件下与临床医生进行比较。