《Journal of Dentistry》:Radiological differentiation of original and generic dental implants using a multiclass AI model in comparison with human expertise: an in vitro study
编辑推荐:
目的:本研究旨在评估编程式人工智能(AI)系统能否可靠区分两家原研种植体制造商及其对应的两家仿制种植体系统,并将诊断性能及判别把握度与人类专家评估直接比较,以确定AI相对于临床经验的准确度和可靠性。方法:为识别四种种植体类型,研究人员实施两阶段AI流程,先经目
目的:本研究旨在评估编程式人工智能(AI)系统能否可靠区分两家原研种植体制造商及其对应的两家仿制种植体系统,并将诊断性能及判别把握度与人类专家评估直接比较,以确定AI相对于临床经验的准确度和可靠性。方法:为识别四种种植体类型,研究人员实施两阶段AI流程,先经目标分割再分类。共1384张标准化离体放射影像作为训练集,采用基于轮廓的分割与预训练Mask R-CNN进行种植体提取,分类使用迁移学习ResNet-50模型并在独立测试集验证。另设对照:61名牙科学生与牙医评估98张影像,并以百分比自评决策把握度。结果:分析61名评估者共2322次个体评分,人类准确率86.60%,显著低于AI无错分类表现(p<0.001);种植体类型、临床经验、性别对正确识别无显著影响,而自评诊断信心是强预测因子(p<0.001)。结论:受控条件下含多系统的AI在区分近乎相同的种植体时分类性能优于人类评估者,AI辅助种植体识别软件有望成为有前景的诊断支持工具。临床意义:在文档缺失或不明时,AI支持识别可提升种植体认读可靠性、降低不兼容部件选配风险并优化治疗流程,但受控条件外仍需真实场景临床验证方可常规应用。
研究背景与问题提出
种植体支持修复在现代牙科中地位日益重要,累计存活率高使其被广泛接受。然而全球超过220家种植体制造商,且原研与仿制(generic/replica)系统在直径、长度、宏观形态及影像学投影上高度相似,加之种植体护照缺失、无中央登记,临床修复阶段常因无法精确识别系统而面临选配风险。仿制种植体虽连接界面可能兼容,但微动及远期预后差异使准确识别具有修复、质保及法医价值。既往AI研究多限单厂家原研—仿制二分类,尚缺多原研—多仿制并行多分类下与人类专家的直接比对。为此,Mark K Bremer等人在《Journal of Dentistry》发表体外概念验证研究,探讨多分类AI框架在标准化离体放射影像下区分Straumann(含Tissue Level Standard Plus)与Astra Tech EV(骨水平)及其各自仿制的可行性,并与61名莱茵兰-美因茨大学医学中心牙科人员判断对照。
主要技术方法
研究人员构建定制旋转装置,以Sirona Heliodent Plus(70 kV、7 mA、0.8 ms)配合Dürr VistaScan Plus磷光板获取1250×1630像素JPEG影像;训练集1384张(Straumann系488张、Astra系896张),系统变异探测器距离1–16 cm、倾角0–45°、轴旋0–135°。AI侧采用两阶段:预训练Mask R-CNN(ResNet-50-FPN骨干)做感兴趣区(ROI)定位,OpenCV轮廓裁剪后送入全微调ImageNet预训练ResNet-50(四类输出,交叉熵,Adam lr=1e-4,batch 16,10 epoch),训练:验证=80:20,独立测试74张。人类侧为28人评Straumann对(24图)、33人评Astra对(50图),暗室医用显示器每张限时60秒,四分钟熟悉带标样例,每图报原研/仿制及5%步进自信度。
研究结果
3.1 样本描述:2322次评分中Astra占71%、Straumann占29%;参与者临床年限均数6.5±2.8年,男女各半,自信度均数79%±16%。
3.2 正确种植体识别:混合效应逻辑回归显示截距模型正确概率约92%;植入体类型(p=0.391)、经验(p=0.580)、性别(p=0.466)均无显著性,自评信心强预测(p<0.001);Gwet AC1=0.706示实质一致,评估者间变异大于片间变异。
3.3 人机对比:AI在74张测试集与277张验证集均100%准确(AUC=1.000,95% Wilson CI 95.1%–100.0%),人类二分类实测86.6%,精确二项检验p<0.001,Cohen’s h=0.739为大效应。
3.4 Grad-CAM热图:模型注意力集中于种植体体部螺纹几何、尖端形态及种植体—基台界面,证伪随机背景依赖,指向形态学相关特征利用。
讨论总结
研究人员指出,受控体外设定下AI完美精度可能高估真实性能,同物不同投照虽避像素泄漏却存物体级泄漏风险;人类自信度与正确率关联但属校准待考,AI Softmax为伪概率不表真不确定,故AI宜作筛查支持而非代行诊断责任,最终裁量留人。监管上若进临床属医疗器械(MDR 2017/745/SaMD)需外部异质集验证与可解释性集成。样本仅两原研—两仿制、无骨软组织、无像素级分割真值、招募非随机,均限推广。
结论部分翻译
本体外研究结果表明,标准化条件下多分类AI模型在原研与仿制种植体放射学鉴别中可达无错分类,显著优于人类评估者。鉴于种植体系统及仿制品增多,可靠识别对修复随访、责任与法医考量愈显重要。同时结果揭示AI概率输出不似人类反映真实不确定,可能过置信误分。因此AI应理解为补充临床决策的辅助诊断工具,不替代医师注意义务与诊断责任。但受高度标准化体外设计所限,所述性能应视为技术可行性证据而非临床有效性;缺乏独立临床集验证仍为主限,后续需在更大独立异质常规条件集外验以定泛化性。
(注:全文未引文献角标与图号,专名保留Bremer等原文拼写,上下标以呈现,无HTML转义、无svg、无表格。)