综述:人类-人工智能协作用于咬翼片邻面龋检测的有效性:系统综述

《Oral Surgery, Oral Medicine, Oral Pathology and Oral Radiology》:Effectiveness of Human-Artificial Intelligence Collaboration for Interproximal Caries Detection Using Bitewing Radiographs: A Systematic Review

【字体: 时间:2026年07月12日 来源:Oral Surgery, Oral Medicine, Oral Pathology and Oral Radiology 2.0

编辑推荐:

  目的 评估在人类-人工智能(AI)协作条件下,使用咬翼(BW)X线片检测邻面龋,相较于无辅助人工判读的有效性。 研究设计 研究人员对6个数据库进行了系统检索。纳入比较AI辅助判读与无辅助人工判读在BW X线片上邻面龋诊断准确性的研究。由于临床与方法学

  
目的
评估在人类-人工智能(AI)协作条件下,使用咬翼(BW)X线片检测邻面龋,相较于无辅助人工判读的有效性。

研究设计
研究人员对6个数据库进行了系统检索。纳入比较AI辅助判读与无辅助人工判读在BW X线片上邻面龋诊断准确性的研究。由于临床与方法学异质性,结果采用定性综合。偏倚风险(RoB)采用诊断准确性研究质量评价工具2(QUADAS-2)进行评估。

结果
共7项研究符合纳入标准,包含6,400个邻面牙面(共1,802张BW片)。观察者包括牙科学生、全科牙医及研究生阶段临床医师。AI辅助提高了邻面龋检出的敏感性,尤其对早期病损更为明显,而特异性得以保持或仅受到轻微影响(≤3.4%)。3项研究报告显示,在AI支持下观察者间一致性有所改善。阅片时间变化幅度较小且结果不一致。RoB总体为低至中等,多数顾虑与患者选择及指标试验报告相关。

结论
人类-AI协作通过提高诊断敏感性且维持特异性,改善了BW X线片上邻面龋的检出效果,支持将AI作为以临床医师为中心的决策支持工具加以应用。

临床相关性声明
AI辅助咬翼片判读可帮助临床医师在更早阶段更准确地识别邻面龋,从而支持微创治疗方案制定,并降低常规牙科实践中漏诊病损的风险。
INTRODUCTION

本文首先指出,龋病依据世界卫生组织(WHO)定义为全球最常见的非传染性疾病之一,具有持续性的公共卫生负担。龋损可累及乳牙列与恒牙列的光滑面、邻面及??面,其中窝沟与邻接区由于菌斑滞留倾向更易发生病变。邻面病损常位于接触点下方,直接视诊受限,单纯临床检查可靠性不足,因此早期检出对于阻止病变进展及实施微创治疗具有重要意义。文章进一步强调,咬翼片(BW)是邻面病损影像学检出的参考标准,可揭示肉眼不可见的脱矿改变;当其与临床检查联合使用时,可提高诊断准确性并优化治疗决策。随后,作者概述了机器学习(ML)与深度学习(DL)在牙科影像龋病检测中的应用潜力,指出人工智能(AI)的真正价值不在于完全替代医师,而在于以增强智能的形式支持临床解释与诊断决策。尽管既往研究多聚焦于AI单独检测邻面龋,但真正面向临床转化的问题应是医师与AI协作是否优于单独人工阅片,因此本文以系统综述方式对此进行评价。

METHODS

Protocol and Reporting Standards
本综述遵循PRISMA 2020与PRISMA-DTA规范开展与报告,以保证诊断准确性研究报告的透明性,并已在PROSPERO完成注册。该部分说明研究具有预先设定的方法学框架,有助于降低选择性报告风险并提升系统综述的可重复性。

Research Question and Eligibility Criteria
研究问题聚焦于:与无辅助人工判读相比,人类-AI协作是否能够提升临床医师在BW片上检出邻面龋的诊断表现。纳入标准依据PIRDS框架构建。参与者为口腔健康专业人员,包括全科牙医、牙科学生、口腔卫生专业学生及口腔颌面放射科医师。指标试验为人机协同判读,即临床人员在作出最终判断前可参考AI生成的叠加标注、边界框、热图、颜色编码区域、分割掩膜或概率评分。参考标准要求明确且具有临床有效性,例如经校准专家共识判读、多名检查者裁定后的结果,或采用国际龋病检测与评估系统(ICDAS)/国际龋病分类与管理系统(ICCMS)标准的临床视触诊。诊断目标限定为BW影像中的邻面釉质或牙本质龋损。纳入研究设计为回顾性或前瞻性诊断准确性研究,且须比较AI辅助与无辅助人工判读,并报告敏感性、特异性、准确度、诊断信心、判读时间或观察者间一致性等至少1项指标。排除标准包括非邻面龋研究、非BW成像、仅AI或仅人工判读、缺乏有效参考标准,以及病例报告、综述、社论、会议摘要、体外研究和无法提取关键诊断数据的研究。

Search Strategy
研究人员在医学图书馆员支持下,对Ovid MEDLINE、Ovid Embase、CINAHL、Scopus、Web of Science Core Collection及Cochrane Library进行系统检索,并进行了更新检索。检索策略同时使用主题词与自由词,覆盖AI、ML、DL、增强智能、龋病、邻面病损及BW影像等概念,且不设语言及日期限制。此外,还筛查了Google Scholar前100条结果、纳入研究的参考文献,并考虑灰色文献。整体上,该检索策略体现出较广的数据库覆盖和较高的敏感性。

Study Selection
全部检索记录导入Covidence软件进行去重与筛选。两名研究者独立进行题名摘要筛选和全文筛选,并在正式筛选前进行标准校准;分歧通过讨论或第三位研究者裁决解决。该流程有助于降低筛选过程中的主观偏倚。

Human-AI Collaborative Interpretation
该部分提取了AI模型类型、输出形式以及其嵌入诊断流程的方式,例如顺序判读、同步可视化或第二阅片者辅助,并关注龋病诊断阈值是否预先设定或受AI工具影响。作者特别记录了AI呈现风格、阅片者与AI的交互方式、临床经验水平及AI工具特征,为后续异质性解释提供依据。

Data Collection
一名研究者采用结构化模板提取数据,另一名研究者独立核查准确性与完整性。提取变量包括研究基本信息、研究设计、受试者特征、检查者经验及校准、AI模型架构与训练数据集特征、影像采集参数、AI输出形式、阳性阈值以及主要和次要结局。同时还记录流程与时序因素,如是否使用相同参考标准、AI辅助与无辅助判读顺序是否随机化、是否设置清洗期以及是否存在失访等。

Risk of Bias (RoB) Assessment
方法学质量采用QUADAS-2工具评价,覆盖患者选择、指标试验、参考标准及流程与时序4个领域。评价重点包括抽样方式、临床医师是否对参考标准设盲、AI阈值是否预先规定、模型开发是否可能过拟合,以及参考标准对邻面龋分类的适切性。流程与时序方面,则考察参考标准应用的一致性、阅片顺序随机化或平衡化处理以及清洗期设置是否充分。每个领域被评为低、高或不明确风险,并同时判断适用性问题。

Data Synthesis
由于AI模型架构、人机交互模式、影像采集协议、诊断阈值和结局定义存在显著异质性,研究采用叙述性综合而非Meta分析。作者原计划在至少3项研究具有可比设计、相同诊断目标且报告一致诊断参数时进行定量合并,但实际纳入研究未满足这一条件,因此最终未实施统计合并。

RESULTS

Studies Selection
6个数据库共检索到8,702条相关记录,去重后剩余2,983条进入题名与摘要筛选。初筛排除2,966条后,17篇全文接受资格评估,其中10项因体外研究、无人工观察者、使用非BW或非影像数据、或未报告AI辅助前后临床人员表现而被排除,最终纳入7项研究进行定性综合。整体筛选流程符合系统综述标准路径。

Studies Characteristics
纳入研究发表于2021至2025年,分别来自澳大利亚、土耳其、丹麦、德国、英国和韩国,均围绕数字化BW片上邻面龋的人机协作诊断展开。研究对象包括牙科学生、全科牙医及研究生阶段临床人员,总观察者数为239名,分析牙面总数为6,400个。所有研究均采用病例富集型图像集,重点关注邻面龋。AI系统主要基于卷积神经网络(CNN),包括denti.ai、dentalXrai Pro、基于You Only Look Once(YOLO)的模型、基于U-Net的模型,以及商业化决策支持软件AssistDent?。在所有研究中,AI输出均作为辅助信息呈现,而最终诊断仍由人工完成。参考标准通常为口腔放射科医师和/或修复科资深医师的专家共识判读,部分结合ICDAS框架或类似的牙面级评分体系。

Risk of Bias
偏倚风险总体为低至中等。患者选择领域中,大多数研究满足关键信号条目,但有2项研究因样本代表性问题呈高风险。指标试验领域全部研究均被评为不明确风险,主要原因是缺少关于指标试验判读设盲以及AI辅助判读独立性的关键报告。参考标准领域全部研究为低风险,说明参考标准的设定与执行较为适切,且不依赖于指标试验结果。流程与时序领域亦全部为低风险,提示大部分研究对参考标准的应用一致,且无明显排除或流程偏离。尽管存在报告不足与抽样局限,作者认为这些问题未明显削弱研究在临床情境中的适用性。

Diagnostic Performance of Human-AI Collaboration

Evaluators
在学生群体中,3项研究显示增强智能通常可提高邻面龋检出的敏感性及总体诊断表现,同时对特异性的影响不一,对阅片时间影响较小。Hegde等的三臂随机研究比较了无辅助、结构化核对清单及ML辅助3种情境,结果显示ML辅助组在二分类邻面龋检测中的敏感性和诊断比值比最高,而特异性在各组均保持较高水平。Ayan等发现,基于YOLO的AI训练可提升二年级牙科学生对釉质及牙本质邻面龋的敏感性、准确度与F1值,提示AI不仅具有即时辅助作用,还可能具有教育增益。Schropp等将AssistDent?应用于教学场景后发现,使用AI提示的学生初期负向一致性更高,随访时正向一致性有所改善,提示人机协作可能带来一定持续性学习效应。

Dentists and Postgraduate Clinicians
在临床牙医与研究生阶段检查者中,4项研究总体表明AI辅助可稳定提高敏感性,并在若干场景中提升准确度或受试者工作特征曲线下面积(ROC AUC),但特异性的变化并不一致。Devlin等在仅针对釉质期邻面龋的研究中发现,AssistDent?显著提高敏感性,但降低了特异性,显示AI可能促使检查者更偏向早期检出,从而增加假阳性。相对地,Mertens等随机交叉研究表明,使用dentalXrai Pro后,全科牙医的ROC AUC、敏感性和F1值均提高,且特异性也得到改善,说明CNN叠加标注在某些条件下并不会必然导致过度诊断。Schwendicke等基于相关准确性数据进一步进行了卫生系统层面的建模分析,虽然AI提高了邻面龋检出的敏感性,但其成本效果仍取决于后续治疗决策与干预阈值。Lee等采用基于U-Net的模型作为“第二意见”工具,发现AI支持可提高敏感性与F1值,尤其在初始和中度病损方面更明显,对经验较少的医师获益更大。

Agreement and Other Outcomes
在报告该结局的研究中,AI辅助通常提高了观察者间一致性,尤其体现在学生与全科牙医群体中,提示AI提示信息可降低邻面龋识别的主观变异性。关于判读时间,少数研究报告了轻微增加或变化不一致的结果,总体上对工作流程的影响较小,但统计学评估并不充分。

Synthesis of Results and Feasibility of Meta-analysis
尽管若干研究报告了敏感性、特异性等诊断指标,但由于临床与方法学异质性显著,且多数研究未提供完整的2×2列联表数据,故正式Meta分析不可行。异质性主要体现于结局指标、分析单位、研究设计及人机交互方式的差异,因此作者采用结构化叙述综合呈现证据。

DISCUSSION

本文讨论部分认为,人类-AI协作较无辅助人工判读更能提升BW片邻面龋诊断表现,核心优势在于提高敏感性,且对早期或局限于釉质的病损增益最明显。作者将这一结果解释为AI能够帮助识别人工容易忽视的细微影像学脱矿征象,但AI更适合作为以临床医师为中心的支持工具,而非替代专业判断。文章进一步指出,增强智能在口腔放射学中的价值,与龋病诊断本身需要结合临床检查和风险评估的特征高度一致。

Diagnostic performance of human-AI collaboration
作者强调,敏感性的提高具有直接临床意义,因为漏诊早期病损可能导致病情进展并增加侵入性治疗需求。多数研究观察到AI支持可提高敏感性,同时在部分研究中改善F1值与AUC。特异性的波动则可能与用户界面设计、工作流程嵌入方式及检查者经验有关。若AI提示降低了诊断阈值,虽可减少漏诊,但也可能增加假阳性及过度干预风险。因此,F1值与AUC等平衡型指标更能反映临床真实环境下的综合表现。

CNN Models and Algorithms Application
纳入研究中的AI系统均基于CNN架构。作者指出,检测型CNN适于快速引导临床注意可疑区域,有助于提高筛查敏感性;分割型方法则提供像素级病损定位,更有助于解释性与诊断信心,尤其适用于早期或釉质期病损。YOLO等检测模型偏重效率与实时性,而U-Net等分割模型更强调病变范围描绘。即使AI提供提示,最终解释仍高度依赖临床医师经验。

Evaluator experience significantly influenced AI effectiveness
检查者经验是影响AI效果的重要调节因素。经验较少者往往获得更大增益,这可能源于AI在一定程度上弥补了经验不足并减少漏诊;同时,AI还可能促进学习迁移,改善其后续无辅助表现。经验较丰富者因基线表现较高,增益相对较小,但AI仍可作为确认工具并减轻复杂病例中的认知负荷。

Reference Standards and Dataset Characteristics
文章指出,病损定义、分类系统及参考标准缺乏统一,限制了研究间比较与临床转化。病例富集型数据集可能高估模型及协作诊断表现,与真实世界患病谱并不完全一致。此外,诊断指标报告方式不统一、临床相关结局如诊断信心和工作流影响报告不足,也是当前临床AI研究中的普遍问题。

Clinical Translation of this Systemic Review Findings
从临床转化角度看,证据支持将AI视为第二阅片者或提示工具,而非治疗决策的替代者。其应用契合微创牙科理念,因为更早识别病损有助于预防性与风险导向管理。然而,若AI导致阈值下移,也可能将无需立即干预的病损误判为需处理对象,引发过度诊断与过度治疗。因此,AI输出应被理解为风险评估线索,而非直接治疗指令;其临床价值取决于是否能与ICCMS等风险分层和管理框架相衔接,并保持临床医师的监督主导地位。

Limitations of this study
作者承认本综述存在若干局限:研究间在AI模型、人机交互方式及结局指标上的显著异质性限制了可比性,并阻止了Meta分析;诊断数据报告不完整进一步妨碍了定量综合;病例富集型数据集可能高估外部真实场景中的效果;参考标准与临床相关结局报告不一致也削弱了证据的普适性与实践解释性。

Clinician accountability remains essential for ethical and patient-centered AI use
文章最后强调,在伦理和以患者为中心的AI应用中,临床医师责任不可替代。未来研究应优先采用标准化报告、具临床代表性的数据集以及对下游治疗决策的评价;多机构研究与外部验证可增强结果的泛化性;纳入不同经验层级的检查者有助于优化实施策略。高质量研究仍需进一步证实:诊断准确性的提升能否真正转化为患者结局改善。

CONCLUSION

综上,本系统综述认为,在BW片邻面龋检测中,人类-AI协作相较于无辅助人工判读主要通过提高诊断敏感性而改善总体诊断表现,同时通常能够维持特异性。现有证据支持将AI定位为以临床医师为中心的决策支持工具,而不是替代临床判断的自主系统。但由于研究设计、AI方法、参考标准及结局定义存在明显异质性,目前尚不足以对其临床有效性作出完全确定的结论。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号