《Frontiers in Medicine》:Artificial intelligence for dental caries diagnosis: translating algorithms to clinical practice
编辑推荐:
龋齿仍然是全球最普遍的慢性疾病,影响超过二十亿人,并导致巨额医疗成本。尽管早期检测是微创牙科的核心,但传统诊断方法存在敏感性有限和检查者间变异性高的问题,尤其对于早期病变。人工智能(AI)已显示出克服这些局限性的潜力,许多研究报告了在受控条件下达到专家水平的性
龋齿仍然是全球最普遍的慢性疾病,影响超过二十亿人,并导致巨额医疗成本。尽管早期检测是微创牙科的核心,但传统诊断方法存在敏感性有限和检查者间变异性高的问题,尤其对于早期病变。人工智能(AI)已显示出克服这些局限性的潜力,许多研究报告了在受控条件下达到专家水平的性能。然而,在算法在硅片上的成功与真实临床环境中的可靠性能之间,仍然存在显著的转化差距。本综述综合了AI用于龋齿诊断的完整开发流程——从数据整理和地面实况构建到模型设计、验证和临床部署。研究人员强调了持续存在的瓶颈,包括不同成像设备和临床环境之间的领域偏移(domain shift)、主观且不一致的标注实践、有限的多模态数据集以及异质性的报告标准。新兴策略如多中心数据收集、概率标注(probabilistic labeling)、自监督学习(self-supervised learning)、领域适应(domain adaptation)和测试时增强(test-time augmentation)提供了部分解决方案,但尚未得到充分利用。研究人员主张从二元检测向定量、基于风险的分期(risk-based staging)转变,这与微创牙科和世界卫生组织《2023–2030年全球口腔健康行动计划》相一致。通过倡导标准化多模态数据集、严格的外部验证、可解释的界面(explainable interfaces)以及以人为中心的临床整合,本综述勾勒出一条将AI创新转化为可信、公平且具有临床意义的决策支持系统的路线图,该系统能够减少全球未治疗龋齿的负担。
论文主体部分总结如下:
**1 Introduction(引言)**
龋齿是一种慢性、多因素疾病,以牙体硬组织脱矿为特征。未经治疗的恒牙龋齿影响全球数十亿人,给中低收入人群带来不成比例的经济负担。世界卫生组织(WHO)的《2023–2030年全球口腔健康行动计划》雄心勃勃地设定了到2030年将未经治疗的龋齿患病率降低25%的目标。传统诊断方法中的视觉-触觉检查和二维放射摄影在检测早期脱矿方面存在局限性。检查者间一致性差,尤其是对于早期病变,导致治疗决策不一致。虽然辅助技术如激光荧光和近红外透照提高了敏感性,但成本高昂且性能不稳定。人工智能(AI),特别是卷积神经网络(CNN),已成为自动化图像分析的有力工具。在龋齿检测、分割、分类和风险预测方面,AI已应用于多种成像模态。在受控研究中,CNN分类和语义分割模型(如ResNet-50、U-Net)表现出高诊断性能,受试者工作特征曲线下面积(AUC)指标达到0.76–0.98,与专家水平相当或超越。然而,在不同数据集的外部验证下,由于严重的领域偏移(domain shift),这些指标通常降至0.53–0.57。本文审视了AI开发全流程,分析了算法在硅片上的性能与临床椅旁实用性之间的转化差距,并强调了领域偏移、标注稀缺和缺乏标准化报告等持续障碍。通过PubMed和IEEE Xplore的结构化检索,结合AI概念、龋齿概念和模态/背景,确定了相关文献。本文从数据、算法和临床转化三个相互关联但不同的角度,综合了一个用于开发稳健、可临床部署的AI龋齿诊断系统的框架。每个部分整合了迄今已完成的工作以及下一步应进行的工作。本文作为一篇叙事性综述,整合了已发表证据的综合分析与前瞻性专家观点,未进行正式偏倚风险评估或荟萃分析,而是采用结构化文献检索策略,并围绕数据、算法和临床转化三大支柱展开讨论。
**2 Methodology(方法论)**
鉴于本文的叙事性性质,未进行正式的系统荟萃分析,而是进行了全面的结构化文献检索以确保广泛覆盖。主要检索的电子数据库为PubMed和IEEE Xplore,并辅以Google Scholar以捕捉跨学科研究和近期在线优先发表的文章。检索时间范围覆盖2020年1月至2025年10月,起始年份与深度学习技术在医学图像分析中的广泛采用时间一致。检索策略在PubMed和IEEE Xplore上结合了医学主题词(MeSH)和自由文本关键词,结构为:(dental caries or tooth decay) and (ai or deep learning for cnn) and (radiograph or bitewing or panoramic or cbct or x-ray or intraoral or periapical radiograph)。对于Google Scholar,使用类似的关键词组合进行筛选,手动筛选前200条按相关性排序的记录。文章选择标准优先考虑同行评审的原创研究、系统综述和临床试验,排除会议摘要和未专门针对基于图像的龋齿检测的研究。当同一队列有多个研究时,保留最全面或最新的报告。此外,手动交叉检查所有纳入文章的参考文献列表和现有系统综述,以识别初始数据库查询遗漏的相关研究。最终纳入的研究由所有作者迭代讨论并达成一致,以符合本综述的主题框架。
**3 Data: the foundation and bottleneck(数据:基础与瓶颈)**
3.1 领域偏移的普遍挑战:领域偏移(domain shift)是指模型在应用于与训练集不同的数据时性能下降,这在牙科成像中尤为突出。深度学习龋齿检测器在特定训练集上表现优异,但在不同X光机、传感器、格式或标注风格的异质性临床环境中可能表现不佳。问题源于成像设备差异(如CCD与CMOS传感器、制造商和成像协议)、患者人口统计学差异(年龄、种族、人群的解剖变异)以及临床条件差异(唾液、修复体存在、疾病患病率)。比较研究表明,当模型在一个厂商的图像上训练而在另一个厂商的图像上测试时,AUC和敏感性会有可测量的下降。一些研究开始通过外部验证或有限的多机构数据收集来解决泛化性问题,但跨设备领域偏移的全面评估仍不常见。其他研究应用了领域适应技术(如对抗性领域适应、特征对齐)或测试时增强来改善性能。无监督领域适应和自监督预训练可恢复0.1–34.2%的精度下降,但硬件特定的高频噪声限制了这种恢复。局部对比度增强策略(如CLAHE)可提高早期釉质病变敏感性,但会放大放射噪声,显著增加假阳性率。为实现跨场景鲁棒性,未来工作必须构建多中心、跨设备的标准化数据集,并优化迁移学习(Transfer Learning)和领域适应算法。训练时应有目的地从不同地点和设备收集数据,并在保留中心上评估模型。建立代表性的全球口腔成像数据库可系统减少硬件变异对诊断准确性的负面影响。
3.2 地面真值悖论与标注稀缺:整理数据集中的“地面真值”(ground truth)存在固有的主观性。在大多数临床成像研究中,组织学金标准如拔牙组织切片难以大规模获取,多位临床医生的标注共识常被视为参考标准。然而,这造成了临床验证的主要瓶颈。专家标注的成对比较显示重叠度低(如文献中报告的IoU值)。概率标注策略(如高斯混合模型将多个标注转换为连续标签热图)已被提出并试点,以保留专家间不确定性而非将其压缩为单一二元掩码。自监督学习(SSL)方法(如SimCLR风格预训练)已应用于未标记的CBCT和放射数据,以减少对昂贵标注的依赖,初步结果显示在下游分类/分割性能上有可衡量的提升。该领域应扩大概率标注流程,并将SSL预训练整合到标准工作流中。具体而言,多专家概率标签应作为训练目标(而非硬共识掩码),并在有监督微调之前将大型未标记临床图像语料库的SSL预训练作为常规步骤。同时,研究联盟应在部分病例上试点收集生物学有意义的基准(如micro-CT、偏振光成像等离体模态),为算法校准提供客观锚点。这些生物学基准尚未广泛可用,但针对性的努力(如在可获取拔牙的学术中心)可创建种子数据集,提高模型可解释性和有效性。
3.3 迈向多模态与标准化数据集:下一代场景的定义必须向“全流程决策支持”演变,以弥合工程研发与临床管理之间的差距。未来在于经过整理的、多模态的公共数据集,平衡标准化与鲁棒性。一些数据集现在将放射图像与临床元数据配对。例如,少数试点数据集(如MMDental和其他机构收藏)结合了CBCT与带注释的临床记录和有限的纵向随访。高分辨率模态如口内光学相干断层扫描(OCT)也被整合到研究数据集中,为早期病变检测提供更丰富的特征。这种整合促进了从简单定性检测到定量分期和纵向风险评估的飞跃。例如,通过从像素分割计算脱矿深度与釉质厚度之比,并直接映射到ADA CCS分类:初始期(仅釉质;指示非侵入性再矿化)、中度(外牙本质;指示微创封闭剂)和晚期(内牙本质;需要微创修复),可实现定量分期。除了构建多中心、跨设备标准化数据集,缓解领域偏移还包括:扩展数据集以包含多模态输入(口内照片、咬翼片和全景放射片、OCT,以及可能时包括非成像数据如患者病史、龋齿风险因素、氟化物暴露、微生物组/唾液生物标志物);收集纵向数据并训练模型进行病变活动性评估和进展预测;标准化标注协议和元数据模式以确保互操作性。
**4 Algorithms: toward precision in prediction(算法:迈向预测的精准化)**
4.1 主流架构与任务:大多数AI龋齿诊断应用使用监督学习,模型在专家标注的数据集上训练以执行特定临床任务。当前格局中的三种主要任务范式——分类(classification)、目标检测(object detection)和分割(segmentation)——基于其空间定位能力和诊断深度形成了临床相关性的层次结构。分类(ResNet风格)广泛用于快速分诊,许多研究在整理数据集上报告了高准确率。目标检测(YOLO系列、EfficientDet、RetinaNet)用于多颗牙定位和多类别病变筛查,单阶段检测器已针对速度进行优化并正在适用于边缘设备。分割(U-Net系列、nnU-Net)提供像素级掩码用于体积量化和ICDAS映射,nnU-Net和自配置框架在分割任务中设定了性能基准。这些架构具有互补优势。例如,YOLOv5在某些任务中表现出比EfficientDet显著更低的假阴性率,但在需要高精度的小目标或遮挡物体或复杂场景中表现不佳。实验证据表明,与单一模型相比,集成策略(ensemble strategies)可显著改善与假阴性相关的性能指标(敏感性/召回率)。表1总结了代表性研究,展示了不同架构、模态和性能基准。未来架构发展方向包括:从二元龋齿/非龋齿分类向细粒度、有序架构转变,能够将像素级分割掩码映射到临床分期系统如ICDAS或ADA CCS;开发混合注意力架构(如Vision Transformers),整合局部特征提取与全局上下文意识以区分解剖变异和实际病理;增强检测任务的算法粒度,从粗边界框转向实例分割,允许精确测量龋齿与牙体的体积比。
4.2 多模态/整合诊断方法:前沿研究正超越孤立的图像分析,向反映龋齿作为生物膜介导疾病生物学复杂性的多模态和整合方法迈进。高分辨率技术如口内OCT以及将放射图与可见光图像配对的多数模态数据集正被用于概念验证研究,以提高早期病变检测能力。融合策略(早期融合、晚期融合、注意力融合)也被探索以结合互补模态。未来系统必须从图像分类器演变为整合诊断助手,涉及:融合来自多个来源的成像数据(如结合口内照片与咬翼片放射图进行更完整评估);纳入非成像数据如患者病史、龋齿风险因素(饮食、卫生、氟化物暴露)和微生物组/唾液生物标志物。
4.3 应对资源约束与真实世界部署:AI的临床部署需要同时实现实时(秒级反馈)和精细区分(如釉质与牙本质龋)。为满足这些对精度和速度的冲突需求,算法进化已根据临床环境分为两个不同方向。轻量级单阶段检测器(YOLO系列及其衍生品)已针对移动和边缘部署进行优化,当前硬件和优化方法下亚100毫秒实时推理似乎可行。相比之下,复杂的双阶段和集成流程在困难成像场景(如修复体附近继发龋)中表现出更优性能,但需要先进计算硬件(如RTX 3090级GPU)进行训练和推理。未来研究需:继续开发混合边缘-云架构,轻量级边缘模型用于即时筛查,基于云的高精度模型用于复杂病例;这种边缘-云-临床闭环应与持续学习机制相结合,整合临床医生反馈和局部数据漂移监测;投资于模型压缩、知识蒸馏和自适应分割框架(如轻量级nnU-Net变体),以将高分割精度带入资源受限环境;在实地研究中验证移动部署,不仅测量诊断指标,还要测量工作流整合、临床医生接受度和下游治疗决策。
**5 Clinical implementation: from metrics to medicine(临床实施:从指标到医学)**
5.1 验证差距:超越回顾性AUC:当前牙科AI的大部分证据来自回顾性诊断准确性研究,优先考虑AUC、敏感性和特异性等指标。虽然这些指标证明了技术可行性,但它们并非真实世界效能的好预测指标。随机对照试验和读者研究一致表明,AI辅助可提高从业者,特别是初级牙医对早期釉质龋的检测敏感性。这些研究证明AI在受控条件下可增强诊断性能。然而,当前牙科龋齿AI的验证研究受限于对回顾性、单中心数据集的严重依赖、主观专家标注的地面真值以及诊断准确性指标。未来研究需:从回顾性验证转向前瞻性、多中心临床试验,测量以患者为中心的结局(如避免不必要的治疗、疼痛预防、长期牙齿保留)而非仅诊断一致性;将多维金标准(如组织学、子集上的micro-CT验证、纵向临床结局)纳入试验设计,以校准AI决策逻辑与生物学现实;在人机协同研究中评估决策影响和工作流人体工学,测量诊断协同效应、对治疗轨迹的决策影响以及临床医生认知负荷。
5.2 可解释性与人机交互:复杂深度学习模型的“黑箱”性质仍是临床医生信任的主要障碍。为解决这一问题,研究人员通过数学可视化和行为评估两种途径探讨可解释性。技术如Grad-CAM和EigenCAM已被应用于可视化模型注意力,为临床医生提供警报的直观理由。眼动追踪研究表明,在某些场景下,AI帮助临床医生减少任务无关注意力并加速目标锁定。未来研究仍需:标准化用于临床的可解释性输出:提供校准热图、不确定性估计和简洁的文本理由,与临床医生工作流整合;将行为研究(眼动追踪、认知负荷测量)扩展到不同临床医生群体和真实世界环境,以确保可解释性干预措施超越实验室条件;设计透明呈现不确定性的界面,以减轻自动化偏见并支持与患者共享决策。
5.3 整合、监管、经济学与伦理:牙科AI的可行性最终取决于与现有PACS和EHR系统的无缝整合、监管批准以及可证明的经济价值。主要司法管辖区的监管路径正在成熟,制造商越来越多地追求设备分类和上市后监测。经济建模研究表明,AI辅助早期检测可通过防止进展为复杂修复护理来降低终身治疗成本。然而,一些研究表明,如果不将增加的检测置于基于风险的管理框架中,可能导致治疗强度增加和潜在过度治疗。未来研究需:优先整合PACS/EHR以最小化工作流摩擦;在试点部署中评估整合策略;规划上市后监测和持续性能监控以检测数据漂移并维持安全性;在临床试验同时进行前瞻性卫生经济学评估,以量化不同卫生系统中的“高初始投资、长期回报”特征。此外,解决AI使用的伦理和法律维度至关重要。数据隐私方面,大规模牙科数据集的使用需要严格的去标识化,并遵守GDPR或HIPAA等框架,防止通过独特牙科解剖结构重新识别患者。算法偏见必须通过确保训练集代表不同种族、社会经济背景和解剖变异来缓解,从而防止诊断差异。同时,诊断错误的问责是一个主要法律障碍。当前共识表明AI应作为“第二读者”,持证临床医生负责最终诊断和治疗。这需要明确的专业指南和可能的新保险框架用于AI辅助护理。最后,知情患者同意至关重要;患者应被知晓AI在其诊断中的使用,并通过透明解释系统角色及其已知局限性来了解。
**6 Additional considerations(附加考虑)**
6.1 标准化与报告:文献显示报告方法异质且不一致,阻碍了复制和荟萃分析。AI报告检查表(CLAIM、TRIPOD-AI、CONSORT-AI、SPIRIT-AI、DECIDE-AI)的采用尚未成为主流。期刊、资助者和会议应强制要求遵守不断发展的报告指南。数据集应以标准化元数据(设备型号、采集参数、患者人口统计学、标注协议和共识方法)发布。基准测试挑战应要求在保留中心进行外部验证,并报告技术指标和临床有意义的结果。这些步骤将数据、算法和转化需求综合为一个连贯的可重复性和验证生态系统。
6.2 公平性、可及性与全球健康目标对齐:大多数算法是在资源充足环境的数据上训练的,这可能导致对代表性不足人群的较差性能。移动筛查工具的概念验证部署已显示出在社区筛查和远程牙科中的潜力。未来工作应有意识地收集包含不同种族、年龄和社会经济背景的包容性数据集;优先开发轻量级、低成本解决方案,可通过移动设备部署于社区筛查和远程牙科,特别是在资源匮乏地区;将AI开发与公共卫生目标(如WHO目标)对齐,聚焦于早期检测和预防导向路径,可在公共卫生项目中推广。
6.3 大语言模型:生成式AI和多模态基础模型的快速发展代表了牙科AI格局的重大转变。大语言模型(LLM)和视觉-语言模型(VLM),如GPT-4V、LLaVA和Med-PaLM M,提供了超越孤立图像分析的潜力,通过将视觉发现与复杂临床推理相结合。与传统CNN输出狭窄的分类或分割掩码不同,VLM可生成结构化诊断报告、用自然语言解释其推理并实时回答临床医生查询。在龋齿管理中,这些模型理论上可综合放射学证据与患者风险因素(如饮食、卫生、唾液生物标志物),提供个性化、纵向的治疗建议。然而,此类模型在牙科中的部署仍处于起步阶段,面临临床上下文中的幻觉、本地部署的高计算需求以及需在高质量牙科语料库上进行领域特定微调等重大挑战。未来研究应聚焦于开发牙科特异性VLM,优先考虑诊断准确性同时保持临床信任所需的可解释性。
**7 Conclusion(结论)**
人工智能在龋齿诊断中具有变革潜力,提供了一条标准化、敏感且可扩展的检测路径,可解决主观人类解释的局限性。深度学习架构的技术进步已在回顾性图像分析任务中达到专家级性能。然而,从高性能算法到可信赖临床工具的旅程复杂,需克服数据稀缺与偏见、领域偏移以及临床真相的主观性等根本挑战。成功取决于将研究范式从追求孤立准确性指标转向工程化整合系统,并通过以患者为中心的严格临床试验进行评估。通过拥抱标准化报告、投资共享多模态数据集、优先考虑可解释性和人机协作,并将开发与全球口腔健康公平目标对齐,牙科AI社区可确保技术兑现其承诺。最终,AI不能取代临床医生;它通过创造协同合作关系增强其专业知识,促进早期检测,推动微创护理,并减少这一基本可预防疾病的全球负担。