
-
生物通官微
陪你抓住生命科技
跳动的脉搏
三种多模态大型语言模型在基于儿童资料的正畸筛查中的性能评估
《Scientific Reports》:Performance evaluation of three multimodal large language models for pediatric profile-based orthodontic screening
【字体: 大 中 小 】 时间:2026年07月24日 来源:Scientific Reports 4.9
编辑推荐:
摘要本研究旨在比较三种多模态大型语言模型(ChatGPT、DeepSeek和Gemini)在分析儿童侧貌照片并给出早期正畸干预建议方面的表现,以此评估它们的临床可行性和可靠性。在这项横断面研究中,共纳入了2025年1月至6月期间在嘉兴第二医院就诊的100名5至12岁的儿童。这些儿
本研究旨在比较三种多模态大型语言模型(ChatGPT、DeepSeek和Gemini)在分析儿童侧貌照片并给出早期正畸干预建议方面的表现,以此评估它们的临床可行性和可靠性。在这项横断面研究中,共纳入了2025年1月至6月期间在嘉兴第二医院就诊的100名5至12岁的儿童。这些儿童的照片经过标准化处理后,由这三种模型使用相同的提示词进行分析。模型输出结果被匿名处理,随后由正畸专家和家长在单盲、随机条件下独立评估。评估采用了八维加权评分系统,包括专业性、临床合理性、完整性、个性化、安全性、可理解性、同理心以及易读性。统计分析方法包括Friedman检验、Wilcoxon符号秩检验以及Kendall’s W效应量分析。三种模型的总体得分都很高,介于3.9到4.2之间。ChatGPT的平均得分略高,为4.07至4.15,而DeepSeek和Gemini的得分则较为接近,为3.91至4.09。模型间的差异没有统计学显著性(所有q值均大于0.05),效应量也极小(Kendall’s W值为0.003至0.029)。基于侧貌照片进行儿童正畸筛查时,ChatGPT、DeepSeek和Gemini的表现相当且总体可靠,其中ChatGPT略有优势但并不显著。目前,大型语言模型可作为早期正畸评估的辅助工具,但不能替代专业医生的临床判断。本研究证实,多模态大型语言模型可以作为轻量级的辅助工具,用于初步的儿童正畸筛查,从而显著提高早期颌面畸形筛查的可及性和临床效率。该工具能为三类不同的用户群体带来不同的临床价值:普通医生和儿科医生可以利用标准化的儿童侧貌照片快速判断颅面发育异常的风险,从而准确地将患者转诊给正畸专家,减少不必要的咨询和漏诊情况;儿童患者的监护人可以在家中拍摄标准化的面部图像,自行进行初步评估,及早发现颅面发育异常,抓住5至12岁这一关键的生长调整期,避免延误干预;正畸专家则可将模型输出结果作为患者教育和初步筛查的参考,但这些结果无法替代全面的临床检查和正式诊断。这类人工智能工具仅具有预测性筛查功能,不应被视为临床诊断手段。未来的研究可以结合头影测量片、CBCT扫描以及口内扫描等多模态影像数据,开展大规模、多中心的临床验证。进一步优化模型的分析性能,将有助于在基层口腔医疗机构和家庭健康管理场景中应用这种筛查方案。