
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于证据的牙科种植体治疗中不同大型语言模型性能的评估:采用专家小组评估的盲法对照实验研究
《BMC Oral Health》:Evaluating different large language model performances in evidence-based dental implantology: a blinded controlled experimental evaluation using expert panel assessment
【字体: 大 中 小 】 时间:2026年07月24日 来源:BMC Oral Health 3.8
编辑推荐:
摘要背景在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问
在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问题时,提供准确、基于证据且具有临床相关性的答案的能力。
在受控条件下,向四种LLM提出了16个硕士水平的临床问题。三位牙科种植体领域的专家根据特异性、准确性及临床实用性这三个核心标准,使用0–10分制独立评估了这些模型的匿名回答结果。描述性统计数据以中位数和四分位距的形式呈现。模型间的差异主要通过Kruskal–Wallis检验来分析,而评分者间的一致性则通过Fleiss’ kappa系数进行评估。
在所有评估标准上,LLM4始终获得最高的中位数得分(特异性:中位数9.0,四分位距9.0–10.0;准确性:中位数9.5,四分位距9.0–10.0;临床实用性:中位数10.0,四分位距9.0–10.0),其表现显著优于其他模型(所有p?<?0.001)。Cohen’s d系数显示,在与LLM2和LLM3的比较中,LLM4的效果大小为较大到非常大。LLM2的得分最低,且变化幅度最大。在所有评估指标上,评分者间的一致性都较低(κ?=?0.078–0.180),表明评估者之间存在一定程度的分歧。
在所测试的模型中,LLaMA 3.2?+?RAG在牙科种植体领域的临床表现更为出色且更稳定。虽然微调能带来一定的提升效果,但实时获取结构化指南能显著提高回答质量。尽管评分者间的一致性较低,但这些研究结果仍显示出RAG模型在支持高复杂性、基于证据的临床应用方面的巨大潜力,同时也强调了在AI评估方案方面需要标准化。
在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问题时,提供准确、基于证据且具有临床相关性的答案的能力。
在受控条件下,向四种LLM提出了16个硕士水平的临床问题。三位牙科种植体领域的专家根据特异性、准确性及临床实用性这三个核心标准,使用0–10分制独立评估了这些模型的匿名回答结果。描述性统计数据以中位数和四分位距的形式呈现。模型间的差异主要通过Kruskal–Wallis检验来分析,而评分者间的一致性则通过Fleiss’ kappa系数进行评估。
在所有评估标准上,LLM4始终获得最高的中位数得分(特异性:中位数9.0,四分位距9.0–10.0;准确性:中位数9.5,四分位距9.0–10.0;临床实用性:中位数10.0,四分位距9.0–10.0),其表现显著优于其他模型(所有p?<?0.001)。Cohen’s d系数显示,在与LLM2和LLM3的比较中,LLM4的效果大小为较大到非常大。LLM2的得分最低,且变化幅度最大。在所有评估指标上,评分者间的一致性都较低(κ?=?0.078–0.180),表明评估者之间存在一定程度的分歧。
在所测试的模型中,LLaMA 3.2?+?RAG在牙科种植体领域的临床表现更为出色且更稳定。虽然微调能带来一定的提升效果,但实时获取结构化指南能显著提高回答质量。尽管评分者间的一致性较低,但这些研究结果仍显示出RAG模型在支持高复杂性、基于证据的临床应用方面的巨大潜力,同时也强调了在AI评估方案方面需要标准化。