今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

基于证据的牙科种植体治疗中不同大型语言模型性能的评估:采用专家小组评估的盲法对照实验研究

《BMC Oral Health》:Evaluating different large language model performances in evidence-based dental implantology: a blinded controlled experimental evaluation using expert panel assessment

【字体: 大 中 小 】 时间:2026年07月24日 来源:BMC Oral Health 3.8

编辑推荐:

  摘要背景在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问

  

摘要

背景

在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问题时,提供准确、基于证据且具有临床相关性的答案的能力。

方法

在受控条件下,向四种LLM提出了16个硕士水平的临床问题。三位牙科种植体领域的专家根据特异性、准确性及临床实用性这三个核心标准,使用0–10分制独立评估了这些模型的匿名回答结果。描述性统计数据以中位数和四分位距的形式呈现。模型间的差异主要通过Kruskal–Wallis检验来分析,而评分者间的一致性则通过Fleiss’ kappa系数进行评估。

结果

在所有评估标准上,LLM4始终获得最高的中位数得分(特异性:中位数9.0,四分位距9.0–10.0;准确性:中位数9.5,四分位距9.0–10.0;临床实用性:中位数10.0,四分位距9.0–10.0),其表现显著优于其他模型(所有p?<?0.001)。Cohen’s d系数显示,在与LLM2和LLM3的比较中,LLM4的效果大小为较大到非常大。LLM2的得分最低,且变化幅度最大。在所有评估指标上,评分者间的一致性都较低(κ?=?0.078–0.180),表明评估者之间存在一定程度的分歧。

结论

在所测试的模型中,LLaMA 3.2?+?RAG在牙科种植体领域的临床表现更为出色且更稳定。虽然微调能带来一定的提升效果,但实时获取结构化指南能显著提高回答质量。尽管评分者间的一致性较低,但这些研究结果仍显示出RAG模型在支持高复杂性、基于证据的临床应用方面的巨大潜力,同时也强调了在AI评估方案方面需要标准化。

背景

在牙科种植体领域,人工智能(AI)和大型语言模型(LLM)被越来越多地用于临床决策以及基于证据的信息检索。然而,对于各种AI方法的准确性、可靠性及临床适用性仍存在疑问,这些方法包括通用型模型、微调模型以及检索增强生成(RAG)模型。本研究旨在比较它们在回答与种植体相关的问题时,提供准确、基于证据且具有临床相关性的答案的能力。

方法

在受控条件下,向四种LLM提出了16个硕士水平的临床问题。三位牙科种植体领域的专家根据特异性、准确性及临床实用性这三个核心标准,使用0–10分制独立评估了这些模型的匿名回答结果。描述性统计数据以中位数和四分位距的形式呈现。模型间的差异主要通过Kruskal–Wallis检验来分析,而评分者间的一致性则通过Fleiss’ kappa系数进行评估。

结果

在所有评估标准上,LLM4始终获得最高的中位数得分(特异性:中位数9.0,四分位距9.0–10.0;准确性:中位数9.5,四分位距9.0–10.0;临床实用性:中位数10.0,四分位距9.0–10.0),其表现显著优于其他模型(所有p?<?0.001)。Cohen’s d系数显示,在与LLM2和LLM3的比较中,LLM4的效果大小为较大到非常大。LLM2的得分最低,且变化幅度最大。在所有评估指标上,评分者间的一致性都较低(κ?=?0.078–0.180),表明评估者之间存在一定程度的分歧。

结论

在所测试的模型中,LLaMA 3.2?+?RAG在牙科种植体领域的临床表现更为出色且更稳定。虽然微调能带来一定的提升效果,但实时获取结构化指南能显著提高回答质量。尽管评分者间的一致性较低,但这些研究结果仍显示出RAG模型在支持高复杂性、基于证据的临床应用方面的巨大潜力,同时也强调了在AI评估方案方面需要标准化。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:人工智能|大型语言模型|牙科种植体|临床评估|RAG|模型表现

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号