大语言模型回答关于根外颈吸收的结构化问题:一项比较研究

《Odontology》:Large language models answering structured questions on external cervical resorption: a comparative study

【字体: 时间:2026年09月09日 来源:Odontology 2.6

编辑推荐:

   # 摘要 本研究旨在评估六款大语言模型(LLM)在连续七天内回答关于牙外颈椎吸收(ECR)的结构性问题时的准确性、一致性和时间稳定性,并分析其特定领域的错误模式。研究使用了46道经过验证的关于ECR的二元选择题,对四种基础配置(ChatGPT-5、Gemini、Claude

  # 摘要本研究旨在评估六款大语言模型(LLM)在连续七天内回答关于牙外颈椎吸收(ECR)的结构性问题时的准确性、一致性和时间稳定性,并分析其特定领域的错误模式。研究使用了46道经过验证的关于ECR的二元选择题,对四种基础配置(ChatGPT-5、Gemini、Claude和Mistral)以及两种基于文档的检索增强生成(RAG)配置(NotebookLM和Perplexity Pro)进行评估。每款模型均在连续七天内使用三个独立用户账户进行查询。准确性定义为与预定义的参考答案一致的程度。跨账户一致性和时间稳定性分别在账户和日期维度上进行了评估。对各领域的错误模式进行了分析。采用广义估计方程模型评估不同LLM配置、临床领域、用户账户和评估日期之间的回答准确性差异。总体准确率较高(90.8%)。模型配置对表现有显著影响(p = 0.050),其中NotebookLM和Gemini的估计错误率最低(分别为3.0%和4.0%),而Claude的错误率最高(12.0%)。准确率在不同用户账户和评估日期之间保持稳定,未发现与账户相关的变异性证据(p = 0.654)或时间漂移(p = 0.875)。临床领域对表现有显著影响(p < 0.001);分类类问题的错误率最高(37.0%)。LLM表现出高准确率、可重复性和时间稳定性。然而,不同模型和临床领域之间的表现存在差异,分类类问题仍然是难点。这些结果支持将LLM谨慎地整合到临床实践和牙髓病学教育中,同时也强调了人工监督的必要性。重要的是,所观察到的表现仅限于标准化问题,不应被解读为具有全面临床决策能力的证据。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号