大语言模型回答关于根外颈吸收的结构化问题:一项比较研究
《Odontology》:Large language models answering structured questions on external cervical resorption: a comparative study
【字体:
大
中
小
】
时间:2026年09月09日
来源:Odontology 2.6
编辑推荐:
# 摘要
本研究旨在评估六款大语言模型(LLM)在连续七天内回答关于牙外颈椎吸收(ECR)的结构性问题时的准确性、一致性和时间稳定性,并分析其特定领域的错误模式。研究使用了46道经过验证的关于ECR的二元选择题,对四种基础配置(ChatGPT-5、Gemini、Claude
# 摘要本研究旨在评估六款大语言模型(LLM)在连续七天内回答关于牙外颈椎吸收(ECR)的结构性问题时的准确性、一致性和时间稳定性,并分析其特定领域的错误模式。研究使用了46道经过验证的关于ECR的二元选择题,对四种基础配置(ChatGPT-5、Gemini、Claude和Mistral)以及两种基于文档的检索增强生成(RAG)配置(NotebookLM和Perplexity Pro)进行评估。每款模型均在连续七天内使用三个独立用户账户进行查询。准确性定义为与预定义的参考答案一致的程度。跨账户一致性和时间稳定性分别在账户和日期维度上进行了评估。对各领域的错误模式进行了分析。采用广义估计方程模型评估不同LLM配置、临床领域、用户账户和评估日期之间的回答准确性差异。总体准确率较高(90.8%)。模型配置对表现有显著影响(p = 0.050),其中NotebookLM和Gemini的估计错误率最低(分别为3.0%和4.0%),而Claude的错误率最高(12.0%)。准确率在不同用户账户和评估日期之间保持稳定,未发现与账户相关的变异性证据(p = 0.654)或时间漂移(p = 0.875)。临床领域对表现有显著影响(p < 0.001);分类类问题的错误率最高(37.0%)。LLM表现出高准确率、可重复性和时间稳定性。然而,不同模型和临床领域之间的表现存在差异,分类类问题仍然是难点。这些结果支持将LLM谨慎地整合到临床实践和牙髓病学教育中,同时也强调了人工监督的必要性。重要的是,所观察到的表现仅限于标准化问题,不应被解读为具有全面临床决策能力的证据。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号