在不同输入水平下对大语言模型解读口内扫描仪相关科学文献的比较评估

《The Journal of Prosthetic Dentistry》:Comparative evaluation of large language models in interpreting the scientific literature on intraoral scanners across varying input levels

【字体: 时间:2026年09月09日 来源:The Journal of Prosthetic Dentistry 4.3

编辑推荐:

   摘要问题陈述牙科专业人员越来越寻求人工智能(AI)生成的来源,以获取关于进展和科学文献中新兴主题的简明信息;然而,人们仍然担心AI工具的准确性以及根据提示复杂度生成的回复可靠性。目的本研究旨在评估和比较两个先进的大语言模型(LLM)——OpenAI ChatGPT-5.2(自

  

摘要

问题陈述

牙科专业人员越来越寻求人工智能(AI)生成的来源,以获取关于进展和科学文献中新兴主题的简明信息;然而,人们仍然担心AI工具的准确性以及根据提示复杂度生成的回复可靠性。

目的

本研究旨在评估和比较两个先进的大语言模型(LLM)——OpenAI ChatGPT-5.2(自动模式)和Google Gemini-3.0 Flash——在解读和分析口内扫描仪已发表数据方面的响应准确性。

材料与方法

通过结构化的PubMed检索共选取20篇文章。两名独立的资深口腔修复科专家在盲法评估下,对LLMs在每个提示层级生成的每一条回复进行评估。提示按不同复杂度层级(1-4级)输入:第1级由需要LLM高度逻辑推理的简化提示组成,而第4级由包含方法学的结构化提示组成。采用5点李克特量表在相关性、科学准确性、清晰度和贴近文章内容这四个领域对回复进行评估。采用非参数Friedman检验和经Bonferroni校正的Wilcoxon符号秩检验进行统计分析(α=.05)。

结果

在较简单的提示层级(第1级和第2级),ChatGPT-5.2的答案相关性和清晰度中位数高于Gemini-3.0(P<.05),而在较高层级,趋势发生逆转,Gemini-3.0在第3级(P<.001)和第4级(P<.001)表现显著更优。在科学准确性方面,ChatGPT-5.2在第1级(P=.003)和第4级(P=.023)始终获得更高评分,而Gemini-3.0在各层级间保持稳定(P>.05)。相比之下,Gemini-3.0在贴近文章方面优于ChatGPT-5.2,尤其是在第2级(P<.001)和第4级(P=.019)。

结论

Gemini-3.0 Flash在高度结构化的直接回复型提示中,在相关性、清晰度和贴近文章方面表现突出,而ChatGPT-5.2在所有层级的科学准确性更高,并且在需要高度逻辑推理的简化提示中表现更佳。在利用AI工具进行科研分析时,构建适当的提示输入对于实现更好的科学准确性至关重要。

章节片段

材料与方法

在印度钦奈斯里·拉马钱德拉牙科学院进行了一项带有人类验证的比较实验研究,旨在评估和比较两个先进的大语言模型——OpenAI的ChatGPT-5.2(自动模式)和Google Gemini-3.0 Flash——在解读与口内扫描仪相关的科学内容方面的响应准确性,并已获得机构伦理委员会批准(CSP-III/25/DEC/31/551)。通过结构化的PubMed检索共选取了20篇关于口内扫描仪的文章

结果

总体ICC为0.638(95% CI:0.59至0.68),表明评价者间信度中等。各领域特定ICC为:相关性(ICC=0.705,95% CI:0.62至0.77);科学准确性(ICC=0.544,95% CI:0.42至0.65);清晰度(ICC=0.632,95% CI:0.53至0.72);贴近文章(ICC=0.686,95% CI:0.59至0.76)。Bland-Altman分析证实了可接受的契合度,大多数观察值均落在各领域的95%界限内(图1)。中位数、四分位距的描述性数据

讨论

关于改变输入给LLMs的提示复杂度不会在结果中产生差异的零假设被拒绝,输入提示的复杂度影响了LLMs的响应。AI现已成为研究和数据解读的核心部分,临床医生、学术界人士和研究者日益依赖AI驱动的工具来分析科学证据,但在口腔修复学和数字化辅助等细分牙科领域的比较评估却非常有限

结论

基于本研究的发现,得出以下结论:
  • 1.
    Gemini-3.0在高度结构化的直接回复型提示中表现优异,在相关性、清晰度和贴近文章方面尤为突出,而ChatGPT-5.2在所有层级的科学准确性更高,并且在需要更多逻辑推理的简化提示中表现更佳。
  • 2.
    构建适当的提示输入对于实现更好的科学准确性、相关性、清晰度和贴近程度至关重要

CRediT作者贡献声明

Pranay Jain:概念化、数据整理、形式分析、资金获取、调查、方法论、项目管理、资源、软件、监督、验证、可视化、撰写——初稿、撰写——审阅与编辑。 Fathima Banu R:概念化、数据整理、形式分析、调查、方法论、项目管理、资源、软件、监督、验证、可视化、撰写——初稿、撰写——审阅与编辑。 Anand
Pranay Jain|Fathima Banu R|Anand Kumar V|Sarvesh Kulkarni|Maheshwaran KS
研究生,印度泰米尔纳德邦普鲁尔,斯里·拉马钱德拉高等教育与研究机构,斯里·拉马钱德拉牙科医院与医院,口腔修复学系
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号