
-
生物通官微
陪你抓住生命科技
跳动的脉搏
对大型语言模型回答牙科问题情况的横向评估
《BMC Oral Health》:A cross-sectional evaluation of Large Language Model answers to dental questions
【字体: 大 中 小 】 时间:2026年07月12日 来源:BMC Oral Health 3.8
编辑推荐:
摘要背景越来越多的患者倾向于通过互联网,尤其是大型语言模型来寻求牙科相关问题的解答。然而,目前尚未对这类模型为患者提供的牙科建议的安全性进行系统评估。方法研究团队准备了涵盖六个领域的30个牙科问题,并用波兰语和英语提交给六种大型语言模型。每种模型每种语言对应的问题都会被回答5次,
越来越多的患者倾向于通过互联网,尤其是大型语言模型来寻求牙科相关问题的解答。然而,目前尚未对这类模型为患者提供的牙科建议的安全性进行系统评估。
研究团队准备了涵盖六个领域的30个牙科问题,并用波兰语和英语提交给六种大型语言模型。每种模型每种语言对应的问题都会被回答5次,最终得到了2,700条不同的模型回复,每条回复都由两名牙医独立评估。研究人员还训练了一个二元文本分类器,该分类器结合了Qwen3-Embedding-0.6B词嵌入与支持向量机,使用1,680条已标注的回复进行训练,再用420条未参与训练的回复进行测试。
不同评估者在对内容危害性的判断上存在较高的一致性(科恩系数为\(\kappa = 0.722\))。在没有系统提示的情况下,gpt-4o、gpt-4o-mini和llama-3.3-70b产生的回复中,有56%被判定为有害(两种语言的结果合并统计,若某问题的5条回复中至少有一条被至少一名评估者标记为有害,则该问题被视为有害)。添加了安全导向的系统提示后,这一比例下降了26个百分点,降至30%。此外,llama-3.3-70b在处理波兰语问题时产生的有害内容比例明显高于处理英语问题时(卡方值为\(\chi ^2 = 25.65\),概率值小于0.000001)。虽然训练出的分类器存在将无害回复误判为有害的倾向,但其对波兰语内容的识别准确率低于英语内容。
如果不对公共可用的大型语言模型加以约束,它们可能会给牙科患者带来安全隐患。系统提示能有效减少有害内容的产生。未来可考虑针对不同语言进行模型训练,以及采用检索增强生成等策略来降低错误输出的概率。
越来越多的患者倾向于通过互联网,尤其是大型语言模型来寻求牙科相关问题的解答。然而,目前尚未对这类模型为患者提供的牙科建议的安全性进行系统评估。
研究团队准备了涵盖六个领域的30个牙科问题,并用波兰语和英语提交给六种大型语言模型。每种模型每种语言对应的问题都会被回答5次,最终得到了2,700条不同的模型回复,每条回复都由两名牙医独立评估。研究人员还训练了一个二元文本分类器,该分类器结合了Qwen3-Embedding-0.6B词嵌入与支持向量机,使用1,680条已标注的回复进行训练,再用420条未参与训练的回复进行测试。
不同评估者在对内容危害性的判断上存在较高的一致性(科恩系数为\(\kappa = 0.722\))。在没有系统提示的情况下,gpt-4o、gpt-4o-mini和llama-3.3-70b产生的回复中,有56%被判定为有害(两种语言的结果合并统计,若某问题的5条回复中至少有一条被至少一名评估者标记为有害,则该问题被视为有害)。添加了安全导向的系统提示后,这一比例下降了26个百分点,降至30%。此外,llama-3.3-70b在处理波兰语问题时产生的有害内容比例明显高于处理英语问题时(卡方值为结论 如果不对公共可用的大型语言模型加以约束,它们可能会给牙科患者带来安全隐患。系统提示能有效减少有害内容的产生。未来可考虑针对不同语言进行模型训练,以及采用检索增强生成等策略来降低错误输出的概率。