
-
生物通官微
陪你抓住生命科技
跳动的脉搏
在针对土耳其甲状腺癌患者教育内容的盲测中,通用型开放权重语言模型的表现优于经过医学领域微调的模型
《Scientific Reports》:A general-purpose open-weight language model outperforms a medically fine-tuned model i?n blinded endocrinologist evaluation of Turkish thyroid cancer patient education
【字体: 大 中 小 】 时间:2026年08月14日 来源:Scientific Reports 4.9
编辑推荐:
摘要开源大型语言模型可以以较低成本在本地部署,因此很适合用于资源有限且非英语环境中的患者教育,而这些环境在目前的LLM基准测试中往往被忽视。目前尚不清楚在这类环境中,针对医疗领域的优化是否能提升面向患者的回答质量。我们比较了一个通用型开源模型(GPT-OSS-20B)和一个经过医
开源大型语言模型可以以较低成本在本地部署,因此很适合用于资源有限且非英语环境中的患者教育,而这些环境在目前的LLM基准测试中往往被忽视。目前尚不清楚在这类环境中,针对医疗领域的优化是否能提升面向患者的回答质量。我们比较了一个通用型开源模型(GPT-OSS-20B)和一个经过医疗领域微调的开源模型(MedGemma-27B-Instruct),看它们在用土耳其语为甲状腺癌患者提供教育内容方面的表现。这两个模型分别回答了60个土耳其患者关于甲状腺癌的提问。五位内分泌科医生在不知晓模型身份和研究假设的情况下,根据准确性、完整性、清晰度、临床实用性以及满意度五个维度,对每个回答进行5分制李克特量表评分。分析时采用每题得分的中位数(每个维度有60对评分数据),并结合威尔科克森符号秩检验和霍尔姆校正方法;效应大小则用等级二列相关系数来衡量,位置差异则通过霍奇斯-莱曼差值法估算。评分者间的一致性通过ICC(2,k)指标来评估,同时还会进行考虑上限值的分析,包括满分率和最高分组分析。经过霍尔姆校正后,GPT-OSS-20B在所有五个维度上的得分中位数都高于MedGemma-27B-Instruct。其中满意度(中位数分别为5.0和4.0;RBC=0.788;霍尔姆校正后p值<0.001)和完整性(中位数分别为5.0和4.0;RBC=0.599;霍尔姆校正后p值<0.001)的差异最为明显。至于准确性、清晰度和临床实用性,由于评分中经常出现最高分,霍奇斯-莱曼位置差异为0,不过基于等级的效应大小仍属于中等至较大水平(RBC为0.45–0.64)。不同模型之间的评分者间一致性良好,数值在0.74–0.80之间。考虑上限值的分析显示,GPT-OSS-20B在各个维度上的满分率都更高,尤其是在满意度和完整性方面差距最为显著。在这次直接对比中,通用型模型GPT-OSS-20B在所有五个维度上的评分都高于经过医疗领域微调的MedGemma-27B-Instruct,其中在满意度和完整性方面的差异最为明显且持续。由此可见,对于用土耳其语为患者提供教育这样的任务来说,医疗领域专项优化并未带来优势。由于仅比较了两种模型,这些结果不能作为关于通用型模型与医疗领域微调模型这一整类模型的普遍结论。
生物通微信公众号