
-
生物通官微
陪你抓住生命科技
跳动的脉搏
使用本地微调的大语言模型对日本药剂师国家考试进行评估
《Scientific Reports》:Assessment of the Japanese national examination for pharmacists using locally fine tuned large language models
【字体: 大 中 小 】 时间:2026年09月04日 来源:Scientific Reports 4.9
编辑推荐:
摘要本地部署的大语言模型(LLMs)在数据安全和定制化方面具有优势,使其在处理敏感信息的领域特别有用。尽管商业云大语言模型在日本药师国家考试(JNEP)中表现出色,但本地部署的开放权重模型在这类知识型任务上的有效性尚未得到充分探索。在需要数据隐私和控制模型部署的环境中,评估这
本地部署的大语言模型(LLMs)在数据安全和定制化方面具有优势,使其在处理敏感信息的领域特别有用。尽管商业云大语言模型在日本药师国家考试(JNEP)中表现出色,但本地部署的开放权重模型在这类知识型任务上的有效性尚未得到充分探索。在需要数据隐私和控制模型部署的环境中,评估这些模型具有重要意义。在本研究中,评估了四种本地部署的大语言模型:phi-4、DeepSeek R1 Distill Qwen (DSR1-Qwen32B),以及基于 DSR1-Qwen 的两个日语微调变体(CA-DSR1-32B 和 CA-DSR1-14B)。在第 109 届 JNEP 的 165 道文本问题上的准确率介于 55.2% 至 76.4% 之间。使用低秩适应(LoRA)的参数高效微调将 phi-4 的准确率从 60.6% 提高到了 66.1%,表明任务特定的适配能提升性能。尽管不同领域的改进程度各异,但结果表明微调可以提升在需要药学知识的考试型问题上的性能。这些结果提供了初步证据,表明本地部署的大语言模型以及包括 LoRA 在内的资源高效适配技术可以应用于诸如 JNEP 之类的结构化知识评估。虽然需要在更广泛的任务中进行进一步评估,但本地部署的大语言模型可能为药学及相关医疗领域的知识密集型任务提供一种有前景的方法。