
-
生物通官微
陪你抓住生命科技
跳动的脉搏
人类评估员与作为评判者的LLM:迈向全球健康领域生成式AI的规模化评估
《npj Digital Medicine》:Human evaluators vs. LLM-as-a-Judge: toward scalable evaluation of GenAI in global health
【字体: 大 中 小 】 时间:2026年07月21日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要如何评估生成式AI的输出,仍是确保AI在医疗领域安全且大规模应用时的关键瓶颈。专家的临床判断常被视为黄金标准,但人工评估既昂贵又存在一致性问题。虽然已有利用AI来评估其他AI输出的“AI作为评判者”系统被提出,但其在全球医疗领域的可靠性尚未得到验证。我们比较了五种AI评判者与
如何评估生成式AI的输出,仍是确保AI在医疗领域安全且大规模应用时的关键瓶颈。专家的临床判断常被视为黄金标准,但人工评估既昂贵又存在一致性问题。虽然已有利用AI来评估其他AI输出的“AI作为评判者”系统被提出,但其在全球医疗领域的可靠性尚未得到验证。我们比较了五种AI评判者与六名人类临床医生对卢旺达卫生工作者提出的问题的回答进行评估的情况。表现最佳的AI评判者(Claude-4.1-Opus)在11项评估标准中仅有4项与人类评估者结果一致,其他模型的评分要么过宽(Gemini-2.5-Pro),要么过严(GPT-5)。即便组建“AI评审团”以平衡各模型间的偏差,也仅使另一项标准上的评价更加一致。值得注意的是,当从英语切换到基尼亚卢旺达语时,这些系统的性能和成本效益都会下降。总体而言,尽管AI评判者展现出潜力,但其无法处理语言和文化背景因素这一缺陷是严重的限制,这也凸显出需要在可扩展的评估解决方案上进一步投入。