
-
生物通官微
陪你抓住生命科技
跳动的脉搏
用于系统评价任务的大型语言模型与Cochrane综述的比较:一项评估准确性、一致性和时间效率的方案
《Systematic Reviews》:Large language models for systematic review tasks compared with Cochrane reviews: a protocol for evaluating accuracy, agreement, and time efficiency
【字体: 大 中 小 】 时间:2026年09月02日 来源:Systematic Reviews 5.7
编辑推荐:
摘要 背景 大型语言模型(LLMs)在加速系统评价(SR)的各个阶段方面展现出潜力,但目前仍缺乏针对已验证标准的全面比较评估。 目的 旨在比较四种LLM(GPT、Claude、Gemini和DeepSeek)在五个系统评价阶段(搜索策略制定、去重、文章选择、偏倚风险评估和证据
大型语言模型(LLMs)在加速系统评价(SR)的各个阶段方面展现出潜力,但目前仍缺乏针对已验证标准的全面比较评估。
旨在比较四种LLM(GPT、Claude、Gemini和DeepSeek)在五个系统评价阶段(搜索策略制定、去重、文章选择、偏倚风险评估和证据综合)中的准确性、一致性及时间效率,以已发布的Cochrane Review作为参考标准。
采用威廉姆斯拉丁方设计进行随机分配的比较研究。将由15名根据经验分层的研究人员对25项(2020-2025年期间的)Cochrane干预措施系统评价进行研究。提示语将使用4D框架开发;底层过程模型将通过Delphi共识法进行验证,最终的提示语表述将通过专家内容审查来完成。评估指标包括召回率、敏感性、Cohen’s kappa系数和执行时间。
将申请伦理豁免。研究结果将通过五篇同行评审的出版物进行传播。
大型语言模型(LLMs)在加速系统评价(SR)的各个阶段方面展现出潜力,但目前仍缺乏针对已验证标准的全面比较评估。
旨在比较四种LLM(GPT、Claude、Gemini和DeepSeek)在五个系统评价阶段(搜索策略制定、去重、文章选择、偏倚风险评估和证据综合)中的准确性、一致性及时间效率,以已发布的Cochrane Review作为参考标准。
采用威廉姆斯拉丁方设计进行随机分配的比较研究。将由15名根据经验分层的研究人员对25项(2020-2025年期间的)Cochrane干预措施系统评价进行研究。提示语将使用4D框架开发;底层过程模型将通过Delphi共识法进行验证,最终的提示语表述将通过专家内容审查来完成。评估指标包括召回率、敏感性、Cohen’s kappa系数和执行时间。
将申请伦理豁免。研究结果将通过五篇同行评审的出版物进行传播。