《Pharmaceutical Research》:Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design
编辑推荐:
背景:大型语言模型(LLMs)自动化和支持药物流行病学研究设计的潜力是一个新兴关注领域,但其可靠性仍未得到充分表征。通用型LLMs经常表现出不准确性,而专业化生物医学LLMs在该领域的比较性能仍然未知。方法:本研究评估了通用型LLMs(GPT-4o和DeepS
背景:大型语言模型(LLMs)自动化和支持药物流行病学研究设计的潜力是一个新兴关注领域,但其可靠性仍未得到充分表征。通用型LLMs经常表现出不准确性,而专业化生物医学LLMs在该领域的比较性能仍然未知。方法:本研究评估了通用型LLMs(GPT-4o和DeepSeek-R1)与生物医学微调LLMs(QuantFactory/Bio-Medical-Llama-3-8B-GGUF和Irathernotsay/qwen2-1.5B-medical_qa-Finetune),使用了来自HMA-EMA目录和哨点系统(Sentinel System)的46个方案(2018-2024年)。使用最少到最多(Least-to-Most, LTM)和主动提示(Active Prompting)策略,在相关性、论证逻辑和跨多个编码系统的本体-代码一致性(ontology-code agreement)方面评估了性能。结果:GPT-4o和DeepSeek-R1与LTM提示配对获得了最高的相关性和论证逻辑评分,其中GPT-4o-LTM在HMA-EMA方案的9个问题中的8个达到了中位相关性评分4。生物医学LLMs总体相关性较低,且经常产生不充分的论证。所有LLMs在本体-代码映射方面表现出有限的能力。结论:现成的通用型LLMs目前比所评估的小型生物医学LLMs为药物流行病学研究设计提供了更可靠的支持。在模型控制的比较(GPT-4o使用最少到最多与主动提示)中,提示策略未显著影响性能(配对p?=?0.93),因此提示比较以描述性方式报告。由于两组模型在规模上和在指令调优上也有所不同,这种对比应被解释为对现成可部署选项的比较,而非仅对生物医学专业化的比较。
药物流行病学研究设计是药物流行病学领域的核心环节,其质量直接影响真实世界证据的可靠性,尤其对于临床试验中代表性不足的人群和常规医疗中的比较效果与安全研究。随着人工智能在生物医学研究中的深度融合,大型语言模型(LLMs)被提议作为支持耗时且资源密集任务(如研究设计)的潜在工具。美国食品药品监督管理局(FDA)和欧洲药品管理局(EMA)已开始探索LLMs在监管活动中的用途,但LLMs在药物流行病学研究设计中的可靠性尚未充分表征,通用型模型常出现不准确,而生物医学专用模型的表现未知。因此,研究者开展了一项系统评估,旨在检验通用型和生物医学LLMs结合提示工程策略在支持药物流行病学研究设计中的性能,并探讨模型类型与提示策略的相对贡献。该研究发表于《Pharmaceutical Research》。
研究人员采用了来自HMA-EMA目录和哨点系统(Sentinel System)的46份研究方案(2018–2024年),其中包括16份DARWIN EU
?方案、15份非DARWIN专家方案和15份哨点系统方案。研究评估了两种通用型LLMs(GPT-4o、DeepSeek-R1)和两种生物医学微调LLMs(QuantFactory/Bio-Medical-Llama-3-8B-GGUF、Irathernotsay/qwen2-1.5B-medical_qa-Finetune),并结合7种提示工程策略进行预筛选,最终选择5种模型-提示组合进入主分析。研究者从两大人群队列来源(HMA-EMA目录和哨点系统)获取方案文本,由两名药物流行病学专家根据HARPER清单独立提取设计概念作为金标准,并设置10个问题评估包括研究设计、索引日期、纳排标准、暴露、结局、随访期、协变量及协变量评估窗等内容。评价指标采用Likert量表评估相关性(1–5分)、5分量表评估论证逻辑,并通过规则匹配评估本体-代码一致性。主要技术方法包括:最少到最多(LTM)提示策略,将复杂问题分解为顺序子任务;主动提示(Active Prompting)策略;以及针对GPT-4o自我评估偏倚的盲法人类验证。统计分析使用了Kruskal-Wallis检验、Dunn事后检验、配对Wilcoxon符号秩检验及累积logit混合效应模型等。
在描述性分析中,46份方案的主题以药物利用(n=18)和疾病流行病学(n=15)为主,其次为安全性(n=11)和有效性(n=2);最常用的数据源包括IQVIA Germany(n=23)、SIDIAP(n=15)和哨点分布式数据库(n=14);共涉及15种本体-编码系统,其中ICD、SNOMED、ATC、CPT和RxNorm最为常见。在相关性方面,GPT-4o-LTM和DeepSeek-R1-LTM获得了最高评分,GPT-4o-LTM在HMA-EMA方案的9个问题中有8个达到中位评分4,表现最稳定;Kruskal-Wallis检验显示五种组合间差异显著(H=384.3,p<0.001),Dunn事后检验表明通用型组合之间无显著差异,但均显著优于生物医学组合;模型控制比较中,GPT-4o使用LTM与Active Prompting无显著差异(配对p=0.93)。盲法人类验证中,两名专家与GPT-4o分配的相关性评分完全一致(100%)。在论证逻辑方面,通用型LLMs的评分同样更高,推理更连贯且方法学上更合理;基于GPT-4o的推理一致性评定中,通用型模型“同意”比例为70.7%,而生物医学模型为20.2%(卡方=406.1,p<0.001);但生物医学模型有大量缺失或不可评估的评分(覆盖仅14.7%),因此完整案例分析可能低估其实际差距。在本体-代码一致性方面,所有LLMs表现均有限:在477个模型生成的代码映射中,仅113个匹配参考编码,364个为错误;错误主要由遗漏(占73.6%)和映射到非方案实际使用的编码系统(占17.0%)构成;SNOMED CT和RxNorm的差异多为编码惯例问题(原始标识符对OMOP标准概念ID),而ICD的一致性相对较高。在错误分类方面,生物医学LLMs表现出更频繁的结构化失败,包括无关的自动生成问题(n=189)和缺少论证(n=105),其次为长答案和不遵守算法等;Bio-Medical-Llama-3-8B在核心问题(问题3–7)上错误更集中,而Qwen错误分布较平坦。
讨论部分指出,通用型LLMs的优势可能源于更大规模的预训练语料、成熟的指令调优和对齐,以及小规模基础模型进行窄域生物医学微调可能损害通用指令遵循能力。提示策略未产生一致的总体优势,但LTM的分解式结构可能有助于构建完整推理链,同时也可能使早期错误向下游传播。方案来源显著影响模型表现,HMA-EMA方案评分最高且最稳定,而DARWIN EU
?方案评分较低且不稳定,这可能与主题混合、标题信息量和参考特异性有关。本体编码任务与叙述性解释任务对LLMs的要求不同,不能依赖自由文本推断,需要确定性工具支持。研究还强调了局限性,包括模型规模不匹配、缺少任务特异性微调、提示内容差异、以及人类逻辑评分缺失率偏高等。
研究结论:这项研究表明,现成的通用型LLMs,尤其是GPT-4o和DeepSeek-R1结合LTM提示,在支持药物流行病学研究设计方面优于本研究评估的生物医学LLMs。其优势不仅体现在主要结局(相关性)上,也体现在论证逻辑上,表明这些模型在生成与专家提取答案一致的结果的同时,能提供更连贯的方法学推理。鉴于方案来源间的变异性、对提示策略的依赖性、Likert评分的主观性以及较差的本体-代码性能,这些系统尚不能可靠地用于自主药物流行病学研究设计。它们更适合作为专家辅助工具,在合格药物流行病学家的审阅下支持单个设计要素的起草和总结,而非作为自动化设计系统。由于所评估的生物医学模型在规模上更小,且在指令调优上不如通用模型,该比较反映了当前可部署的选项,而非生物医学专业化本身。