
-
生物通官微
陪你抓住生命科技
跳动的脉搏
大型语言模型在肝损伤药物警戒证据结构化摘要中的应用评估:性能、一致性与安全性分析
《BMC Pharmacology and Toxicology》:A source-grounded benchmark for extracting causality-relevant pharmacovigilance evidence from liver injury case narratives
【字体: 大 中 小 】 时间:2026年10月11日 来源:BMC Pharmacology and Toxicology 2.8
编辑推荐:
摘要背景肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。方法我们进行了一项描述性单次运
肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。
我们进行了一项描述性单次运行基准测试,使用120例源自LiverTox的叙述,这些叙述在提示和模式开发期间被排除在外:包括42例草药诱导或植物/草药膳食补充剂相关肝损伤病例,以及78例常规药物诱导肝损伤对照组。一个锁定的模式为每个病例定义了40个字段。初始的单专家参考之后,进行了由模型触发、模型盲法的人为原始资料再审查,涵盖240个唯一病例字段行,在最终重新评分前产生了184处修正。对GPT、Codex和异质性Gemini混合端点条件进行了评估。结局指标包括状态-模式遵从性、与最终精选参考的一致性、原始和标准化精确匹配率、证据片段提供及原文片段匹配率,以及六项规则靶向安全差异筛查(含盲法人工裁定)。
所有360个输出均可解析。有效状态率为:GPT 100.0%,Codex 99.9%,Gemini混合端点条件63.5%。与最终精选参考的状态一致率分别为81.5%、81.5%和50.3%;标准化精确匹配率为60.0%、60.5%和30.8%。在非空模型提供片段中的原文片段匹配率分别为100.0%、99.8%和95.6%。靶向筛查产生了15、25和40个自动标记,其中经盲法裁定确认了10、19和38个可能影响因果关系的模型错误。未得到支持的不存在合并暴露是最常见的确认类别。
在所评估的单次运行条件下,执行条件产生了可解析的结构化输出,但模式遵从性、与最终精选参考的一致性,以及靶向安全相关错误特征存在差异。结构化输出和原文证据片段并不能消除人工验证的需要。本研究未评估自动化因果评估、临床就绪状态或人在环路工作流的有效性。
不适用。
肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。
我们进行了一项描述性单次运行基准测试,使用120例源自LiverTox的叙述,这些叙述在提示和模式开发期间被排除在外:包括42例草药诱导或植物/草药膳食补充剂相关肝损伤病例,以及78例常规药物诱导肝损伤对照组。一个锁定的模式为每个病例定义了40个字段。初始的单专家参考之后,进行了由模型触发、模型盲法的人为原始资料再审查,涵盖240个唯一病例字段行,在最终重新评分前产生了184处修正。对GPT、Codex和异质性Gemini混合端点条件进行了评估。结局指标包括状态-模式遵从性、与最终精选参考的一致性、原始和标准化精确匹配率、证据片段提供及原文片段匹配率,以及六项规则靶向安全差异筛查(含盲法人工裁定)。
所有360个输出均可解析。有效状态率为:GPT 100.0%,Codex 99.9%,Gemini混合端点条件63.5%。与最终精选参考的状态一致率分别为81.5%、81.5%和50.3%;标准化精确匹配率为60.0%、60.5%和30.8%。在非空模型提供片段中的原文片段匹配率分别为100.0%、99.8%和95.6%。靶向筛查产生了15、25和40个自动标记,其中经盲法裁定确认了10、19和38个可能影响因果关系的模型错误。未得到支持的不存在合并暴露是最常见的确认类别。
在所评估的单次运行条件下,执行条件产生了可解析的结构化输出,但模式遵从性、与最终精选参考的一致性,以及靶向安全相关错误特征存在差异。结构化输出和原文证据片段并不能消除人工验证的需要。本研究未评估自动化因果评估、临床就绪状态或人在环路工作流的有效性。
不适用。