新技术专栏 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通 | 新技术专栏
生物通首页  >  新技术专栏  >  正文

大型语言模型在肝损伤药物警戒证据结构化摘要中的应用评估:性能、一致性与安全性分析

《BMC Pharmacology and Toxicology》:A source-grounded benchmark for extracting causality-relevant pharmacovigilance evidence from liver injury case narratives

【字体: 大 中 小 】 时间:2026年10月11日 来源:BMC Pharmacology and Toxicology 2.8

编辑推荐:

   摘要背景肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。方法我们进行了一项描述性单次运

摘要

背景

肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。

方法

我们进行了一项描述性单次运行基准测试,使用120例源自LiverTox的叙述,这些叙述在提示和模式开发期间被排除在外:包括42例草药诱导或植物/草药膳食补充剂相关肝损伤病例,以及78例常规药物诱导肝损伤对照组。一个锁定的模式为每个病例定义了40个字段。初始的单专家参考之后,进行了由模型触发、模型盲法的人为原始资料再审查,涵盖240个唯一病例字段行,在最终重新评分前产生了184处修正。对GPT、Codex和异质性Gemini混合端点条件进行了评估。结局指标包括状态-模式遵从性、与最终精选参考的一致性、原始和标准化精确匹配率、证据片段提供及原文片段匹配率,以及六项规则靶向安全差异筛查(含盲法人工裁定)。

结果

所有360个输出均可解析。有效状态率为:GPT 100.0%,Codex 99.9%,Gemini混合端点条件63.5%。与最终精选参考的状态一致率分别为81.5%、81.5%和50.3%;标准化精确匹配率为60.0%、60.5%和30.8%。在非空模型提供片段中的原文片段匹配率分别为100.0%、99.8%和95.6%。靶向筛查产生了15、25和40个自动标记,其中经盲法裁定确认了10、19和38个可能影响因果关系的模型错误。未得到支持的不存在合并暴露是最常见的确认类别。

结论

在所评估的单次运行条件下,执行条件产生了可解析的结构化输出,但模式遵从性、与最终精选参考的一致性,以及靶向安全相关错误特征存在差异。结构化输出和原文证据片段并不能消除人工验证的需要。本研究未评估自动化因果评估、临床就绪状态或人在环路工作流的有效性。

试验注册

不适用。

背景

肝损伤病例叙述中包含与因果关系相关的信息,涉及暴露时间顺序、撤药反应、再暴露反应、合并暴露、竞争病因、表型、产品特征和结局。大型语言模型(LLM)可能辅助结构化药物警戒证据摘要,但仅凭可解析的输出并不能证明与原始证据的一致性或使用安全性。

方法

我们进行了一项描述性单次运行基准测试,使用120例源自LiverTox的叙述,这些叙述在提示和模式开发期间被排除在外:包括42例草药诱导或植物/草药膳食补充剂相关肝损伤病例,以及78例常规药物诱导肝损伤对照组。一个锁定的模式为每个病例定义了40个字段。初始的单专家参考之后,进行了由模型触发、模型盲法的人为原始资料再审查,涵盖240个唯一病例字段行,在最终重新评分前产生了184处修正。对GPT、Codex和异质性Gemini混合端点条件进行了评估。结局指标包括状态-模式遵从性、与最终精选参考的一致性、原始和标准化精确匹配率、证据片段提供及原文片段匹配率,以及六项规则靶向安全差异筛查(含盲法人工裁定)。

结果

所有360个输出均可解析。有效状态率为:GPT 100.0%,Codex 99.9%,Gemini混合端点条件63.5%。与最终精选参考的状态一致率分别为81.5%、81.5%和50.3%;标准化精确匹配率为60.0%、60.5%和30.8%。在非空模型提供片段中的原文片段匹配率分别为100.0%、99.8%和95.6%。靶向筛查产生了15、25和40个自动标记,其中经盲法裁定确认了10、19和38个可能影响因果关系的模型错误。未得到支持的不存在合并暴露是最常见的确认类别。

结论

在所评估的单次运行条件下,执行条件产生了可解析的结构化输出,但模式遵从性、与最终精选参考的一致性,以及靶向安全相关错误特征存在差异。结构化输出和原文证据片段并不能消除人工验证的需要。本研究未评估自动化因果评估、临床就绪状态或人在环路工作流的有效性。

试验注册

不适用。

订阅生物通快讯

订阅快讯:
免费订阅退订

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号