RADAR:基于ACR结构适宜性知识库、具备引文验证与弃权机制的大语言模型咨询支持原型

《Journal of Imaging Informatics in Medicine》:RADAR: A Prototype for Grounding Large Language Model Consult Support in an ACR-Structured Appropriateness Knowledge Base with Citation Validation and Abstention

【字体: 大 中 小 】 时间:2026年09月25日 来源:Journal of Imaging Informatics in Medicine 3.1

编辑推荐:

  大语言模型(Large Language Model, LLM)能够流畅回答医学问题,但过于频繁地捏造陈述和引文,在诊疗现场无法不加辅助地被信任。研究人员描述了RADAR(Radiology Appropriateness Decision and Advis

  
大语言模型(Large Language Model, LLM)能够流畅回答医学问题,但过于频繁地捏造陈述和引文,在诊疗现场无法不加辅助地被信任。研究人员描述了RADAR(Radiology Appropriateness Decision and Advisory Resource,放射学适宜性决策与咨询资源),一种原型检索增强式咨询支持流水线,将LLM锚定在一个按美国放射学会(American College of Radiology, ACR)适宜性标准结构、以单个临床变异型为粒度的知识库中。该知识库是合成的(五个主题、十二个变异型),因为官方标准受版权保护。其设计刻意保守:一个BM25检索器、一个绝对分数弃权门、一个受提示内锚定契约约束的结构化输出生成器,以及一个确定性验证器,它会剔除任何引文无法解析到已检索块的推荐。研究人员报告了一个用于参数选择的开发集(八个场景、七个域外探针)和一个在所有参数冻结后撰写的留出集(36个场景,每个变异型三个,以及24个临床邻近探针),在确定性仅检索模式和完整流水线中以温度0进行五次独立运行评估。仅检索在36个留出场景中的25个中将正确变异型排在首位(69.4%;95% CI 51.9–83.7),但总能将其置于前五位,分数门仅拦截了22个临床邻近探针中的3个。完整流水线(claude-sonnet-4–6,温度0,五次运行)在36个场景中的33个(91.7%;95% CI 77.5–98.2)中的每次运行均选择了正确的变异型和首选操作;在每一次独立运行中,36个场景中正确数为33或34个;每次失败运行都是对雷击样头痛表现(thunderclap-headache presentation)的错误弃权,且没有任何场景的任何运行推荐了错误的变异型。它拒绝了22个临床邻近探针中的17个(77.3%;54.6–92.2)。所有721条发出的引文都解析到已检索块。这些发现描述了一个概念验证:词法检索提供主题路由和引文可追溯性,而变异型选择和实际弃权依赖于生成器充当语义重排序器,残余失败是拒绝而非错误答案。临床就绪将需要获得ACR许可的内容、更大的参考标准集和前瞻性评估。
研究背景与现存问题:影像检查适宜性证据早已存在。美国放射学会适宜性标准(ACR-AC)将200多个临床主题细分为变异型,并由专家小组对影像操作按1–9分排序。然而在繁忙急诊等场景中,临床医生难以实时查阅正确的变异型和操作表,标准知晓率高于常规使用率。LLM能解析自由文本并具备较多临床知识,但会捏造陈述与不存在的引文;直接应用于影像适宜性时,模型在精细区分上不稳定,且已有ACR聊天机器人缺少引文验证和明确拒绝机制。因此需要一种将LLM锚定在外部知识库、可验证引文并允许弃权的会诊支持流水线。

研究人员开展的研究:构建RADAR,一种原型检索增强式会诊支持流水线。知识库为合成,包含五个主题十二个变异型,因官方ACR标准受版权保护。设计包括BM25检索器、绝对分数弃权门、受提示内锚定契约约束的结构化输出生成器和确定性引文验证器。开发集用于参数选择,留出集在参数冻结后撰写并用于独立评估。主要结论是:仅凭词法检索可实现主题路由和引文可追溯性,但变异型选择依赖于生成器充当语义重排序器;残余失败表现为拒绝而非错误推荐。研究意义在于提供可复现的概念验证,并明确临床就绪需许可ACR内容、更大参考标准集和前瞻性评估。

关键技术方法:研究人员使用BM25Okapi词法检索,并将每个变异型的场景关键词重复三次后再索引,以避免通用成人变异型压制特殊变异型;采用绝对分数弃权门,顶部BM25分数低于2.0时返回INSUFFICIENT_EVIDENCE;生成器只能推荐检索上下文中逐字出现的操作并附加citation_id,否则声明证据不足;确定性验证器检查每条citation_id是否属于该查询实际检索到的块并剔除未通过者。评估使用开发集和留出集,报告精确二项95%置信区间、逐次运行一致性和语义支持。无患者队列;参考标准由一名诊断放射学住院医师(AA)在系统输出前根据知识库变异型定义指定。

研究结果:

开发集(Development Set):仅检索在8个开发场景中将8个路由到正确主题,7个选到正确变异型;对7个域外探针拒绝6个。原始单次claude-opus-4–8完整流水线运行选择全部8个正确变异型,并拒绝全部7个探针,无引文被剔除。但8项样本的置信区间很宽。

留出集:仅检索(Held-Out Set: Retrieval-Only):在36个留出场景中,词法检索将34个路由到正确主题,但仅25个将正确变异型排在首位(69.4%),36个均将正确变异型置于前五。11个排序失败分为三类:极性或否定错误(如“否认发热、体重下降”被引向red-flag变异型);特殊变异型与默认变异型的混淆;短查询中的主题级错配。分数门对22个应拒绝的临床邻近探针仅拒3个;敏感性分析显示没有任何单一阈值能同时避免错误拒绝和错误放行。简短合法查询“PE workup”被路由,“appendicitis”因得分低于2.0被拒。

留出集:完整流水线(Held-Out Set: Full Pipeline):claude-sonnet-4–6在温度0下五次运行时,36个场景中有33个每次运行均选出正确变异型和首选操作(91.7%);逐次运行正确数为33、33、34、33、33个。11个检索排序失败中10个被生成器在每次运行中纠正。没有任何一次运行推荐错误的变异型;14次失败运行全部是雷击样头痛变异型上的弃权,研究人员未能从结构化输出中确定其机制。在22个应拒探针中,完整流水线拒绝17个(77.3%);5个错误放行包括两个矛盾发现探针被按临床合理方向解决、两个语义相近的非匹配被映射到邻近变异型,以及一个双主题探针被路由至肺栓塞。所有591条留出集推荐和130条开发集推荐的引文均解析到该查询实际检索的块;在166个非弃权运行中,最高推荐均为被引变异型的最高评分操作。非LLM部分延迟为每查询0.15毫秒,LLM平均往返时间为12.2秒。

讨论与结论:讨论部分指出,留出集改变了原先“检索已解决大部分问题”的解读;词法检索可靠完成主题路由和引文可追溯,但变异型选择主要由生成器作为语义重排序器完成。弃权设计是两层的:分数门对非医学输入有效,但对临床邻近输入几乎无效;临床邻近输入的拒绝依赖于生成器在锚定契约下比较检索上下文与查询后主动弃权。研究强调引文有效性是机械性质,语义支持是另一属性,验证器保证“引文指向可见块”,而不保证块内容支持推荐;研究还报告了延迟、模型依赖性和缺少人类对照等局限性。研究结论:将LLM锚定在变异型粒度的ACR结构知识库中,用检索阈值门控并强制引文通过确定性检查,可得到失败模式可读、弃权明确的原型。在留出集上,完整流水线33/36场景全五次正确,拒绝17/22个临床邻近探针,721条引文无无效项,且从不呈现错误变异型;其失败是某一表现上的弃权。这些是合成语料上的概念验证。获得许可的ACR内容、独立标注的参考标准、人类对比和前瞻性评估是任何部署声明的前提。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号