大语言模型安全性与可靠性评估框架的构建:一项概念验证评估

《Journal of Medical Systems》:Development of a Framework for Evaluating Large Language Model Safety and Reliability: a Proof-of-Concept Evaluation

【字体: 大 中 小 】 时间:2026年09月24日 来源:Journal of Medical Systems 8.8

编辑推荐:

  大语言模型(LLMs)进入临床决策支持的速度快于方法学对其安全性进行表征的能力。聚合准确性将所有错误视为可互换,无法支持在医疗器械软件(Software as a Medical Device, SaMD)和欧盟人工智能法案框架下的安全部署。本研究旨在开发并演

  
大语言模型(LLMs)进入临床决策支持的速度快于方法学对其安全性进行表征的能力。聚合准确性将所有错误视为可互换,无法支持在医疗器械软件(Software as a Medical Device, SaMD)和欧盟人工智能法案框架下的安全部署。本研究旨在开发并演示一个使用灾难性失败频率和响应可重复性来评估大语言模型安全性与可靠性的框架,并纳入预先指定的误差分类、难度分层分析和两层响应一致性。该框架应用于来自非公开机构记录的54个诊断具有挑战性的急诊病例。通过应用程序编程接口(Application Programming Interface, API)访问6个大语言模型(仅文本、零样本、默认设置;2025年8月至12月),每个模型查询三次,共产生972个由医师评分的响应。聚合评分掩盖了异质性:锚定偏倚失败(评分≤3)变化近四倍(6.9%–26.4%),罕见病识别变化六倍(6.1%–37.9%);灾难性(危险推荐,评分≤2)率呈现两层结构(最安全的两个模型为1.5%,其余为6.0%;p<0.001),尽管层级内的排序无法区分(每个模型2–12次)。尽管处于中间性能层级,GPT-5.1的可重复性最低(病例内标准差为2.69),并属于较高灾难性失败层级;在所有模型中,34种危险组合中有31种是随机的而非系统性的——这是一种被聚合指标隐藏的失败模式。开源DeepSeek R1与Gemini 3 Pro在1.5分区间内通过两个单侧检验(Two One-Sided Tests, TOST)达到统计等效(Δ = ?0.09;90%置信区间 ?0.47至0.30;p<0.001)。在这项单中心概念验证中,聚合准确性不足以进行安全性特征刻画:平均准确性无法区分的模型具有不同的灾难性失败层级和可重复性特征。错误类型和响应一致性分析可为模型选择、集成设计和合格评定提供信息。
大语言模型(Large Language Models, LLMs)正以前所未有的速度进入高风险临床决策支持领域,但现有评估方法学难以同步刻画其安全相关的失败模式。当前主流评估范式依赖标准化基准上的聚合准确性,将所有错误视为等价,然而在安全关键场景中,不同错误类型的后果差异巨大,且模型输出具有随机性——同一查询多次运行可能产生安全性不同的推荐。这种范式无法支持医疗器械软件(Software as a Medical Device, SaMD)和欧盟人工智能法案等监管框架下的合格评定。现有评估实践存在四个具体缺口:第一,研究普遍仅报告聚合性能而不刻画错误类型,导致有临床意义的失败模式被汇总统计量掩盖;第二,响应一致性研究不足,仅有少量医学评估研究报告随机性处理参数;第三,高性能开源模型(如DeepSeek R1)引入了本地部署维度,但其安全性特征是否与专有系统匹配尚未明确;第四,多数评估来自西方英语环境,跨语言泛化性有限。为此,研究人员开发并演示了一个多维安全性特征分析框架,整合预定义错误分类、难度分层分析和两层响应一致性评估,并将主要安全终点设定为灾难性(危险)推荐频率和响应可重复性,平均性能仅作为支持性分析。该框架应用于来自中国一家三级医院(首都医科大学宣武医院)的54个诊断挑战性急诊病例,评估了6个前沿LLM,以检验聚合准确性是否会掩盖模型间安全特征的差异。

研究人员的主要方法包括:从该院2015—2024年非公开机构记录中,由28名急诊医师组成的小组回顾性挑选54个诊断复杂病例,涉及12个临床领域,并预设三种错误类型(罕见病识别、锚定偏倚易感性、医源性风险识别)。6个模型(DeepSeek R1、DeepSeek V3.1、Claude Sonnet 4.5、GPT-5.1、Grok 4、Gemini 3 Pro)通过官方API访问,采用统一中文零样本提示,每个病例独立查询三次,共获得972个响应;两名不知晓模型身份的急诊医学专家独立评分。统计分析采用线性混合效应模型(Linear Mixed-effects Model, LMM)、两个单侧检验(TOST)、Fisher精确检验、Bland–Altman分析、组内相关系数等,并进行五项预设敏感性分析。

研究结果如下:

**评分者间信度**:总分评分者间信度为中等(组内相关系数ICC=0.719,95%置信区间0.687–0.748),Bland–Altman分析显示无明显系统偏倚(均差0.02)。

**三层性能层级**:线性混合效应模型显示模型间存在显著性能差异(F5,265=27.89,p<0.001)。Gemini 3 Pro(估计边际均值EMM=13.89)和DeepSeek R1(EMM=13.80)构成顶层,两者在预设1.5分最小临床重要差异(Minimal Clinically Important Difference, MCID)内等效(Δ=?0.09,90% CI ?0.47至0.30,p<0.001);Claude Sonnet 4.5、GPT-5.1和Grok 4居中;DeepSeek V3.1(EMM=11.53)显著低于所有其他模型。

**灾难性失败频率**:危险推荐率从DeepSeek R1的1.2%(162例次中2例)到GPT-5.1的7.4%(162例次中12例)不等,整体差异显著(Fisher–Freeman–Halton精确检验p=0.009)。最安全两个模型合并失败率为1.5%(324例次中5例),其余四个模型为6.0%(648例次中39例),差异显著(p<0.001)。值得注意的是,中间性能层级的GPT-5.1落入较高风险层。34个出现危险推荐的病例×模型组合中,31个(91%)为随机性而非系统性危险,说明危险失败多为随机波动。

**响应一致性与可重复性**:将轮次作为固定效应无显著影响(F2,646=0.59,p=0.56),支持轮次作为可交换重复。GPT-5.1的病例内标准差(SD=2.69)几乎是其他模型(SD 1.03–1.36)的两倍,是唯一平均SD超过1.5分MCID的模型,表明其重复查询稳定性最差。

**难度分层**:模型×难度交互作用显著(F10,306=2.66,p=0.004),在困难病例上模型间差距扩大(Gemini 3 Pro下降最小?1.28分,Grok 4下降最大?3.51分)。

**错误分类**:错误类型剖析显示各模型脆弱性模式不同:罕见病识别失败率6.1%–37.9%,锚定偏倚易感性6.9%–26.4%,医源性风险识别6.1%–33.3%。GPT-5.1虽总体性能居中,但锚定偏倚失败率最高(26.4%);DeepSeek R1与Gemini 3 Pro总体失败率相同(7.6%),但各自脆弱性模式不同。

**敏感性分析**:五项预设敏感性分析(Friedman检验、累积链接混合模型、轮次效应、评分者校正、排除Case 20)均保留三层排序、所有TOST等效和可重复性排序。

讨论部分总结:聚合准确性——当前LLM评估的主导指标——可能掩盖模型间安全性关键差异。研究发现三类被汇总统计量隐藏的信息:灾难性失败频率和响应可重复性与均值层级不一致(顶层两个模型同时也是最安全者,而中层的GPT-5.1属于较高风险层且可重复性最低);聚合等效的模型具有不同错误类型脆弱性。开源DeepSeek R1与专有Gemini 3 Pro在聚合性能上统计等效,但在安全性层级上属于最安全组,说明开源模型在适当条件下可具备可靠安全特征。错误分类揭示了架构相关的脆弱性模式,锚定偏倚敏感性与“推理模型”标签不匹配,提示需谨慎解释推理能力与安全性关系。响应一致性是与准确性正交的安全维度,且病例层面的随机失败即使在最稳定模型中也可能发生。监管方面,错误类型分析和两层一致性应成为欧盟AI法案和美国食品药品监督管理局(FDA)SaMD指导的合格评定标准组件。研究也指出主要局限性:单中心数据、错误分类样本量小、中文提示可能偏袒某些模型、评分者信度中等、模型版本时效、无同期人类医生对照等,因此结果是假设生成性的,需多中心前瞻性验证。

研究结论部分翻译:作为一项单中心概念验证,本研究说明——而非确立——整合错误分类剖析、难度分层和两层响应一致性的多维框架能够揭示被聚合准确性掩盖的安全相关差异。在所检查的54个病例中,聚合等效的模型表现出不同的错误类型脆弱性,开源DeepSeek R1在聚合性能上与领先专有模型匹敌,但错误类型特征不同。这些探索性的单机构观察是假设生成性的,在作出任何部署建议之前需要更大规模、多中心、前瞻性且包含人类对照的验证。错误分类和响应一致性分析是未来LLM安全性评估的有前景的组成部分,利用互补安全特征的多智能体架构值得进一步研究。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号