《Frontiers in Public Health》:Quality, readability, and clinical-risk signals of default public-interface LLM responses to vascular and perioperative patient questions: a cross-sectional snapshot
编辑推荐:
背景:患者日益使用公开大语言模型(LLM)聊天机器人接口获取健康信息。在血管疾病与围手术期管理中,默认首条回复可能影响患者对紧急症状、抗血栓药物、操作选择及麻醉相关安全问题的理解。方法:本横断面基准研究评估了2026年5月28–29日北京时间(UTC+8)一限
背景:患者日益使用公开大语言模型(LLM)聊天机器人接口获取健康信息。在血管疾病与围手术期管理中,默认首条回复可能影响患者对紧急症状、抗血栓药物、操作选择及麻醉相关安全问题的理解。方法:本横断面基准研究评估了2026年5月28–29日北京时间(UTC+8)一限定访问窗口内,五个公开可访问LLM聊天机器人接口返回的110条默认首条回复。接口名称仅记录为访问时可见的公开显示标签,不应解读为经独立验证的API级模型标识。每个模型以22个指南衍生的英文患者面向问题查询,共得110条回复。采用DISCERN、确保患者信息质量(EQIP)、全球质量量表(GQS)、美国医学会(JAMA)基准标准(仅作可见元数据/透明度替代指标)、六种可读性公式、研究者制定的指南一致性评分(GCS)及研究者制定的潜在临床风险严重度标记进行评估。跨接口差异采用Friedman检验与Holm校正事后比较。结果:既定量表评分者间一致性高(DISCERN ICC(A,1)=0.940,EQIP ICC(A,1)=0.830,GQS加权κ=0.829,JAMA加权κ=0.898)。DISCERN、EQIP、JAMA标准(均p<0.001)及GQS(p=0.011)差异显著。标签为“Grok-4.3”的接口在DISCERN(58.68)、EQIP(81.14)、GQS(4.27)、JAMA可见元数据代理分(1.00)均值最高;无接口达六年级可读性推荐值,单条回复均未同时满足六项可读性阈值,标签“DeepSeek-v4”可读性最优但FKGL均值仍达11.53。结论:该英文基准中107/110条回复获满分GCS,无回复触发高风险标记。显著天花板与地板效应妨碍对临床充分性或安全性的结论。发现不应推广至非英文使用、不同健康素养、各国急诊路径、其他地区/账户配置或后续接口状态。
研究背景与动机
患者越来越多地借助公开大语言模型(LLM)聊天机器人接口获取健康信息,尤其在血管疾病与围手术期管理场景中,默认首条回复可能左右患者对紧急症状识别、抗血栓用药、操作决策及麻醉安全的判断。既往综述指出LLM可辅助患者教育,但准确性、可靠性、可读性、透明度及以患者为中心的验证仍存疑;在线心血管与血管健康教育材料常高于推荐阅读年级,ACC/AHA患者材料亦如此。2025年系统综述显示LLM仅在被显式提示简化时才可改善可读性。血管与围手术期属高风险域,需个体化临床解释,而公开接口用户多不会主动请求六年级语言或来源标注,故评估零样本单轮默认首条回复具现实生态效度。该研究发表于《Frontiers in Public Health》,旨在对五个公开LLM接口在2026年5月下旬单一窗口、自香港IP、登录账户下的默认英文首条回复做时间定点基准刻画,而非确立持久模型排名。
主要技术方法
研究人员采用横断面基准设计,以22个源自PubMed索引临床实践指南与共识(覆盖外周动脉疾病、慢性肢体威胁性缺血、颈动脉病、腹主动脉瘤、围手术期心血管评估、抗血栓管理及区域麻醉安全)的英文患者面向问题,在2026年5月28–29日于Windows 10/Chrome隐身模式、新建登录账户、中国香港IP下,对五个公开Web接口(显示标签ChatGPT-5.5-thinking、DeepSeek-v4、Gemini-3.5-flash、Grok-4.3、Qwen3.7-max)逐题新建会话、清缓存、原文输入、保留首条完整回复,得110条。回应文本去标识随机化后由两名资深血管外科医师独立盲评,资深医师裁决;Q18–Q22另由一名麻醉科医师独立评GCS与风险标记。量表含DISCERN(16–80)、EQIP(20项百分比)、GQS(1–5)、JAMA基准(0–4,仅作可见元数据代理);可读性用readabilityformulas.com算ARI、FRES、GFI、FKGL、CLI、SMOG;研究者订GCS(0–2)与潜在临床风险严重度标记(0–2)。统计用SPSS 29与R 4.3.2,Friedman检验+Wilmoxon-Holm事后,配对题级bootstrap(1万次)作敏感性,ICC与加权κ估一致性,CHART框架报告。
研究结果
数据集与评分者间一致性:110条无拒绝/空白。裁决前DISCERN ICC(A,1)=0.940、EQIP 0.830、GCS加权κ=0.829、JAMA 0.898;两项研究者量表确切一致98.2%、加权κ=0.491(分布极度不均)。麻醉医师对Q18–Q22(25条)与裁决集一致24/25(96.0%),二次加权κ=0.648。
患者信息质量与可见元数据:Friedman显示DISCERN(χ2=40.535,p<0.001,Kendall W=0.461)、EQIP(χ2=21.807,p<0.001,W=0.248)、GQS(χ2=12.966,p=0.011,W=0.147)、JAMA代理(χ2=23.138,p<0.001,W=0.263)跨五接口差异显著。Grok-4.3在四项均值最高(DISCERN 58.68、EQIP 81.14、GQS 4.27、JAMA 1.00)。
指南一致性与潜在临床风险:GCS天花板效应——107/110(97.3%)得满分2,3条得1,0条得0;风险标记地板效应——107条得0,3条得低中度1,0条得高分2;三对部分一致回复即三对低风险回复(Gemini-3.5-flash对Q15、Q21;Qwen3.7-max对Q12),涉AAA随访间隔未个体化、抗凝中断/桥接未按出血/血栓/肾功限定、颈动脉干预未分症状/狭窄度/多学科评估。两量表Friedman均p=0.255不显著且分布完全重合。
可读性:所有接口超六年级推荐。DeepSeek-v4最优(FKGL均值11.53,FRES 42.09),Grok-4.3最差之一(FRES 29.18,CLI 15.95)。六项公式跨接口均p<0.001,Kendall W 0.232–0.424。无单条同时满足六阈值。
综合与两两模式:方向对齐归一化热力图(图3)与复合z分图仅作探索可视化不用于推断。Grok-4.3的DISCERN bootstrap差值7.32–11.23点且95%区间不含0;DeepSeek-v4在多个年级指数优于Gemini-3.5-flash、Grok-4.3、Qwen3.7-max。
讨论部分总结
研究人员指出,快照式基准揭示五接口默认首条回复在信息质量/可见元数据上有差异,但可读性全超推荐、无高分风险建议(受天花板地板限解);相对排序非持久优越性,因后端路由/安全层可变。JAMA低分仅反映缺传统出版元数据而非综合可信度低。可读性差距主因含必留医学术语,但患者看到的是完整文本,故仍具生态意义;与“显式简化可降年级”文献对照,说明默认输出不能假定患者可用。GCS与风险标记数值重叠因样本受限,不等同两构念等价。临床含义:LLM可作广义科普首过工具,但不能替代对紧急症状、抗栓、操作指征、麻醉安全的个体化咨询;部署须加红标症状、停药警告、来源/时效线索与“须与医师个体化讨论”声明。
结论译文
在该2026年5月下旬自中国香港IP、特定登录账户访问的五公开LLM接口英文默认首条回复基准中,110条中的107条获满分指南一致性评分,无回复满足预设高分潜在临床风险严重度标记标准。显著的天花板与地板效应妨碍对临床充分性或安全性的结论。这些发现不应推广至非英文使用、不同健康素养水平、国家特异性急诊路径、其他地区或账户配置,或后续接口状态。