九种消费级多模态人工智能系统对皮肤血管异常在文本与图像工作流中的诊断一致性:一项横断面审计

《Diagnostics》:Diagnostic Concordance Across Text and Image Workflows in Nine Consumer Multimodal Artificial Intelligence Systems for Cutaneous Vascular Anomalies: A Cross-Sectional Audit

【字体: 大 中 小 】 时间:2026年09月25日 来源:Diagnostics 3.8

编辑推荐:

  背景/目的:广泛可及的多模态人工智能系统(multimodal artificial intelligence systems)在罕见或复杂皮肤血管异常中的可靠性尚不确定。研究人员评估了临床摘要文本、临床摘要文本加图像以及仅图像三种工作流中的诊断一致性和专家评

  
背景/目的:广泛可及的多模态人工智能系统(multimodal artificial intelligence systems)在罕见或复杂皮肤血管异常中的可靠性尚不确定。研究人员评估了临床摘要文本、临床摘要文本加图像以及仅图像三种工作流中的诊断一致性和专家评级的管理输出。方法:在这项横断面审计中,研究人员采用目的性组装、非连续的511例已发表病例挑战集,在九个消费级网络系统的新对话首次响应会话中进行评估(共13,797条最终评分记录)。输出被分类为与来源报告诊断的首位一致(top-1 concordance)、仅纳入鉴别诊断列表(differential-list-only inclusion)或遗漏(omission)。两名血管异常专家独立使用5点量表对预期管理适当性和安全性进行评分。配对比较采用精确McNemar检验、Friedman检验和配对Wilcoxon检验。结果:仅图像工作流的首位一致率范围为0.4%至7.0%,遗漏率为71.0%至97.8%;相应临床摘要文本工作流范围分别为32.9%至53.0%和11.5%至29.4%。在每个系统中,仅图像工作流的性能均低于两种含文本工作流。文本加图像工作流未一致性地优于单独文本工作流。结论:这些带日期戳的工作流对比不能估计真实世界的诊断准确性,也不能分离图像的因果贡献。研究结果支持保留临床背景和专家监督。
皮肤血管异常涵盖血管肿瘤与血管畸形,包括婴儿血管瘤、血管畸形、淋巴管畸形、静脉畸形、卡波西样血管内皮瘤和Sturge-Weber综合征等,其生物学行为、外观、自然史和并发症差异巨大。部分病变呈自限性,但严重婴儿血管瘤、淋巴管和静脉畸形需要遵循不同诊疗路径,罕见肿瘤如卡波西样血管内皮瘤可导致危及生命的凝血功能障碍,Sturge-Weber综合征可同时出现皮肤和神经系统损害。诊断和处理往往需要临床检查、影像学、病理学或分子检测等多维度信息。近年来,多模态人工智能系统(multimodal artificial intelligence systems)可整合文本与图像,消费级网络系统在医学中的应用日益广泛,但其在罕见或复杂皮肤血管异常领域的可靠性缺乏系统验证。已有皮肤病学人工智能性能评价显示结果随疾病类别、图像类型、比较对象和外部验证环境而变化,而针对皮肤血管异常的证据十分有限。因此,研究人员设计了一项日期戳横断面审计,以评估消费者可及系统在三种输入工作流下的诊断一致性与专家管理评级。

研究人员从PubMed检索英文病例报告,无日期限制,最终纳入511例具有诊断挑战性或临床意义的已发表病例,构成目的性、非连续挑战集。研究使用九个消费级网络系统:ChatGPT 4o、Claude 3.5 Sonnet、Gemini 2.0、Copilot、文小言、Kimi、豆包、通义和百小应,于2025年1月至2月通过网页界面访问。每个病例分别在临床摘要文本(H)、临床摘要文本加图像(H+I)和仅图像(I)三种工作流下以新对话首次响应方式进行测试,共产生13,797条最终评分记录。输出由临床医师根据来源报告诊断分类为首位一致、仅纳入鉴别诊断列表或遗漏;两名血管异常专家独立对预期管理适当性和安全性进行5点量表评分。统计采用精确McNemar检验、Friedman检验和配对Wilcoxon检验,并进行多重比较校正。

该研究的关键技术方法包括:从PubMed检索已发表病例报告,由研究人员筛选并组装非连续挑战集;使用固定但按模态定制的提示词,在每个系统的新对话中获取首次响应;由两名具有10年以上临床经验的医师对诊断输出进行分类;由两名血管异常专家独立评分;使用精确McNemar、Friedman和配对Wilcoxon检验进行配对比较。样本队列来源为已发表的公开病例报告,而非前瞻性患者队列。

研究结果部分如下。

3.1 研究样本与诊断一致性
511例病例在九个系统和三种工作流下共产生13,797条评分记录。事后基于标签的病例谱分类显示,血管/内皮肿瘤或反应性增生241例(47.2%),综合征性或复杂性血管/过度生长表现137例(26.8%),血管畸形或相关血管异常56例(11.0%),血管样模拟或相关非血管疾病77例(15.1%)。仅图像工作流的首位一致率范围为0.4%至7.0%,遗漏率高达71.0%至97.8%;临床摘要文本工作流的相应范围为32.9%至53.0%和11.5%至29.4%。对每个系统而言,仅图像工作流的首位一致率均显著低于含文本工作流(与H比较的配对比值比范围0.0019至0.069;与H+I比较为0.0020至0.062;所有调整后p<0.001),且遗漏率显著更高(与H比较比值比22.07至166.00;与H+I比较20.08至125.67;p<0.001)。H+I与H的对比呈异质性:七个系统在H+I下首位一致率更低,八个系统遗漏率更高,但ChatGPT 4o和Claude 3.5 Sonnet未检测到显著首位一致率差异。

3.2 管理评级与评分者间信度
在全部13,797次交互中,预期管理适当性评级的Cronbach α为0.947,ICC(3,1)为0.898;安全性评级α为0.915,ICC(3,1)为0.843,提示两位专家评分高度一致。按工作流合并九个系统后,ICC(3,1)在适当性上范围为0.727至0.912,安全性上为0.746至0.848;按系统合并三种工作流后,适当性ICC(3,1)范围0.768至0.935,安全性0.807至0.862。Friedman检验显示每个系统在不同工作流间的适当性与安全性评分均有显著差异(均p<0.001)。临床摘要文本工作流的适当性评分高于仅图像0.924至2.169分,安全性高0.494至0.841分(Holm校正p<0.001)。H与H+I之间差异因系统而异,例如ChatGPT 4o在H和H+I下的平均适当性/安全性评分均为4.03/4.14,仅图像为3.11/3.30,H与H+I差异无统计学意义。

讨论部分指出,本审计发现仅图像工作流与含临床摘要文本工作流之间存在巨大且一致的性能差距。血管肿瘤和血管畸形可能在表面颜色或形态上相似,但在血流动力学、深部范围、生物学行为上差异显著;罕见肿瘤和综合征性疾病可能带来图像中无法体现的系统性后果,因此仅凭图像容易遗漏有意义的诊断。由于病例来自公开报告,模型可能通过参数记忆或检索增强生成获得相关信息,而消费级界面无法区分响应是来自内部参数记忆、网络搜索、
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号