评估大语言模型在非转移性黑色素瘤诊疗中的应用:一项比较分析

《Frontiers in Medicine》:Evaluating LLMs in non-metastatic melanoma care: a comparative analysis

【字体: 时间:2026年09月08日 来源:Frontiers in Medicine 3.6

编辑推荐:

  背景:恶性黑色素瘤是一种侵袭性皮肤癌,发病率不断上升。准确的早期分期和标准化治疗对预后至关重要。本研究评估了七种大语言模型(LLMs)——包括GPT-5.2、Gemini-3.1以及医学增强模型——在临床复杂性背景下辅助非转移性黑色素瘤管理的能力。方法:研究人

  
背景:恶性黑色素瘤是一种侵袭性皮肤癌,发病率不断上升。准确的早期分期和标准化治疗对预后至关重要。本研究评估了七种大语言模型(LLMs)——包括GPT-5.2、Gemini-3.1以及医学增强模型——在临床复杂性背景下辅助非转移性黑色素瘤管理的能力。方法:研究人员采用前瞻性、模拟专家盲法设计,评估了涵盖TNM分期、年龄和合并症的59个虚拟病例。多位资深肿瘤学家独立使用6点Likert量表评估模型输出的分期准确性、治疗合理性和方案标准化程度。结果:GPT-5.2(5.56?±?1.12)和Gemini-3.1(5.25?±?1.3)取得了最高的分期准确性,而AntAngelMed表现最差(2.93?±?1.67)。在复杂的III期病例中,模型性能显著下降。GPT-5.2和Gemini-3.1在治疗合理性方面也领先,表现出稳定性,而模型性能在早期阶段趋于一致,在晚期阶段出现分化。Gemini-3.1在方案标准化方面表现优异(5.17?±?0.57),但一些模型存在推荐手术切缘不足等风险。结论:领先的LLMs显示出高质量黑色素瘤管理的潜力,但其性能受架构和病例复杂性影响而不一致,在晚期阶段可靠性下降。未来的工具需要风险分层指南和真实世界验证以改善患者结局。
恶性黑色素瘤是一种高度侵袭性的皮肤恶性肿瘤,近年来全球发病率持续上升,给公共卫生带来沉重负担。对于非转移性黑色素瘤,精确的肿瘤分期和标准化治疗是改善预后的关键。目前临床主要依据TNM分期系统及美国国家综合癌症网络(NCCN)和中国临床肿瘤学会(CSCO)等权威指南进行管理。然而,随着疾病进入中晚期,治疗选择呈指数级增加,涉及手术切缘界定、前哨淋巴结活检(SLNB)指征、辅助治疗利弊权衡等多维度决策。同时,医学知识快速更新,不同医疗机构的资源分配和诊疗理念存在差异,导致相同分期患者的治疗策略呈现显著异质性,这种标准化不足直接影响患者生存结局。因此,探索能够辅助临床决策、提高诊疗一致性的新型技术工具成为迫切需求。

近年来,大语言模型(LLMs)的快速发展为上述问题提供了新思路。已有研究初步证实通用LLMs在医学知识问答、病历摘要和基础诊断推理中表现出色,但现有文献多集中于一般医学场景或单一任务,缺乏针对特定癌种完整诊疗流程的系统比较,尤其是基于TNM分期分层分析的研究尚属空白。为填补这一知识缺口,研究人员设计了一项前瞻性、模拟临床病例的评估研究,系统考察七种LLMs在非转移性黑色素瘤管理中的实际效能。该研究发表于《Frontiers in Medicine》。研究结果揭示了不同模型在分期准确性、治疗合理性和实施标准化上的显著分层,并指出疾病复杂程度是影响模型可靠性的关键因素。这些发现为临床医师选择人工智能辅助工具提供了科学依据,也为开发风险分层的临床决策支持系统(CDSS)奠定了基础。

关键技术方法方面,研究人员从所在机构管理的真实非转移性黑色素瘤病例中提取关键决策参数,通过结构化改编构建了59个去标识化虚拟临床场景,覆盖AJCC I-III期、不同年龄段和合并症谱。研究选取了五个主流通用LLM(ChatGPT-5.2、Gemini-3.1、Deepseek-V3.2、Qwen3.5-Plus、GLM-5)和两个医学增强模型(Baichuan-M3-Plus、AntAngelMed)。采用标准化提示词输入,禁用网络搜索,并新开会话避免记忆效应。五位资深肿瘤学专家根据CSCO/NCCN指南,使用6点Likert量表独立盲评各模型在分期准确性、治疗合理性及实施标准化三个维度的表现。统计采用Kruskal-Wallis H检验、Dunn事后检验(Bonferroni校正)、Fleiss' kappa系数及Cohen's d效应量。

研究结果部分如下。

肿瘤分期的准确性:专家间一致性极高(κ=0.9)。GPT-5.2获得最高平均分(5.56±1.12),Gemini-3.1次之(5.25±1.30),而AntAngelMed得分最低(2.93±1.67)且变异性最大。分层分析显示,GPT-5.2和Gemini-3.1在多数TNM分期中表现优异,但所有模型在IIIB期评分均未超过5分,提示晚期复杂病例对语言模型的推理能力构成显著挑战。DeepSeek-V3.2在早期(IA期5.0)尚可,但晚期表现波动大;AntAngelMed则在各阶段均落后,尤其IIIC和IIID期仅约1.6-1.8分。

治疗策略的合理性:GPT-5.2和Gemini-3.1并列最高(均为5.63±0.70和5.63±0.73),且差异无统计学意义。早期(IA-IB期)各模型得分普遍≥5,表现趋同;进入II期后明显分化,例如IIA期DeepSeek-V3.2低至3.93,而GPT-5.2达6.00;晚期(III期)各模型各具优势,如IIIA期Gemini-3.1领先(5.97),IIIB期GLM-5和Baichuan-M3-Plus突出(5.90、5.88),IIIC期Gemini-3.1和GPT-5.2领先(5.64、5.52),IIID期GPT-5.2最高(5.67)。这表明模型在复杂场景中的知识侧重点和推理策略存在差异。

治疗实施的标准化:Gemini-3.1得分最高(5.17±0.57),GPT-5.2次之(4.94±0.72),AntAngelMed最低(3.47±0.94)且变异性最大。尽管部分模型能提出合理的宏观策略,但在转化为具体操作参数(如手术切缘、淋巴结清扫范围)时存在不足。AntAngelMed系统性偏向推荐“切缘不足”;Qwen3.5-Plus和DeepSeek-V3.2在不同分期中波动最大。在复杂IIC/IIIC期,即使领先模型也出现标准化评分波动。

讨论部分指出,通用LLM(如GPT-5.2)之所以优于医学增强模型,可能是因为后者对窄域指南文本“过拟合”,而在边缘病例的原始解剖表型推理上能力不足。晚期IIIB期性能下降与隐匿性淋巴结受累等非线性生物学复杂性有关。治疗决策在II期出现的分化,反映了高危II期黑色素瘤(如SLNB指征和辅助免疫治疗)的临床争议;顶尖模型能内化多因素风险算法,而较差模型依赖过时方案。实施标准化方面的缺陷源于预训练语料中非标准历史实践的影响,导致模型输出“平均化”而非遵循NCCN/CSCO指南。

研究结论最终指出,利用多维专家盲法评估框架,本研究系统描绘了不同LLMs在非转移性黑色素瘤临床管理中的性能分层。虽然领先的通用模型在分期、治疗决策和执行标准化方面展现出接近专家的可靠性,但在晚期复杂场景中性能显著下降,部分医学专用模型表现意外不佳。这些发现为未来临床决策支持系统(CDSS)的开发提供了实证基础。LLMs可作为早期或常规病例的高效标准化参考,但在高危晚期阶段的应用必须与人类专家审查严格整合。未来的研究方向应包括动态多轮交互评估范式和模型集成策略,并通过前瞻性真实世界研究验证AI工具能否切实改善患者临床结局。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号