《Scientific Reports》:Trajectory-aware risk stratification of oral lichen planus using a multimodal large language model: a longitudinal diagnostic accuracy study
编辑推荐:
为了评估多模态大语言模型(LLM)在口腔扁平苔藓(OLP)纵向轨迹分类和风险分层中的性能,与专家小组共识进行比较。这项回顾性诊断准确性研究纳入了300例经组织病理学确诊的OLP并至少随访24个月的患者。研究人员独立评估了多模态纵向病例资料(连续临床记录、口内照
为了评估多模态大语言模型(LLM)在口腔扁平苔藓(OLP)纵向轨迹分类和风险分层中的性能,与专家小组共识进行比较。这项回顾性诊断准确性研究纳入了300例经组织病理学确诊的OLP并至少随访24个月的患者。研究人员独立评估了多模态纵向病例资料(连续临床记录、口内照片和组织病理学报告),这些资料由(ChatGPT, OpenAI)和一个专家小组(参考标准)进行评估,两者均对结果不知情。主要结局是检测专家定义的高危病例(一对余)的敏感性。次要结局包括总体轨迹分类和三级风险分层。专家共识将156例(52.0%)归类为稳定良性,92例(30.7%)为炎症进展,52例(17.3%)为可疑恶性演变。风险分层为73例低风险(24.3%)、161例中风险(53.7%)和66例高风险(22.0%)。对于高风险检测,敏感性为78.8%(95% CI 67.2–87.5),特异性为99.6%(95% CI 97.6–100.0)。总体轨迹分类准确率为94.7%。三级风险分层准确率为76.3%,大多数错误表现为向下偏移(98.6%)。多模态LLM在OLP纵向监测中与专家共识具有高度一致性,轨迹分类准确率高,高风险识别特异性高。这些发现表明,多模态LLM可能通过整合纵向临床信息支持基于轨迹的评估,尽管前瞻性外部验证仍然是必要的。
**论文解读:多模态大语言模型在口腔扁平苔藓纵向监测中的轨迹感知风险分层**
**研究背景与问题**
口腔扁平苔藓(Oral Lichen Planus, OLP)是一种慢性免疫介导的疾病,其临床病程多变,可从良性表现进展为恶性转化。当前OLP的监测主要依赖连续的临床观察,通过主观判断形态学变化来评估疾病轨迹。然而,这种临床观察方法在不同评估者之间以及同一评估者内部存在变异性、偏差和延迟,尤其在非专科环境中更为突出。此外,现有的监测缺乏标准化的定量评估量表,限制了疾病活动的客观评估。
多模态大语言模型(Large Language Models, LLMs)能够同时分析文本和图像数据,为慢性病管理带来了范式转变。尽管已有初步研究验证了多模态LLM在单时间点分类口腔苔藓样病变时的准确性,但其在纵向监测中的应用尚未被探索。先前的研究多聚焦于单次诊断,利用卷积神经网络(Convolutional Neural Network, CNN)或LLM进行OLP与口腔苔藓样病变(OLL)或鳞状细胞癌(SCC)的鉴别,但未能分析跨多次就诊的疾病进展、演变和消退。当前人工智能技术在口腔医学中倾向于使用孤立的数据类型(如图像或文本单独分析),而多模态LLM整合连续图像、纵向临床记录和患者病史进行疾病监测的能力尚未被充分研究。
本研究旨在填补这一空白,通过验证一个多模态LLM平台在OLP纵向监测中的性能,评估其整合纵向临床信息(如病程记录、随访照片和组织病理学报告)以动态分类疾病轨迹并分层恶性转化风险的能力,从而解决临床对标准化、客观工具辅助OLP长期随访的迫切需求。
**研究内容与结论**
研究人员开展了一项回顾性纵向诊断准确性研究,纳入300例经组织病理学确诊的OLP患者,且均完成了至少24个月的随访。研究构建了多模态纵向病例资料,包括基线及随访的临床记录、口内照片和组织病理学报告。这些资料由多模态大语言模型(ChatGPT-5.2, OpenAI)和由三名资深口腔医学专家组成的专家小组(作为参考标准)独立评估,两者均对结果不知情。主要结局指标为检测专家定义的高风险病例(一对余)的敏感性,次要结局包括总体轨迹分类准确性和三级风险分层性能。
研究结论表明,多模态LLM在OLP纵向监测中与专家共识高度一致,轨迹分类准确率高,高风险识别特异性近乎完美,但存在向下的分类偏差,且敏感性中等。该研究发表在《Scientific Reports》,强调了多模态LLM通过整合纵向临床信息支持基于轨迹评估的潜力,但提出在独立使用前需改进模型,并需进行前瞻性外部验证。
**主要关键技术方法**
为开展研究,作者使用了以下关键技术方法:1) 采用多模态大语言模型(ChatGPT-5.2)处理文本和图像输入,通过单一预设提示进行轨迹和风险分类,未进行提示优化或迭代微调。2) 构建标准化纵向病例资料,按时间顺序呈现基线(T0)及后续随访的临床记录、口内照片和组织病理学报告,以保持疾病演变的时序性。3) 以专家小组共识(多数同意,至少三人中两人一致)作为参考标准,进行轨迹分类(稳定良性、炎症进展、可疑恶性演变)和三级风险分层(低、中、高)。4) 从三个学术转诊中心(埃及的King Salman International University, Galala University, Ain Shams University)的电子健康档案和临床档案中连续筛选病例。5) 对组织病理学报告中“异型增生”相关术语进行掩码处理,以最小化信息泄漏,并评估模型对纵向信息的利用情况。6) 进行重复性评估(每例病例独立运行三次),并计算Fleiss’ kappa和百分比一致性。
**研究结果**
**样本特征(Sample characteristics)**:研究共纳入300例经组织病理学确诊的OLP患者,所有患者均完成至少24个月随访。队列以女性患者为主,并代表多种临床亚型,来自三个学术转诊中心。
**专家参考标准分类(Expert reference standard classification)**:根据专家共识,基于纵向随访的轨迹分类,156例(52.0%)为稳定良性,92例(30.7%)为炎症进展,52例(17.3%)为可疑恶性演变。风险分层为73例(24.3%)低风险,161例(53.7%)中风险,66例(22.0%)高风险。
**主要终点:高风险检测(Primary endpoint: high-risk detection)**:在66例专家分类的高风险病例中,52例被正确识别,敏感性为78.8%(95% CI: 67.2–87.5)。特异性为99.6%(95% CI: 97.6–100.0),仅出现1例假阳性。阳性预测值为98.1%,阴性预测值为94.3%。
**轨迹分类性能(Trajectory classification performance)**:总体轨迹分类准确率为94.7%(95% CI: 91.5–96.9),与专家共识的一致性高(Cohen’s κ = 0.913, 加权κ = 0.936)。各类别召回率:稳定良性91.0%,炎症进展98.9%,可疑恶性演变98.1%,精确率均超过87%。
**风险分层性能(Risk level stratification performance)**:总体风险分层准确率为76.3%(229/300)。各类别召回率:低风险100.0%,中风险64.6%,高风险78.8%。精确率:低风险56.2%,中风险88.9%,高风险98.1%。
**错误分析与风险转移(Error analysis and risk transitions)**:共71例错误分类,其中70例(98.6%)为相对于专家共识的向下分类(低估风险),1例为向上分类。最常见的错误模式是中风险被归为低风险(56例),其次为高风险被归为中风险(13例)。
**重复性(Repeatability)**:三次独立运行中,296例(98.7%)完全一致(轨迹和风险分类均一致),Fleiss’ κ = 0.96(95% CI: 0.93–0.99)。其余4例通过多数投票解决,无病例出现三种不同分类。
**纵向信息利用评估(Assessment of longitudinal information utilization)**:在随机选取的50例病例中,两名独立评估者均判断模型生成的解释包含至少一个明确的时间变化或疾病演变引用,表明模型利用了纵向信息而非仅依赖孤立诊断术语。
**校准分析(Calibration analysis)**:Brier评分为0.172,表明整体预测误差较低。高风险检测的受试者工作特征(ROC)曲线下面积(AUC)为0.942(95% CI: 0.911–0.973),显示优秀的区分能力。
**讨论与结论**
**讨论部分总结**:本研究表明,多模态LLM在OLP纵向监测中与专家共识高度一致,轨迹分类准确率(94.7%)显著高于先前单时间点诊断研究(如CNN模型81.82%-88.18%)。高风险检测的高特异性(99.6%)对于避免不必要的活检和患者焦虑至关重要,但中等敏感性(78.8%)和向下的分类偏差(98.6%的错误为低估风险)提示模型在独立使用前需改进。这种偏差可能与数据集中高风险病例占比较小导致的类别不平衡有关,可能导致高风险病例被延迟识别。研究局限性包括:回顾性设计、仅评估单一模型和单一提示策略、样本来自单一国家三个学术中心、缺乏外部验证、对组织病理学术语进行掩码处理可能改变了模型可用信息、以及校准评估受限于分类输出而非概率输出。尽管如此,该框架作为临床决策支持工具具有潜力,但需保持临床专家监督。
**结论部分翻译**:这项工作表明,多模态大语言模型在OLP监测中能够与纵向评估框架高度一致,在三级疾病病程预测中具有高准确率,并在高风险恶性进展识别中具有近乎完美的特异性。观察到的向下分类偏差表明,当前模型在自主使用前仍需改进。随着人工智能从研究走向实践,临床医生、数据科学家和监管机构之间的密切合作对于实现OLP患者的早期准确诊断和个体化管理至关重要。