《Neurogastroenterology & Motility》:Gut Instincts, Machine Decisions: Evaluating AI Accuracy in the Diagnosis and Treatment of Disorders of Gut-Brain Interaction
编辑推荐:
背景: 脑-肠互动障碍(Disorders of Gut-Brain Interaction, DGBIs)对于胃肠病学家和初级保健临床医生来说是常见但具有挑战性的诊断。大型语言模型(Large Language Models, LLMs)可能支持临床管理,但
背景: 脑-肠互动障碍(Disorders of Gut-Brain Interaction, DGBIs)对于胃肠病学家和初级保健临床医生来说是常见但具有挑战性的诊断。大型语言模型(Large Language Models, LLMs)可能支持临床管理,但其准确性仍不明确。本研究使用来自罗马IV多维临床概况(Rome IV Multidimensional Clinical Profile, MDCP)的方便样本临床场景,评估了五种大型语言模型(LLMs)的诊断和治疗准确性。
方法: 将代表DGBI的68个病例输入到常用的、未经训练的大型语言模型(LLMs)中:ChatGPT 4.0、Google Gemini 2.5 Pro、Microsoft Copilot、OpenEvidence和Perplexity。标准化提示要求给出诊断、治疗选项以及每个诊断的置信度评分。输出结果根据MDCP建议和专家意见进行评估。
主要结果: 各模型的诊断准确性显示,Perplexity为74%,ChatGPT和Google Gemini均为72%,Microsoft Copilot和OpenEvidence均为65%。各模型治疗选项的准确性显示,ChatGPT、Google Gemini和Microsoft Copilot在53%到54%的病例中生成准确的治疗方案,而OpenEvidence和Perplexity各为41%。在诊断或治疗准确性方面,各人工智能模型之间未观察到统计学显著差异。置信度评分无论准确性如何均一致较高,平均分数范围在93%至96%之间,标准差范围在1%至4%之间。
结论与推断: 在本研究对DGBI病例方便样本的测试中,未经训练的大型语言模型(LLMs)表现出有希望但不完善的诊断和治疗性能。尽管存在诊断错误和不一致的治疗建议,但高置信度凸显了谨慎临床整合和验证的必要性。
**论文解读:基于罗马IV多维临床概况的脑-肠互动障碍诊断与治疗中人工智能准确性评估**
**研究背景与问题**
脑-肠互动障碍(Disorders of Gut-Brain Interaction, DGBIs)是临床常见但诊断复杂的疾病,影响全球超过40%的人口,且患病率在COVID-19疫情后持续上升。这类疾病缺乏明确的炎症、代谢或结构异常标志物,主要依赖症状诊断。尽管罗马IV标准及多维临床概况(Multidimensional Clinical Profile, MDCP)为临床提供了系统化分类和诊疗指南,但普通医生和胃肠病学家在诊断DGBIs时仍面临困难,诊断过程耗时且易引发患者病耻感。为解决这一问题,人工智能(Artificial Intelligence, AI),尤其是大型语言模型(Large Language Models, LLMs),被视作潜在的支持工具。然而,LLMs在DGBIs领域的诊断和治疗准确性尚缺乏系统评估,现有研究多集中于模拟场景,且缺乏对不同模型间的比较。因此,研究人员开展了一项探索性研究,以评估五种常用未经训练LLMs在基于罗马IV MDCP临床案例中的诊断和治疗准确性。
**研究内容与结论**
研究人员选取了五种公开可用的LLMs:ChatGPT 4.0、Google Gemini 2.5 Pro、Microsoft Copilot、OpenEvidence和Perplexity,利用罗马基金会授权的MDCP案例库中68个代表八种DGBI亚型的病例,在标准化提示下获取各模型的诊断结果、治疗方案及置信度评分。研究结果显示:诊断准确性方面,Perplexity最高(74%),ChatGPT和Google Gemini均为72%,Microsoft Copilot和OpenEvidence均为65%;治疗准确性方面,ChatGPT、Google Gemini和Microsoft Copilot分别为54%、53%和53%,而OpenEvidence和Perplexity均为41%。各模型间诊断和治疗准确性无统计学显著差异。值得注意的是,所有模型在诊断时均报告极高的置信度(均值93%–96%),无论诊断是否准确。该研究首次揭示了LLMs在DGBIs中的潜在应用价值与局限性,强调其高置信度与有限准确性之间的矛盾,提示临床整合需谨慎。该论文发表在《Neurogastroenterology》。
**关键技术方法**
研究采用以下主要方法:(1)病例来源:罗马基金会MDCP中的68个专家验证案例,涵盖食管、胃十二指肠、肠道、中枢介导的胃肠痛、胆囊与Oddi括约肌、肛门直肠、新生儿/幼儿及儿童/青少年八大DGBI亚型,排除“多文化障碍”案例;(2)AI模型选择:基于公开可及性和临床使用频率,选取ChatGPT 4.0、Google Gemini 2.5 Pro、Microsoft Copilot、OpenEvidence(检索增强生成模型)和Perplexity五种LLMs,均未经领域特化训练;(3)数据收集:在2025年6月21日的24小时内完成,使用新高级账户以减少历史干扰,标准化提示要求给出最可能诊断、置信度评分及治疗方案;(4)评分体系:采用三级评分(准确、部分准确、不准确),由两位DGBI专家独立评分并达成共识,诊断准确性参照MDCP金标准,治疗准确性结合MDCP及专家意见;(5)统计分析:使用Friedman检验比较模型间差异,Fleiss' kappa评估一致率,并针对MDCP诊断类别进行亚组描述性分析。
**研究结果**
**3.1 诊断准确性**
通过将各模型输出与MDCP参考诊断进行三级分类比较发现:Perplexity准确率最高(74%),ChatGPT和Google Gemini并列72%,Microsoft Copilot和OpenEvidence均为65%。部分准确诊断占比中,Microsoft Copilot和OpenEvidence最高(19%),主要表现为仅识别相关修饰因子或部分诊断。不准确诊断占比最高为Google Gemini(18%),多数为与MDCP完全不符。Friedman检验显示模型间无显著差异(p=0.372),Fleiss' kappa为0.58,表明中等一致性。
**3.2 治疗建议**
治疗准确性评估显示:ChatGPT准确率最高(54%),Google Gemini和Microsoft Copilot均为53%,OpenEvidence和Perplexity均为41%。部分准确诊断中OpenEvidence和Perplexity最高(55%),主要表现为遗漏部分推荐或添加非MDCP治疗。不准确诊断占比低(2%–4%)。Friedman检验无显著差异(p=0.089),Fleiss' kappa为0.51。
**3.3 置信度评分**
所有模型报告的置信度均值在93%–96%之间,标准差1%–4%。无论诊断准确、部分准确还是不准确,模型均保持高置信度。例如,对不准确诊断,Google Gemini和Perplexity仍报告95%的平均置信度。
**3.4 MDCP诊断类别的亚组分析**
按MDCP类别分层,模型在食管和儿童/青少年疾病中诊断准确性较高(如食管疾病达100%),而在肛门直肠疾病中表现极差(准确率低至0%)。治疗准确性方面,模型在新生儿/幼儿及胆囊/Oddi括约肌疾病中表现稳定,而在胃十二指肠和肠道疾病中准确性较低。各模型间在胆囊/Oddi括约肌疾病中诊断差异最大,而在治疗选项上该类别一致性较高。
**讨论与结论**
讨论部分指出,LLMs在DGBIs诊断和治疗中展现出中等但有限的准确性,尤其对复杂或多因素病例表现不佳。与专门设计的检索增强生成模型(RAG)如OpenEvidence相比,通用型LLMs(如ChatGPT、Google Gemini)表现更优,这可能源于RAG模型虽提供循证药物或手术推荐,但忽略了患者验证、教育等支持性护理,而后者对DGBIs的治疗至关重要。亚组分析揭示模型在数据充足的领域(如食管疾病)表现更好,而肛门直肠疾病因术语不一致、文献不足和国际指南缺乏导致低准确性。此外,模型频繁使用历史术语(如胆囊及Oddi括约肌疾病)而非更新后的罗马IV定义,反映了训练数据的滞后性。研究观察到的高置信度偏差提示过度自信问题,与临床医生的谨慎形成对比。
研究结论(翻译原文结论部分):总之,研究人员的发现表明,在来自罗马IV MDCP的DGBI病例方便样本中,未经训练的大型语言模型(LLMs)在诊断和推荐治疗方面表现出有希望但尚不完善的准确性。虽然它们在具有标准化治疗的明确疾病中表现最佳,但对于更复杂病例,准确性较低。无论准确性如何,高置信度的频繁表达凸显了谨慎临床解释的必要性。随着这些工具不断发展,其作用应被视为支持性的,而非取代临床专业知识、以患者为中心的护理和循证判断。最终,它们的价值不会取代临床医生,而是使临床医生能够提供更准确、细致和富有同情心的护理。