ChatGPT能否通过波兰骨科与创伤学国家医学专科考试?

《Archives of Orthopaedic and Trauma Surgery》:Can ChatGPT pass the polish national medical specialization examination in orthopedics and traumatology?

【字体: 时间:2026年08月11日 来源:Archives of Orthopaedic and Trauma Surgery 2.2

编辑推荐:

  摘要 引言 人工智能(AI)近年来迅速发展,并日益融入医学的多个领域。在医学领域,这些系统因其在临床决策支持、医学教育、科学交流和研究生培训中的潜在应用而备受关注。本研究旨在评估ChatGPT是否能在波兰骨科与创伤学国家医学专科考试(Panstwowy

  
摘要
引言
人工智能(AI)近年来迅速发展,并日益融入医学的多个领域。在医学领域,这些系统因其在临床决策支持、医学教育、科学交流和研究生培训中的潜在应用而备受关注。本研究旨在评估ChatGPT是否能在波兰骨科与创伤学国家医学专科考试(Panstwowy Egzamin Specjalizacyjny, PES)中达到及格分数,并确定不同提示策略如何影响其表现。
材料与方法
研究人员系统地评估了ChatGPT-4在连续五次官方PES考试(2023年秋季至2025年春季)中的表现,这些考试涉及骨科与创伤学。每次考试使用三种不同的提示策略进行:教授提示、专家提示、住院医师提示。对于每个考试场次(例如2024年春季、2023年秋季),提示被依次提交给ChatGPT。模型的回答根据波兰医学考试中心(Centrum Egzaminów Medycznych, CEM)发布的官方答案进行评分。
结果
所有提示策略的结果取平均值。总体准确率为81%(范围:68.33%–85.83%)。最高分(85.83%)在不同提示类型中多次出现,表明模型可以根据提示结构接近或超过最低及格阈值。提示策略之间的一致性为中等至显著(Cohen's κ 0.518–0.632;Fleiss' κ = 0.571)。在所有问题类别中,放射学相关问题的错误率最高。
结论
像ChatGPT这样的大型语言模型可以在基于知识的骨科考试中表现良好,并可能成为考试准备和教育支持的有用工具。然而,考试成功不应被解释为临床能力或独立手术实践准备的证据。专科认证和患者护理仍然依赖于人类专业知识、实践技能和专业责任。
近年来,人工智能(AI)技术快速发展,大型语言模型(Large Language Models, LLMs)如ChatGPT在医学领域的应用引发广泛关注。这些模型在临床决策支持、医学教育、科学交流和研究生培训中展现出潜力,尤其能够处理复杂文本信息并生成流畅、上下文相关的回答。然而,LLMs在医学考试中的表现存在显著差异,受模型版本、考试语言、专业领域、问题复杂度及提示策略等因素影响。此前研究多集中于英语医学考试,如美国执业医师资格考试(USMLE)和骨科住院医师考试(OITE),对非英语国家专科认证考试的证据有限。此外,不同提示策略及多模态考试内容(如放射学图像)对模型表现的影响尚未在骨科专科认证环境中充分探讨。波兰骨科与创伤学国家医学专科考试(PES)作为标准化国家考试,用于验证专科医师的知识水平,包含临床导向和图像类问题,为评估LLMs在非英语专科认证环境下的表现提供了合适框架。本研究旨在评估ChatGPT是否能通过PES考试,并分析不同提示策略对其表现的影响。

研究人员使用ChatGPT-4(OpenAI)对连续五次官方PES考试(2023年秋季至2025年春季)进行了系统评估。研究得出以下结论:在特定提示条件下,ChatGPT能持续超过PES的正式及格线(75%),总体准确率为81%。不同提示策略中,住院医师提示表现最一致,且多次达到最高分(85.83%)。提示策略间一致性为中等至显著,但专家提示与教授提示和住院医师提示在回答模式上存在显著差异,提示策略制定可能非线性地影响知识检索。放射学相关问题错误率最高,反映了当前多模态LLMs在医学影像理解方面的局限性。膝关节和肩关节问题错误率较高,但可能受样本量小的影响。该论文发表在《Archives of Orthopaedic and Trauma Surgery》。

主要关键技术方法包括:使用ChatGPT-4平台,以官方DOCX文件(含120道单选题及嵌入的放射学图像)作为输入,采用三种角色提示策略(教授提示、专家提示、住院医师提示),分别在新对话中依次提交,无自定义指令或外部工具。回答对照波兰医学考试中心(CEM)发布的官方答案进行评分。问题按主题(如关节成形术、创伤学、小儿骨科、肿瘤学、一般医学知识、肩、手、髋、膝、足踝、脊柱)和类型(放射学、病例基础、组合、标准选择题)分类。统计分析包括描述性统计、Cohen's κ和Fleiss' κ一致性检验及McNemar检验。样本队列来源为波兰医学考试中心(CEM)发布的五次官方考试材料(2023年秋季至2025年春季)。

研究结果如下:
- **总体准确率**:所有提示策略的结果取平均值,总体准确率为81%(范围:68.33%–85.83%)。相比之下,同一时期参加考试的439名考生的平均分为57.64%。
- **提示策略表现**:住院医师提示在多次考试中表现最一致,且多次达到最高分(85.83%),表明模型能因提示结构而接近或超过及格线。专家提示与教授提示和住院医师提示在回答模式上存在显著差异(McNemar检验p值分别为0.016和<0.001),而教授提示与住院医师提示无显著差异(p=0.208)。
- **一致性分析**:教授提示与住院医师提示之间一致性最高(Cohen's κ = 0.632),专家提示与其余策略间一致性较低。总体一致性为中等(Fleiss' κ = 0.571)。
- **错误分布**:按主题,膝关节和肩关节问题错误率最高(分别为67%和30%);按类型,放射学相关问题错误率最高(38%)。在所有考试中,问题分布以创伤学、一般医学知识和关节成形术占比最高;类型以标准选择题为主。

讨论部分强调,ChatGPT在PES中的表现与之前基于英语考试的研究一致,表明其知识检索能力在不同语言和考试系统中相对稳健。住院医师提示的持续优势提示,更复杂的专家导向提示可能引入不必要的认知约束,而简单提示更利于直接检索知识。放射学问题的高错误率反映了多模态LLMs在医学影像理解中的挑战,即使原始图像可用,模型仍存在图像理解、幻觉和泛化性受限等问题。膝关节和肩关节问题的高错误率需谨慎解读,可能因样本量有限导致。研究局限性包括:LLMs的文本输出基于训练数据模式,不具备临床判断力或情境意识;提示措辞可能引入变异;考试成功不等同于临床能力,骨科实践依赖手动技能、术中适应性和伦理决策。

结论部分翻译如下:本研究支持AI语言模型如ChatGPT可以在基于知识的医学考试中表现良好的观点。这些发现表明,大型语言模型可能在医学教育和考试准备中发挥有价值的作用。然而,考试成功不应被解释为临床能力或独立实践准备的证据。即使AI模型正确回答了90%的问题,也不意味着它可以安全管理患者、建立治疗关系或对结果负责。它当然不能进行手术。AI可以并且应该协助医学教育,特别是测试准备或知识巩固。然而,它仍然是一个工具,而不是替代品。在骨科领域,物理技能和人类判断力至关重要,AI的角色必须是补充性的,而不是竞争性的。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号