GPT-4o、GPT-5.4与DeepSeek配置在中国放射肿瘤技术资格考试题库上的基准测试:准确率、共识与效率的AI辅助教育评估

《Frontiers in Oncology》:Benchmarking large language models on a Chinese radiation oncology technology examination-preparation question set: accuracy, consensus, and efficiency for AI assisted education

【字体: 大 中 小 】 时间:2026年09月24日 来源:Frontiers in Oncology 3.4

编辑推荐:

  目的:本研究使用公开可获取的2025年中国全国放射肿瘤技术资格考试(中级)练习集中的1,053道备考题目,评估了GPT-4o、GPT-5.4和两种DeepSeek平台配置的性能。研究人员评估了准确率、相同应答覆盖率、准确共识以及模型报告的延迟估计。 方法:

  
目的:本研究使用公开可获取的2025年中国全国放射肿瘤技术资格考试(中级)练习集中的1,053道备考题目,评估了GPT-4o、GPT-5.4和两种DeepSeek平台配置的性能。研究人员评估了准确率、相同应答覆盖率、准确共识以及模型报告的延迟估计。
方法:四种配置——GPT-4o、GPT-5.4、DS-Fast和DS-Expert——使用相同的零样本中文提示进行了测试。准确率以Wilson 95%置信区间汇总。主要中文分析中的配对差异使用精确McNemar检验并采用Holm校正进行评估。一项描述性语言对照分析使用等效英文提示评估了相同题目的英文翻译。
结果:四种配置的总体准确率分别为:GPT-4o 56.7%(95% CI,53.7–59.7),GPT-5.4 66.1%(63.2–68.9),DS-Fast 98.4%(97.4–99.0),DS-Expert 99.8%(99.3–99.9)。所有六项总体配对比较在Holm校正后仍保持显著。DS-Fast和DS-Expert在1,053道题目中的1,034道(98.2%)产生了相同应答,且全部正确。GPT-5.4和DS-Expert在共同应答中的条件准确率为100%,但它们的相同应答覆盖率仅为65.9%(694/1,053)。模型报告的延迟估计以DS-Fast最低(0.68 ± 1.00秒),以DS-Expert最高(3.69 ± 2.24秒)。在英文翻译条件下,总体准确率分别为62.6%、61.5%、66.5%和76.9%。DS-Expert仍是最准确的配置,尽管其对GPT模型的优势有所减小。
结论:在这套中文备考题目中,DeepSeek配置的表现优于GPT模型,DS-Expert达到了最高准确率。然而,各模型的表现在不同题目语言下存在显著差异。这些发现支持对其在答案验证和练习题复习中的进一步评估,但并未确立其教育有效性。
近年来,大语言模型(large language model, LLM)在自然语言理解、推理和知识综合方面展现出显著能力,其在医疗保健领域中的应用受到广泛关注。但放射肿瘤学与医学物理是高度专业化的技术领域,临床实践要求极高精度,因此需要依据权威标准(如专业资格考试)对LLM进行严格基准测试。已有评估多数集中于英语考试环境,而LLM在非英语医学情境中的表现可能因语言、专业和考试情境而异。例如,GPT-4o在美国放射肿瘤学住院医师培训考试和RAPHEX放射物理考试中分别取得78.77%和77%的准确率,但在中文医学考试中,DeepSeek-R1在中文执业医师考试中达到96%准确率,显著高于GPT-4o的75.3%。然而,针对中国放射肿瘤技术资格考试(中级)的LLM评估仍然有限。该考试涉及复杂放射物理、设备操作、剂量计算和质量保证等高度依赖中文教材与本土指南的知识。因此,本研究旨在系统比较GPT-4o、GPT-5.4以及两种DeepSeek配置(DS-Fast、DS-Expert)在该考试官方推荐的2025年备考题集上的表现,通过准确率、相同应答覆盖率、准确共识和模型报告延迟估计提供实证证据。

研究人员使用了来自人民卫生出版社《肿瘤及放射肿瘤技术同步习题集》2025年版(ISBN 978-7-117-37350-0)的1,053道文字型单选最佳答案题,题目涵盖基础知识、相关专业知识、专业知识、专业实践能力四个科目。四种模型配置通过OpenAI和DeepSeek官方API,以完全相同的零样本中文提示进行查询,要求模型仅输出答案字母和模型报告的思考时间。准确率以Wilson 95%置信区间描述,配对差异采用精确McNemar检验并进行Holm校正,按预设族控制多重检验;同时将全部题目逐题翻译成英文,进行描述性语言对照分析。研究未对输出内容进行二次加工,也未修改标准答案键。

结果部分如下。

### 3.1 准确率

通过对1,053道题目的应答进行评分,结果显示GPT-4o总体准确率为56.7%(95% CI,53.7–59.7),GPT-5.4为66.1%(63.2–68.9),DS-Fast为98.4%(97.4–99.0),DS-Expert为99.8%(99.3–99.9)。所有六项总体配对比较在Holm校正后均显著,GPT-5.4显著高于GPT-4o,DS-Expert小幅但显著高于DS-Fast。科目层面,GPT模型在专业实践能力科目上准确率最低,GPT-4o仅38.8%,GPT-5.4为62.6%;错误集中分布于质量保证、模拟定位技术和体位固定技术等操作性内容。该结果表明,DeepSeek配置在中文题目上显著优于GPT模型,且GPT模型在涉及流程与安全的内容上风险更高。

### 3.2 相同应答覆盖率与准确共识

通过比较模型对之间原始应答的相同比例(identical-response coverage),以及相同应答中正确应答的比例(accuracy consensus),研究发现DS-Fast与DS-Expert之间相同应答覆盖率为98.2%(1,034/1,053),且所有相同应答均正确,准确共识为100%;GPT-5.4与DS-Expert的覆盖率为65.9%(694/1,053),准确共识也为100%;GPT-5.4与DS-Fast的覆盖率为65.4%(689/1,053),准确共识为99.3%。该结果表明,两种DeepSeek配置具有很高的一致性,而跨模型对即使相同应答较少,其共同应答也几乎全部正确。

### 3.3 模型报告延迟估计

模型自报的延迟估计(model-reported latency estimate)显示,DS-Fast平均值最低(0.68 ± 1.00秒),DS-Expert最高(3.69 ± 2.24秒),GPT-4o和GPT-5.4分别为1.49 ± 0.29秒和1.83 ± 1.46秒。所有配置的平均值均在4秒以内,提示即使最耗时的配置也能满足实时教育辅助的基本速度要求。但该指标由模型自行生成,仅作为探索性描述指标。

### 3.4 语言对照分析

将
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号