《Frontiers in Oncology》:Comparative assessment of DeepSeek-R1 and GPT-4 for structured ultrasound reporting of adnexal masses
编辑推荐:
目的:本研究主要评估两种大语言模型(DeepSeek-R1与GPT-4)从自由文本附件肿块(AM)报告中生成结构化超声报告的能力;次要评估其在O-RADS分类与管理建议中的准确性,并探索其在良恶性鉴别中的表现。方法:研究纳入2024年7月至2025年3月共21
目的:本研究主要评估两种大语言模型(DeepSeek-R1与GPT-4)从自由文本附件肿块(AM)报告中生成结构化超声报告的能力;次要评估其在O-RADS分类与管理建议中的准确性,并探索其在良恶性鉴别中的表现。方法:研究纳入2024年7月至2025年3月共215份自由文本超声报告,每例每份模型处理三次,多数投票确定最终输出。三名高年资放射科医师盲法对照预设模板、O-RADS类别及管理指南进行评价;良恶性鉴别以组织病理学为参考标准,其余终点以专家共识为参考。结果:GPT-4在结构化报告生成中数值优于DeepSeek-R1(99.5% vs 96.7%,p=0.07);DeepSeek-R1在O-RADS准确性(64.4% vs 52.9%,p<0.001)与合理管理建议(66.4% vs 58.0%,p=0.007)上占优;两模型良恶性判别AUC均>0.80。结论:两种模型均具自动化附件肿块结构化报告潜力,DeepSeek-R1在分类与建议上更优,但独立临床应用前仍需结合图像数据与前瞻性验证。
研究背景与动机
附件肿块(adnexal masses, AMs)是女性常见病变,其中恶性者居妇科肿瘤死因前列,准确鉴别良恶性对个体化诊疗至关重要。超声是最常用评估手段,但自由文本报告存在术语不一、信息遗漏,制约了O-RADS(Ovarian-Adnexal Reporting and Data System)标准化落地。现有大语言模型(large language models, LLMs)如GPT-4已展现多模态与文本结构化潜力,而DeepSeek系列虽在通用NLP任务表现出色,其在影像报告结构化与O-RADS推理中的系统性评估仍稀缺。该研究即在此缺口下,比较DeepSeek-R1与GPT-4于四项任务上的表现:自由文本转结构化报告(主终点)、O-RADS赋值、管理建议生成及良恶性判别(探索性)。论文发表于《Frontiers in Oncology》。
主要技术方法
研究人员回顾性纳入2024年7月至2025年3月单中心术后病理确诊的215例患者共295个AMs(184良性、111恶性,含24交界性归为恶性),原始中文报告不经翻译直输模型。DeepSeek-R1(R1-202505)与GPT-4(GPT-4-2024-04-09)经官方API以相同参数(temperature=0.7, top_p=0.9, max_tokens=2048)调用,每例每模型运行三次,多数投票决出最终输出。O-RADS与管理建议以三名高年资放射科医师图文共识为参考(模型仅见文本,存在信息不对称);良恶性以外科病理为金标准。统计采用McNemar检验、Benjamini-Hochberg校正、DeLong法AUC比较及加权Fleiss’ Kappa稳定性分析。
研究结果
3.1 基线特征:215例女性(均值45±14岁),295个病灶中O-RADS 2–5分布均匀,恶性亚型以高级别浆液性癌居多。
3.2 结构化报告生成(主终点):报告级(n=215)GPT-4完整率99.5%略高于DeepSeek-R1的96.7%(p=0.070),两者均极少输出无结构或错漏内容。
3.3 O-RADS分类与管理建议(次终点):病灶级(n=295)DeepSeek-R1分类正确率64.4%显著优于GPT-4的52.9%(p<0.001),前者O-RADS 4识别尤佳;管理建议合理率66.4% vs 58.0%(p=0.007)。GPT-4有12例未分类,DeepSeek-R1仅2例。
3.4 三次运行稳定性:完全一致率超80%,模态一致率超90%;因结局分布极度偏倚,加权Fleiss’ Kappa偏低不反映真实复现性。
3.5 错误分析:多发肿块报告错误率飙升(DeepSeek-R1 32.5%→60.0%,GPT-4 41.3%→78.2%),DeepSeek-R1对复杂度鲁棒性更强。
3.6 良恶性鉴别(探索):患者级(n=215)DeepSeek-R1 AUC 0.897(95%CI 0.863–0.931)高于GPT-4 0.825(0.776–0.873,p=0.040);DeepSeek-R1敏感度95.5%但特异度67.9%,GPT-4反之(特异96.7%、敏感48.6%),总准确率均约78%。
讨论与结论翻译
讨论指出,文本仅入LLM在O-RADS这类需整合形态、血流与临床语境的任务上天花板明显,且模型管理建议质量受中间分类精度捆绑。作者承认放射科医师参考标准含图而模型无图为信息不对称局限。结论:DeepSeek-R1与GPT-4均能较好完成AMs结构化报告自动化,GPT-4在格式完整率上数值占优但不显著,DeepSeek-R1在O-RADS分类与管理建议上更准;良恶性判别AUC>0.80具探索价值,但缺图、单中心、提示词简略等限制下,独立临床应用前须融入图像、多中心前瞻验证与专家监督。