
-
生物通官微
陪你抓住生命科技
跳动的脉搏
针对胸部X光片解读的领域专用型与通用型人工智能模型的性能评估:一项比较研究
《BMC Medical Imaging》:Performance evaluation of domain-specific and general-purpose AI models for chest radiograph interpretation: a comparative study
【字体: 大 中 小 】 时间:2026年07月12日 来源:BMC Medical Imaging 3.9
编辑推荐:
摘要背景胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。研究目的本研究旨
胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。
本研究旨在比较专门设计的多模态人工智能模型(M4CXR)与通用大型语言模型(ChatGPT-4o)在胸部X光片解读方面的性能及临床适用性。
在这项回顾性研究中,分析了来自某家三级医疗机构的500份匿名胸部X光片。四名经过专业认证的放射科医生分别独立评估了这两种模型生成的报告。主要评估指标包括关键异常的检测情况(分为完全识别、部分识别或无法识别)、报告生成时间,以及通过RADPEER评分系统对报告差异进行的评估。通过类内相关系数和加权Cohen’s kappa值来分析原始评分与M4CXR辅助评分之间的吻合度。统计分析则采用了配对t检验和卡方检验。
M4CXR在报告一致性方面显著优于GPT-4o:完全一致的案例比例分别为55.8%和19.8%,而报告不一致的比例则分别为25.2%和46.4%,差异具有高度显著性(P<.001)。使用M4CXR还能显著缩短报告生成时间,无需辅助解读时的时间为16.3?±?12.9秒,而使用该模型后则为179.2?±?50.4秒,差异同样具有高度显著性(P<.001)。通过RADPEER评分系统进行的差异分析显示,原始解读结果与AI辅助解读结果之间没有显著差异。原始评分与M4CXR辅助评分之间的吻合度具有良好的可靠性(ICC?=?0.701),加权kappa分析则显示两者之间存在较高的一致性(κw?=?0.652)。
本研究中所评估的专门设计的多模态人工智能模型,在诊断一致性方面优于研究条件下的通用大型语言模型。这些结果表明,专门的AI模型有望成为有效的辅助工具,同时也凸显了通用大型语言模型在更广泛的临床场景中的互补作用。未来的应用应注重人机协作,并开展前瞻性多中心验证。
胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。
本研究旨在比较专门设计的多模态人工智能模型(M4CXR)与通用大型语言模型(ChatGPT-4o)在胸部X光片解读方面的性能及临床适用性。
在这项回顾性研究中,分析了来自某家三级医疗机构的500份匿名胸部X光片。四名经过专业认证的放射科医生分别独立评估了这两种模型生成的报告。主要评估指标包括关键异常的检测情况(分为完全识别、部分识别或无法识别)、报告生成时间,以及通过RADPEER评分系统对报告差异进行的评估。通过类内相关系数和加权Cohen’s kappa值来分析原始评分与M4CXR辅助评分之间的吻合度。统计分析则采用了配对t检验和卡方检验。
M4CXR在报告一致性方面显著优于GPT-4o:完全一致的案例比例分别为55.8%和19.8%,而报告不一致的比例则分别为25.2%和46.4%,差异具有高度显著性(P<.001)。使用M4CXR还能显著缩短报告生成时间,无需辅助解读时的时间为16.3?±?12.9秒,而使用该模型后则为179.2?±?50.4秒,差异同样具有高度显著性(P<.001)。通过RADPEER评分系统进行的差异分析显示,原始解读结果与AI辅助解读结果之间没有显著差异。原始评分与M4CXR辅助评分之间的吻合度具有良好的可靠性(ICC?=?0.701),加权kappa分析则显示两者之间存在较高的一致性(κw?=?0.652)。
本研究中所评估的专门设计的多模态人工智能模型,在诊断一致性方面优于研究条件下的通用大型语言模型。这些结果表明,专门的AI模型有望成为有效的辅助工具,同时也凸显了通用大型语言模型在更广泛的临床场景中的互补作用。未来的应用应注重人机协作,并开展前瞻性多中心验证。