今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

针对胸部X光片解读的领域专用型与通用型人工智能模型的性能评估:一项比较研究

《BMC Medical Imaging》:Performance evaluation of domain-specific and general-purpose AI models for chest radiograph interpretation: a comparative study

【字体: 大 中 小 】 时间:2026年07月12日 来源:BMC Medical Imaging 3.9

编辑推荐:

  摘要背景胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。研究目的本研究旨

  

摘要

背景

胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。

研究目的

本研究旨在比较专门设计的多模态人工智能模型(M4CXR)与通用大型语言模型(ChatGPT-4o)在胸部X光片解读方面的性能及临床适用性。

研究方法

在这项回顾性研究中,分析了来自某家三级医疗机构的500份匿名胸部X光片。四名经过专业认证的放射科医生分别独立评估了这两种模型生成的报告。主要评估指标包括关键异常的检测情况(分为完全识别、部分识别或无法识别)、报告生成时间,以及通过RADPEER评分系统对报告差异进行的评估。通过类内相关系数和加权Cohen’s kappa值来分析原始评分与M4CXR辅助评分之间的吻合度。统计分析则采用了配对t检验和卡方检验。

研究结果

M4CXR在报告一致性方面显著优于GPT-4o:完全一致的案例比例分别为55.8%和19.8%,而报告不一致的比例则分别为25.2%和46.4%,差异具有高度显著性(P<.001)。使用M4CXR还能显著缩短报告生成时间,无需辅助解读时的时间为16.3?±?12.9秒,而使用该模型后则为179.2?±?50.4秒,差异同样具有高度显著性(P<.001)。通过RADPEER评分系统进行的差异分析显示,原始解读结果与AI辅助解读结果之间没有显著差异。原始评分与M4CXR辅助评分之间的吻合度具有良好的可靠性(ICC?=?0.701),加权kappa分析则显示两者之间存在较高的一致性(κw?=?0.652)。

结论

本研究中所评估的专门设计的多模态人工智能模型,在诊断一致性方面优于研究条件下的通用大型语言模型。这些结果表明,专门的AI模型有望成为有效的辅助工具,同时也凸显了通用大型语言模型在更广泛的临床场景中的互补作用。未来的应用应注重人机协作,并开展前瞻性多中心验证。

背景

胸部X光检查仍是全球应用最广泛的影像学检查方法;但由于解剖结构重叠以及一些细微的异常表现,其解读工作本身就具有较高难度。近年来,多模态大型语言模型取得了进展,能够实现放射学报告的自动化生成,但相较于专门的医疗人工智能系统,这类模型的临床性能仍需进一步验证。

研究目的

本研究旨在比较专门设计的多模态人工智能模型(M4CXR)与通用大型语言模型(ChatGPT-4o)在胸部X光片解读方面的性能及临床适用性。

研究方法

在这项回顾性研究中,分析了来自某家三级医疗机构的500份匿名胸部X光片。四名经过专业认证的放射科医生分别独立评估了这两种模型生成的报告。主要评估指标包括关键异常的检测情况(分为完全识别、部分识别或无法识别)、报告生成时间,以及通过RADPEER评分系统对报告差异进行的评估。通过类内相关系数和加权Cohen’s kappa值来分析原始评分与M4CXR辅助评分之间的吻合度。统计分析则采用了配对t检验和卡方检验。

研究结果

M4CXR在报告一致性方面显著优于GPT-4o:完全一致的案例比例分别为55.8%和19.8%,而报告不一致的比例则分别为25.2%和46.4%,差异具有高度显著性(P<.001)。使用M4CXR还能显著缩短报告生成时间,无需辅助解读时的时间为16.3?±?12.9秒,而使用该模型后则为179.2?±?50.4秒,差异同样具有高度显著性(P<.001)。通过RADPEER评分系统进行的差异分析显示,原始解读结果与AI辅助解读结果之间没有显著差异。原始评分与M4CXR辅助评分之间的吻合度具有良好的可靠性(ICC?=?0.701),加权kappa分析则显示两者之间存在较高的一致性(κw?=?0.652)。

结论

本研究中所评估的专门设计的多模态人工智能模型,在诊断一致性方面优于研究条件下的通用大型语言模型。这些结果表明,专门的AI模型有望成为有效的辅助工具,同时也凸显了通用大型语言模型在更广泛的临床场景中的互补作用。未来的应用应注重人机协作,并开展前瞻性多中心验证。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:多模态医疗 AI|胸部 X 光分析|诊断一致性|临床适用性|模型对比|人机协作

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号