面向多样化医学应用的开源医学视觉-语言基础模型 MedGemma 与医学图像编码器 MedSigLIP

《Nature Medicine》:An open vision-language model for diverse medical applications

【字体: 大 中 小 】 时间:2026年10月07日 来源:Nature Medicine 52.5

编辑推荐:

  人工智能(artificial intelligence, AI)在医疗保健(healthcare)应用中具有很高影响潜力,但其训练和部署因数据多样、可能任务谱复杂以及重要隐私需求而具有挑战性。能够为多样化下游任务(downstream tasks)实现数据高

  
人工智能(artificial intelligence, AI)在医疗保健(healthcare)应用中具有很高影响潜力,但其训练和部署因数据多样、可能任务谱复杂以及重要隐私需求而具有挑战性。能够为多样化下游任务(downstream tasks)实现数据高效微调(data-efficient fine-tuning)的高性能基础模型(foundation models)可显著加速该领域发展。研究人员介绍 MedGemma,一组基于 Gemma 3 的医学视觉-语言基础模型(medical vision-language foundation models)。MedGemma 在图像和文本以及多个医学影像领域展示先进医学理解与推理,超过同等规模生成模型(generative models)的性能,同时保持 Gemma 基础模型的通用能力。对于分布外(out-of-distribution, OOD)任务,与基础模型相比,MedGemma 在医学图像问答(medical image question answering)中取得 2.6–10% 提升,在胸部X射线(chest X-ray, CXR)发现分类中取得 15.5–18.1% 提升,在智能体评估(agentic evaluations)中取得 10.8% 提升。研究人员的结果表明,对医学任务而言,微调 MedGemma 可能比微调基础 Gemma 3 模型更有效,尤其在训练数据有限的情况下。研究人员另外介绍 MedSigLIP,一种源自 SigLIP 的医学调优视觉编码器(vision encoder)。MedSigLIP 为 MedGemma 的视觉理解能力提供支持,并且作为编码器,达到与许多专用医学图像编码器(specialized medical image encoders)相当或更好的性能。总体而言,MedGemma 集合提供医学图像和文本能力的强基础,具有加速医学研究和下游应用开发的潜力。
研究背景与目的:现代医疗保健(healthcare)以空前规模和多样性的数据生成与使用为特征,诊断、治疗和监测依赖连接许多不同数据源与医学专科。近期发展的大型多模态模型(large multimodal models)是在庞大且多样数据上训练的高级人工智能(artificial intelligence, AI)系统,在检测复杂模式、生成连贯文本和处理视觉信息方面展示显著能力,可能改变 AI 辅助医疗工作流程和提取新见解的方式。然而,通用型非医学调优大型多模态模型虽具广泛能力,却可能缺乏稳健解释和推理医学数据所需的细微医学理解。同时,AI 训练和部署因数据多样、任务谱复杂和隐私需求而具挑战;可数据高效微调(data-efficient fine-tuning)的高性能基础模型(foundation models)可加速该领域发展。基于此,研究人员开发 MedGemma,一组医学调优视觉-语言基础模型(vision-language foundation models),构建于 Gemma 3 架构,旨在解释和推理医学图像与文本,同时保留 Gemma 3 强通用能力,并开发医学调优视觉编码器 MedSigLIP。该研究发表于《Nature Medicine》。

关键技术方法:研究人员基于 Gemma 3 架构开发 MedGemma 集合,包括多模态 MedGemma 4B、MedGemma 27B 和文本优化 MedGemma 27B Text,并开发 4 亿参数医学图像编码器 MedSigLIP。MedSigLIP 由 Gemma 3 中 SigLIP-400M 视觉编码器用数百万医学图像–文本对微调,原始通用数据保留且医学数据混合权重约 2%。多模态解码器(multimodal decoder)预训练在 Gemma 3 预训练检查点上继续,医学图像数据混合权重约 12%,训练约五个医学混合轮次。后训练(post-training)包括蒸馏(distillation)和强化学习(reinforcement learning, RL),医学文本用于蒸馏,医学影像配对文本用于 RL。微调实验比较 MedGemma 4B 与 Gemma 3 4B,采用监督微调(supervised fine-tuning, SFT)和低秩适应(low-rank adaptation),使用 SIIM-ACR、CRC100k 和 ISIC 2017 数据集,并开展 MIMIC-CXR 报告生成 RL 与 EHRQA 纵向门诊电子健康记录(electronic health record, EHR)数据实验。训练数据来源包括 MedQA、MedMCQA、PubMedQA、MedExpQA、AfriMed-QA、HealthSearchQA、LiveQA、合成医学问题、PMC-OA、内部眼科/皮肤科/组织病理/放射学数据、Chest ImaGenome 和 EHRQA。

研究结果:MedGemma 在医学文本和影像基准中的性能:研究人员用多个医学文本和医学影像基准评估 MedGemma,包括分布内和分布外(out-of-distribution, OOD)基准。总体,MedGemma 在多个基准任务上达到超过或等同于更大非开放模型及任务专用模型的准确度。医学文本问答:在 MedQA、MedMCQA、PubMedQA、MMLU 子集、AfriMed-QA 和 OOD MedXpertQA 上,MedGemma 优于基线 Gemma 3,并与更大模型有竞争力;MedQA 得分 86.2,为发布时开放模型最佳之一,除 6710 亿参数 DeepSeek-R1 的 91.0 外,明显高于 OpenBioLLM 70B 的 78.2。第三方 MedHallu 硬集评估中,MedGemma 4B 得分 0.50,Gemma 3 4B 得分 0.09。医学图像分类:在放射学、组织病理学、皮肤科和眼科的零样本图像分类中,MedGemma 明显优于 Gemma 3 基线,并超过更大 API 模型。开放式医学问答与临床推理:每问由三名医师评分,MedGemma 4B 相较 Gemma 3 4B 事实不准确响应相对减少约 17%(Gemma 3 为 18.5%,MedGemma 为 15.4%)。在开放式临床情景提示中,MedGemma 有效总结场景关键组成并识别相关管理建议。医学视觉问答:在 SLAKE 和 VQA-RAD 上,MedGemma 优于 Gemma 3,与更大 API 模型总体相似;研究人员未与采用判别式嵌入方法的专用模型直接比较。CXR 报告生成:在 MIMIC-CXR 和 RadGraph F1 指标上,MedGemma 4B 预训练检查点与其他顶级模型相似或更好。专家评估显示,正常研究生成报告 68%、异常研究 49% 被评等于或优于原始报告;81% 生成报告可能带来相同或更优临床决策,优于更大 Med-Gemini 的 73%。CXR 解剖结构定位:在 Chest ImaGenome 测试集以交集比联合(intersection over union, IoU)评估,MedGemma 27B 为 0.16,Gemma 3 27B 为 0.08,MedGemma 4B 为 0.03,Qwen3-VL 4B 为 0.09;表明加入相关训练数据后改善,但仍有优化空间。医学智能体行为:在 AgentClinic 基准,MedGemma 27B 在 AgentClinic-MedQA 超过人类医师,并在 AgentClinic-MIMIC-IV 接近更大模型;Gemma 3 4B 和 MedGemma 4B 不适合该任务。通用基准:在 MMLU Pro、Global MMLU Lite 和 MMMU 上,MedGemma 相对同尺寸 Gemma 3 仅轻微下降,提示可兼顾专业与通用能力。观察主题:更大计算成本模型常表现更好,但 MedGemma 显示大小效率优势,医学视觉任务尤明显;MedGemma 4B 与最昂贵比较模型计算成本相差 500 倍;旧基准性能提高也可能反映测试数据泄漏。微调 MedGemma 实现稳健任务特异性适应:在三个未纳入训练的数据集微调中,MedGemma 4B 通常优于 Gemma 3 4B,尤其仅用 10% 数据时;SIIM-ACR 中 Gemma 3 崩溃预测多数类,MedGemma 避免。RL 微调 MedGemma 4B 在 MIMIC-CXR 报告生成取得 RadGraph F1 30.3,为该指标和数据集最先进;EHRQA 上 RL 微调 MedGemma 27B Text 改善性能,跨相互依赖记录推理问题增益最大。

讨论部分总结:研究人员介绍 MedGemma 医学视觉-语言基础模型集合和 MedSigLIP 多领域医学图像编码器,基于 Gemma 3 并针对医学域优化。评估涵盖临床推理、生物医学知识、报告生成和医学图像分类,显示强性能,微调可进一步改善,表明其作为医疗 AI 应用开发起点的潜力。可有效跨不同医学图像模态进行 token 化并与语言模型对齐的视觉编码器是关键贡献。MedGemma 优势主要来自预训练和后训练中域特异性数据优化;相比大型或 API 前沿模型,MedGemma 适用于需要冻结模型以保证文档和可靠性、对训练或推理成本敏感、本地或离线运行、特定医学图像和文本能力或完全控制模型适配的场景;前沿模型仍可能在无上述约束时提供最佳广泛性能,且可与 MedGemma 在智能体设置中组合。下游应用包括医学图像检索、研究队列、教育工具、整合放射/组织病理/眼科/皮肤科与临床信息、从报告和临床记录提取概念、临床试验匹配、药物警戒、医疗质量指标分析、协助放射科医生和患者沟通,以及智能体框架。局限包括基准仅第一步,部分接近饱和,需新高质量挑战基准;实际应用和智能体框架需更多工作;专科模型仍可能更优,如组织病理学最先进视觉编码器;未来可扩展 CT/MRI 三维序列和基因组学等模态。实践者应比较 MedGemma 与其他基础模型。开放发布促进评估、改进和适应。

研究结论翻译:在本研究中,研究人员表明 MedGemma 模型在多种视觉-语言和纯文本医学任务中展示强基线性能,并能够通过任务特异性微调进一步提高性能。研究人员还表明 MedSigLIP 展示稳健的多领域能力,因此可作为强医学视觉编码器基础模型。这些结果表明,在预训练和后训练中优化方法可在多个医学影像领域实现多模态能力,为进一步开发提供统一起点。这些模型的广度和效率为应对一系列用例提供令人兴奋的可能性。同时,模型错误或训练数据中细微形式分布偏倚的潜在风险仍是重要方面,需要通过持续模型改进、缓解策略和持续验证加以解决。对下游应用的安全性、性能和可靠性的审慎验证仍是推进多模态 AI 模型在医学中应用的关键方面。通过向开发者社区提供具有透明方法的 MedGemma 和 MedSigLIP 模型,研究人员希望它们能够促成许多有用和创新的医学应用。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号