编辑推荐:
前沿人工智能(AI)模型通过在互联网规模公共数据上的训练取得了快速进展,然而这类系统无法访问私有临床数据。由于磁共振成像(MRI)和计算机断层扫描(CT)中存在可识别的面部特征,神经影像在公共领域中的代表性不足,限制了模型在临床医学中的性能。研究人员在此表明,
前沿人工智能(AI)模型通过在互联网规模公共数据上的训练取得了快速进展,然而这类系统无法访问私有临床数据。由于磁共振成像(MRI)和计算机断层扫描(CT)中存在可识别的面部特征,神经影像在公共领域中的代表性不足,限制了模型在临床医学中的性能。研究人员在此表明,前沿模型在神经影像任务上表现不佳,而直接从健康系统常规临床护理过程中产生的未经整理的数据中学习(一种研究人员称之为“健康系统学习”(health system learning)的范式)能够产生高性能的通用神经影像模型。研究人员介绍了NeuroVFM,这是一个视觉基础模型(visual foundation model),使用可扩展的体积预测架构在524万份临床MRI和CT体积上训练。NeuroVFM学习了大脑解剖和病理的综合表征,在多项临床任务(包括放射学诊断和报告生成)中达到了最先进的性能。该模型将MRI和CT扫描嵌入到一个共享的神经解剖学潜在空间中,并实现了诊断发现的可解释性。当与开源语言模型配对时,NeuroVFM生成的放射学报告在准确性、临床分诊和专家偏好方面超过了前沿模型。NeuroVFM减少了幻觉发现和关键错误,提供了更安全的临床决策支持。这些结果确立了健康系统学习作为构建通用医学AI的范式,并为临床基础模型提供了一个可扩展的框架。
### 论文解读:健康系统学习驱动通用神经影像模型的构建
#### 研究背景与问题
在临床医学中,人工智能(AI)模型的发展长期受限于训练数据的可获得性。当前前沿AI模型(如多模态大语言模型(MLLM))依赖互联网规模的公共数据,取得了显著进步,但这类数据缺乏对私有临床信息的覆盖,尤其是神经影像领域。由于磁共振成像(MRI)和计算机断层扫描(CT)中包含可识别的面部特征,这些数据难以公开共享,导致神经影像在公共领域中代表性不足,制约了模型在临床任务中的性能。研究人员提出,直接学习健康系统常规临床护理过程中产生的未经整理的数据,即“健康系统学习”(health system learning),能够使模型在复杂且细微的临床环境中习得丰富的医学表征,从而克服公共数据的局限。为此,研究人员开发了NeuroVFM,一个基于健康系统学习的通用神经影像视觉基础模型。
#### 研究内容与结论
研究人员构建了UM-NeuroImages数据集,包含来自密歇根大学医学院(Michigan Medicine)超过20年临床实践的566,915次CT和MRI研究(共524万个三维体积),覆盖脑、头、颈、面部和眼眶区域。该数据集用于对NeuroVFM进行自监督预训练,未使用人工标注或放射学报告监督。通过在多种临床任务上的评估,包括放射学诊断和报告生成,NeuroVFM在宏观平均受试者工作特征曲线下面积(AUROC)上达到CT 92.68%、MRI 92.49%,显著优于基于报告监督(HLIP、PRIMA)、体素重建(NeuroMAE)及互联网规模自监督(DINOv3、BiomedCLIP)的基线模型。NeuroVFM还展现出跨模态泛化能力,其CT训练的分类器在MRI任务上AUROC下降不足5个百分点;在外部公共基准(如ADNI、RSNA-ICH)上,NeuroVFM在非报告直接编码的诊断任务(如阿尔茨海默病分类)中表现优异。此外,NeuroVFM与开源语言模型Qwen3-14B结合,通过视觉指令微调生成了放射学报告,在三分类急性度评估中准确性超过GPT-5和Claude Sonnet 4.5,盲法专家评审显示其关键发现错误率约为GPT-5的一半(10%对20%),且幻觉和侧别错误更少。在一周前瞻性可行性研究(1,155次检查)中,NeuroVFM驱动的分诊流程的平衡准确率达到92.6%,显著高于GPT-5的71.2%,关键发现漏诊率降低近4倍。这些结果确立了健康系统学习作为构建通用医学AI的有效范式,并验证了基于临床未整理数据训练的基础模型在诊断、分诊和报告生成中的临床价值。该论文发表在《Nature Medicine》。
#### 关键技术方法概述
NeuroVFM采用自监督的体素联合嵌入预测架构(Vol-JEPA),该架构将三维体积划分为可见上下文区域和掩蔽目标区域,通过学生编码器提取上下文表征,经预测器预测目标区域在潜在空间中的表征,并与教师编码器(通过指数移动平均更新)生成的目标真实表征进行平滑L1损失优化。所有训练数据来自密歇根大学医学院的UM-NeuroImages队列(临床PACS系统),包含超过20年的常规影像数据。预训练在学院超级计算机上完成,无需人类标注或放射学报告配对。
#### 研究结果
**学习过程与Vol-JEPA**
研究人员设计了神经解剖学自适应的掩蔽策略,利用神经影像中共享的空间结构,使编码器学习到对成像协议不变、对解剖和病理等变的表征。相比对比学习和重建目标,Vol-JEPA在下游诊断任务中表现更优。
**多种神经影像任务测试**
在时间上留出的诊断队列(2023年6月至2024年5月)中,NeuroVFM在宏观平均AUROC上超过所有基线(CT +0.98%至+3.87%;MRI +1.55%至+2.88%)。在17个CT诊断类别中,NeuroVFM显著优于DINOv3、BiomedCLIP和NeuroMAE中的至少12个类别;在MRI中至少14个类别。标签效率分析显示,NeuroVFM达到同等性能所需阳性样本数量比基线少31.5%–55.9%(CT)和6.5%–37.9%(MRI)。预训练数据和编码器容量扩展显示性能持续提升,未出现饱和趋势。多模态预训练(同时使用CT和MRI)非劣于单模态模型,且性能在不同MRI制造商、场强、人口学亚组和医疗中心间保持稳定。在外部公共基准上,NeuroVFM在阿尔茨海默病分类(ADNI→AIBL)、创伤性脑损伤等任务中优于报告监督模型(如HLIP)。
**NeuroVFM联合编码空间与语义信息**
通过t-SNE可视化显示,NeuroVFM的块嵌入在无监督条件下形成按解剖区域聚类。跨协议解剖标志匹配误差比NeuroMAE降低44.2%(2.27?cm对4.07?cm)。在BraTS21单次肿瘤检索任务中,NeuroVFM测得的交并比(IoU)超过50%,且跨MRI序列保持稳定。零样本跨模态诊断转移中,CT训练的分类器在MRI上AUROC下降不足5个百分点,优于其他基线。
**初步报告生成**
通过冷冻编码器与Qwen3-14B的LLaVA式微调,NeuroVFM-LLaVA在300次专家验证检查的三级急性度分类中准确率超过GPT-5(+11.0%)和Claude Sonnet 4.5(+20.3%)。盲法专家评估中,NeuroVFM关键发现错误率为10%,幻觉和侧别错误更少,专家偏好多于2:1(Fleiss’ κ=0.718)。示例报告展示了模型对肿块、中线移位等紧急发现的准确识别。
**前瞻性分诊可行性研究**
在一周前瞻性队列(1,155次检查)中,NeuroVFM驱动的两阶段分诊流程(基于美国神经放射学会关键发现列表筛查+专家审核)实现了92.6%的平衡准确率,显著优于GPT-5的71.2%(P<0.0001)。NeuroVFM的紧急漏诊率(13.5%)远低于GPT-5(52.3%),但仍有提升空间(敏感度86.5%)。
#### 讨论与结论翻译
**讨论**
研究人员指出,健康系统学习使AI模型能够直接体验临床世界,而非仅通过互联网描述学习。NeuroVFM作为该范式的首次影像学实例,通过集成领域特异性感知与通用推理,为构建具有专家可靠性的临床AI系统提供了路线图。未来研究方向包括整合时间序列、病理学、基因组学等多模态数据流,以及将Vol-JEPA架构扩展到其他医学影像模态和身体部位。尽管NeuroVFM展现出可解释性,但将其转化为可操作的临床接口仍需人机协作、不确定性量化及多中心前瞻性研究等新方法。
**研究结论翻译**
总之,NeuroVFM证明通用AI模型可以从健康系统本身构建。直接从健康系统数据中学习所产生的表征能够转化为诊断、分诊和报告生成能力。研究人员为开发将在21世纪医疗中产生变革性影响的医学基础模型提供了可扩展的蓝图。