
-
生物通官微
陪你抓住生命科技
跳动的脉搏
CT视觉-语言基础模型Percival在捕捉临床、生理和纵向变化特征中的应用研究
《npj Digital Medicine》:Generalizable CT vision-language modeling for population health and disease risk
【字体: 大 中 小 】 时间:2026年09月30日 来源:npj Digital Medicine 18.0
编辑推荐:
摘要用于计算机断层扫描(CT)的视觉-语言基础模型(VLM)正在成为一种新兴工具,能够从大规模临床影像数据中学习具有泛化能力的表征。尽管这些模型能够预测任务特定的标签,但它们的表征在多大程度上捕捉了真实患者群体在临床、生理和纵向变化方面的特征,目前尚不明确。我们提出了Perc
用于计算机断层扫描(CT)的视觉-语言基础模型(VLM)正在成为一种新兴工具,能够从大规模临床影像数据中学习具有泛化能力的表征。尽管这些模型能够预测任务特定的标签,但它们的表征在多大程度上捕捉了真实患者群体在临床、生理和纵向变化方面的特征,目前尚不明确。我们提出了Percival,一个基于CT的原生VLM,利用宾夕法尼亚医学生物库中超过40万对CT报告数据,通过双编码器对称对比框架进行训练。在超过2万名保留参与者中,Percival的潜空间与人口学、生理学和实验室指标变化相一致,并支持电子健康记录中的表型组学广泛关联。我们将Percival与替代基础模型范式(包括仅视觉对比学习和多器官分割)进行了比较评估,证明视觉-语言预训练能够捕捉到仅视觉替代方案无法完全获取的临床信息,这体现在疾病分类和纵向风险建模方面。总体而言,这些发现表明,CT-VLM揭示了与疾病患病率谱中临床、生理和预后变化相一致的潜在结构。