端到端多模态病理学基础模型与临床对话

《Nature Medicine》:End-to-end multimodal pathology foundation model with clinical dialogue

【字体: 时间:2026年08月01日 来源:Nature Medicine 52.5

编辑推荐:

  摘要:计算病理学领域的最新快速进展得益于基础模型。这些模型正开始从编码图像块转向全切片理解,但其临床实用性仍然有限。研究人员在此提出PRISM2,一种多模态切片级基础模型,基于230万张全切片图像(WSI)和源自70万份病理报告的1400

  
摘要:计算病理学领域的最新快速进展得益于基础模型。这些模型正开始从编码图像块转向全切片理解,但其临床实用性仍然有限。研究人员在此提出PRISM2,一种多模态切片级基础模型,基于230万张全切片图像(WSI)和源自70万份病理报告的1400万个问答对进行训练。通过临床对话监督,PRISM2将组织形态学与诊断推理对齐,生成既支持基于提示的推理又支持下游任务可迁移嵌入的表示。通过基于提示的推理,PRISM2在前列腺、乳腺和乳腺淋巴结的癌症检测中达到或超过(P<0.05)临床级产品校准后的平衡准确率。此外,在全面的诊断、生物标志物和生存基准测试中,通过线性探针评估,PRISM2嵌入在统计上从未低于先前的基础模型(P<0.05)。此外,在生存预测上的任务特定微调优于在同一大型生存数据集上从头训练。PRISM2展示了语言监督预训练如何为通用病理学表示提供可扩展、临床基础信号,弥合人类诊断推理与基础模型性能之间的差距。
**论文解读:PRISM2——端到端多模态病理学基础模型与临床对话**

**研究背景与问题**
计算病理学领域已因基础模型的发展而变革,如Virchow2、UNI2和H-Optimus-1,这些模型通过自监督学习在数百万组织切片上训练,学习通用表示,在癌症检测、分型和生物标志物量化中提升了性能、鲁棒性和数据效率。然而,这些模型在病例级推理上仍存在根本局限。大多数高价值预测任务发生在患者病例层面,通常包含一个或多个千兆像素的全切片图像(WSI),需要聚合数千个图像块。当前工作流程主要通过弱监督学习训练任务特定的图像块聚合器,但这需要大量数据整理以避免过拟合和低鲁棒性。研究人员的工作超越了这一范式,据研究人员所知,首次提供了一种通用模型无需额外训练即可达到临床授权专用模型性能的证据。

**研究内容与结论**
研究人员提出PRISM2,一种切片级基础模型,具备临床级预测性能。创建切片级基础模型的关键挑战是选择一种监督信号,既能有效压缩长序列的图像块表示,又能对下游任务保持足够通用性。PRISM2利用从大量可用的临床报告中学习所实现的规模与多样性。据研究人员所知,它是迄今为止最大的多模态切片级病理学基础模型,在最大语料库上训练,包含68.5万份不同临床报告,对应230万张WSI,来自不同机构,涵盖不同组织类型。与同样利用报告文本训练的PRISM和TITAN不同,PRISM2采用新颖的双嵌入架构:轻量级“基础”嵌入(base embedding)可良好迁移到新颖复杂任务(如生物标志物预测),以及源自40亿参数语言模型隐藏状态的“诊断”嵌入(diagnostic embedding),专为临床任务(如癌症检测和分型)调优。尽管PRISM2被训练用于复制临床对话,但目标并非将其部署为对话代理,而是将单轮对话作为丰富监督信号,用于学习语义基础且通用化的切片级表示。

**结论**
PRISM2展示了语言监督预训练如何为通用病理学表示提供可扩展、临床基础信号,弥合人类诊断推理与基础模型性能之间的差距。该论文发表在《Nature Medicine》。

**主要关键技术方法**
1. **数据构建与对话生成**:使用GPT-4o从685,507份临床报告(对应200,692名患者,2,350,518张WSI,来自MSK及全球外部机构)生成五类临床对话任务:临床报告生成、是非问答、开放问答、多项选择问答、图像-文本匹配。
2. **模型架构**:PRISM2包含(1)切片编码器(perceiver架构,5.41亿参数),聚合Virchow2图像块嵌入;(2)语言编码器(BioGPT)用于对比学习;(3)大语言模型解码器(Phi-3 Mini,38亿参数)通过LLaVA风格适配器处理图像与文本,生成诊断嵌入。
3. **两阶段训练**:第一阶段联合优化对比损失(使用BioGPT文本嵌入)和自回归损失(Phi-3 Mini),第二阶段冻结切片编码器,仅微调语言模型和适配器,实现临床对话监督。
4. **生存预测微调**:在225,597例(含69,114死亡事件)总生存数据集上微调PRISM2切片编码器,学习新的生存嵌入。

**研究结果**

**临床对话训练实现无任务特定训练的诊断级性能**
通过是非问答(yes/no question answering)进行基于提示的推理,PRISM2在前列腺、乳腺和乳腺淋巴结(BLN)癌症检测中匹配或超越临床级商业产品(Paige Prostate、Paige Breast、Paige BLN),无需额外训练。对比PRISM和TITAN(采用对比分类)无法达到临床级产品性能,尤其在BLN上差距显著。在全癌种(pan-cancer)检测中,PRISM2基于提示的推理表现最佳,线性探针进一步改善结果。在TCGA乳腺癌、肺癌和肾癌分型中,多项选择问答表现优异。

**PRISM2诊断嵌入适用于诊断病理学任务**
线性探针评估显示,PRISM2诊断嵌入在全癌种检测(AUC 0.967)、乳腺癌(AUC 0.967)和胃肠道(AUC 0.967)任务中优于其他模型(PRISM、TITAN、COBRA、Prov-GigaPath、Virchow2均值)。在外部公共数据集(CAMELYON16/17、PANDA、IMP-CRS)上,PRISM2诊断嵌入在肿瘤分级、分期和检测中表现最佳,尤其在CAMELYON17肿瘤分期(quadratic weighted κ 0.881)和PANDA-SI前列腺分级(0.862)中显著优于其他模型。

**PRISM2生存嵌入优于生存专用模型**
在MSK结直肠癌(CRC)无复发生存(RFS)预测中,PRISM2生存嵌入(C-index 0.809)优于从头训练的生存专用模型(0.773)。在TCGA 13个疾病特异性生存(DSS)任务中,PRISM2生存嵌入平均表现最佳。基础嵌入在无生存微调时也优于其他模型。

**PRISM2基础嵌入泛化到生物标志物预测**
在10个MSK组织特异性生物标志物(如AR、FGA、Her2、MSI、EGFR等)和7个TCGA生物标志物任务中,PRISM2基础嵌入平均AUC最高(MSK: 0.854 vs COBRA 0.846;TCGA: 0.784 vs TITAN 0.781),且在每任务排名中更常居前三位。

**对话解锁病理报告自动完成**
按照CAP指南,PRISM2通过多项选择和是非问答直接完成乳腺癌活检报告字段。调整后平均召回率(AMR)在组织学类型(0.519,校准后0.731)、导管原位癌(DCIS)存在(0.823)等字段表现中等至良好,但部分字段(如导管癌变体区分)需校准。

**数据、架构与优化设计分析**
定性审查显示,训练数据中错误率(如是非问答互补问题达18%)主要源于不相关或不准确的问题-答案对。模型错误率较低(问答7-11%),但诊断摘要中存在幻觉和遗漏。消融实验表明:从PRISM基线开始,依次更换图像块嵌入模型为Virchow2、更新架构、添加问答训练数据、第二阶段微调语言模型、冻结切片编码器,以及数据规模扩大3.5倍,均逐步提升诊断、生物标志物和生存任务性能,其中约50%的诊断改进来自规模扩展。

**总结讨论与结论翻译**
讨论部分指出:PRISM2基础嵌入在诊断、预后和生物标志物任务上优于其他切片级模型;诊断嵌入利用诊断对话训练的语言模型进一步提升了诊断任务性能;PRISM2是唯一通过问答式基于提示的推理无需额外训练即匹配或超越所有测试临床级产品癌症检测的模型;生存嵌入在预后任务上优于基础嵌入。优化细节(如提前冻结切片编码器)对泛化性至关重要。局限性包括:缺乏位置编码(可能影响精准测量任务)、仅使用单一放大倍数、生物标志物预测改进有限、训练数据噪声和偏倚。未来方向包括纳入预后和生物标志物预训练、改进空间推理和鲁棒性。

研究结论翻译:PRISM2扩展了计算病理学基础模型从切片级到病例级的规模,据研究人员所知,是首个达到临床级癌症检测性能的模型。它是当前最大模型(46亿参数),在迄今最全面的数据集上训练(近70万标本和临床报告,覆盖230万张切片和1400万问答对)。通过引入大视觉-语言模型,研究人员展示了利用LLM技术可改进图像-报告对齐。此外,研究人员发现,随着病理诊断性能趋于饱和,进一步改进生物标志物和预后预测可能成为新的研究前沿。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号