《Journal of Pathology Informatics》:HistoEncoder: A digital pathology foundation model for prostate cancer
编辑推荐:
HistoEncoder是一种基于前列腺组织图像训练和验证的基础模型(Foundation Model, FM)。领域特定模型在最小微调下优于自然图像模型。该开源模型可为下游任务实现大规模组织注释。HistoEncoder的特征包含与格利森分级(Gleason
HistoEncoder是一种基于前列腺组织图像训练和验证的基础模型(Foundation Model, FM)。领域特定模型在最小微调下优于自然图像模型。该开源模型可为下游任务实现大规模组织注释。HistoEncoder的特征包含与格利森分级(Gleason grading)相当量级的预后信息。
数字病理学(Digital Pathology, DP)中,有监督训练的卷积神经网络(Convolutional Neural Network, CNN)已在癌症检测、分级和体细胞突变检测等临床任务中达到与人类观察者相当的水平。然而,基于自然图像(如ImageNet)预训练的网络通过迁移学习进行微调时,由于组织学图像与自然图像之间存在显著的领域差异,其性能提升十分有限。此外,有监督方法依赖大量带专家标注的数据集,而跨扫描仪和实验室条件差异导致的领域偏移也影响了模型的泛化能力。近年来,自监督学习(Self-Supervised Learning, SSL)和基础模型(Foundation Model, FM)在蛋白质结构预测、自然语言建模和图像分析等领域展现出卓越性能,有望解决上述问题。前列腺癌(Prostate Cancer, PCa)是全球男性第二常见的癌症,但许多局限性肿瘤呈惰性病程,治疗决策需要在肿瘤侵袭性与患者预期寿命、合并症等因素之间权衡。当前风险分层主要依赖ISUP分级组、血清前列腺特异性抗原和临床分期,其中基于组织病理学的格利森分级存在分级迁移和膨胀问题,导致新诊断病例集中在GG2和GG3,中间风险疾病内部仍存在显著结局异质性。
为解决这些问题,研究人员构建了HistoEncoder——一个针对前列腺组织图像预训练的基础模型。该模型采用跨协方差图像变换器(Cross-Covariance Image Transformer, XCiT)作为骨干网络,利用自蒸馏式自监督学习方法DINO,在包含1307例患者、11,226张切片、共计4800万张组织图像块的数据集上进行预训练。研究中训练了prostate-s和prostate-m两种规模的模型,并与自然图像预训练的对应模型(natural-s、natural-m)以及四个公开的泛组织基础模型(H-Optimus-1、UNI2-h、Virchow2、CONCH v1.5)进行对比。研究开发了两个工作流:一是大规模切片图像数据的自动预标注;二是将组织组学特征与其他数据模态(如临床数据、空间转录组数据)整合。在评估中,研究使用Radboud数据集的454,379张图像块进行UMAP可视化和线性探针分类,并在PESO、Karolinska、Radboud、Helsinki30、Helsinki60等数据集上对模型进行微调。生存分析基于HelsinkiTMA队列中398例具有完整随访和格利森分级数据的患者,采用重复嵌套交叉验证比较仅组织簇分数、仅格利森分级以及两者联合的Cox比例风险模型的判别性能。
研究结果显示,在Radboud数据集上,HistoEncoder提取的特征能够清晰区分良性与恶性上皮组织,并能按格利森分级进一步分层,其线性探针分类性能与大型泛组织基础模型相当(AUROC接近),而自然图像模型表现较差。推理速度方面,prostate-m比H-Optimus-1快约5倍,比Virchow2快约3倍。在大规模自动标注中,基于prostate-m特征的聚类显示出高标签纯度,54%的恶性图像块被分配至至少90%标签纯度的聚类,且聚类能区分基质、上皮和恶性组织。微调实验中,HistoEncoder模型在四个评估数据集上达到81%至95%的AUROC,显著高于自然图像模型的70%至92%;仅用4张切片微调的HistoEncoder模型即可达到用37张切片微调的自然图像模型性能。未进行任何微调的K近邻(K-Nearest Neighbor, KNN)分类器也能显著优于全微调的自然图像模型。在生存预测中,仅组织簇分数模型的Harrell一致性指数(Concordance index, C-index)为0.695,格利森分级模型为0.729,两者差异为?0.034(95%置信区间?0.153至0.086),表明组织簇分数包含的预后信息与格利森分级相当,但未能证明其更优。将组织簇分数加入格利森分级后,判别性能未得到改善(C-index差异为?0.001)。
研究结论表明,HistoEncoder作为前列腺特异性基础模型,能够在无标注信息的情况下学习到具有临床意义的组织学表征,在癌症检测、组织分类和预后预测方面达到与大型泛组织模型相当的性能,同时显著降低了计算资源和推理时间。组织簇分数捕获的预后信息与格利森分级高度重叠,尚不能作为独立的增量预测指标。该模型以开源Python包形式发布,可便捷地适用于前列腺癌数字病理学的多种下游任务,为精准肿瘤医学中的多模态预测模型开发提供了低计算成本的替代方案。