综述:用于人工智能的病理学公共数据集:一项系统综述
《Journal of Imaging Informatics in Medicine》:Pathology Public Datasets for Artificial Intelligence: A Systematic Review
【字体:
大
中
小
】
时间:2026年03月11日
来源:Journal of Imaging Informatics in Medicine
编辑推荐:
摘要:组织病理学在许多疾病的诊断中发挥着关键作用,尤其是在癌症领域,正确分类组织样本对患者的治疗具有显著影响。人工智能(AI)在数字病理学中的日益广泛应用为提高诊断过程的速度、准确性和可扩展性提供了机会。结构良好、带有注释的组织病理学数据集的可用性对于这一进展至关重要。本研究提供
摘要:组织病理学在许多疾病的诊断中发挥着关键作用,尤其是在癌症领域,正确分类组织样本对患者的治疗具有显著影响。人工智能(AI)在数字病理学中的日益广泛应用为提高诊断过程的速度、准确性和可扩展性提供了机会。结构良好、带有注释的组织病理学数据集的可用性对于这一进展至关重要。本研究提供了一个关于专为组织病理学相关AI和机器学习研究设计的公开可用数据集的全面概述。我们的审查发现了151个数据集,涵盖了不同类型的组织和癌症(包括胃肠道、脑胶质瘤、肺腺癌等)。我们还根据患者数量、器官、染色方法、放大倍数、扫描仪型号、数据集大小、收集方法和分辨率对这些数据集进行了分类。我们分析了多个关键和流行的数据集,包括但不限于CAMELYON、TUPAC、MIDOG、MoNuSeg和BreakHis。我们相信,通过提供对现有数据集及其结构和具体应用的全面理解,这篇综述将有助于计算组织病理学研究。研究人员可以通过记录和评估这些资源,更有效地选择适合特定任务(如癌症诊断、治疗反应预测和组织分类)的相关数据集。在该领域内,标准化这些数据集中的图像可以促进数据生成专家、病理学家和AI模型开发者之间的合作,同时有助于提高可重复性、基准测试和评估。此外,通过结合组织病理学、放射学和基因组数据等,这种评估将有助于识别当前数据集中的不足之处。另一个好处是它将有助于确定需要哪些包含多模态数据的多样化数据集。填补这些空白对于创建适用于不同类型医疗机构和患者群体的AI模型至关重要。
引言:传统上,病理学家的专业知识在组织病理学领域至关重要,该领域通过显微镜检查组织样本来识别和诊断疾病(如癌症)。然而,机器学习和人工智能(AI)的最新进展为提高组织病理学研究的整体效率、诊断准确性和减少主观性提供了机会。将人工智能整合到病理学中对于提高诊断准确性、效率及标准化具有巨大潜力。随着对自动化系统需求的增长,特别是医疗诊断领域,开发强大、通用且具有临床相关性的AI模型已成为一个关键研究方向[1]。高质量和大规模的组织病理学数据集的可用性是这些进步的基础。这些包含诊断注释的数字病理学图像集合对于AI模型的训练和验证至关重要。研究人员可以利用精心策划的数据集创建能够执行癌症检测、肿瘤分级和治疗反应预测等任务的强大模型。重要的是,反映成像技术、染色过程和患者人口统计特征的多样性数据集对于确保AI模型在不同临床环境中的泛化能力至关重要。尽管数据集的可访问性和公开程度不断提高,但仍有一些障碍需要克服才能充分利用这些资源[2]。不同数据集之间的成像方式、染色方案、放大倍数和组织类型可能存在很大差异。此外,某些任务(如分割[3, 4]或分类[5, 6]更适合特定数据集,而预测或疾病进展建模[7]任务则更适合其他数据集。此外,包括类别不平衡、领域偏移和标签噪声等问题使得创建AI模型变得更加困难。随着基础模型(FMs)的出现,我们需要大量数据。例如,Virchow[8]、UNI[9]、GIGAPATH[10]等组织病理学FM分别在10万个全切片图像(WSIs)、1亿个tile和1.4亿个tile上进行了训练。目前已有超过50个组织病理学FM,其数据集包含3000到150万个WSIs;有关这些模型的最新综述可以参考[11,12,13]。除了病理学数据集的可用性不断增加外,AI驱动的病理学进展还受到计算基础设施和深度学习技术改进的推动。通过云计算、图形处理单元(GPU)加速和优化的数据管道的发展,现在可以在高分辨率全切片图像(WSIs)上训练AI模型。这些发展显著减少了处理大规模组织病理学图像时的计算瓶颈,使得模型训练和推理更加高效。此外,最近在自监督学习、对比学习和基于Transformer的架构方面的创新在从大型未注释病理学数据集中学习方面展示了有希望的结果。随着数据集规模的持续增长,确保AI算法能够在最小化人工注释的情况下有效利用这些数据集将成为推动数字病理学研究的关键因素。在这项工作中,我们系统地回顾了用于开发和评估AI模型的病理学数据集。通过汇总这些数据集,我们提供了关于其器官、染色方法和详细描述的简洁概述。据我们所知,目前还没有类似的综述。然而,有一些关于病理学AI的综述和调查[4, 14,15,16,17,18]。虽然这些之前的综述专注于特定模型、技术或狭窄的任务(如细胞核分割和图像分类),但我们的工作是第一个对整个组织病理学范围内的151个数据集进行分类的研究,提供了病理学数据爆炸性增长的纵向时间线。病理学的数字化转型不仅仅是一种技术变革,而是由于全球癌症负担增加和专家病理学家数量减少所驱动的临床需求。本综述中确定的151个数据集的临床意义在于它们有潜力标准化诊断标准并减少手动组织评估中的主观性。传统上,组织病理学依赖于病理学家的定性专业知识来识别复杂的形态学模式。然而,在关键任务中,观察者之间的差异仍然是一个挑战。例如,在肿瘤分级中,DiagSet(前列腺)和IDC Histology(乳腺)等数据集提供了训练AI识别细微细胞变化所需的大规模注释示例,如Gleason分级系统,这直接决定了手术和治疗方案。在转移检测中,识别前哨淋巴结中的微转移是一个劳动密集型任务,人类的疲劳可能导致疏忽。像CAMELYON16和CAMELYON17这样的基础资源使得开发“临床级”算法成为可能,这些算法可作为二次检查系统,提高肿瘤患者的诊断敏感性。除了初步诊断之外,整合AI就绪的数据集对于精准肿瘤学至关重要。现代病理学现在需要超越肉眼可见范围的“预测性”见解。在生物标志物量化方面,自动化HER2(通过HER2-Warwick和HEROHE数据集)或PD-L1(通过IMPRESS数据集)的评分,确保患者根据客观、可复制的测量结果接受最适当的治疗。同样,在治疗预测方面,Ovarian Bevacizumab Response和Post-NAT-BRCA等数据集对于训练模型预测患者对化疗或免疫治疗的反应至关重要,使临床医生能够在不良反应发生前调整治疗计划。最终,这些高质量、带注释的数据集的可用性是下一代诊断工具的“临床燃料”。通过填补原始数据和可操作临床见解之间的差距,这些资源有助于确保AI模型能够在不同医疗机构和多样化患者群体中通用,从而改善全球医疗结果。我们认为这提供了一整套可用于AI研究的病理学数据集,可以帮助研究人员定制机器学习和AI研究流程。我们讨论了从这些数据集的审查中获得的见解,以及仍然存在的挑战。
方法:我们使用Google Scholar、PubMed、ScienceDirect、IEEE Xplore和Scopus数据库进行了全面搜索,关键词包括“组织病理学数据集”、“癌症组织病理学数据集”、“基于AI的组织病理学”、“病理学中的深度学习”和“用于癌症检测的AI”。我们搜索至2025年9月底。最初,我们共找到了2874篇文章,经过去重后得到353个独特的参考文献和数据集。从这些数据集中,我们根据三个主要标准进一步筛选出不相关的研究:1. 数据集与组织病理学无关;2. 论文/数据集不专注于与AI相关的图像分析任务,如分类、分割或检测;3. 论文中使用的数据集不是公开可用的或缺乏足够的注释。通过仔细检查相应的在线存储库和链接来应用这些标准后,剩下151篇论文。通过将范围缩小到与AI、诊断和治疗相关的公开可用数据集,我们确保选出的151个数据集具有高质量并且与当前计算病理学研究趋势相关。这两位作者(ARC, SSD)独立调查了根据资格标准找到的数据集的特征。记录的详细信息包括直接链接或数字对象标识符(DOI)、相关出版物或引用、年份、版本、访问权限(完全公开、受控访问)以及数据集的内容,包括WSI的数量、图像类型(原始、处理过)和其他显著特征。第三位作者(VBSP)独立验证了所有结果数据集,并在排除标准上起到了决定性作用。我们还采取了滚雪球策略——通过探索描述特定数据集的论文的引用来寻找后续和相关的数据集。最终确定的151个数据集代表了来自不同器官的各种组织类型、放大倍数、扫描仪型号、大小、收集方法、年份和分辨率水平。
图1:我们系统综述的PRISMA流程图
系统综述结果:图1展示了系统综述和元分析(PRISMA)[19, 20]的优先报告项目,以及病理学数据集及其相应出版物的流程。我们注意到,最终的数据集集合是根据数据集的元数据描述和相关引用仔细确定的。共有151个数据集,接下来我们简要描述了这些数据集的器官、放大倍数、患者数量、包含的全切片图像(WSIs)以及它们的用例和标签:1. BreakHis [21]:BreakHis数据集包含来自82名患者的7909张组织病理学图像,包括良性(2480张)和恶性(5429张)病例。这些图像的放大倍数分别为40×、100×、200×和400×,它为开发计算机辅助诊断(CAD)系统提供了详细的基础。该数据集包括四种良性肿瘤亚型和四种恶性肿瘤类型,提供了多样化的诊断信息,以提高乳腺癌的检测和分类能力。2.LC25000 [22]:LC25000 包含了25,000张肺和结肠组织的病理图像,这些图像被分为五个类别,每个类别有5,000张图片。其中包括来自这两个器官的腺癌和良性组织。这些图像最初是从病理切片中捕获的,后来通过扩充数据集来增加其数量。它免费提供给研究人员,用于开发癌症病理学中的机器学习算法。
3. 卵巢贝伐单抗反应 [23]:该数据集包含78名患者的288张上皮性卵巢癌和腹膜浆液性乳头状癌的数字化切片(WSIs)。数据集提供了有效治疗和耐药治疗的结果,有助于研究人员开发预测贝伐单抗反应的方法。它还包括详细的临床数据,支持个性化癌症治疗。
4. PLISM(PLISM-original、PLISM-WSI、PLISM-sm [24]:PLISM数据集由东京大学的研究人员创建,旨在解决病理分析中的领域转换问题。数据集包含91张高分辨率的病理图像,以及两个子集:PLISM-sm(包含60,000个智能手机图像瓦片)和PLISM-wsi(包含300,000个WSI瓦片)。这两个子集捕捉了组织染色和成像的差异,使得开发适应性强的AI模型成为可能。
5. Chaoyang [25]:Chaoyang数据集是一项关于抗噪声学习方法的研究的一部分,包含处理成512×512像素块的结肠组织切片,由多名病理学家进行了标注。它模拟了病理学中的实际挑战,标签差异反映了观察者之间的差异。该数据集与合成噪声数据集一起,有助于评估抗噪声分类模型。
6. DiagSet [26]:DiagSet是一个用于前列腺癌检测的大型数据集,包含超过260万个按Gleason分级分类的组织片段。它包括完全标注和二元诊断的扫描结果,为开发前列腺癌检测和分类的机器学习模型提供了丰富的资源。该数据集便于进行片段级别和扫描级别的前列腺癌研究。
7. BCNB [27]:BCNB数据集包含1058名早期乳腺癌患者的数字化切片,由两名病理学家进行了标注。这些切片在200倍放大倍数下拍摄,附带了详细的临床数据,如肿瘤类型、大小、分子亚型和转移状态。数据集分为训练集、验证集和测试集,有助于深度学习研究,特别是预测腋窝淋巴结(ALN)转移。标注信息以JavaScript对象表示法(JSON)存储,同时提供了提取肿瘤区域的预处理代码。
8. MHIST [28]:MHIST数据集包含3152张H&E染色的结直肠息肉图像,由专家病理学家进行了标注。它专注于增生性息肉(良性)和固定锯齿状腺瘤(癌前病变)的二元分类。数据集包括图像文件、标注以及用于检查数据完整性的校验和。它支持数字病理学研究,特别是在结直肠息肉分类方面,并鼓励开发先进的组织学图像分析技术。
9. 用于乳腺浸润性导管癌分级的病理图像数据集 [29]:该数据集包含922张浸润性导管癌(IDC)的病理图像,根据改良的Bloom Richardson分级系统分为三个级别。这些图像在一致的条件下以不同的放大倍数拍摄,支持乳腺癌分级的AI研究。数据集来自124名患者,旨在开发分析肿瘤特征(如核多形性和有丝分裂计数)的机器学习模型。
10. 基于CNN的皮肤癌病理图像分类 [30]:该数据集来自354名患者,包含16,099张H&E染色的良性及恶性肿瘤皮肤组织的病理图像。这些图像以不同的放大倍数拍摄,被分为八个良性亚类和三个恶性亚类,包括黑色素瘤。它支持使用CNN进行皮肤癌诊断的研究,为分类各种皮肤肿瘤类型提供了全面的资源。
11. 三类的结肠癌病理图像片段:肿瘤、基质和其他 [31]:该数据集包含2770张224×224像素的结肠癌组织病理图像片段。这些片段由病理学家标注,分为三类:肿瘤、基质和其他(包括正常组织和碎片)。它可以作为深度学习模型在结肠癌分析中的外部测试集。
12. 口腔癌分析的病理成像数据库 [32]:该数据集包含1224张正常组织和口腔鳞状细胞癌(OSCC)的图像,分别以100×和400×的放大倍数拍摄。数据集来自230名患者,支持口腔癌诊断的研究,便于进行架构和细胞级别的分析,从而开发基于AI的计算工具。
13. 子宫内膜疾病诊断的病理图像数据集 [33]:该数据集包含3302张子宫内膜组织的病理图像,分为正常子宫内膜、息肉、增生和腺癌。数据集来自接受宫腔镜手术的患者,有助于使用深度学习进行子宫内膜疾病诊断的研究。它为训练识别子宫内膜组织复杂形态特征的AI模型提供了坚实的基础。
14. 结直肠癌组织学中的多类纹理分析 [34]:该数据集包含5000张来自10张匿名H&E染色结直肠癌(CRC)组织切片的病理图像。这些图像来自曼海姆大学医学中心的病理档案,包括低级别和高级别肿瘤的图像。每张图像被分割成150×150像素的瓦片,捕捉从单个细胞到较大黏膜结构的纹理特征。数据集将图像分为八种组织类型:肿瘤上皮、简单基质、复杂基质、免疫细胞、碎片、黏膜腺体和背景。此外,还包括十张较大的图像(5000×5000像素),用于在更现实的场景中测试分类方法。它为研究CRC组织学中的纹理分析和多类分类提供了丰富的资源,旨在推进数字病理学中的机器学习应用。
15. 浸润性导管癌(IDC)病理图像数据集 [35]:该数据集包含277,524张图像片段(每张50×50像素),来自162张在40倍放大倍数下拍摄的乳腺癌样本的完整切片。这些片段被标记为IDC阳性(78,786张)或IDC阴性(198,738张),分别代表浸润性导管癌和非IDC组织。数据集包含患者ID和片段坐标等关键元数据。它被用于训练检测IDC的深度学习模型,并允许研究人员复制研究的训练和测试协议以进行进一步分析和模型开发。该数据集支持高分辨率的片段级别分析,对比较乳腺癌诊断中的AI模型非常有价值。
16. 卵巢癌及其亚型病理数据集 [36]:该数据集包含分为四种亚型的卵巢癌病理图像——透明细胞癌、子宫内膜样癌、黏液癌和浆液癌,以及非癌性图像。数据集分为五个文件夹,支持卵巢癌亚型分类的研究。它旨在研究癌性和非癌性卵巢组织,有助于开发用于卵巢癌诊断和分类的机器学习模型,这对改善治疗和早期检测策略至关重要。
17. ViCE病理图像 [37]:ViCE数据集包含肠道组织图像,用于自动化分析绒毛高度与隐窝深度(Vh:Cd)的比例。这一比例是诊断乳糜泻等疾病的重要特征,常用于评估治疗反应。该数据集支持ViCE软件,该软件可以自动化量化组织参数,减少临床试验中的手动工作量。ViCE利用数学形态学分析组织几何结构,提供了一个与尺度无关、用户友好的平台,适用于肠道疾病诊断,既可用于研究也可用于临床环境。
18. HEPASS算法数据集 [38]:HEPASS数据集包含77名肝脏捐赠者的385张H&E染色的肝脏病理图像,旨在量化肝脏脂肪变性(脂肪积累),这对评估移植中的肝脏移植物适用性至关重要。该数据集与HEPASS算法配对使用,这是一种结合自适应阈值和CNN的混合深度学习框架,用于检测和分类微脂肪变性和宏观脂肪变性。该算法在测试集上的准确率达到97.27%,处理速度迅速(每张图像0.72秒),优于现有的脂肪变性分割方法。该数据集推进了肝脏病理学和移植研究。
19. RINGS算法数据集 [39]:该数据集包含支持RINGS算法的图像数据和手动标注,该算法用于病理图像中的前列腺腺体分割。前列腺腺体分割对于检测前列腺癌至关重要。RINGS采用传统图像处理和深度学习技术的混合方法,提高了腺体分割的准确性和效率,其Dice得分达到90.16%,优于现有的七种方法。该数据集对前列腺癌诊断研究非常宝贵,旨在减少临床环境中手动标注的时间和错误。
20. NDB-UFES数据集 [40]:NDB-UFES数据集包含237张高分辨率的病理图像,专注于口腔癌,特别是口腔鳞状细胞癌(OSCC)和白斑。这些图像收集自2010年至2021年,包括患者的烟草和酒精使用等信息。图像使用光学显微镜在10×和40×放大倍数下拍摄。数据集支持研究AI驱动的口腔癌诊断工具,结合图像数据与社会人口统计因素进行更全面的分析,可能提高临床医生和病理学家的诊断准确性。
21. RENFAST算法数据集 [41]:该数据集支持RENFAST算法,这是一种自动分割病理图像中肾脏血管和纤维化的方法。RENFAST利用深度学习和自适应染色分离技术分割血管和纤维化,准确率分别达到90.89%(血管)和92%(纤维化),处理图像所需时间少于三秒。该数据和算法代表了肾脏病学领域的重大进展,提供了肾脏移植的定量评估。
22. DeepHP数据集 [42]:DeepHP数据集包含394,926张来自胃活检切片的图像片段,分为幽门螺杆菌阳性或阴性两类。这些图像使用H&E染色,在20倍放大倍数下拍摄,用于训练CNN模型以检测幽门螺杆菌感染。该数据集在感染检测方面取得了高准确率,优于一些内镜学研究,对于开发胃病理学的深度学习工具非常有价值。它为研究人员提供了大规模的公共可用数据集,用于探索幽门螺杆菌检测和其他病理学任务。
23. HistMNIST [43]:HistMNIST数据集包含16名患者的28×28像素的骨髓活检图像片段。该数据集最初设计为模仿MNIST格式,用于机器学习应用,包含6800张训练图像、2000张验证图像和2000张测试图像。它被用于训练变分自编码器(VAEs)等深度生成模型。HistMNIST对于从事医学影像无监督学习的研究人员非常有价值,特别是在骨髓病理学领域。
24. Ph阴性骨髓增生性肿瘤的病理图像数据集 [44]:该数据集包含300张骨髓活检图像,专注于Ph阴性骨髓增生性肿瘤(MPNs),包括原发性血小板增多症(ET)、真性红细胞增多症(PV)和原发性骨髓纤维化(MF)。这些图像使用Olympus BX41显微镜在10×、20×和40×放大倍数下拍摄,旨在支持基于AI的MPNs诊断,便于应用如图像分割和疾病分类。数据集解决了罕见MPNs的诊断挑战,并提供了开发辅助早期准确检测的工具。
25. NCT-CRC-HE-100K [45]:该数据集包含100,000张224×224像素的结肠癌(CRC)和正常组织病理图像片段,来自86张H&E染色的切片,每个像素的分辨率为0.5微米。数据集包括九种组织类型,如正常结肠黏膜、脂肪组织和结肠腺癌上皮,所有图像均使用Macenko方法进行了颜色标准化。该数据集为开发自动化图像分析算法提供了大规模资源,特别是用于结肠癌分类。
26. NCT-CRC-HE-100K-NONORM [45]:该版本的NCT-CRC-HE-100K数据集包含与原始数据集相同数量的图像片段(100,000张)和组织类型,但未进行颜色标准化。未进行颜色标准化可以保留自然染色差异,提供了更真实的病理图像表示。该数据集对于研究颜色标准化对病理学中机器学习模型的影响非常有价值。
27. CRC-VAL-HE-7K [45]:作为在NCT-CRC-HE-100K数据集上训练的模型的验证集,CRC-VAL-HE-7K包含50名结肠腺癌患者的7180张224×224像素的图像片段。该数据集保持与原始数据集类似的规格,但没有患者重复,确保了模型测试的独立性。它允许研究人员评估他们的结肠癌分类算法的泛化能力和准确性。
28. 病理图像处理特征用于慢性肿瘤缺氧的量化表征 [46]:该数据集包含66张结肠癌异种移植的病理图像,使用H&E和抗-pimonidazole染色。这些图像捕捉了不同浓度的抗吡莫尼达唑(anti-pimonidazole),用于研究缺氧肿瘤细胞、坏死肿瘤细胞和存活肿瘤细胞。该数据集有助于分析肿瘤缺氧情况,并为癌症研究中量化缺氧特征的方法开发提供支持。
29. 乌苏木精和伊红染色的膀胱尿路上皮细胞癌与炎症的数字病理学图像数据集 [47]:该数据集包含14,891张膀胱组织的病理学图像,主要关注尿路上皮细胞癌(UCC)和炎症。这些图像是使用奥林巴斯E-330数码相机在20倍放大下从74名患者的90张H&E染色切片中捕获的,分辨率为3136×2352像素(JPEG格式)。数据集中包含5948张炎症图像和5811张UCC图像,排除了3132张无效图像。该数据集由病理学家手动注释,并在Dryad平台上公开提供。
30. HistologyHSI-GB [48]:HistologyHSI-GB数据集包含469张高光谱图像(波长范围400–1000纳米,放大倍数20倍),来自13名患者的胶质母细胞瘤活检样本。每张图像都包含肿瘤区域和非肿瘤区域,并由病理学家进行了标注,以帮助区分这两类区域。该数据集来自H&E染色切片,提供了校准后的高光谱图像(HS images)、对应的RGB图像以及用于光谱一致性的白色/黑色参考图像。这一集合支持计算病理学研究,通过光谱数据、图像分类和光谱解混技术促进胶质母细胞瘤的分析,对于开发脑肿瘤诊断算法非常宝贵。
31. 乌苏木精和伊红染色的口腔鳞状细胞癌病理学图像数据集 [49]:该数据集包含1020张乌苏木精和伊红染色的口腔鳞状细胞癌(OSCC)病理学图像(尺寸640×640像素),由专家手动标注。这些图像是在20倍放大下捕获的,适用于图像分割任务,对于推进基于计算机辅助诊断(CAD)和深度学习技术在口腔癌检测中的应用具有价值。
32. 胃癌病理组织图像数据集(GCHTID)/HMU-GC-HE-30K [50]:该数据集包含31,096张非重叠的胃癌组织图像(尺寸224×224像素),来源于H&E染色的切片。数据集涵盖了八种不同的组织类型,包括癌相关基质、平滑肌和胃癌组织。它旨在支持胃癌分析的机器学习研究,为组织分类和模型测试提供了强大的资源。
33. 内窥镜活检病理学H&E图像数据集(EBHI-Seg)[51]:该数据集包含4456张经过H&E染色的结直肠活检图像,每张图像都附带用于图像分割任务的真实标注。这些图像涵盖了六个肿瘤分化阶段,包括正常组织、息肉和腺癌,为开发先进的结直肠癌诊断分割算法提供了资源。
34. 乳腺癌组织的自动配准 [52]:ACROBAT 2023数据集包含了乳腺癌组织样本的广视野(WSIs)以及匹配的H&E和免疫组化(IHC)染色结果。数据集包括750个训练案例、100个验证案例和200个测试案例,为跨不同染色的图像配准算法开发提供了资源。它专注于评估算法在领域变换下的性能,并支持乳腺癌病理学研究。
35. 自动非刚性病理学图像配准(ANHIR)数据集 [53]:ANHIR是一系列高分辨率的全切片图像,专为数字病理学中的非线性图像配准而设计。数据集包括用不同染料染色的组织样本,并附有手动标注的标志点,用于评估配准质量。该数据集挑战研究人员开发出适用于具有复杂纹理和多样染色方式的病理学图像的强大自动配准方法。
36. ICIAR 2018 BACH数据集 [54]:ICIAR 2018 BACH数据集包含400张乳腺癌组织的显微镜图像和全切片图像,这些图像被分类为四种类型:正常、良性、原位癌和浸润性癌。该数据集支持乳腺癌诊断中的分类和分割任务,为开发基于人工智能的诊断工具提供了宝贵的资源。
37. BRACS [55]:BRACS数据集包含547张乳腺癌组织样本的广视野(WSIs)和4539个感兴趣区域(ROIs),来自乳腺癌病理学图像,分为七种病变亚型,如良性病变、导管增生和导管原位癌。该数据集包括了其他数据集中常被忽略的非典型病变,对于开发和评估乳腺癌诊断的人工智能算法非常宝贵。
38. CAMELYON16 [56]:CAMELYON16数据集是一个开创性的乌苏木精和伊红染色广视野(WSIs)集合,旨在检测乳腺癌患者的哨兵淋巴结转移。该数据集来源于两个荷兰医疗中心,包含用于数字病理学算法开发的训练集和测试集。作为同类中的首个挑战项目,CAMELYON16推动了使用WSIs进行转移检测的创新,引起了全球研究界的关注。该数据集在推进人工智能驱动的诊断工具和减少癌症诊断主观性方面发挥了重要作用,特别是在哨兵淋巴结评估方面。
39. CAMELYON17 [57]:CAMELYON17在CAMELYON16数据集的基础上构建,包含了来自五个医疗中心的899张乳腺癌患者淋巴结切片的广视野图像。这些图像按照TNM分类系统进行标注,重点关注三种转移类型:孤立肿瘤细胞(ITC)、微转移和宏转移。数据集以可扩展标记语言(XML)和逗号分隔值(CSV)格式提供详细注释,是开发用于改善乳腺癌诊断和淋巴结转移检测的人工智能模型的宝贵资源。
40. CPTAC-BRCA [58]:CPTAC-BRCA数据集专注于乳腺癌浸润性癌,包含了134名患者的病理学数据,以及临床、基因组和蛋白质组信息。数据总量为113.29 GB,整合了多组学和临床数据,使研究人员能够研究癌症表型及其与分子特征的相关性,通过全面的数据支持癌症研究。
41. DRYAD数据集(HASHI)[59]:HASHI数据集通过Dryad平台提供,支持用于病理学图像分析的高通量自适应采样(HASHI)方法,该方法采用卷积神经网络(CNNs)处理大规模乳腺癌WSIs。数据集包含500个训练案例和195个测试案例,包括XML注释和二值掩码,以实现稳健的分割和分类。HASHI解决了WSIs的计算挑战,有助于在保持准确性的同时减少样本量,特别是对于浸润性乳腺癌的检测。
42. GTEx门户 [60]:GTEx数据库是一个公开可访问的存储库,整合了来自约900名捐赠者的基因组、转录组和临床数据,涵盖了大约50种组织类型,包括大脑、心脏和胰腺等难以获取的器官。它使研究人员能够通过基因型数据、RNA测序和表达数量性状位点(eQTL)映射探索遗传变异和基因表达关系。该平台在NCBI和dbGaP等平台上提供开放和受控访问方式,以保护捐赠者隐私。GTEx支持顺式和反式eQTLs、等位基因特异性表达、可变剪接和基因调控网络的分析。
43. HER2-Warwick数据集 [61]:该数据集为2016年的HER2评分竞赛创建,包含约100张用于自动化乳腺癌HER2评分的广视野图像。参与者开发了从H&E染色切片中评估HER2状态的算法,旨在减少乳腺癌诊断的主观性。由于图像尺寸较大(100,000×80,000像素)以及病理学家提供的真实HER2评分,该数据集为开发准确的自动化诊断工具提供了独特挑战。
44. HEROHE [62]:HEROHE挑战数据集包含509张经过H&E染色的乳腺癌组织广视野图像。这些切片与来自IHC和原位杂交(ISH)测试的HER2分类结果相关联。研究人员利用这些数据集开发基于形态特征的HER2状态预测算法,对于推进计算病理学中的乳腺癌诊断非常有价值。
45. IMPRESS数据集:该数据集包含126张HER2阳性和三阴性乳腺癌患者的乳腺癌组织广视野图像,这些图像是在新辅助化疗(NAT)后捕获的。数据集还包括多重IHC染色切片,其中包含PD-L1和CD8等生物标志物以及相应的临床数据,支持基于人工智能的化疗结果预测分析,有助于制定个性化治疗策略。
46. Post-NAT-BRCA [63]:该数据集包含96张来自接受过新辅助化疗的乳腺癌患者的高分辨率广视野图像,专注于残余浸润性乳腺癌。数据集包括用于计算残余癌症负担指数(RCBi)的肿瘤细胞密度注释,以及支持细胞分割和治疗结果预测的临床数据。
47. SLN-Breast [64]:该数据集包含78名乳腺癌患者的腋窝淋巴结样本的130张广视野图像,放大倍数为20倍。其中36张切片显示了转移性乳腺癌。数据集包含二进制类别标签,指示转移的存在与否,适合开发检测乳腺癌患者淋巴结转移的模型。
48. TCGA-BRCA数据集 [65]:TCGA-BRCA数据集是癌症基因组图谱(TCGA)的一部分,包含了139名乳腺癌患者的临床、基因组和病理学数据,以及3111张H&E染色的广视野图像。这是最大的公开可用乳腺癌病理学数据集,旨在研究乳腺癌表型与基因型之间的关系,支持基于人工智能的诊断和预后工具的开发。
49. TIGER数据集 [66]:该数据集专注于量化乳腺癌病理学中的肿瘤浸润淋巴细胞(TILs),特别是HER2+和三阴性乳腺癌(TNBC)。数据集包含来自TCGA-BRCA和其他医疗机构的195张广视野图像和4539个感兴趣区域(ROIs),分为七种病变亚型,如良性病变、导管增生和导管原位癌。数据集包括通常在其他数据集中被忽略的非典型病变,对于开发和评估乳腺癌诊断的人工智能算法非常有价值。
50. GasHisSDB [67]:GasHisSDB数据集包含245,196张胃癌病理学的子尺寸图像,用于开发计算机辅助诊断算法。这些图像被分为正常和异常两类,并提供了多种分辨率,适用于弱监督学习。数据集由经验丰富的病理学家标注,为胃癌检测的机器学习研究提供了大规模资源。
51. MIHIC [68]:MIHIC数据集包含309,698张来自肺癌切片的图像片段,这些切片用12种IHC标志物(如CD3、CD20)染色。数据集由病理学家手动标注,专注于肿瘤免疫微环境的量化,是开发肺癌预后和免疫微环境研究深度学习模型的宝贵资源。
52. BMIRDS达特茅斯肺癌病理学数据集 [69]:该数据集包含143张来自达特茅斯-希区柯克医疗中心的肺癌腺癌广视野图像。这些图像由三名病理学家根据主要病理模式(如鳞状细胞癌、腺泡细胞癌)进行标注,旨在促进肺癌分类和病理学分析的研究,支持肺癌检测和诊断的人工智能模型开发。
53. BMIRDS达特茅斯肾癌病理学数据集 [70]:该数据集包含563张来自达特茅斯-希区柯克医疗中心肾细胞癌(RCC)的去标识化广视野图像。这些H&E染色的福尔马林固定石蜡包埋(FFPE)切片用于标记不同的RCC亚型,包括肾细胞瘤、乏色RCC和乳头状RCC。数据集分为训练集、验证集和测试集,支持RCC分类和病理学图像分析的研究。
54. 结肠组织学图像中的腺体分割(GlaS)[71]:GlaS数据集包含165张经H&E染色的结直肠腺癌病理学图像,标注了腺体边界。数据集包括良性 and 恶性组织样本,有助于开发自动化的腺体分割算法,用于癌症分级。该数据集在2015年的MICCAI比赛中被用于促进结直肠癌图像分析。
55. ACDC-LungHP [72]:ACDC-LungHP数据集是一个旨在检测和分类肺癌广视野图像的挑战项目。数据集包含200张经过H&E染色的肺部组织活检样本,专注于肺癌区域的分割和亚型分类。该数据集支持肺癌检测人工智能系统的研究,肺癌是导致癌症相关死亡的主要原因之一。
56. Count-ception [73]:该数据集是Count-ception项目的一部分,专注于各种类型细胞图像中的细胞计数,包括脂肪细胞、骨髓细胞(MBM)和细菌细胞(VGG)。VGG细胞包含200张通过荧光显微镜生成的模拟细菌细胞图像,每张图像大约含有174个细胞。MBM细胞基于健康个体的真实骨髓样本,包含44张图像,平均每张图像约126个细胞。脂肪细胞数据集来自人类皮下脂肪组织的组织学切片,包含200个感兴趣区域,每张图像大约165个细胞。
57. ADP数据集 [74]:ADP数据集包含来自不同器官(包括大脑、肾脏、乳腺和心脏)的广视野图像。这些图像在40倍放大下数字化,尺寸为1088×1088像素,排除了背景区域,并根据组织类型进行标注。该多样化的数据集旨在促进跨多个器官的组织分类和疾病诊断的计算病理学算法开发。
58.2022年自动化Gleason分级挑战赛(AGGC)[75]:该数据集包含了前列腺样本的H&E染色全切片图像(WSI),由专家病理学家标注了Gleason分级特征。这些图像来自新加坡的国立大学医院,并使用多种扫描仪进行扫描。数据集包括105例前列腺切除术病例和37例活检病例用于训练,以及45例前列腺切除术病例和16例活检病例用于测试,旨在支持前列腺癌诊断中的自动化Gleason分级研究。
59. 利用空间上下文表示的多类细胞检测(BRCA-M2C)[76]:该数据集支持乳腺癌、肺癌和结直肠癌的多类细胞检测与分类。它包含了来自TCGA、监测队列和SEER队列的120个500×500像素的图像块,这些图像块被标注为炎症细胞、上皮细胞和基质细胞。该数据集对于癌症组织病理学中的细胞联合检测与分类研究具有重要价值。
60. HER2肿瘤ROI [77]:该数据集包含了273张HER2阳性乳腺癌的WSI图像,其中手动标注了肿瘤感兴趣区域(ROI)。数据集包含了来自耶鲁大学和TCGA的HER2阳性和HER2阴性样本,有助于利用H&E染色切片开发预测HER2状态和对trastuzumab治疗反应的计算模型。
61. CryoNuSeg [78]:CryoNuSeg是一个完全标注的核分割数据集,用于处理经过冷冻切片处理的H&E染色组织学图像。该数据集包含来自十个器官的30张图像,由两位专家进行了手动核分割。它旨在支持深度学习模型的开发,特别是解决冷冻切片与FFPE处理之间的挑战。
62. Lizard [79]:Lizard数据集专注于结肠组织中的核实例分割与分类。它包含了近50万个来自正常、炎症、异型增生和癌变状态的标注核。该数据集旨在支持肿瘤微环境分析和结肠组织特征的计算模型开发。
63. 全肿瘤T淋巴细胞数据集 [80]:该数据集包含了头颈癌、肺癌和胃癌中CD3+ T淋巴细胞检测的IHC染色切片。图像中标注了T淋巴细胞和其他细胞类型的边界框,支持肿瘤免疫微环境分析的研究。
64. CoNSeP - HoVer-Net [81]:CoNSeP数据集包含41张结直肠腺癌的H&E染色图像块,用于核分割与分类标注。数据集包含超过24,000个核标注,支持同时进行核分割与分类,便于计算机病理学研究。
65. PANDA挑战数据集 [82]:PANDA挑战数据集包含了来自欧洲和美国的12,625张前列腺活检的WSI图像,支持前列腺癌诊断和Gleason分级研究。该数据集具有多样性,涵盖不同人群、实验室和扫描设备,有助于开发具有普遍适用性的AI模型。
66. PanNuke [83]:PanNuke数据集包含了来自19种不同组织类型的近20万个分割后的核,分为五种主要细胞类别(肿瘤性、非肿瘤性上皮细胞、结缔组织、炎症细胞和死亡细胞)。标注通过半自动流程创建并由病理学家审核,确保了准确性和临床相关性。数据集包含超过2000个视野,解决了图像伪影和变异性等问题。PanNuke对于在多样化组织环境中训练核分割和分类模型、提高模型对实际临床场景的泛化能力具有重要价值。
67. Janowczyk等人 [35]:该数据集包含了143张40倍放大的雌激素受体阳性(ER+)乳腺癌图像,每张图像大小为2000×2000像素。大约有12,000个核被手动分割,提供了原始的H&E染色图像及其对应的核掩膜(白色像素代表核区域)。该数据集非常适合训练核分割的深度学习模型,能够捕捉核的复杂纹理、形态和大小变化,适用于稳健的分割模型测试。
68. NuCLS [84]:NuCLS是一个大规模的核分类、定位和分割数据集,主要集中在乳腺癌组织病理学研究上。它包含了来自125例三阴性乳腺癌患者的3944个视野的超过220,000个标注,提供单评估者和多评估者的标注,为核检测、分割和分类模型的训练和基准测试提供了有价值的真实数据。该数据集弥合了专家标注有限性与可扩展数据生成之间的差距,适用于计算病理学研究。
69. 骨髓细胞形态学 [85]:该数据集包含了来自945名患者的超过170,000张去标识化的骨髓细胞图像,主要用于诊断白血病和淋巴瘤等血液系统恶性肿瘤。图像使用明场显微镜和May-Grünwald-Giemsa/Pappenheim染色技术在40倍放大下拍摄。这是最大的公开可用的骨髓细胞学集合之一,为开发用于检测血液系统疾病的AI驱动诊断算法提供了重要资源。
70. PAIP2021:PAIP2021数据集专注于检测多个器官中癌组织中的神经周围浸润(PNI)。它包含了20倍和5倍放大的高分辨率WSI图像,带有详细的PNI(神经、肿瘤、良性)或非PNI标注。该数据集有助于开发自动化PNI检测的深度学习模型,这是癌症病理学中的一个重要因素,通过提供关于肿瘤中神经受累的见解来帮助改善治疗决策。
71. WSSS4LUAD [86]:该数据集是肺腺癌弱监督组织语义分割挑战的一部分。它包含了67张WSI图像(其中49张来自广东省人民医院,14张来自TCGA),包括用于训练的图像级标注和用于验证和测试的像素级标注。该数据集关注肿瘤上皮组织、肿瘤相关基质和正常组织,支持弱监督分割方法的研究。
72. CellSeg [87]:该数据集用于训练CellSeg软件,这是一种基于Mask R-CNN的核分割工具。它包含了来自各种组织微环境的29,464个手动分割的核,特别是癌症研究中的样本。数据集包括了具有不同细胞表型、大小和亮度条件的生物显微镜图像,确保了在不同成像条件下的鲁棒性,支持深度学习核分割研究。
73. PAIP2023:PAIP2023数据集包含了来自韩国医疗中心的100张肝脏组织的高分辨率WSI图像,专注于肝细胞癌(HCC)肿瘤分割。图像以20倍放大扫描,数据集包含了用于训练和验证的像素级真实掩膜。该数据集支持HCC的高级分割研究,解决了大尺寸金字塔图像中肿瘤边界的复杂性问题。
74. NuClick [88]:NuClick包含了用于核、细胞和腺体分割的数据集,包括用于腺体分割的GlaS和CRAG数据集,用于核分割的MonuSeg和CPM数据集,以及用于白细胞(WBC)计数的合成数据集。该数据集促进了不同生物结构分割任务的稳健模型训练和评估。
75. MIDOG 2022 [89]:MIDOG 2022数据集旨在检测不同物种(人类、犬类、猫科动物)中多种肿瘤类型的有丝分裂图像。它包含了405例肿瘤病例和9501个有丝分裂图像,使用多种全切片图像扫描仪捕获。它支持开发稳健的深度学习模型,这些模型对于评估肿瘤侵袭性至关重要。
76. MIDOG 2021 [90]:该数据集专注于乳腺癌组织病理学图像中的有丝分裂图像检测,强调不同扫描仪之间的领域泛化能力。它包含了每台扫描仪50例乳腺癌病例的WSI图像,带有有丝分裂图像和非有丝分裂样本的标注。该数据集支持检测有丝分裂图像的研究,并帮助调整算法以适应不同的扫描设备。
77. MIDOG++ [91]:MIDOG++是一个多领域数据集,用于人类和犬类肿瘤中的有丝分裂图像检测。它包含了503个组织学样本和11,937个有丝分裂图像的标注,代表了肿瘤类型、实验室和全切片图像扫描仪的多样性。该数据集支持开发在不同肿瘤类型和领域中稳健的有丝分裂图像检测深度学习算法。
78. CAMEL [92]:CAMEL数据集源自CAMELYON16数据集,专注于使用弱监督进行组织病理学图像分割。它包含了400张用H&E染色的前哨淋巴结WSI图像,分为用于训练和测试的块。CAMEL通过提供图像级标签并细化到实例级分割来支持弱监督学习,用于癌症检测。
79. OCELOT [93]:OCELOT数据集包含了来自TCGA WSI的小视野和大视野图像块,使用了H&E染色。它包含了细胞和组织的标注,支持细胞检测和组织分割研究。数据集提供了详细的空间信息,并有严格的多病理学家标注,有助于计算病理学研究。
80. CAMELYON [94]:CAMELYON包含了1399张乳腺癌患者的前哨淋巴结切片WSI图像,旨在推进用于检测癌症转移的机器学习模型。它包含了详细的转移标注,并在CAMELYON16和CAMELYON17挑战赛中得到应用,促进了CNN在转移检测方面的研究。
81. BCSS [95]:该数据集包含了来自TCGA的151张TNBC WSI图像,包含了超过20,000个标注区域(肿瘤、基质、淋巴细胞)。它旨在支持开发用于癌症病理学语义分割的深度学习模型,特别是那些改善乳腺癌诊断和治疗的模型。
82. SegPath [96]:SegPath提供了一个大规模的组织学分割数据集,包含多个器官和癌症类型中八种主要细胞类型的标注。它提供了高效且准确的组织/细胞类型分割,通过包含更广泛的细胞形态提高了手动标注的质量。它旨在通过机器学习推进癌症诊断和研究。
83. SPIE-AAPM_NCI BreastPathQ [97]:BreastPathQ数据集包含了55名接受新辅助治疗的乳腺癌患者的96张WSI图像。它包含了2394个512×512像素的图像块,由专家病理学家标注了肿瘤细胞密度。该数据集支持开发评估肿瘤细胞密度的模型,这是确定治疗反应的重要因素。
84. NADT-Prostate [98]:该数据集包含了37名接受新辅助治疗的前列腺癌患者的治疗前组织病理学图像和临床数据。它包含了多种IHC染色的组织切片图像,以及基因组和临床信息,是研究前列腺癌治疗反应机制的宝贵资源。
85. TIL-WSI-TCGA [99]:TIL-WSI-TCGA数据集为13种癌症类型的5200张诊断H&E切片提供了TIL映射。该数据集使用深度学习生成,允许详细分析淋巴细胞浸润模式,支持研究肿瘤免疫微环境及其与癌症结果的关系。
86. TUPAC16 [100]:该数据集包含821张用于评估肿瘤增殖的WSI图像。它包括一个训练集(500张图像)和一个测试集(321张图像),以及每个案例的有丝分裂分数和基于PAM50基因表达的增殖分数。辅助ROI和有丝分裂检测数据集增强了有丝分裂图像检测的模型训练。组织染色的变化性和实验室之间的差异增加了数据的复杂性,使其成为开发评估肿瘤侵袭性的模型的宝贵现实世界资源。
87. TUPAC16 – aux [100]:肿瘤增殖评估挑战(TUPAC16)提供了来自TCGA的500例乳腺癌病例,每个病例都标注了基于有丝分裂计数和分子数据的增殖分数。WSI图像以高分辨率.svs格式提供,附带辅助数据集用于有丝分裂检测(73例)和感兴趣区域(148例)。这些辅助数据集可以增强肿瘤增殖预测模型的开发,特别是在增殖与组织结构和细胞核外观相关的案例中。
88. UniToPatho [101]:该数据集专注于结直肠息肉和腺瘤异型增生。它包含了来自292张全切片图像(WSI)的9536个H&E染色图像块。该数据集支持训练深度神经网络来分类结直肠息肉并评估异型增生级别,解决了病理学家诊断的差异性问题。它有助于开发可靠的自动化系统,用于早期癌变检测和改善结直肠癌管理。
89. 用于食管腺癌肿瘤组织检测和组织学回归分级的人工智能 [102]:该数据集包含了来自德国、奥地利和TCGA的食管腺癌患者的组织学切片。数据集被标注为11个组织类别,并包括接受新辅助治疗的病例和未接受治疗的病例。它支持开发AI算法来检测肿瘤组织并评估肿瘤回归,提高了食管癌诊断的准确性。
90. VisioMel:VisioMel包含了来自法国医疗中心的皮肤黑色素瘤WSI图像,以金字塔TIF格式提供。每张切片都链接了临床元数据(例如患者年龄、性别、肿瘤特征),包括关于黑色素瘤复发的数据。该数据集旨在开发预测黑色素瘤复发可能性的模型,推动了数字病理学和AI驱动的黑色素瘤预后诊断的进步。
91. BreCaHAD [103]:BreCaHAD包含了162张乳腺癌组织病理学图像,分为六个类别:有丝分裂、凋亡、肿瘤核、非肿瘤核、导管和non-tubule。这些图像反映了现实世界的临床挑战,如图像伪影和染色变异性。该数据集用于开发和测试乳腺癌检测与分类的自动化诊断工具,为乳腺癌组织病理学中的机器学习研究奠定了基础。
92. UCSB生物分割基准数据集[104]:UCSB生物分割数据集包含多种生物图像,用于评估生物图像分析算法。该数据集涵盖了二维、三维和时间序列下的亚细胞、细胞和组织结构,包含来自多个物种和成像模式的微管、细胞核、乳腺癌细胞、肾细胞和视网膜组织的图像,并提供了用于分割、分类和追踪的地面真实注释,支持生物图像分析中的算法基准测试。
93. PathVQA数据库[105]:PathVQA包含4998张病理图像和32,799对相关问答。该数据集专为病理学中的视觉问答(VQA)研究设计,问题类型包括“什么”、“在哪里”、“何时”、“如何”以及“是/否”。这些问题是通过自然语言处理技术从图像描述中生成的,对AI模型来说是一种独特的挑战。
94. CoNIC 2022[106]:CoNIC包含4981张结肠组织组织学图像片段,其中有50万个标记的细胞核,涵盖六种类型:上皮细胞、结缔组织细胞、淋巴细胞、浆细胞、中性粒细胞和嗜酸性粒细胞。每个片段都包括实例分割和分类图,用于推动细胞核分割、分类和量化方面的研究,适用于正常、炎症和癌变条件下的结肠组织分析。
95. MoNuSAC 2020[107]:MoNuSAC 2020数据集专为肺、前列腺、肾脏和乳腺四种器官的细胞核分割和分类设计。这些经过H&E染色的图像以40倍放大率数字化,来源于多家医院,格式为.svs和.tif。训练集包含31,000条XML格式的细胞核边界注释,而测试集包含图像和模糊区域的二值掩码。该数据集支持计算病理学中的分割和分类任务,包含专家病理学家的注释,并采用CC BY-NC-SA 4.0许可协议发布。
96. MoNuSeg[108]:MoNuSeg是一个细胞核分割数据集,提供来自多个患者的H&E染色组织图像,这些患者患有不同器官的肿瘤。数据集汇集了不同医院的数据,反映了由于器官和染色协议差异导致的细胞核外观的多样性。训练数据包含30张图像和22,000条细胞核边界注释,测试集新增了7,000条注释。该数据集在CC BY-NC-SA 4.0许可下发布,旨在促进计算病理学中通用细胞核分割技术的发展。
97. ARCH[109]:ARCH数据集专为计算病理学中的多实例标注设计,包含超过11,800个图像袋和15,164张单独图像,这些图像配有从病理教科书和临床文章中提取的详细注释。这些注释描述了诊断和形态学细节,涵盖了各种组织类型、染色方法和病理情况,有望超越像ImageNet这样的传统预训练模型。
98. 骨肉瘤肿瘤评估数据集[110]:该数据集包含1,144张骨肉瘤的H&E染色组织学图像,来自达拉斯儿童医学中心的四名患者。图像被分为三类:非肿瘤、坏死肿瘤和活性肿瘤。每张图像大小为1,024×1,024像素,放大率为10倍。该数据集有助于评估主要影响青少年的骨肉瘤,旨在用于计算机辅助诊断和肿瘤分析。
99. CoCaHis[111]:CoCaHis数据集包含82张来自19名转移性结肠癌患者的冰冻切片H&E染色图像。该数据集由四位病理学家在像素级别进行注释,并包括标准化后的版本以消除批次效应。该数据集已用于训练传统机器学习模型(如支持向量机SVM、K最近邻KNN)和深度学习模型(如U-Net、DeepLabv3),深度学习方法在准确性和F1分数方面优于传统方法,适用于开发术中病理分析的CAD工具。
100. Naylor等人[112]:该数据集包含两个主要来源:来自居里研究所的50张TNBC(三阴性乳腺癌)H&E染色图像,包含4,022个细胞核注释;以及来自印度古瓦哈提理工学院的30张图像,包含21,623个不同类型癌症的细胞核注释。这两组数据均以40倍放大率拍摄。数据集包含多样化的注释,包括正常上皮细胞、侵袭性癌细胞、成纤维细胞和免疫细胞,有助于开发稳健的细胞核分割模型。
101. SICAPv2[113]:SICAPv2数据集专注于前列腺癌,包含95名患者的155份活检样本。专家泌尿生殖系统病理学家对这些样本进行了Gleason分级和细胞核结构的注释,这对癌症诊断和预后至关重要。这些全切片图像以40倍放大率数字化后降采样到10倍分辨率,提取了512×512像素的样本并根据主要Gleason分级进行标注。该数据集支持前列腺癌分级和模式检测的深度学习研究。
102. CPTAC-COAD[114]:作为临床蛋白质组学肿瘤分析联盟(CPTAC-COAD)的一部分,该数据集包含106名诊断为结肠腺癌的受试者的组织病理学图像。这些数据在癌症影像档案(TCIA)上可用,将癌症表型与分子数据联系起来,有助于研究结肠腺癌的进展和分子相关性。
103. PAIP2020[115]:PAIP2020数据集专注于结肠腺癌诊断,提供来自首尔国立大学医院的患者活检样本。图像以40倍放大率扫描,划分为训练集、验证集和测试集,包含详细的肿瘤注释和微卫星不稳定性(MSI)分类信息,支持使用AI进行自动化结直肠癌检测和分类的研究。
104. KIMIA Path24C[116]:Kimia Path24C数据集专为数字病理学中的分类和检索任务设计,包含从24张全切片图像中提取的RGB片段,这些图像采用H&E、IHC和Masson三色染色方法。片段排除了背景像素等无关区域,为AI模型提供了高质量的训练数据,支持基于内容的图像检索(CBIR)和计算机辅助诊断(CAD)研究。
105. UPENN-GBM[117]:UPENN-GBM数据集包含来自美国宾夕法尼亚大学治疗的630名胶质母细胞瘤(GBM)患者的多参数MRI扫描和组织病理学图像。数据集包含DICOM和NIFTI格式的MRI图像、肿瘤分割标签和H&E染色组织切片,有助于研究GBM的肿瘤进展、放射基因组学和治疗反应。
106. 前列腺融合MRI-病理学[118]:该数据集包含28名前列腺癌患者的MRI扫描和数字化组织病理学图像。图像使用3特斯拉MRI扫描,包含多种序列(T1、T2、DWI、DCE)和全切片前列腺切除标本,有助于分析MRI和病理学数据之间的空间关联,促进前列腺癌检测和表征的高级图像分析算法开发。
107. PAIP2019[119]:PAIP2019数据集专注于肝癌分割,特别是HCC(肝细胞癌)的分割。提供以20倍放大率扫描的肝脏组织全切片图像,包含详细的肿瘤边界注释,旨在训练AI模型准确检测和量化肝癌组织中的肿瘤区域。
108. LYON19[120]:LYON19数据集是LYON19大挑战的一部分,旨在利用IHC染色样本推进乳腺、结肠和前列腺组织中淋巴细胞分布模式的分析。该数据集包含来自荷兰八家医疗中心的441个ROI(感兴趣区域),组织样本用针对CD3或CD8的抗体染色,用于突出显示淋巴细胞。图像使用Pannoramic 250Flash II扫描仪以0.24 μm/px的分辨率数字化。数据集展示了多种淋巴细胞分布模式,包括规则分布、簇状分布和组织伪影,非常适合研究淋巴细胞行为的变异。
109. DigestPath2019[121, 122]:该数据集旨在帮助检测印戒细胞癌(一种罕见且侵袭性强的腺癌),并分割结肠镜组织。数据集包含77张阳性图像(含有印戒细胞)和383张阴性图像,这些图像来自胃黏膜和肠道组织的全切片。图像尺寸为2000×2000像素,由病理学家标注边界框。此外还提供了一个包含227张图像的评估集,以帮助开发稳健的检测算法——其中27张为阳性样本,200张为阴性样本。该数据集用于自动化分割结肠镜组织切片,区分良性和恶性病变,包含250张带有像素级恶性肿瘤注释的阳性图像和410张无病变的阴性图像。结肠镜组织分割数据集还包含212张组织样本,其中90张为阳性(含有病变),122张为阴性,由于来自不同医疗中心,数据存在一定的多样性。
110. 数字脑肿瘤图谱(Digital Brain Tumour Atlas):这是一个全面的组织病理学资源,包含2880名患者的3,115张数字化H&E染色切片,涵盖了1995年至2019年的126种脑肿瘤类型。使用Hamamatsu NanoZoomer 2.0 HT切片扫描仪以高分辨率数字化,切片经过专家神经病理学家审核以确保诊断质量。数据包括患者人口统计信息、肿瘤位置、复发情况等临床注释,以及世界卫生组织(WHO)分类,还包括罕见肿瘤类型,适用于更广泛的研究应用。MATLAB脚本可用于估计组织面积和细胞密度,支持高级计算分析。该数据通过EBRAINS以非商业许可原则提供,对机器学习、诊断研究和教学具有重要意义。
111. 多扫描仪SCC[124]:该数据集包含犬皮肤鳞状细胞癌(SCC)的组织病理学图像,使用五种不同的切片扫描系统(NanoZoomer、Aperio和Pannoramic)采集。数据集包含220张全切片图像和1,243个多边形注释,涵盖肿瘤、表皮、真皮和炎症/坏死等七种组织学类别,突显了不同扫描仪引起的图像质量差异,并为开发考虑这些差异的模型提供了有价值资源。
112. Gleason_CNN[125]:该数据集包含前列腺癌患者的组织微阵列(TMAs),以40倍放大率数字化。包含五个TMAs,每个包含约200–300个视野,由专家病理学家进行Gleason分级(3、4、5级)标注,并标记出良性区域。数据集支持使用机器学习模型进行Gleason分级和前列腺癌诊断。数据还包括三个TMAs的临床信息和生存结果,为前列腺癌研究提供了全面的基础。
113. MITOS_WSI_CMCv[126]:该数据集包含21张犬乳腺癌(CMC)的WSI(全切片图像),包含13,907个有丝分裂细胞和36,379个类似有丝分裂的细胞,由专家病理学家标注。数据集以0.25 μm/px的分辨率扫描,是检测和分类癌症有丝分裂活性的宝贵资源,适用于兽医和人类乳腺癌研究。详细注释有助于开发改进癌症诊断和分级的机器学习模型。
114. IMP-CRS 2024[127]:该数据集包含5,333张结直肠活检和息肉切除样本的WSI图像。切片以40倍分辨率数字化,分为非肿瘤性、低级别和高级别病变,包括侵袭性腺癌。数据集总量约为5TB(Tb),以.svs格式存储,适用于训练基于AI的数字病理学诊断工具,特别是结肠癌诊断。
115. CRCHisto[128]:该数据集包含100张结肠腺癌的组织病理学图像,每张大小为500×500像素,分辨率为0.55 μm/px。数据集包含对29,000多个细胞核的注释,分为上皮细胞、炎症细胞、成纤维细胞等类别。专家病理学家进行注释,确保细胞核分割和分类的准确性。该数据集特别适用于开发结肠癌病理学模型。
116. CPTAC-OV[129]:CPTAC-OV数据集属于美国国家癌症研究所(NCI)的CPTAC项目,专注于卵巢浆液性囊腺癌。数据集包含102名患者的组织病理学图像,总数据量为54.64GB(SVS格式),通过TCIA提供,旨在通过关联成像数据与蛋白质组学和基因组学数据来支持卵巢癌研究。
117. ENDO-AID[130]:该数据集包含91张通过微创Pipelle活检获得的子宫内膜癌样本的WSI图像。这些使用H&E染色并以0.25 μm/px分辨率扫描的图像以TIFF格式提供,便于与其他病理学查看器兼容。该数据由荷兰拉德布德大学医学中心开发。ENDO-AID 支持在 grand-challenge.org 平台上进行基准测试,允许研究人员将模型性能与病理学家在子宫内膜癌诊断中的评估结果进行对比。
118. 用于乳腺癌诊断的数字病理学数据集 [131]:该数据集包含使用 IHC 和 H&E 技术染色的高分辨率乳腺组织切片。数据来源于 Bahcesehir 大学医学院,分为两个子集:BAU_IHC(包含 55 个压缩文件中的 163 张切片)和 BAU_HE(包含 36 个压缩文件中的 72 张切片),文件大小从几百兆字节(MB)到超过一吉字节(GB)不等。这些以 .svs 格式提供的图像是组织病理学研究、基于深度学习的组织分割和计算病理学应用的宝贵资源。该数据集附带一个 GitHub 仓库,其中包含基于 Python 的组织区域分割代码,可以自动分析切片以获取潜在的诊断洞察。已获得 Bahcesehir 大学院临床研究机构审查委员会的批准。
119. TCGA-UT - 来自 TCGA 切片中的均匀肿瘤区域组织学图像 [132]:该数据集涵盖 32 种癌症类型,共计 8736 张切片和 271,000 个高质量视图。视图被调整为 256 × 256 像素大小,保留了对组织病理学研究至关重要的细节。这些图像经过标注,可用于深度学习任务,如纹理表示提取、CBIR 和基因组特征预测,并由受过培训的病理学家进行质量监督。
120. CRAG [133]:该数据集用于结直肠癌中的腺体实例分割,提供 173 张训练图像和 40 张验证图像,每个切片包含 1500 × 1500 像素的区域,放大倍率为 20×。它捕捉了多样的腺体形态,支持结直肠癌诊断中的分割任务。注释突出了分化良好和较差的结构,有助于开发准确的腺体分割模型,如在 MILD-Net 框架中所展示的那样。
121. PESO [134]:PESO 数据集包含使用 H&E 染色的前列腺切除术切片的前列腺上皮分割图像,用于基于深度学习的前列腺癌(PCa)上皮分割。它包括 62 张训练切片和 40 张测试切片,分辨率设置为 0.48 微米/像素。训练集包含使用在 IHC 染色切片上训练的 U-Net 生成的分割掩码,以及突出显示 P63 和 CK8/18 染色区域的颜色反卷积掩码,还有 25 张手动校正的掩码以去除伪影。测试集包括带有注释的测试区域(每个区域 2500 × 2500 像素)、真实分割掩码以及 CSV 文件中的癌症/良性标签。
122. TCGA [135]:作为 NIH 的一项综合性倡议,TCGA 提供了超过 33 种癌症类型的丰富基因组、转录组、蛋白质组和临床数据。该数据集整合了分子细节与组织病理学和临床注释,使研究人员能够研究基因突变、组织形态和临床结果之间的关系。乳腺癌子集包含超过 1200 个病例,涵盖了全面的分子特征,支持癌症生物学研究、潜在的治疗靶点和各种癌症的生物标志物识别。
123. HunCRC [136]:该结直肠癌数据集包含 200 张使用 H&E 染色的活检样本切片,放大倍率为 40×(0.1213 微米/像素)。它包含超过 101,389 个区域(512 × 512 像素),这些区域被标注为十个病理类别,如低度异型增生、腺癌和肿瘤坏死。局部和全局注释由经过认证的病理学家验证,确保了数据质量,支持结直肠癌筛查中的细粒度病理分析和模型开发。
124. TissueNet:为“检测宫颈活检中的病变”挑战创建的 TissueNet 包含来自法国医疗中心的宫颈活检高分辨率切片,总计 700 GB。每张切片最大为 150,000 × 85,000 像素,被分类为四种病变类型:良性、低恶性潜能、高恶性潜能和浸润性癌症。这个大规模、高分辨率的数据集支持宫颈癌检测模型的开发,由于其数据量庞大,需要高效的计算方法。
125. AML-Cytomorphology_LMU [137]:该急性髓系白血病(AML)数据集包含来自 200 名患者的 18,000 多张白细胞注释图像,使用 Wright 染色法在 100× 放大倍率下捕获。每张图像都被标记以识别恶性和非恶性细胞,有助于深度学习模型准确检测原始细胞。该数据集在 TCIA 上公开可用,作为自动化 AML 诊断和临床决策支持的基准,促进了血液涂片分析的进步。
126. CPTAC-AML [138]:该数据集来自 CPTAC,包含 88 名 AML 患者的 122 张高分辨率组织学图像,以 SVS 格式提供,同时还附带详细的临床元数据。该数据集支持发现性和靶向蛋白质组学研究,允许进行与 AML 相关的全面蛋白质分析。带有人口统计、分类和随访数据,非常适合探索 AML 蛋白质组学特征的机器学习应用。它根据 CC BY 3.0 许可证在 TCIA 上提供,可通过 IBM-Aspera-Connect 插件访问。
127. CRC-TP [139]:该数据集专为结直肠癌研究设计,包含来自 20 张切片的 280,000 个区域,标注了七种组织表型,如肿瘤、良性组织和坏死组织。此外,CRC-CC 子集还提供了五种细胞类型的细胞级分类,为结直肠癌组织分割和表型分析提供了详细的资源。该数据集支持计算病理学的进步,促进了自动化组织特征描述和表型分析。
128. DLBCL-Morph [140]:该数据集专注于弥漫性大 B 细胞淋巴瘤(DLBCL),包含 209 例病例的组织微阵列图像,采用 H&E 和 IHC 染色(例如 CD10、BCL6)。数据集由病理学家注释,用于核分割和形态分析,使用 HoVer-Net 模型捕捉对预后有价值的几何特征。生存数据允许进行 Cox 模型建模,仅基于几何特征即可获得 0.635 的 C 指数。该数据集通过斯坦福 ML Group 的 GitHub 提供,有助于 DLBCL 形态和生存预测研究。
129. 用于计算病理学的一般化核分割的数据集和技术 [141]:该数据集提供了来自多个器官和疾病状态的 30 张 H&E 染色组织图像,包含超过 21,000 个具有详细边界的细胞核。经过专家病理学家验证,它包含多样化样本,用于训练在不同核外观下的细胞核分割机器学习模型,包括挑战性的密集包装和染色质稀疏的细胞核。它作为一个强大的基准,支持模型向新的数据集进行泛化。
130. SegPC-2021 [142, 143]:该数据集针对多发性骨髓瘤(MM)诊断中的浆细胞分割,包含来自印度新德里 AIIMS 的 775 张骨髓穿刺图像,使用 Jenner-Giemsa 染色。图像以两种分辨率捕获并进行颜色标准化,解决了细胞聚类和背景干扰等分割挑战。注释区分了细胞核和细胞质,为机器学习提供了详细的训练集。SegPC-2021 在 IEEE ISBI 2021 中被用来评估活跃排行榜上的分割性能。
131. UMMC ER-IHC 乳腺癌组织学全切片图像和 Allred 分数 [144]:该数据集来自马来西亚马来亚大学医学中心,包含 37 张乳腺癌的 ER-IHC 切片,放大倍率为 20×,Allred 分数由病理学家验证,用于区分 ER 阳性和 ER 阴性病例。WKT 格式中的病理学家定义的 ROI 支持计算评分,CSV 文件中包含 ROI 特征的数据。细胞核分割计数使用 Stardist-HE 模型获得,有助于自动化评估乳腺癌的 ER 状态和 Allred 分数。
132. 良性乳腺肿瘤数据集 [145]:该数据集支持良性乳腺肿瘤分析中的 AI 应用。它包含 80 张高分辨率乳腺 X 光图像和 83 名印度患者的详细患者数据,存储在压缩文件和 Excel 表中。该数据集包含肿瘤亚分类、乳房 X 光发现和组织病理学特征,有助于诊断工具区分良性和恶性病变。最初为 AI Against Cancer 数据科学黑客马拉松开发,为计算病理学和放射学研究提供了多样化的成像和临床数据。
133. 乳腺癌的细胞学和组织学图像 [146]:该数据集来自乌克兰机构,提供 3264 × 2448 像素(40× 镜头)的细胞学图像和 2048 × 1536 像素的组织学图像,包括四种生物标志物的 IHC 染色图像:ER、PR、KI67 和 HER2NEU。它支持乳腺癌生物标志物和图像分析研究。
134. 应用 Appl1、Sortilin 和 Syndecan-1 生物标志物重新解读前列腺癌病理学 [147]:该数据集为前列腺癌诊断提供了全面的数字病理学图谱。它包括 H&E 染色的组织切片以及三种新颖生物标志物(Appl1、Sortilin 和 Syndecan-1)染色的切片,提高了癌症分级的准确性。数据集涵盖良性病例和 ISUP 1–5 级别,使病理学家能够使用生物标志物辅助的组织病理学进一步细化诊断。高分辨率图像使用 Carl ZEISS AxioScan.Z1 显微镜在 40× 放大倍率下获取,保存在 BigTIFF 格式中以实现无损压缩,确保质量保留。
135. 200 万张带有 HER2 标签的乳腺癌肿瘤组织学图像 [148, 149]:该数据集来自巴西 A.C. Camargo 癌症中心,包含 200 名乳腺癌患者的 200 万个 H&E 染色切片(256 × 256 像素,0.5 微米/像素),HER2 状态(HER2-阴性、HER2-低、HER2-高)。这些图像在 40× 放大倍率下捕获,排除了转移或治疗前的病例,专注于肿瘤区域。该数据集在 Zenodo 上根据 CC BY 4.0 许可证提供,预处理使用了 ConvNext-tiny 网络,并包含模型训练代码,有助于基于 HER2 的乳腺癌分析。
136. 计算病理学用于区分乳腺良性与恶性导管增生 [150]:该数据集专注于区分原位导管癌(DCIS)和普通导管增生(UDH),包含从马萨诸塞州总医院 116 份乳腺活检中提取的 392 个特征(细胞核大小、形状、强度、纹理)。使用 L1-正则化逻辑回归,模型在交叉验证(AUC 0.95)和外部验证(AUC 0.86)中表现出较高的性能,突出了预测性形态特征。该数据集在 Dryad 上提供,还支持使用 AUC 0.98 对 DCIS 细胞核等级进行分层,有助于计算病理学中的乳腺病变诊断。
137. 通过实时定量 RT-PCR 进行乳腺癌的生物学分类 [151]:该数据集旨在简化乳腺癌分类,使用 53 基因面板验证基于 qRT-PCR 的检测方法,将肿瘤分为 Luminal、Normal-like、HER2+/ER? 和 Basal-like 亚型。在 123 个样本上测试后,qRT-PCR 方法显示出 91% 的一致性。此外,Luminal 肿瘤与更好的预后相关,而某些基因独立于等级和阶段预测了无复发生存期,展示了 qRT-PCR 在乳腺癌亚型预测中的潜力。
138. 乳腺癌的单细胞病理学景观 [152]:该成像质谱(IMC)数据集包含来自 352 名乳腺癌患者的 720 张病理图像,使用 35 种抗体面板捕获细胞异质性和空间组织。它涵盖了 ER、PR、HER2、Ki-67 等指标,能够提供肿瘤微环境的单细胞洞察,并识别出具有独特空间模式的独特乳腺癌亚群,这些模式与临床结果相关。该数据集提供了肿瘤内细胞相互作用的详细视图,增强了单细胞水平的乳腺癌分类,有助于潜在的个性化诊断。
139. 外源性激素使用的类型和持续时间影响乳腺癌组织学 [153]:该数据集基于 2003 年 Kaiser Permanente 北加州癌症登记处的队列,包含 2830 例乳腺癌病例。它研究了激素替代疗法(HRT)类型和持续时间对癌症组织学的影响,使用药房记录将 HRT 分类为无、仅雌激素、孕酮或联合使用。结果显示,长期联合 HRT(超过六个月)增加了 ER 阳性肿瘤的可能性,而仅雌激素 HRT 与低级别、早期阶段的癌症相关。研究强调了 HRT 对乳腺癌风险和表型的持续时间依赖性影响。
140. 乳腺癌中自动化的核多态性评分 [154, 155]:该数据集包含来自 Radboud 大学医学中心的 118 张乳腺癌组织切片,使用 H&E 染色,有助于评估核多态性——一种癌症侵袭性的标志。最初扫描分辨率为 0.25 微米/像素,现在以 0.5 微米/像素的 TIFF 格式提供,便于访问。作为自动化多态性评分算法的基准,该数据集在 Zenodo 上提供,支持评估乳腺癌中肿瘤细胞变化的研究。
141. 未标准化的乳腺癌组织学 [154, 155]:该数据集由 Sourabh Kumar 创建,包含 2480 张组织病理学图像,分为良性(1240 张)和恶性(1240 张)两类。2022 年 11 月发布,提供了一组未标准化的乳腺癌图像,适用于训练和评估无需预标准化的乳腺癌分类机器学习模型。这种直接的组织结构有助于早期开发良性与恶性组织的分类模型。
142. 乳腺癌治疗反应的多组学机器学习预测器 [156]:该数据集包含来自 168 名患者的乳腺癌活检的多组学特征(临床、基因组、转录组和数字病理学),旨在预测治疗反应。数据包括 DNA 和 RNA 序列以及数字病理学信息,评估免疫浸润和突变负担。关键特征如 TP53 和 PIK3CA 突变及免疫特征与治疗结果相关,已在 75 名患者的独立队列上得到验证。该数据集支持对化疗、HER2靶向治疗和新辅助治疗的反应进行预测建模。
143. CBIS-DDSM [157]:该数据集于2017年发布,是用于筛查乳腺X光摄影的数字化数据库中的乳腺影像子集,包含3103张乳腺X光图像和超过3500个标记的异常情况,这些数据来自麻省总医院和维克森林大学等机构。它包含详细的注释信息,如肿块形状、边缘、BI-RADS分类以及病理状态(良性或恶性),涵盖了从头到尾(CC)和内外侧斜位(MLO)的视图。凭借像素级别的实例分割和统一的训练-测试划分,该数据集非常适合推动基于乳腺X光摄影的检测和诊断领域的人工智能发展。
144. 肺腺癌演化H&E病理特征分析数据集 [158]:专注于肺腺癌的演化过程,该数据集包含来自日本、中国和美国的98名患者的H&E染色组织病理图像。它涵盖了162张切片和669个感兴趣区域(ROI),涵盖了从正常组织到晚期腺癌的各种组织学阶段,并具有强大的细胞分割能力和九个病理特征。结构化数据文件支持细胞分类、临床人口统计和组织学进展的分析,使其成为研究肺癌诊断和演化过程的宝贵资源。
145. 融合放射学-病理学肺数据集 [159, 160]:由美国凯斯西储大学整理的数据集整合了放射学(计算机断层扫描(CT)和病理学数据,用于分析小磨玻璃肺结节中的浸润性腺癌。涵盖了6名患者的11,210张CT图像(以DICOM格式)和标注的组织病理学信息(以TIF格式),通过排除较大的结节来提供精确的影像真实信息。数据集中还包括Excel格式的临床数据,分析脚本可在GitHub上获取。该数据集非常适合验证腺癌的诊断成像模型。
146. Colsanitas数据集 [161, 162]:该数据集来源于哥伦比亚波哥大的Colsanitas诊所,包含80名乳腺癌患者的544张全色扫描图像(WSI),这些图像是来自H&E染色切片的40倍放大倍数数字化结果。专家病理学家对2250张图像进行了四类标注:正常组织、良性病变、原位癌和浸润性癌。数据以TIF格式保存,支持多类分类,并应用了染色标准化处理以解决颜色变化问题,使其成为开发乳腺癌诊断模型的宝贵资源。
147. CPM-17 [163]:该数据集来源于TCGA(肿瘤基因组学联盟),包含非小细胞肺癌(NSCLC)、多形性胶质母细胞瘤(GBM)、低级别胶质瘤(LGG)和头颈部鳞状细胞癌(HNSCC)的高分辨率WSI。它为每种癌症类型提供了32个手动分割的图像块,用于细胞核分割和NSCLC分类的诊断区域。该数据集能够详细捕捉细胞结构,非常适合细粒度分割和更广泛的癌症研究中的诊断分类任务。
148. CPM-15 [163]:专注于脑组织样本,该数据集包含15张20倍和40倍放大的H&E染色图像块,存储在Google Drive上以便访问。总共有2905个分割的细胞核,图像尺寸范围为400×400到600×1000像素,允许对脑组织进行广泛和详细的分析。它非常适合高级分割任务,为分割研究提供了细胞级别的细节。
149. 国际癌症基因组联盟(ICGC)乳腺癌组织学图像:该数据集托管在欧洲基因组-表型档案(EGA)上,包含ICGC通过BASIS项目收集的151个新鲜冷冻乳腺癌组织样本。每个样本都与Nik-Zainal等人2016年的全基因组测序数据相关联,提供了丰富的遗传和组织学数据组合。该数据集支持深入研究乳腺癌生物学、肿瘤异质性和进展,有助于推进个性化医学和癌症研究。
150. CRC-ICM [165]:CRC-ICM数据集是来自136名结直肠癌患者的专门IHC(免疫组化)图像集合,旨在分析肿瘤微环境(TME)中的免疫细胞活动。它包含1756张高分辨率RGB图像(以JPEG格式),捕捉肿瘤中心和浸润边缘区域的免疫标记。该数据集突出了六个关键免疫标记——CD3、CD8、CD45RO、PD-1、Tim3和LAG3——提供了关于免疫浸润和免疫检查点活动的见解。每张图像都附有临床和病理数据,包括肿瘤位置、TNM分期和分化程度,便于深入分析不同肿瘤区域的免疫行为。
151. SurGen [166]:SurGen数据集包含WSI(全色扫描图像)以及相关的临床和遗传数据,重点关注结直肠区域及其转移部位。它包含843例患者的10,202张WSI,其中426例提供了生存数据,以便分析WSI与生存遗传标记之间的关联。提供了关键基因突变(KRAS、NRAS、BRAF)的详细注释,以及肿瘤位置、患者年龄、性别、生存情况和MMR/MSI状态的数据点,这些数据有助于从WSI预测结直肠癌的错配修复状态。
表1 根据主要器官或组织类型划分的151个被审查数据集的分布
表2 根据设计支持的主要人工智能(AI)任务划分的151个被审查数据集的分布
基于上述对病理数据集的回顾,我们观察到以下趋势:
在表1中,我们根据每个数据集描述的主要器官或组织类型对其进行了分类。涵盖多种器官的数据集被归类为“多器官”类别。数据明显显示出对乳腺癌的关注度最高,占所有专门数据集的四分之一以上。其次是结直肠癌和前列腺癌,表明在病理学领域AI研究和数据生成方面这两个领域最为活跃。“其他”类别包括针对食道、胰腺、宫颈等器官的单个数据集。在表2中,我们根据数据集的主要设计任务进行了分类,例如细胞核分割或组织类型分类。许多数据集支持多种任务;该表格反映了最突出的主要任务。分割是最常见的任务,几乎出现在一半的数据集中。这是由于在进行更高级分析之前,需要先识别出细胞核、细胞和腺体等结构的基本需求。组织块的分类(例如,良性与恶性)是第二常见的任务。“检测”任务通常针对特定对象,如有丝分裂图或转移灶,而“分割”则更广泛,涵盖细胞核、腺体和肿瘤区域。最后,从表3可以看出,自2019年以来数据集的发布数量显著增加,2021-2023年达到了峰值。这一时间线直接反映了深度学习在数字病理学领域的兴趣和研究爆发。虽然我们的系统回顾确定了151个公开可用的数据集,但其中一部分数据集获得了显著的影响力,成为开发和验证新AI模型的常见基准。许多这些有影响力的资源来源于大型挑战项目或大规模研究联盟,这些项目推动了创新并建立了该领域性能评估的标准。为了提供这些关键数据集的集中概述,表4总结了15个最受欢迎和被广泛引用的数据集。该表格详细列出了每个数据集的主要器官或组织类型、其主要AI任务及其独特特征,如规模或来源。这份精选列表包括基础资源,如多模态TCGA-BRCA集合、开创性的挑战数据集CAMELYON16(用于转移检测),以及最近的大规模基准数据集PANDA(用于Gleason分级),其中包含超过12,000张WSI。此外,还强调了对于基本任务至关重要的数据集,如MoNuSeg(用于多器官细胞核分割)和NCT-CRC-HE-100K(用于结直肠组织分类)。
表3 根据每个数据集的主要引用次数划分的数据集发布时间线。自2019年以来,数据集的发布数量显著增加。
表4 从全面回顾中选出的流行且被高度引用的计算病理学公共数据集汇总。这些数据集经常用于评估AI模型。
讨论
由于AI模型的广泛应用,计算病理学领域在过去十年取得了巨大进展。尽管与之前的图像处理和机器学习方法相比,AI模型取得了显著改进,但这种进步依赖于需要精心获取和元数据聚合的大规模病理数据集。据我们所知,目前没有专门针对开源病理数据集(无论是学术还是商业可用数据集)的详细综述。我们的系统回顾识别并编目了151个公开可用的AI在组织病理学领域的数据集,揭示了一个快速增长但分布不均的数据集景观。自2019年以来数据集发布的显著增加反映了深度学习和AI在病理学领域的兴趣激增。虽然数据的增长是一个积极的信号,但我们的分析指出了几个关键趋势、差距和挑战,研究社区必须解决这些问题以继续推动该领域的发展。
基于FAIR原则的数据集质量评估
随着组织病理学数据量的持续增长,确保数据集能够被机器处理并减少人为干预至关重要。我们根据可发现性(Findability)、可访问性(Accessibility)、互操作性(Interoperability)和可重用性(Reusability,简称FAIR)指导原则[167]评估了所包含的数据集,发现数据整理和共享方式存在显著差异。
- **可发现性(F)**:可发现性要求数据被赋予一个全局唯一且持久的标识符(PID),如数字对象标识符(DOI)。优点:像CAMELYON16和TCGA-BRCA这样的主要挑战数据集被索引在可搜索的存储库中,如癌症影像档案(TCIA)中,确保全球研究社区可以轻松找到它们。
- **可访问性(A)**:可访问性关注通过标准化通信协议检索数据的能力。公开 vs. 受控:虽然151个数据集因其公开可用性而被选中,但一些数据集(例如GTEx Portal)需要授权访问以保护患者隐私。
- **互操作性(I)**:互操作性确保数据可以与其他数据集或分析工作流程集成。标准格式:高质量的数据集使用广泛接受的文件格式,如BigTIFF、SVS或DICOM(用于整个切片图像),以及JSON或XML(用于注释)。
- **多模态差距**:互操作性的一个重要障碍是缺乏跨组织病理学、放射学和基因组数据的共享词汇表和本体,使得多模态融合变得困难。
- **可重用性(R)**:可重用性是最终目标,需要丰富的元数据和明确的使用许可证。MoNuSeg和PanNuke等数据集提供了详细的来源信息(染色协议、器官类型),并在明确的许可证下发布(例如CC BY-NC-SA 4.0),便于将其作为新AI模型的基准。
为了严格评估这些研究资源的可用性和长期可持续性,对所有151个数据集进行了FAIR原则的系统性评估。这项评估使用了F-UJI自动化评估框架,这是一种基于16个核心指标[168]程序化衡量研究数据“FAIR性”的公认工具。通过评估元数据的机器可读性和每个数据集页面标识符(如DOI)的持久性,量化了计算病理学领域目前的数据管理水平。完整评估结果在补充材料中提供,强调了标准化数据实践的迫切需求。我们的分析表明,尽管数据量迅速扩展,但大量公开可用资源缺乏实现无缝跨机构整合所需的持久标识符和标准化元数据。因此,采用FAIR原则不仅是技术要求,而且是确保AI就绪数据真正可访问、可互操作和可重复性的临床必要条件。
对151个数据集的分析显示,平均FAIR得分为55.6%,其中“高性能”数据集的得分高达92%。顶级数据集,包括HistMNIST、TNBC、Naylor等人以及融合放射学-病理学肺数据集,一致使用Zenodo、TCIA和Dryad等成熟平台。这些平台确保了在可发现性(平均4.15/7)和可访问性(平均4.01/7)方面的高得分,通过提供持久的DOI和标准化检索协议。这项评估的一个重要发现是数据量与数据管理之间的差异:尽管图像数量激增,但互操作性(平均3.13/6)和可重用性(平均3.31/6)仍然是主要瓶颈。许多托管在机构网站或个人云存储上的数据集缺乏机器可读的元数据和明确的许可协议(例如,知识共享许可),这些是实现自动化跨机构工作流程所必需的。在互操作性方面的较低评分表明,研究人员在尝试融合不同的病理数据集时仍然存在“人为成本”。为了使临床人工智能向需要处理大规模、多样化数据的基础设施模型迈进,社区必须从孤立的网络链接转向标准化的数据对象。补充材料中提供的定量评分为此过渡提供了路线图,确定了哪些资源真正“适合人工智能使用”,以及哪些需要更好的管理以达到可重复医学科学的标准。这些数据集的临床意义显而易见:它们提供了减少诊断主观性并自动化繁琐任务(如转移检测和生物标志物评分)所需的基础真相。然而,为了使这些人工智能工具真正达到“临床级”,社区必须朝着FAIR原则迈进,确保数据不仅可用,而且能够在不同的机构环境中找到、互操作和重新使用。
在计算病理学中,一个关键挑战是,由于“领域差异”(由不同的扫描仪、染色协议和组织类型引起),在一个数据集上的表现很少能直接转化为另一个数据集上的表现。为了帮助研究人员选择最合适的资源,我们评估了两个最常见任务的数据集情况:细胞核分割和组织分类。
1. **细胞核分割 - 从专用到通用**:虽然有多种流行的数据集支持细胞核分割,但它们在“难度”和预期用途方面存在显著差异。MoNuSeg(通用基准)提供了一种高多样性的多器官方法(肺、前列腺、肾、乳腺),包含22,000个细胞核边界注释。它是测试模型在不同人体器官和染色协议下泛化能力的黄金标准。PanNuke(多类粒度)提供了近200,000个跨19种组织类型的细胞核分割结果。与MoNuSeg不同,它将细胞核分为五类(例如,肿瘤性、炎症性、死细胞),更适合用于肿瘤微环境(TME)分析,而不仅仅是简单检测。Lizard(大规模结肠聚焦)包含近500,000个专门来自结肠组织的注释细胞核。这非常适合专注于结直肠癌分析的研究人员,因为庞大的数据量允许训练出对临床“噪声”具有鲁棒性的深度学习模型。
2. **组织分类 - 二元 vs. 多类复杂性**:分类任务从简单的“良性 vs. 恶性”二元决策到复杂的多组织分期不等。BreakHis(二元基线)专注于四种放大倍数(40×–400×)下的乳腺癌图像。其明确的二元和亚型标签使其成为在稳定且易于理解的数据集上测试新架构的理想起点。NCT-CRC-HE-100K(多组织分类)提供了100,000个跨九种不同组织类型的样本。这个数据集比BreakHis更具挑战性,因为它要求模型区分各种非癌结构,这对于开发实际的自动化诊断工具至关重要。
在水平评估数据集适用性时,研究人员必须考虑几个影响性能的技术变量:(1) 放大倍数和分辨率——在20×数据集(例如MoNuSAC 2020)上训练的模型可能在40×数据集(例如Janowczyk等人[35])上表现不佳,因为可见细胞细节的差异;(2) 注释粒度——在弱监督的图像级标签(例如CAMEL)上训练的模型与在像素级真实掩膜(例如PAIP 2023)上训练的模型之间存在显著的性能差距;(3) 染色标准化——一些数据集,如NCT-CRC-HE-100K-NONORM,明确排除颜色标准化,以迫使模型学习“不受染色影响的”特征,这虽然难度更大,但能产生更可靠的临床工具。
当前的病理学基础模型,如Virchow、UNI和GIGAPATH,是在包含数十亿图像 tiles的数据集上训练的。这些模型创建了高维的特征表示,可以使用以前架构所需标记数据的一小部分进行“微调”。这种转变突显了像TCGA和PANDA这样的大规模存储库的临床重要性,它们提供了训练这些“知识丰富”模型所需的大量数据。在我们的审查中发现的一个主要问题是,罕见恶性肿瘤和代表性不足的患者群体的数据集稀缺。生成模型,特别是生成对抗网络(GANs)[169]和扩散模型[170],提供了一个潜在的解决方案。对于数据增强,研究人员现在可以生成高保真的合成病理学样本,以平衡某些类别(例如,罕见肿瘤亚型或特定基因突变)代表性不足的数据集。除了增强之外,专家指导的图像生成可以通过创建多样化的、真实的边缘案例来提高AI诊断的准确性,帮助解决临床“噪声”数据中的差距。生成式AI还在从一种模态合成另一种模态方面展现出潜力,例如,从H&E染色的切片生成类似IHC的染色模式,如在HEROHE和ACROBAT 2023等数据集中探索的那样。此外,尽管多模态数据集目前仍然稀缺,生成式AI、大型语言模型(LLMs)和视觉语言模型(VLMs)提供了整合不同数据类型的新方法[171]。像PathVQA(问答)和ARCH(多实例字幕)这样的数据集对于训练能够解释病理图像和临床文本的模型至关重要,朝着更全面的、类似临床医生的“推理”过程迈进。
基于我们的审查,我们发现了以下几点以及创建和维护高影响力大规模病理数据集时仍存在的一些挑战:
- **分割和分类任务的主导地位**:在细胞核和细胞分割领域,公开、精心策划、引用频繁的数据集很常见,而处理其他病理学挑战(如肿瘤学分类和生物标志物发现)的数据集相对较少[172]。即使在细胞核和细胞分割数据集的范围内,每个数据集提供的注释质量也差异很大,开发能够在不同数据集之间工作的AI模型需要特别注意,因为一些数据集之间存在数据重叠。数据集领域主要由少数几种癌症类型和AI任务主导:我们的分析显示,资源集中在乳腺癌、结直肠癌和前列腺癌上。这种关注虽然富有成效,但许多其他恶性肿瘤的资源却不足。此外,最常见的任务是分割和分类。像MoNuSeg、GlaS和PanNuke这样的基础分割数据集对于开发能够识别细胞核和腺体等基本结构的模型至关重要。然而,这种对基本任务的关注意味着用于更复杂临床挑战(如预测治疗反应或患者生存)的数据集较少。
- **异质性和泛化的挑战**:尽管癌症基因组图谱(TCGA)拥有大量的H&E数据集和其他相关组学数据,但它们缺乏特定于WSI的兴趣区域(ROIs)及其相应的标签,这限制了开发出的AI模型的临床适用性,因为泛化较为困难。
- **真正的大数据的缺乏**:有一些通用的病理学H&E数据集,例如MedMNIST[173, 174]包含PathMNIST作为其子集,有助于开发概念验证的病理学特定AI模型。然而,它们仍然不足以开发出可以在多个任务中使用的强大病理学AI模型。例如,PathMNIST为AI模型提供了一个9类的分类,并包含100,000个样本用于训练和7,180个样本用于测试。
- **多模态数据集的缺口**:尽管病理学数据集的总体可用性有所增加,但多模态数据集并不常见——癌症和许多其他疾病需要利用多种数据源(成像、基因组学、患者记录和临床数据)的综合性方法[175,176,177,178]。我们审查中发现的一个显著缺口是多模态数据集的稀缺。癌症是一种由基因组、蛋白质组和组织层面相互关联的因素驱动的复杂疾病。虽然有一些值得注意的数据集,如CPTAC集合和UPENN-GBM,将病理学与组学或放射数据相结合,但它们是例外而不是规则。
- **精确医学的未来**:精密医学的未来依赖于能够整合这些不同数据类型的AI模型。推进该领域将需要共同努力,创建更多将整个切片图像与相应的基因组学、转录组学和临床结果联系起来的数据集。
- **地理偏见和地区差异**:我们的分析显示了数据的显著地理集中现象。大多数高影响力、大规模的数据集(例如TCGA、CAMELYON、PANDA)来自北美和欧洲的医疗中心(以西方为中心)。全球南部(包括非洲、拉丁美洲和东南亚部分地区)的数据集严重匮乏,这可能导致“人口偏差”,模型无法考虑这些地区的遗传和环境差异(代表性不足的人口)。例如,人口统计偏见可能导致亚型乳腺癌(TCGA-BRCA)和肺癌(TCGA-lung cohorts)以及脑肿瘤IDH1突变预测(TCGA-GBMLGG cohort [5])的显著性能差异。此外,仅在资源丰富的机构数据上训练的AI模型可能在资源匮乏的环境中表现不佳,因为那里的染色协议或扫描设备存在显著差异(医疗保健不平等)。与现已成熟的放射学AI[180]不同,在病理学AI领域,对偏见和差异的理解以及如何克服它们仍相对较少探索[181,182,183,184]。
- **注释质量和观察者间变异性**:任何病理数据集的真实性取决于创建它的专家的质量。我们观察到审查的数据集中注释质量存在很大差异,从由多名病理学家验证的像素级掩膜到基于临床报告推断的弱标记图像不等。
- **主观性**:即使在Gleason分级或有丝分裂计数等复杂任务中,专家病理学家也表现出观察者间的变异性。这种主观性内置于训练数据中,可能限制了AI模型能够达到的绝对准确性。
- **众包的权衡**:一些大规模数据集,如NuCLS,利用众包标签。虽然这实现了大规模数据的扩展,但它引入了需要复杂算法处理来确保临床可靠性的“噪声”标签。
- **技术和解释上的差距**:数据集领域主要由分割和分类任务主导,使得像生存预测或疾病进展这样的复杂临床挑战资源不足。
- **多模态的稀缺性**:尽管在整合基因组学和放射学方面有临床需求,但审查发现将WSI与其他数据模态联系起来的数据集存在持续缺口,限制了真正“全面”AI模型的开发。
- **时间的快照**:由于数字病理学的快速增长,自2025年底我们结束搜索以来很可能已经发布了新的数据集。
最后,通过我们的系统审查,我们确定了在正确引用数据集方面存在的一个挑战:数据集作为研究成果的引用方式仍然不一致。最近有人呼吁标准化数据集的组织和引用方式[185],并使用DOI作为检索数据集的永久链接。尽管如此,在我们的审查中,我们发现我们在这里覆盖的151个数据集中,许多数据集既没有标准DOI,也没有可以归因于数据集作者的标准引用。推动社区范围内的数据发布和引用标准对于建立更强大和可重复的研究生态系统至关重要。存在FAIR评分低于30甚至接近零的数据集,这突显了“暗数据”的风险——这些有价值的临床资源对自动搜索和检索系统来说实际上是看不见的。基于我们的发现,我们为社区提出了几个未来的方向:
- **多样化数据收集**:迫切需要更多关注罕见癌症和代表性不足的患者群体的数据集,以确保AI模型的公平性和泛化能力。
- **优先考虑多模态数据集**:未来的数据收集工作应优先考虑将病理学图像与其他数据模态(包括基因组学、蛋白质组学和放射学)联系起来,以实现更全面的疾病建模。
- **开发集中式门户**:创建一个由社区维护的集中式门户来跟踪、访问和引用病理学数据集将是一种宝贵的资源。这将提高可见性,减少重复性,并促进合作。
- **标准化注释和策划**:建立社区范围内的最佳实践,包括注释质量、元数据报告和数据格式,将显著提高公共数据集的实用性和可重用性。
- **标准化注释和策划**:建立社区范围内的最佳实践,包括注释质量、元数据报告和数据格式,将显著提高公共数据集的实用性和可重用性。
最后,关于我们的系统审查,我们发现了一些局限性。首先,尽管我们在多个数据库中进行了全面搜索,但我们可能错过了那些没有正式索引的数据集,或者在机构网站或非英语期刊上发布的数据集。其次,根据原始出版物中的描述,按主要任务和器官对数据集进行分类,这在一定程度上需要主观解释。最后,该领域正在以惊人的速度发展,自我们完成搜索以来,很可能已经发布了新的数据集。
**结论**
计算病理学在多种疾病(包括但不限于癌症)的诊断方面取得了显著进展。人工智能(AI)技术现在越来越多地应用于组织病理学领域,以推断并提供计算机辅助诊断(CAD)解决方案,从而帮助改进决策过程。大规模数据集的可用性对于开发针对组织病理学挑战的AI驱动解决方案至关重要。在这篇综述中,我们提供了各种组织类型、器官和癌症相关的公开可用数据集的详细信息。通过按患者、器官、染色方法和放大倍数对数据集进行分类,我们提供了一个有助于计算病理学研究的列表。尽管近年来公开数据集的数量有所增加,但计算病理学基础模型的最新进展仍需要数百万张高质量整理的全幅切片图像(WSIs),并且还需要更多的多模态数据集来解决复杂的人类健康相关问题。要解决当前数据集可用性方面的限制和差距,需要研究人员、医疗机构、监管机构和技术提供商的持续合作与投资。努力必须集中在提高数据质量、建立标准化注释协议、开发强大的数据共享平台以及确保数据集开发中包含多样化患者群体方面。展望未来,病理学中AI的发展与高质量、标准化和多样化数据集的可用性密不可分。这些资源将对推动该领域的下一波创新至关重要,从而开发出应用范围更广、准确性更高的AI模型,并有可能显著推进精准医疗,改善全球患者的医疗效果。
**补充信息**
Excel文件:Table1_List_of_Datasets_Sep2025_FAIRScores.xlsx
Word文件:Table1_List_of_Datasets_Sep2025.docx