口腔癌域通用分类:桥接多中心组织病理学数据集

《Frontiers in Medicine》:Domain-generalizable oral cancer classification: bridging multi-center histopathological datasets

【字体: 时间:2026年09月09日 来源:Frontiers in Medicine 3.6

编辑推荐:

  深度学习用于苏木精-伊红(H&E)组织病理学图像检测口腔鳞状细胞癌(OSCC)时,在实验室、扫描仪和放大倍数之间性能急剧下降;而目标中心在训练时通常不可用,因此向未见过域的泛化成为可靠筛查的决定性要求。研究人员将多中心OSCC分类定义为域泛化问题,并提

  
深度学习用于苏木精-伊红(H&E)组织病理学图像检测口腔鳞状细胞癌(OSCC)时,在实验室、扫描仪和放大倍数之间性能急剧下降;而目标中心在训练时通常不可用,因此向未见过域的泛化成为可靠筛查的决定性要求。研究人员将多中心OSCC分类定义为域泛化问题,并提出SICA(Style-Invariant Consistency Alignment,风格不变一致性对齐):一个融合三种已有不变性机制的单目标,包括通道级特征统计的风格随机化、强制同一图像两个独立染色视图在嵌入与预测空间一致的染色一致性项,以及保持决策边界的类条件特征对齐。其中两项仅依赖配对染色视图,故SICA在单源域下仍有效,而经典跨域对齐会退化为普通风险最小化。在涵盖真实跨放大倍数偏移与受控多中心染色偏移模拟的可复现留一域基准上,SICA与九种基线在八项指标比较;共享同一ImageNet骨干的十种算法中,SICA取得最佳且最稳定的域外AUROC(多中心协议90.6%),最佳最坏情况中心,以及比经验风险最小化校准更好的均衡工作点。经置信区间、配对检验与多重校正,对最强基线的优势一致但在五个模拟中心上并不具统计决定性。相同协议下,冻结的病理基础模型可缩小部分染色差距但不能缩小尺度差距;在完全相同冻结特征上,所提目标将其从92.3%进一步提升至93.4% AUROC,说明更好表征与显式不变性互补。对公共语料的审计发现28张字节相同图像被标以矛盾标签,去重后在组感知防泄漏协议下重跑基准。最后在真正独立的150患者队列上报告阴性结果:所有方法(含本研究)降至随机水平,因为约束因素是视野尺度而非染色。因此染色不变性必要但不充分,模拟染色偏移基准不能被当作部署性能估计。
《Frontiers in Medicine》刊发的该项研究聚焦口腔鳞状细胞癌(OSCC,oral squamous cell carcinoma)组织病理学图像在多中心场景下的域泛化(DG,domain generalization)问题。研究背景在于:H&E切片是诊断参考标准,但人工评估耗时、依赖稀缺专家且观察者变异性大;单中心训练的深度学习模型在实验室、扫描仪、放大倍数变化时会严重退化。现有方法各有局限,染色归一化与染色增强只在输入/颜色层处理,通用域泛化方法需要多源域因而在单源下退化为经验风险最小化(ERM,empirical risk minimisation),一致性学习多用于预训练而非监督正则,且既往评估常忽略类别不平衡与概率校准。由于目标中心数据训练时不可得,模型必须面向未见过域泛化,这正是本研究要解决的核心问题。
研究人员开展的研究是提出SICA(Style-Invariant Consistency Alignment),并把多中心OSCC筛查建模为域泛化问题;构建可复现的多协议留一域(LODO,leave-one-domain-out)基准,包括真实100×与400×跨放大倍数偏移,以及把图像按类与原生放大倍数分层后重新着色为K=5个虚拟中心的多中心染色偏移模拟;审计公共数据集并去除字节相同却标签矛盾的图像;在统一架构、类别不平衡采样与训练域验证下比较十种算法;并将冻结病理基础模型与ImageNet预训练对照。结论上,SICA在共享骨干方法中取得最佳且最稳的域外AUROC、最佳最坏情况中心与更好校准;但模拟染色偏移不能代表真实部署,独立150患者外部队列中所有方法因视野尺度问题跌至随机水平,说明染色不变性必要但不充分,更好表征与显式不变性互补。
关键技术方法上,研究人员使用Rahman等公开H&E口腔癌数据库(230名患者、1224张100×与400×图像)及独立150患者外部队列;以HED(haematoxylin–eosin–DAB)色彩解卷积生成每中心固定染色画像与训练期双视图随机抖动;骨干为ImageNet预训练ResNet-18,早期阶段插入MixStyle做通道级特征统计风格随机化;用SimSiam式对称停止梯度负余弦做嵌入一致性、温度软化知识蒸馏式散度做预测一致性;用类条件二阶统计对齐(类条件Deep CORAL)保决策边界;采用类别平衡采样、训练域20%验证选模、三种子复现,并在去重与组感知分配下控制泄漏。
研究结果如下。
2 Related work
研究人员综述OSCC深度学习、染色/扫描变异、域泛化、一致性表示学习、病理基础模型后指出:单中心研究不能证明部署泛化;染色方法只处理颜色轴;多源域泛化在单源退化;病理基础模型与显式不变性互补而非替代。
3 Methodology
3.1 Relation to prior work: what is reused and what is new
研究人员说明SICA无新损失原语,而是复用MixStyle、SimSiam/BYOL、知识蒸馏、Deep CORAL与HED增强,并将其组合为单目标、以H&E扰动作视图变换、在单源仍有效,并配套泄漏审计基准。
3.2 Overall model architecture
研究人员用共享Siamese ResNet-18,几何增强后做每中心确定性染色与两个独立HED抖动视图; stem与第一阶段冻结,MixStyle训练期开启、推理关闭;分类头与投影头并行;三机制联合优化,正则项线性预热。
3.3 Problem formulation and domain-generalization setup
研究人员定义域为X×Y上分布,LODO中仅用源域学h=C?°Fθ,使未见过目标域风险最小;用跨放大倍数与多中心染色两种域定义分离尺度与颜色两类扰动。
3.4 Stain-aware domain construction and two-view generation
研究人员在HED空间用Tα,β,γ(I)=γ?Φ?1HED(α⊙ΦHED(I)+β)做每像素颜色映射;五中心C0-native、C1-pale、C2-dark、C3-eosin、C4-hema仅改H/E通道。结论是形态学由构造保留,C0 SSIM 0.989,仅C1-pale降到0.910;纯颜色逻辑探针在重染色中心不获得额外类别线索。
3.5 Data provenance, duplicate audit and leakage control
研究人员发现1224文件仅1208个MD5,28张图跨Normal/OSCC同字节矛盾标签,删去后按组感知分配;中心划分在切分前用seedcentre=0完成,增强只在训练循环内、不缓存、不触目标域,从而控制像素级泄漏。
4 Experiments and analysis
研究人员在八指标下比较十算法:SICA多中心AUROC 90.6%最佳最稳;冻结病理基础模型关染色差距不关尺度差距,SICA在其冻结特征上把92.3%升至93.4%;独立150患者队列所有方法近随机,根本约束是field-of-view scale而非stain。
讨论与结论部分总结:研究人员强调模拟多中心染色偏移只是隔离颜色轴的控制实验,不是真实机构间光学、切片厚度、固定与协议联合偏移的替代;公共数据集存在同字节矛盾标签会膨胀指标,去重与组感知拆分是可信评估前提;SICA的价值不在单一平均指标显著胜出,而在最佳均值排名、最小方差、最佳最坏情况中心与更优校准的一致性。结论可译为:染色不变性是跨中心OSCC筛查的必要非充分条件;病理基础模型表征质量与显式不变性目标互补;留一域基准必须有独立外部队列校验,否则模拟染色偏移会被误读为部署性能;未来可信病理AI评估应同时报告校准、最坏情况中心、泄漏审计与真实尺度偏移下的外部验证结果。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号