《Frontiers in Medicine》:Automated bone marrow cell classification using ensemble learning: performance, generalization, and clinical interpretability
编辑推荐:
摘要:研究人员评估并比较了四种集成学习(Ensemble Learning)策略——软投票(Soft Voting)、Bagging、Boosting及Stacking——用于21类骨髓(Bone Marrow, BM)细胞核形态学分类的效果。基模型采用Res
摘要:研究人员评估并比较了四种集成学习(Ensemble Learning)策略——软投票(Soft Voting)、Bagging、Boosting及Stacking——用于21类骨髓(Bone Marrow, BM)细胞核形态学分类的效果。基模型采用ResNet18与MobileNetV3-Large,数据集为慕尼黑白血病实验室(Munich Leukemia Laboratory, MLL)提供的171,374张专家标注高分辨率显微图像,经分层划分与均衡增广(每类20,000张)后开展实验。研究引入加权交叉熵损失的深度网络自适应Boosting流程,并以XGBoost作为Stacking的元模型(Meta-model);采用精度(Precision)、召回率(Recall)、F1值、准确率(Accuracy)及宏平均ROC-AUC评估性能,辅以Grad-CAM、Grad-CAM++与LIME进行可解释性(Explainable AI, XAI)分析及UMAP特征嵌入可视化。结果表明Boosting集成取得最优表现(准确率0.96,宏F1值0.96,ROC-AUC 0.9978),显著优于单一基模型及其他集成方式(软投票与Stacking为0.94,Bagging为0.93),且在形态学模糊的髓系早期细胞(如原始粒细胞MYB、早幼粒细胞PMO)上错误修正效果明显;软投票与Stacking推理耗时最低(分别约1283 s与22 s),Boosting居中(约233 s)。外部验证于BMCD-FGCD与A. Bodzas独立数据集分别获得宏F1值0.93与1.00,证实良好泛化能力。Grad-CAM++的决策影响比(Decision Impact Ratio, DIR)与置信影响比(Confidence Impact Ratio, CIR)定量验证模型关注生物相关形态区域。研究表明深度CNN集成尤其Boosting策略可有效提升骨髓细胞自动化分类的准确性与鲁棒性,为血液病学临床辅助诊断提供技术基础。
论文解读:基于集成学习策略的骨髓细胞形态学分类研究——软投票、Bagging、Boosting与Stacking方法的比较(《Frontiers in Medicine》)
一、研究背景与立题依据
骨髓(Bone Marrow, BM)细胞形态学人工分类是血液系统疾病(如白血病、骨髓增生异常综合征)诊断与分型的核心依据,但受限于细胞类型多样性、同类细胞形态相似性(如粒细胞成熟系列原始细胞MYB、早幼粒PMO、中幼粒MMZ)、罕见细胞低检出率及不同病理医师间判读差异(专家间一致性约85%–91%),传统自动化方法难以满足临床高精度要求。深度学习尤其是卷积神经网络(Convolutional Neural Network, CNN)已在医学图像分析展现潜力,但单模型易陷入过拟合或对少数类欠拟合。集成学习(Ensemble Learning)通过结合异质或多重基模型预测可降方差、纠偏并提高鲁棒性,然而针对21类BM细胞精细分类的不同集成范式(Voting、Bagging、Boosting、Stacking)系统性对比尚缺,亦少见结合可解释性人工智能(Explainable AI, XAI)与跨数据集外部验证的完整评估。为此,研究人员以MLL公开数据集为基础,构建并对比四种CNN集成框架,旨在明确最适集成策略及其在血液学辅助诊断中的应用价值。
二、主要关键技术方法
研究人员采用慕尼黑白血病实验室(Munich Leukemia Laboratory, MLL)数据集共171,374张经血液病学专家标注的BM单细胞高分辨显微图像,涵盖21种细胞类型(含异常嗜酸、毛细胞、柴捆细胞等),按图像级分层8:2切分训练/测试集,训练集经旋转、仿射等增强与过采样/欠采样平衡至每类20,000例。基学习器选用预训练ResNet18(残差连接抗梯度消失,捕捉高层次形态纹理)与MobileNetV3-Large(深度可分离卷积与Squeeze-and-Excitation模块兼顾效率),冻结前端权重微调全连接层输出21维softmax。四种集成策略:(1) 软投票(Soft Voting):两基模型输出概率向量取算术平均后argmax;(2) Bagging:各基模型独立Bootstrap抽样训练,测试阶段多数表决;(3) Boosting(类AdaBoost顺序修正):先训MobileNetV3,依错分样本更新权重,再加权交叉熵损失训ResNet18,推理时按模型误差倒数加权融合概率;(4) Stacking:基模型概率输出拼接为42维特征输入XGBoost元分类器(n_estimators=100, max_depth=3, objective=multi:softprob)。训练用Adam优化器、余弦退火学习率、早停(patience=3),PyTorch框架下M1 Pro芯片MPS加速。评价指标含Accuracy、Precision、Recall、宏/加权平均F1-score、宏ROC-AUC与AUPRC,辅以McNemar检验与Cohen's h效应量;XAI采用Grad-CAM、Grad-CAM++及LIME,定义DIR与CIR量化解释重要性;UMAP降维(ResNet18为512维GAP,MobileNetV3为960维GAP,集成拼接为1472维)分析特征空间聚类质量(轮廓系数、Davies-Bouldin指数等)。外部验证使用BMCD-FGCD(中国浙江医院,17类映射)与A. Bodzas(外周血白细胞,9类映射)数据集零样本推理。
三、研究结果
3.1 基模型与集成整体性能比较
单独ResNet18准确率91.47%(宏F1 0.9152),MobileNetV3为88.41%(宏F1 0.8849)。四种集成均超越最强单模型:Boosting最优(Accuracy 0.9600,Precision 0.9601,Recall 0.9600,宏F1 0.9600,宏ROC-AUC 0.9978,宏AUPRC 0.9612);软投票与Stacking相当(Accuracy 0.94,宏F1 0.94);Bagging略低(Accuracy 0.93,宏F1 0.9304)。Bootstrap置信区间显示Boosting [0.9586, 0.9614]不与其它重叠,McNemar检验证实其显著优于其余方法(p<0.0001)。
3.2 逐类性能与混淆矩阵分析
形态独特且少见类别如柴捆细胞(FGC)、毛细胞(HAC)、异常嗜酸(ABE)、涂抹细胞(KSC)、未成熟淋巴细胞(LYI)在各集成下近完美(F1≈1.00)。困难类MYB(原始粒细胞)、PMO(早幼粒细胞)、MMZ(中幼粒细胞)互有混淆,Boosting将其F1分别提升至0.85、0.84、0.90,优于其他集成。混淆矩阵显示MYB?PMO、MMZ?NGB(杆状核中性粒细胞)互混为主,符合生物学连续成熟谱系特征。
3.3 推理时间与计算效率
软投票1283.61 s、Bagging 1347.28 s(需多CNN前向传播),Boosting 233.38 s(顺序训练但推理仅两模型),Stacking仅22 s(基模型预测一次+XGBoost元模型推断低维向量)。表明Stacking适合实时受限场景,Boosting在精度与效率间取得最佳平衡。
3.4 ROC-AUC与AUPRC
Boosting宏ROC-AUC 0.9978(MYB最低0.9873),宏AUPRC 0.9612;Bagging AUPRC偏低(0.9313),反映Boosting对难分少数类的序敏感性改善更显著。
3.5 统计显著性检验
六组配对McNemar检验Bonferroni校正后Boosting均显著优(p<0.0083),软投票与Stacking无显著差异(p=1.000),Cohen's h对Boosting为0.135–0.173(小效应但在84,000样本下具临床意义)。
3.6 可解释性(XAI)分析
Grad-CAM++热图较Grad-CAM聚焦核染色质、Auer小体等判别区;LIME超像素遮掩互补验证关注区。DIR与CIR排序:Grad-CAM++(均值0.86)>Grad-CAM(0.84)>LIME(0.82);形态模糊类(MYB、PMO)DIR/CIR较低(0.66–0.73),独特类(HAC、FGC)较高(≥0.94),说明解释与分类难度一致。
3.7 UMAP特征嵌入与聚类指标
集成拼接特征UMAP silhouette score 0.441(ResNet18 0.374,MobileNetV3 0.312),Davies-Bouldin 0.637(更低优),Calinski-Harabasz 14876,近邻类纯度(Nearest-Neighbor Class Purity, NNCP)0.852,Trustworthiness 0.921,证实集成习得更具判别力的联合表征。
3.8 外部验证
BMCD-FGCD数据集:Boosting与软投票宏F1均为0.93(Bagging 0.92,Stacking 0.91),粒细胞成熟阶段MYB/PMO/MMZ仍最难(F1 0.79–0.85)。A. Bodzas外周血数据集:Boosting达完美(Accuracy/F1 1.00),其余方法0.99,证实跨域稳健性。
四、讨论与结论总结
讨论指出形态重叠(MYB-PMO-MMZ)、罕见类代表性不足、制片染色伪影为主要误分来源;Boosting借序贯误分重加权缓解此问题但不完全消除,与专家间分歧水平接近。单中心训练为局限,建议多中心联邦学习(Federated Learning, FL)扩展;未来宜引入Transformer或CNN-Transformer混合骨干对照同框架集成效果,并结合全玻片检测(Whole-Slide Image, WSI)上游分割模块。临床整合可分三级:平台嵌入(ONNX/TorchScript)、AI辅助微分计数(低置信Pmax<0.70送人工复核)与主动学习持续迭代。
结论(翻译浓缩): 研究表明深度CNN集成尤其Boosting策略可显著提升21类BM细胞形态学自动分类的准确性(最高准确率96%)与泛化能力,优于单一模型及其他集成范式;软投票与Stacking具计算优势适合特定部署场景;结合Grad-CAM++等XAI手段与DIR/CIR量化指标可增强临床信任度。所提出的集成框架为血液病理学辅助诊断系统奠定了方法学基础,后续需多中心前瞻性验证及与WSI流程整合以推进实际临床应用。