《Leukemia Research Reports》:Machine learning models in predictive factors for megaloblastic character of macrocytic anemia
编辑推荐:
背景:区分巨幼细胞性大细胞性贫血与非巨幼细胞性大细胞性贫血通常依赖于维生素B12和/或B9的检测以及骨髓检查。在资源有限的地区,这些诊断工具不易获得。本研究旨在利用易于获取的临床和实验室参数,开发一种机器学习模型,以区分这两种形式的大细胞性贫血。方法:研究人员
背景:区分巨幼细胞性大细胞性贫血与非巨幼细胞性大细胞性贫血通常依赖于维生素B12和/或B9的检测以及骨髓检查。在资源有限的地区,这些诊断工具不易获得。本研究旨在利用易于获取的临床和实验室参数,开发一种机器学习模型,以区分这两种形式的大细胞性贫血。方法:研究人员利用包含临床特征和常规实验室数据的数据集构建了逻辑回归(logistic regression)模型。通过序列特征选择器(SequentialFeatureSelector)识别关键预测变量。模型使用网格搜索交叉验证(GridSearchCV)进行优化,并通过分层5折交叉验证(stratified 5-fold cross-validation)确保稳健性能。结果:红细胞沉降率(ESR)、舌炎和平均红细胞血红蛋白浓度(MCHC)在预测非巨幼细胞性贫血方面最具影响力,其重要性百分比分别为23.11%、22.07%和13.87%。乳酸脱氢酶(LDH)(13.77%)、再生障碍状态(13.42%)和肢体感觉异常(11.78%)等其他变量也对模型有显著贡献,而平均红细胞体积(MCV)的重要性相对较低(1.98%)。模型表现出较高的判别能力,ROC曲线下面积(AUC)为0.92,总体准确率为94%。学习曲线分析证实了其在不同数据规模下的稳定性和一致性表现。结论:通过减少对专科诊断检测和侵入性操作的依赖,该方法尤其适用于资源受限的医疗环境。
大细胞性贫血(macrocytic anemia)是老年人中常见的贫血类型,尤其在资源有限地区,区分其巨幼细胞性(megaloblastic)与非巨幼细胞性病因对临床决策至关重要。传统诊断依赖维生素B12和叶酸水平检测及骨髓检查,但这些手段在基层医疗机构常不可及。研究人员开展了一项回顾性研究,基于2009年1月1日至2023年12月31日期间法图马·布尔吉巴大学医院内科与血液科收治的263例大细胞性贫血患者(其中39例非巨幼细胞性、224例巨幼细胞性),利用常见临床与实验室参数构建了逻辑回归(logistic regression)预测模型。研究结果显示,该模型在预测非巨幼细胞性贫血方面表现优异,ROC曲线下面积(AUC)为0.92,总体准确率达94%,并识别出红细胞沉降率(ESR)、舌炎、平均红细胞血红蛋白浓度(MCHC)等最具判别力的变量。该研究首次证明无需专门检测和侵入性操作即可实现大细胞性贫血病因的精准分类,为资源受限环境提供了一种实用的临床决策支持工具。
在技术方法方面,研究人员首先对临床和实验室数据进行了预处理,使用KNN插补法(KNN Imputer,n_neighbors=5)处理缺失值,并分别针对目标变量的各组进行插补。随后,通过序列特征选择器(SequentialFeatureSelector)结合逻辑回归进行特征选择,对连续变量采用标准化缩放(StandardScaler),以消除量纲影响。模型开发依托Python(版本3.11.5)及scikit-learn(版本1.6.0)等工具库,采用网格搜索交叉验证(GridSearchCV)优化超参数,并使用分层5折交叉验证(stratified 5-fold cross-validation)确保模型稳定。最终模型配置为C=0.1、class_weight='balanced'、penalty='l2'、solver='newton-cg'。模型评估使用ROC曲线、混淆矩阵和分类报告,学习曲线分析用于验证稳定性。所有数据和代码已在GitHub上公开。
在变量总结与缺失数据处理方面,研究样本平均年龄61岁(范围16-90岁),平均血红蛋白水平为7.38 g/dl。单因素分析显示,头晕、颅神经受累、肢体感觉异常、肝肿大、脾肿大、舌炎、多发性腺病、MCV、MCHC、白细胞计数(WBC)、ESR、天冬氨酸转氨酶(AST)、LDH、肌酐及再生障碍状态在两组间存在显著差异,而年龄和性别无显著差异。缺失值插补后,上述显著变量的统计结果基本保持一致。
在特征选择方面,通过序列特征选择器结合逻辑回归,以召回率(recall)为优化指标,最终筛选出ESR、舌炎、MCHC、LDH、再生障碍状态、肢体感觉异常和MCV共7个最具影响力的预测变量。
在模型创建方面,研究人员将预处理流程整合至逻辑回归模型中,通过GridSearchCV在参数网格中搜索最优超参数,确定最佳配置为C=0.1、class_weight='balanced'、penalty='l2'、solver='newton-cg',有效应对了目标变量的类别不平衡问题。
在最终结果方面,模型在测试集上的ROC曲线AUC为0.92,最优截断值确定为0.73。混淆矩阵显示,模型正确识别43例巨幼细胞性贫血(真阴性)和7例非巨幼细胞性贫血(真阳性),仅出现1例假阴性和1例假阳性。总体准确率为94%,巨幼细胞性贫血类别的精确率、召回率和F1分数分别为0.98、0.96和0.97,非巨幼细胞性贫血类别则分别为0.78、0.88和0.82。学习曲线显示训练和验证分数收敛并趋于稳定,表明模型未过拟合,具有良好的泛化能力。特征重要性分析基于逻辑回归系数绝对值,结果显示ESR(23.11%)、舌炎(22.07%)和MCHC(13.87%)贡献最大,LDH(13.77%)、再生障碍状态(13.42%)和肢体感觉异常(11.78%)次之,MCV贡献相对较低(1.98%)。
在讨论部分,研究人员强调,据其所知,这是首个基于机器学习方法,在不检测维生素B12和叶酸水平、不进行骨髓穿刺的情况下,预测大细胞性贫血非巨幼细胞性病因的研究。模型表现满意,且特征重要性结果与临床病理生理学一致,如维生素B12缺乏可导致舌炎和肢体感觉异常,巨幼细胞性贫血常伴随LDH升高和再生障碍状态。然而,研究存在一定局限性:样本量较小可能影响结果稳健性;类别不平衡虽经处理但未使用合成数据生成;未排除缺铁性贫血患者可能影响MCV的判别价值。尽管如此,该模型在资源有限地区具有重要临床应用前景,可帮助临床医生区分巨幼细胞性贫血与非巨幼细胞性贫血,从而及时启动针对性治疗或转诊至专科中心。
在研究结论中,研究人员指出,本研究证明了使用逻辑回归模型在资源有限环境下预测非巨幼细胞性大细胞性贫血的潜力。通过开发网络应用,旨在促进该模型在地区医院的应用,实现患者的早期识别和恰当管理。尽管结果令人鼓舞,仍需进一步验证和优化以提升模型的准确性和临床适用性。未来研究应着重扩大样本量并整合更多数据,从而改善模型性能及其对患者护理的潜在影响。