基于机器学习的中国东部134,189例患者智能诊断相关分组(DRG)分类

《Journal of Intelligent Medicine》:Intelligent diagnosis-related group classification for 134,189 patients in eastern China using machine learning

【字体: 时间:2026年08月14日 来源:Journal of Intelligent Medicine

编辑推荐:

  诊断相关分组(DRG)分类对于医疗成本管理和资源配置至关重要,但传统的医师人工分类效率低下且易出错,尤其是在大规模医疗数据场景下。为应对这一挑战,研究人员提出了ELGWO-LightGBM(精英灰狼优化–LightGBM)方法,这是一种自动化DRG分类方法,将

  
诊断相关分组(DRG)分类对于医疗成本管理和资源配置至关重要,但传统的医师人工分类效率低下且易出错,尤其是在大规模医疗数据场景下。为应对这一挑战,研究人员提出了ELGWO-LightGBM(精英灰狼优化–LightGBM)方法,这是一种自动化DRG分类方法,将增强的灰狼优化(GWO)算法与LightGBM相结合。该方法引入精英狼机制(ELGWO)来优化LightGBM超参数,有效避免局部最优并提高收敛速度。研究人员在涵盖57个DRG类别的134,189条患者记录数据集上评估了该方法。实验结果表明,ELGWO–LightGBM在分类准确率上显著优于传统深度学习模型和梯度提升方法。ELGWO优化还增强了模型在处理大规模结构化医疗数据时的稳定性和鲁棒性。研究结果表明,ELGWO–LightGBM为DRG分类提供了一种高效、准确的自动化解决方案,有助于推动智能医疗数据处理系统的发展。
诊断相关分组(Diagnosis-related group, DRG)是一种将临床特征和资源消耗相似的患者归类分组的管理工具,由耶鲁大学提出,美国于1983年率先实施。DRG分类对于医疗成本控制、医保支付和资源配置具有重要意义。然而,传统DRG分组依赖医师手工规则,存在效率低下、主观偏倚大、难以适应大规模复杂数据等问题。随着医疗信息化发展,病历数据量激增,传统方法已无法满足实际需求,因此研发自动化、智能化的DRG分组方法成为亟待解决的问题。

本研究提出了一种基于精英灰狼优化(Elite Gray Wolf Optimization, ELGWO)与LightGBM结合的自动化DRG分类模型(ELGWO-LightGBM)。研究数据来源于中国东部某医院2021—2023年的住院病案,原始数据约100万条,经数据清洗后保留134,189条有效记录,覆盖57个DRG类别。研究人员采用均值填补处理缺失值,标签编码(Label Encoding, LEC)转换分类变量,并剔除异常值。实验结果显示,ELGWO-LightGBM在分类准确率上达到0.9858,显著优于传统的深度学习和梯度提升模型。该成果发表于《Journal of Intelligent Medicine》。

在技术方法上,ELGWO算法在标准灰狼优化(Grey Wolf Optimization, GWO)的基础上引入精英狼机制,利用历史全局最优精英解指导位置更新,并采用动态精英权重以平衡全局探索与局部开发,从而避免早熟收敛并提高收敛速度。LightGBM则采用直方图算法和叶子优先生长策略,能够高效处理大规模结构化数据。ELGWO用于优化LightGBM的树数量、学习率、最大深度、叶子数等超参数。样本队列来自中国东部单中心医院,未涉及外部验证。

在结果部分,研究人员进行了多项实验。4.1 实验数据集:预处理消融实验表明,均值填补与标签编码组合的准确率、精确率、召回率和F1值分别为0.9858、0.9858、0.9858和0.9856,优于中位数填补和删除策略。特征重要性分析显示主要诊断代码、次要手术代码和主要手术代码是贡献最大的特征。通过Top-K特征子集实验,发现使用全部9个特征时模型性能最佳(准确率0.9858)。层次聚类分析显示主要诊断代码与手术代码类特征紧密关联,而住院天数和次要诊断代码相对独立。4.2 数据集划分:数据按8:1:1划分为训练集、验证集和测试集,确保模型评估的可靠性。4.3 参数设置:ELGWO优化后的超参数包括树数量200、学习率0.01、最大深度12、叶子数66等;敏感性分析表明超参数范围对模型性能有显著影响。4.4 实验结果分析:特征相关性分析显示主要诊断代码与住院天数呈负相关(-0.64),与次要诊断1代码正相关(0.59)。精英机制消融实验比较了无精英、当前代精英均值、全局精英固定权重和动态权重四种策略,动态权重策略获得最优性能,证明了精英狼机制的有效性。决策树可视化显示模型优先使用主要诊断代码进行分裂,增强了临床可解释性。多分类混淆矩阵显示误分类主要集中在临床相似的DRG亚类之间,如FL19与FL29、FM13与FM23等,这些类别共享相似的诊断和手术组合。与基线模型相比,ELGWO-LightGBM的准确率、精确率、召回率均达0.9858,F1值为0.9856,优于GWO-LightGBM(准确率0.9852)、XGBoost(0.9766)、NODE(0.9301)、TabNet(0.8314)和CatBoost(0.7523)。

讨论部分指出,剩余误分类主要源于DRG亚类间强烈的语义重叠,建议未来可通过引入细粒度编码层次特征、构造诊断-手术交互特征以及类别重加权等策略来进一步改善。

结论部分:本研究提出的ELGWO-LightGBM模型通过精英狼机制有效优化LightGBM超参数,大幅提升了DRG分类的准确性和稳健性。实验证明该方法在多种对比方法中表现最佳。但研究存在局限性:数据来自单一医院,且未进行外部验证。未来将扩展至多中心数据集,并探索数据增强技术以提高模型的泛化能力。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号