综述:基于放射报告、临床笔记与结构化临床数据的多模态机器学习预测脊柱手术建议

《World Neurosurgery: X》:Multimodal machine learning for predicting spine surgery recommendation using radiology reports, clinical notes, and structured clinical data

【字体: 时间:2026年07月12日 来源:World Neurosurgery: X 1.6

编辑推荐:

  目的:随着脊柱门诊高效分诊需求的日益增长,机器学习与自然语言处理(NLP)Transformer模型在预测手术建议方面已展现出应用潜力,为患者的分层管理提供了可行路径。本研究旨在评估一种整合融合模型对全病种脊柱门诊患者手术建议的预测效能,该模型训练数据涵盖放射

  
目的:随着脊柱门诊高效分诊需求的日益增长,机器学习与自然语言处理(NLP)Transformer模型在预测手术建议方面已展现出应用潜力,为患者的分层管理提供了可行路径。本研究旨在评估一种整合融合模型对全病种脊柱门诊患者手术建议的预测效能,该模型训练数据涵盖放射报告、临床笔记及临床变量。方法:研究纳入单中心涵盖50余种ICD编码脊柱疾病的门诊患者队列,收集初诊时的放射报告、门诊病历、结构化临床变量及1年内手术建议状态。针对各数据模态分别构建单模态模型:放射印象模型、门诊笔记模型及结构化临床变量模型;随后采用Logistic回归整合各组件模型输出,构建晚期融合模型。共开发7种基于不同NLP Transformer骨干网络(如BERT、GatorTRON)的晚期融合模型。采用5折交叉验证评估模型性能,指标包括受试者工作特征曲线下面积(AUROC)、灵敏度及特异度,并计算95%置信区间。结果:初诊后1年内,972例患者中有35%被建议行脊柱手术。晚期融合模型预测手术建议的AUROC范围为0.69–0.81,其中GatorTRON晚期融合模型性能最优(AUROC 0.81;95%CI 0.78–0.83)。进一步分析显示,在三类输入模态中,仅基于放射报告的模型对晚期融合模型性能的贡献最大。结论:本研究表明,整合机器学习模型可有效利用初诊时的多模态数据稳健预测脊柱手术建议。
  1. 1.
    引言
    全球范围内脊柱手术发生率呈持续上升趋势。美国数据显示,2010至2022年间颈椎手术发生率增长12.4%,2004至2015年间择期腰椎融合术量增长62.3%,同期住院总费用上升177%。尽管脊柱外科医师数量有所增加,但手术量的增长速度远超医师供给增速,供需失衡凸显了优化脊柱患者分诊与治疗流程的迫切性。当前脊柱门诊的管理决策涵盖手术治疗与保守治疗(如物理治疗、疼痛管理、硬膜外注射等),理想状态下外科医师应优先评估具备明确手术指征的患者。然而,新患者就诊后最终接受手术的转化率仅为7.5%–15%,对非手术适应证的过度评估不仅延误需手术患者的诊疗,也造成医疗资源浪费。从卫生经济学角度,新患者手术转化率每提升5%,总手术收入可增加33.3%,因此优化分诊效率具有重要临床与经济价值。既往研究尝试通过多元Logistic回归模型整合患者报告变量预测手术适应证,但效能有限。近年机器学习方法逐步应用于该领域,如人工神经网络(ANN)模型结合影像与临床特征预测腰椎手术进展,证实影像特征是核心预测因子;另有研究通过机器学习直接解读MRI图像,预测腰椎减压手术适应证的AUROC达0.88。但现有模型多基于窄谱、同质性队列开发,数据结构标准化程度高,难以反映真实世界的临床异质性,限制了其泛化能力。自然语言处理(NLP)Transformer模型为解决这一问题提供了可能,其可从非结构化文本中提取语义与上下文信息,适用于跨脊柱病种的神经影像报告与门诊笔记解析。放射报告本质上是影像原始数据到高价值文本的转化载体,已有研究证实BERT模型可高精度识别脊柱影像学关键发现,在骨转移瘤检测与转诊预测中也表现出可靠性能。Broida等的研究首次采用BERT基于全病种MRI报告预测手术建议,取得较好效果,但该研究仅验证了原始BERT模型,未覆盖2018年后发布的参数规模更大、预训练语料更丰富的新型Transformer模型。本研究拟构建多模态晚期融合模型,整合初诊神经影像输入、现病史(HPI)笔记及结构化临床变量,系统比较不同Transformer模型的性能差异,为开发临床实用的脊柱门诊筛查系统提供依据。
  2. 2.
    方法
    2.1 概述
    本研究的核心目标为开发整合模型,基于初诊时的多模态数据预测脊柱手术建议,整体分为三部分:首先训练并验证基于结构化临床变量的机器学习模型;其次独立训练并验证7种NLP Transformer模型(BERT、BioClinicalBERT、DistilBERT、GatorTRON、Clinical-LongFormer、RadBERT及RoBERTa)在放射报告与HPI笔记上的性能;最后将临床变量、放射及HPI组件模型整合为晚期融合模型。
    2.2 患者与数据收集
    经机构审查委员会(IRB)批准后,检索单中心2010年1月1日至2023年5月31日的电子健康记录,通过ICD-10编码筛选常见脊柱疾病患者。纳入标准:于神经外科脊柱门诊就诊、初诊前存在对应放射报告、初诊后至少1年随访数据。排除初诊后随访不足1年或初诊为术后随访的患者。两名经过结构化图表提取培训的医学生独立审核病历,确定初诊后1年内是否收到手术建议,“建议手术”定义为病历中明确记录手术推荐或已安排手术操作,不要求患者实际接受手术;“建议保守治疗”(如物理治疗、硬膜外注射等)归类为“不建议手术”。提取内容包括初诊影像(MRI、CT、X线)的放射科印象、HPI陈述及结构化临床变量。所有数据均按HIPAA/IRB标准去标识化处理后进行离线分析。
    2.3 临床变量选择与分析
    临床变量涵盖人口学特征、体格检查发现、合并症及相关病史(如既往创伤)。首先通过单因素与多因素广义线性模型分析各变量,计算未调整与调整后的比值比(OR)。采用XGBoost机器学习模型(并行树梯度提升算法)基于全部临床变量单独预测手术建议,通过5折交叉验证生成袋外(OOF)预测概率,用于后续晚期融合模型输入。
    2.4 模型选择与特征
    基于既往研究证据,选取7种NLP Transformer模型进行比较:BERT、BioClinicalBERT、DistilBERT、RadBERT、RoBERTa、GatorTRON及Clinical-LongFormer。模型初始化与训练通过PyTorch结合Huggingface Trainer封装实现。
    2.5 数据预处理
    放射科印象与HPI笔记在输入前进行清洗:统一转换为小写字母,去除换行符合并段落为连续文本,随后进行分词处理,映射至各模型专属词汇表并转换为数值向量用于模型训练。
    2.6 模型优化与训练
    所有模型基于相似架构,采用HuggingFace标准优化与训练协议。通过PyTorch将词元映射为向量后输入Transformer编码器层进行语义解析,输出向量传入线性分类器,任务为基于放射印象或HPI笔记单独预测初诊后1年内手术建议。采用5折交叉验证,每折80%患者用于训练,20%用于测试,以最高AUROC为指标选择最优模型。针对手术建议类别分布不均衡的特点,采用加权交叉熵损失函数,通过为少数类(建议手术)分配更高权重优化模型性能。各模型训练前通过40次随机搜索结合分层80/20调优集确定超参数(学习率、权重衰减、预热比例等),受计算资源限制,所有模型批次大小固定为4(适配GatorTRON的计算需求),训练共4个epoch。交叉验证在放射数据与HPI数据上独立进行,生成OOF预测概率用于晚期融合模型输入。所有脚本随机种子设为“3”以保证结果可复现,代码公开于GitHub平台,模型训练与验证在配备16核CPU、128GB RAM及NVIDIA GeForce RTX 4090 GPU的定制计算机上完成。
    2.7 模型整合
    采用平衡Logistic回归整合放射、HPI及临床变量组件模型,对OOF预测概率进行标准化处理后作为输入,输出整合后的手术建议预测概率。同时采用SHAP(Shapley Additive Explanations)特征重要性分析量化各组件对晚期融合模型的贡献度。
    2.8 模型评估
    采用AUROC、灵敏度(召回率)及特异度评估模型性能。AUROC为主要评价指标,不受分类阈值影响;次要指标基于约登指数确定的阈值计算,该阈值可最大化灵敏度与特异度的差值。
    2.9 统计分析
    所有评估指标均基于OOF预测概率计算,通过5000次重采样的Bootstrap法估计95%置信区间。
  3. 3.
    结果
    初始队列共纳入1111例符合ICD-10编码标准的脊柱门诊患者,经排除后最终972例进入模型训练与交叉验证。队列平均年龄55.4±10.0岁,中位年龄56岁;35%(341例)患者被建议手术。手术组女性占55%、男性占45%,非手术组女性占65%、男性占35%;种族构成以黑人或非裔美国人(52.4%)和白人(16.8%)为主,合计占69.2%。
    临床变量分析共纳入25项指标,单因素分析显示8项因素与手术建议相关:上肢无力、下肢无力、感觉异常、反射异常的阳性体征均与更高手术风险相关。多因素调整后,仅反射异常(OR=2.30;95%CI 1.56–3.40)与下肢无力(OR=1.51;95%CI 1.00–2.28)仍为手术建议的独立预测因子;BMI>30的患者手术风险更低(调整后OR=0.74;95%CI 0.55–0.99);既往卒中史在多因素调整后与手术风险降低相关(OR=0.41;95%CI 0.16–0.94)。年龄、既往脊柱手术史、腰椎病变部位在单因素分析中具有预测价值,但多因素调整后无统计学意义。
    模型性能分析显示,不同数据模态与Transformer模型间存在显著差异。临床变量XGBoost模型性能最低(AUROC 0.64;95%CI 0.60–0.68)。HPI单模态模型AUROC范围为0.62–0.71,7种Transformer模型在HPI上的性能无统计学差异,最优为GatorTRON(AUROC 0.71;95%CI 0.67–0.74)。放射单模态模型整体优于HPI与临床变量组件,除BERT外,其余放射模型性能均显著优于临床变量模型;其中GatorTRON放射模型性能最优(AUROC 0.77;95%CI 0.74–0.80),RadBERT放射模型AUROC为0.74(95%CI 0.71–0.78),显著高于其HPI模型(AUROC 0.64;95%CI 0.61–0.68)。
    晚期融合模型性能在所有Transformer模型中均优于单组件模型,AUROC范围为0.69–0.81。GatorTRON晚期融合模型表现最佳(AUROC 0.81;95%CI 0.78–0.83),性能显著优于除RadBERT外的其他Transformer融合模型;BERT融合模型性能最低(AUROC 0.69;95%CI 0.66–0.73)。所有融合模型性能均显著优于HPI单模态模型,除BERT外均显著优于临床变量模型,较放射单模态模型的性能提升无统计学意义。
    SHAP特征重要性分析显示,放射组件对融合模型的贡献度最高。GatorTRON融合模型中,放射、HPI、临床变量组件的均值绝对SHAP值分别为0.87、0.54、0.22,放射组件的重要性是HPI组件的1.6倍、临床变量组件的2.95倍。在RoBERTa与RadBERT融合模型中,放射组件的重要性约为HPI与临床变量组件的2倍;值得注意的是,RoBERTa、DistilBERT与BERT融合模型中,临床变量组件的重要性高于HPI组件。
  4. 4.
    讨论
    本研究首次系统比较了整合放射报告、HPI笔记与临床变量的晚期融合模型在脊柱手术适应证预测中的效能,证实融合策略可显著提升模型性能,其中GatorTRON晚期融合模型AUROC达0.81。不同Transformer模型的融合性能差异主要源于其放射与HPI组件的表现。放射单模态模型中,GatorTRON、RadBERT与RoBERTa性能最优,其优势可能与模型特性相关:参数规模是重要影响因素,GatorTRON基础版含3.45亿参数,远高于BERT的1.1亿参数,更大的参数规模赋予模型更复杂语义解析能力,RoBERTa(1.25亿参数)的性能优势也支持这一规律,但Clinical-LongFormer(1.49亿参数)的放射性能偏低,提示参数规模并非唯一决定因素。预训练与训练策略同样关键:RadBERT基于大量放射报告预训练,使其在跨场景的放射印象解析中表现优异;RoBERTa与GatorTRON均采用无下一句预测目标的优化训练策略,进一步提升了临床NLP任务性能。
    与Broida等的研究相比,本研究的GatorTRON融合模型适用范围更广,覆盖全脊柱区域,避免了单一节段模型的局限性,同时通过整合多模态数据可减少腰椎“偶发瘤”(无症状影像学发现)对预测的干扰。SHAP分析揭示当前临床决策中影像学的核心地位,这与退行性颈椎病(DCM)临床指南中手术建议主要依赖疾病严重程度评分的现状存在差异,Hilton等的研究也发现影像学脊髓受压比率是唯一与手术建议显著相关的因素,印证了放射组件的高贡献度。临床变量模型性能较低(AUROC 0.64),仅4项变量在多因素分析中具有显著性,与既往研究结果一致,提示人口学特征、合并症等结构化指标的预测价值有限。晚期融合模型的AUROC未达0.90,可能与脊柱手术决策本身存在医师间异质性有关,融合模型可作为相对客观的手术适应证评估工具,助力诊疗标准化。
    本研究开发的GatorTRON融合模型在约登指数最优阈值下的灵敏度与特异度分别为0.75与0.74,可作为脊柱门诊分诊的辅助工具:低手术概率患者可优先由高级非医师从业者评估,减少神经外科医师的初始接诊负荷,尤其适用于医疗资源匮乏地区,通过患者分层优化诊疗流程,而非替代临床医师判断。
  5. 5.
    研究局限性
    本研究存在三方面局限:其一,数据为单中心回顾性队列,来自学术型县级医院,模型外推性需通过多中心外部验证确认;其二,计算资源限制导致仅采用各Transformer模型的基础版本,未纳入参数量更大的大模型(如GatorTRON-large含89亿参数),后者可能在复杂医学文本解析中表现更优;其三,基础Transformer模型的输入序列长度限制导致仅能提取放射报告印象部分进行分析,无法覆盖完整报告内容,Clinical-LongFormer虽支持4096词元输入,但整体仍受限于序列长度约束。
  6. 6.
    结论
    本研究系统比较了基于神经影像报告、HPI笔记与结构化临床变量的多模态晚期融合模型在脊柱手术建议预测中的效能,7种模型均表现出稳健的筛查能力,其中GatorTRON模型性能最优(AUROC 0.81,灵敏度0.75,特异度0.74)。研究结果强调了Transformer模型优化选择的重要性,明确了放射影像数据对融合模型性能的核心驱动作用,为脊柱外科临床预测模型的开发提供了关键证据,是推动临床实用型预测工具落地的重要探索。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号