《Frontiers in Public Health》:Risk prediction models for enteral feeding intolerance in critically ill patients: a systematic review
编辑推荐:
摘要
目的:系统评估危重症患者肠内喂养不耐受(enteral feeding intolerance,EFI)风险预测模型,以期为临床实践提供循证参考。
方法:系统检索PubMed、Web of Science、Cochrane Library、中国知网(CN
摘要
目的:系统评估危重症患者肠内喂养不耐受(enteral feeding intolerance,EFI)风险预测模型,以期为临床实践提供循证参考。
方法:系统检索PubMed、Web of Science、Cochrane Library、中国知网(CNKI)、万方数据库、中国生物医学文献数据库(CBM)和维普数据库,检索时间从建库至2025年11月20日。纳入开发或验证成人危重症患者肠内喂养不耐受风险预测模型的研究。采用CHARMS清单进行数据提取,使用预测模型偏倚风险评估工具(PROBAST)评估纳入研究的偏倚风险和适用性。
结果:共纳入25项研究,涉及25个肠内喂养不耐受风险预测模型。样本量范围为118至1,584例患者,EFI发生率为26.25%至61.3%。急性生理与慢性健康评分-II(APACHE II)、血糖、机械通气、年龄、白蛋白和腹内压是相对频繁报告的预测因子,但没有任何一个预测因子在所有模型中均被一致纳入。
结论:现有危重症患者肠内喂养不耐受风险预测模型显示出一定的预测价值;然而,方法学质量差异较大,外部验证不足。未来研究应开展大规模、多中心、前瞻性研究,并采用标准化方法学流程来开发和验证预测模型,从而提高其临床适用性和可推广性。
系统评价注册:https://www.crd.york.ac.uk/PROSPERO/view/CRD420261281618,标识符(CRD420261281618)。
**3 结果**
**3.1 文献检索过程**
共检索到3,026篇文献,去重并筛选标题和摘要后,剩余31篇,经全文阅读最终纳入25项研究。
**3.2 纳入研究的基本特征**
纳入的25项研究中,24项由中国学者发表,1项由以色列学者发表;24项发表于近5年内。研究对象均为接受肠内营养的成人危重症患者,包括脓毒症、重症卒中、重症急性胰腺炎、神经外科危重症、俯卧位通气及无创通气患者等。研究设计方面,15项为回顾性队列研究,6项为前瞻性队列研究,4项为病例对照研究。19项为单中心研究,6项为多中心研究。样本量从118例至1,584例不等。EFI结局定义主要包括胃残余量(gastric residual volume,GRV)升高、呕吐、腹胀、腹泻、误吸、消化道出血,以及因不耐受导致的肠内营养中断或能量摄入不足等。
**3.3 EFI定义和GRV测量的差异**
各研究对EFI的定义存在显著差异。GRV是报告最多的客观组成部分,但阈值和测量窗口不一:两项研究采用肠内营养启动后4小时单次GRV≥200 mL,一项研究采用6小时内单次GRV>200 mL及6小时累计GRV≥250 mL,一项研究采用6小时后GRV>250 mL,其他研究则采用24小时累计阈值(≥200 mL/24h、>250 mL/24h、≥500 mL/24h),还有研究仅报告“胃潴留”或“GRV升高”但未给出定量阈值。除GRV外,常见定义还包括呕吐、反流、腹泻、腹胀、误吸、消化道出血、肠鸣音减弱或消失、肠内营养中断或72小时内未达到目标能量摄入。根据报告成分,EFI定义可分为单次GRV定义、累计或24小时GRV定义、GRV结合胃肠症状和/或能量摄入不足的复合定义,以及无定量GRV阈值的症状定义。多数研究仅报告整体预测模型的敏感度和特异度,未报告各EFI成分单独的性能指标。
**3.4 模型构建方法与预测性能**
25项研究中,EFI发生率范围为26.25%至61.3%。所有研究均采用逻辑回归单独或与其他方法联用。5项研究采用随机森林,3项采用支持向量机,2项采用梯度提升树,1项采用深度学习,1项采用XGBoost,2项采用k近邻,1项采用AdaBoost,2项采用决策树,1项采用朴素贝叶斯。所有研究均进行了内部验证,9项进行了外部验证。内部验证方法包括17项Bootstrap重采样、6项随机分割验证、1项10折交叉验证和1项5折交叉验证。24项研究报告了曲线下面积(area under the curve,AUC)值,范围0.70至0.99。校准验证和外部验证报告较少。
**3.5 模型中纳入的预测因子**
所有研究均报告了模型呈现格式:20项研究呈现列线图,10项提供回归方程,5项呈现机器学习模型。APACHE II评分、年龄、白蛋白、血糖、机械通气和腹内压是最常纳入的预测因子。血糖和腹内压是报告最多的连续预测因子。各研究对测量时机、建模形式、截断值、截断值选择方法、非线性关联和时间依赖性变化的报告不一致。
**3.6 纳入研究的方法学质量评估**
使用PROBAST工具评估:在研究对象领域,15项回顾性研究和19项单中心研究被判定为高偏倚风险。在预测因子领域,所有研究均采用一致的定义和评估方法,适用性关注较低。在结局领域,所有研究均被评为高偏倚风险,因EFI的操作定义差异大。在统计分析领域,所有研究均被评为高偏倚风险,其中6项研究建模或验证时样本量不足,3项未报告校准,4项未明确报告缺失数据处理方法,仅9项进行外部验证。适用性评估方面,25项研究在参与者、预测因子和结局三个领域均被评为低关注。
**3.7 预测模型的临床影响与干预效果**
纳入研究均未直接评估基于预测模型指导干预的效果,未提供模型应用改善肠内营养实施或患者结局的证据。
**4 讨论**
**4.1 高频报告预测因子及模型间异质性**
模型间预测因子异质性显著,无单一预测因子被所有研究一致纳入。APACHE II评分、血糖、机械通气、年龄、白蛋白和腹内压相对频繁出现,但仅出现在部分模型中,应视为重复信号而非确定性预测因子。APACHE II反映总体生理紊乱而非胃肠特异性指标;血糖有急性高血糖减慢胃排空的实验证据,但尚无通用阈值;机械通气定义不明确,可能为疾病严重程度和治疗强度的代理指标;年龄对胃肠功能直接影响有限,可能反映虚弱和合并症负担;白蛋白受炎症影响,应作为炎症负担代理而非营养指标;腹内压升高有影响腹腔器官灌注的病理生理机制,但尚无EFI特异性阈值。未来研究需采用标准化定义并预先指定候选预测因子集。
**4.2 连续及动态预测因子的阈值效应处理**
血糖和腹内压等连续预测因子可能具有非线性和时间依赖关联。纳入研究对这些变量的处理不一致,部分保留连续尺度,部分转换为分类变量。二分法会损失预后信息、降低检验效能、造成人为风险阶跃,且截断值常来自研究特异性ROC分析而非预先指定标准。多数研究仅基于启动肠内营养前或治疗开始时单次测量,很少考虑重复测量、时间更新值、累积暴露或变化趋势。这种不一致处理可能增加研究间异质性。未来应保留连续尺度、评估潜在非线性关系、预先指定测量窗口并报告重复或时间更新测量。
**4.3 建模方法、验证策略、校准与临床可解释性**
纳入模型AUC范围0.70至0.99,显示可接受至优秀区分度,但高区分度不等同于方法学稳健。逻辑回归最常用,机器学习方法未显示明显优势。19项研究为单中心、仅9项外部验证,外部验证不足。内部验证方法各异,Bootstrap效率高,随机分割会减少有效样本量。校准报告不足,3项研究未报告校准。AUC仅反映区分度,不反映预测概率准确性。列线图和回归模型透明易用,复杂机器学习可解释性差,需平衡统计性能与临床应用。6项研究样本量不足,4项未清晰描述缺失数据处理方法。
**4.4 EFI定义异质性、结局误分类与GRV的作用**
EFI定义差异涉及GRV阈值、测量时机和频率、胃肠症状、喂养中断和能量目标失败,与既往综述一致。GRV是报告最多的客观成分,但评估方法不一致,部分研究未报告定量阈值,常规GRV监测和最佳阈值尚不确定。多数研究仅报告整体结局性能,未分别报告各成分,因此无法进行成分水平分层分析。异质性定义可能引入结局误分类:GRV监测和临床喂养决策可能影响结局判定,喂养中断或能量不足可能为GRV管理策略的后果而非独立胃肠不耐受表现。结局分类部分受机构和治疗方案影响,模型可能捕捉特定机构护理模式而非潜在生理风险,降低可转移性。PROBAST评估中结局领域偏倚风险高。未来需预先指定标准化定义,并报告各成分单独性能。
**4.5 预测模型的临床效用与干预影响**
模型性能指标反映统计学准确性,不代表临床决策改进。纳入研究未评估模型引导干预的效果。EFI预测目的是支持评估和针对性管理而非自动中断喂养。高预测风险可能提示加强胃肠症状监测、调整镇静和镇痛药物暴露、纠正可逆因素、谨慎推进喂养或考虑幽门后喂养。当前指南支持个体化管理和避免不必要喂养中断,但尚缺乏基于这些模型的干预效果证据。需要前瞻性影响研究(如前后对照、集群随机试验等),决策曲线分析可估计净获益但不能替代前瞻性证据。未来影响研究应评估能量达标、喂养中断、误吸、感染、机械通气时间、ICU住院时间、死亡率和治疗相关危害,并检查假阳性风险分类导致的过度监测或喂养限制。
**4.6 对未来研究的启示**
结局定义需标准化,研究应从重复单中心开发转向多中心前瞻性验证。模型开发程序应预先指定,候选预测因子应基于临床可行性和生物合理性,样本量应按预测参数数和结局事件数计算,应避免连续变量二分法,合理处理缺失数据,明确预测因子测量时机,遵循现代预测模型开发和报告指南。机器学习不应仅因单数据集中AUC较高而采用,比较机器学习与回归模型需使用相同的预测因子信息、数据划分、调参程序和验证框架,并评估模型稳定性。可解释性、校准、可重复性和外部效度应与区分度并重。具有充分外部性能的模型应进入实施和影响评估。
**4.7 局限性**
本综述仅纳入中英文文献,且多数纳入研究在中国进行,结果推广到其他医疗系统和人群受限。纳入模型存在方法学局限,如回顾性/单中心设计、外部验证不足。缺乏标准化EFI定义是主要局限,结局误分类可能发生。多数研究未报告各结局成分单独性能,无法进行按GRV阈值、测量窗口或症状模式的正式分层分析。所有研究均为观察性设计,预测因子可能为整体疾病严重程度或治疗强度的代理变量,应视为产生假设而非因果因素。纳入研究未提供模型引导干预有效性的直接证据。
**5 结论**
本系统评价全面评估了危重症患者EFI风险预测模型。现有模型基于常规临床指标,显示可接受至优秀区分