急性心肌梗死后住院期间心房颤动预测:基于意大利与芬兰患者的跨队列研究

《International Journal of Medical Informatics》:Prediction of in-hospital atrial fibrillation after acute myocardial infarction: a cross-cohort study in Italian and finnish patients

【字体: 时间:2026年07月08日 来源:International Journal of Medical Informatics 5.0

编辑推荐:

  急性心肌梗死(Acute Myocardial Infarction, AMI)是全球心血管死亡的首要原因。心房颤动(Atrial Fibrillation, AF)是AMI急性期常见并发症,发生率介于2%至22%之间。住院期间新发AF与短期和长期死亡风险增加

  
急性心肌梗死(Acute Myocardial Infarction, AMI)是全球心血管死亡的首要原因。心房颤动(Atrial Fibrillation, AF)是AMI急性期常见并发症,发生率介于2%至22%之间。住院期间新发AF与短期和长期死亡风险增加相关,尤其是无既往AF病史的新发AF(New-Onset AF, NOAF),即使发作呈一过性,也与卒中、心力衰竭、AF复发及死亡风险增加有关。AF在此情境下的病理生理机制涉及多因素,包括缺血、炎症、自主神经失衡和血流动力学改变等急性触发因素。已知的关键临床危险因素包括高龄、左心室射血分数(Left Ventricular Ejection Fraction, LVEF)降低、心力衰竭征象、炎症标志物升高和高血压等。

在心脏重症监护室(Cardiac Intensive Care Unit, CICU)识别高危患者有助于实施针对性监测策略和预防性干预。然而,在AMI后CICU环境中预测AF存在独特挑战,现有研究存在若干局限:几乎所有既往模型仅针对严格意义上的首次发作AF(NOAF);主要依赖传统统计方法,未充分利用现代机器学习方法;少数研究涉及非亚洲人群;许多模型纳入的预测因子在CICU入院时无法可靠获得,如心电图衍生特征(碎裂QRS波或P波指数)或血管造影和血运重建相关变量;模型评估几乎局限于单一队列,外部验证罕见,更未见跨国验证。

本研究旨在填补上述空白,开发仅依赖CICU入院时可获得的常规、非心电学临床参数的机器学习流程,用于预测AMI后住院期间AF,并首次在来自意大利和芬兰两个国家的队列中进行验证。

方法部分,研究构建了两个独立的回顾性队列:意大利队列(ITA)纳入2010至2018年间Centro Cardiologico Monzino医院CICU收治的2,440例AMI患者,其中240例(9.9%)在CICU出院前发生AF;芬兰队列(FIN)纳入2007至2018年间Tampere University Hospital Tays医院CICU收治的4,083例患者,其中452例(11.1%)在CICU住院期间发生AF。两组患者均在CICU期间接受持续心电监护,AF诊断基于持续心电记录和/或12导联静息心电图的原始信号分析,并由经验丰富的心脏病学家核实。已存在AF或持续性/永久性AF病史者被排除;阵发性AF病史者被保留,因其以窦性心律入院且需要与无AF病史者相同的监测和风险分层。预测时间点明确设定为CICU入院时刻,模型输入参数仅限于该时刻可获得的常规人口学、临床病史、正在进行的治疗和一线实验室参数,排除冠状动脉造影和血运重建衍生变量。

分析前,所有变量在两个队列间统一测量单位。估算肾小球滤过率(estimated Glomerular Filtration Rate, eGFR)采用CKD-EPI方程计算,LVEF通过超声心动图评估,高敏C反应蛋白(high-sensitivity C-Reactive Protein, HsCRP)和血清肌酐采用标准临床实验室检测,所有实验室值均为CICU入院时首次抽血样本结果。

模型评估设置包含多种情景:在ITA队列训练并优化的模型先在ITA本身测试(内部测试),再在FIN测试(外部测试);反之亦然。在联合队列(ITA+FIN)训练的模型仅在该联合队列上评估。内部测试通过嵌套交叉验证(10层内循环和10层外循环)实现,以避免测试集选择偏倚并为训练队列的每个样本生成预测标签。嵌套交叉验证后,用于特征分析和外部验证的模型通过以下步骤获得:选择内部测试中表现最佳的预处理技术、特征选择算法和分类器组合;在整个队列上进行10折交叉验证进行超参数优化;使用这些超参数在整个队列上训练模型。

机器学习流程包括以下主要步骤:首先基于缺失值比例阈值过滤特征,并对相关性超过阈值的特征对保留信息量较高者;保留变量经z-score标准化后,通过k近邻插补处理残余缺失值;训练时通过重采样处理类别不平衡。关键设计在于所有预处理步骤严格在每个折叠的训练分区内部拟合,避免泄露验证数据信息。流程配置并非预先固定,而是从数据中选择,搜索空间包含多种重采样策略(SMOTE、随机欠采样、编辑最近邻)和带/不带类别加权的逻辑回归等候选分类器。采用平衡准确度作为优化标准,以应对约10%AF患病率的显著类别不平衡。

统计比较采用Mann-Whitney U检验(连续变量)和Chi-square检验(分类变量),显著性阈值设定为p<10?4。模型性能指标通过bootstrap重采样(1,000次迭代)计算置信区间。单变量和多变量逻辑回归的特征相关性通过双尾Wald检验获取p值。

结果部分,数据集分析显示两组AF患者均显著更年长、LVEF和eGFR更低、高血压患病率更高,HsCRP和血糖持续更高。ITA队列既往心血管事件和血运重建史更多,正在进行药物治疗更频繁;FIN队列平均体重指数(Body Mass Index, BMI)更高。

初步模型结果表明,对于三个训练模型(ITA队列、FIN队列、ITA+FIN),嵌套交叉验证内循环阶段表现最佳的流程均为编辑最近邻欠采样结合L2正则化逻辑回归分类,无额外特征选择,超参数略有差异。各候选分类器最佳流程比较确认L2正则化逻辑回归在所有情景中均优于替代分类器,仅随机森林接近其性能。五种评估情景下分类性能具有可比性,仅FIN队列内部测试略高。ITA队列内部与外部测试高度相似,FIN模型外部测试虽较内部略有下降但仍表现合理。联合队列模型结果与单独模型相当,可能受益于更多数据量和两队列特征的有限差异。

特征重要性分析显示,逻辑回归作为最佳分类器,其个体预测因子相关性通过逻辑回归系数计算的比值比(Odds Ratio, OR)和95%置信区间(95% Confidence Interval, 95% CI)评估。ITA队列显示6个独立预测因子,高血压和糖尿病勉强达到统计显著性,年龄为最相关个体标志物。FIN队列显示8个独立预测因子(部分统计显著性有限),年龄仍为最强危险因素。与ITA队列不同的是,HsCRP、血糖、甘油三酯及当前吸烟状态作为附加预测因子在FIN队列出现。正在进行的抗凝治疗是两队列中唯一共同确认显著性的其他标志物。

抗凝治疗分析针对ITA队列831例有详细临床记录的患者,识别出三类合并症:人工心脏瓣膜、阵发性AF病史、既往血栓栓塞事件。Fisher精确检验确认抗凝治疗与这些疾病显著相关,但纳入这些特定合并症的多变量回归未能消除抗凝治疗的预测显著性(OR 1.32, 95% CI: 1.08–1.65),提示存在残余未测量混杂因素,促使该变量从最终临床模型中排除。

最终模型(排除抗凝治疗变量)结果显示,所有内部和外部测试情景下性能指标与含抗凝治疗变量的模型高度可比。最优流程配置保持一致,L2正则化逻辑回归结合编辑最近邻类别再平衡在所有情况下均为最佳方法。核心预测因子——高龄、较低LVEF和高血压——在两队列中维持其强独立预测价值。ITA队列中,非ST段抬高型心肌梗死(Non-ST-Elevation Myocardial Infarction, NSTEMI)和持续阿司匹林治疗与较低AF风险独立相关;FIN队列中,较高HsCRP作为额外危险因素出现,当前吸烟状态作为保护因素出现。核心预测因子在初步和最终模型中的持续性确认模型捕获了真正的危险因素,独立于抗凝治疗的混杂信号。

模型校准分析显示,所有情景下模型系统性高估绝对AF风险:校准斜率低于1,校准截距为负,Brier技能评分相对于基于患病率的参考为负,外部测试时错校准最为明显。这是训练策略的预期结果:编辑最近邻欠采样和平衡类别权重有意改变分类器看到的类别分布以提高少数类别敏感度,从而相对于真实人群患病率膨胀预测分数。

讨论部分,研究人员指出本研究训练的机器学习模型用于预测AMI后住院期间AF, exclusively 依赖CICU入院时可获得的常规参数,并在意大利和芬兰两个患者队列上评估。模型性能与文献中相同预测任务报道的水平一致,凸显了在院内且无心电图数据情况下预测AF的难度。两项既往研究报道的AUROC分别为79.1%(95% CI: 69.2–89.1%)和81.8%,略高于本研究模型,但两者数据集小得多(分别为333和311例),且纳入了本研究队列无法获得的临床变量。本研究 arguably 提供了基于机器学习的AMI后住院AF预测更可靠的性能估计,且据研究人员所知是首次进行跨队列、跨国家评估。

比较两队列临床变量分布差异,仅存在少数可预测且总体轻微的差异,如芬兰患者BMI更高、糖尿病患病率更高。最显著的例外是意大利队列观察到的显著更高肌钙蛋白水平,可能原因包括:两医院临床路径的系统差异(如症状发作后抽血时间)、不同制造商的肌钙蛋白检测方法、推荐指南应用的不一致、其他队列特征作为混杂因素(年龄、eGFR和性别均影响绝对肌钙蛋白值,而ITA和FIN队列的eGFR和性别分布不同),以及研究纳入期间(2007–2018年)高敏肌钙蛋白检测广泛临床转换可能在两医院发生时间不同。尽管如此,队列间分布差异最显著的变量(如肌钙蛋白)未被保留为独立预测因子,而核心预测因子高龄、较低LVEF和高血压在两人群中共同存在,凸显了主要危险因素及其对结局的影响在很大程度上共享,仅少数例外。

通过机器学习模型的相对特征重要性和多变量回归分析个体危险因素时,研究人员最初观察到持续抗凝治疗在两队列中均呈现 Alleged 高预后显著性。这种明显影响难以从因果角度解释,Certainly 是指示混杂的例证,抗凝治疗标识了未追踪的潜在合并症。额外分析显示抗凝治疗与三类特定合并症类别相关,但无法完全消除该变量的预测效力,可能由于其他未追踪的独立危险因素,如一般更重的血管疾病负担、衰弱程度或更高CHA2DS2?VASc评分(未完全被个体变量捕获)。这一未解决的混杂因素代表了初步模型的局限性,凸显了常规追踪的临床参数至少在本研究背景下无法完全捕获患者的衰弱谱系。为克服此局限性并开发更具临床可解释性的模型,研究人员训练了排除抗凝治疗变量的模型,该步骤确认了方法的稳健性,因对整体预测性能影响可忽略。

分析最终模型中的显著预测因子,研究人员确认了两队列中高龄、较低LVEF和高血压的已知预后显著性。除此共享核心外,每个队列保留了少数额外的队列特异性预测因子。ITA队列中,NSTEMI和持续阿司匹林治疗与较低风险相关,OR置信区间几乎达到1;合理解释包括NSTEMI相对于ST段抬高型心肌梗死(ST-Elevation Myocardial Infarction, STEMI)的严重程度较低,以及阿司匹林在急性环境中的抗炎效应。FIN队列中,CICU入院时较高HsCRP与较高风险相关,当前吸烟状态具有保护作用:较高HsCRP提示全身炎症,是AF的已知独立风险预测因子;当前吸烟的明显保护作用与 well-documented “吸烟者悖论”一致,常归因于残余混杂,因吸烟者首次缺血事件呈现年龄更轻。值得注意的是,一些在初步模型中出现的既定代谢危险因素未能在最终模型预测因子中持续:ITA队列的糖尿病在移除抗凝混杂因素后失去统计显著性;FIN队列的血糖和甘油三酯作为公认的AF相关代谢标志物,因受限特征集的内循环缺失值过滤被排除于最终模型之外。剩余预测因子的队列特异性出现可能既反映了影响各队列统计显著性的样本量差异,也反映了基线人群差异。

总体而言,本研究提供了迄今为止基于常规追踪临床变量的AMI后住院AF机器学习预测最可靠的性能估计。此外,模型在来自不同国家的完全独立队列上表现相似,强调了所识别风险因素的有效性和互操作性。Notably,尽管评估了所有先进的特征选择程序和分类器,简单的L2正则化逻辑回归在每个考虑的情景中均为最佳表现模型。虽借助欠采样、缺失值插补和其他特征过滤步骤,这一结果表明在本研究背景和此特定预测任务及特征集下,更复杂的黑箱机器学习技术相较于更简单的传统统计方法提供的额外效用有限;此发现不应在无进一步专门证据的情况下推广至其他临床预测任务。

除区分能力外,校准分析显示模型虽能良好地对患者进行风险排序,但系统性高估AF绝对概率。这种行为是训练策略的预期结果:编辑最近邻欠采样和平衡类别权重有意改变分类器看到的类别分布以提高少数类别敏感度,从而膨胀预测分数。因此,模型输出应被解读为用于分层的相对风险分数而非校准的绝对概率;若特定部署需要校准概率,标准事后重新校准(如Platt缩放或等渗回归)可作为本研究范围之外的部署阶段步骤应用。

为使当前性能的实际意义具体化,研究人员进一步量化了模型工作点的预期警报负担。在两个跨队列(外部)情景中,ITA训练FIN测试时模型约每100例入院患者中标记37例,FIN训练ITA测试时约标记57例,其中分别仅约7例和8例实际发生AF。换言之,在此工作点约80–85%的标记患者为假阳性警报(阳性预测值约15–20%),具体说明了有限精确度带来的限制,并强化了模型以当前形式尚不适合直接临床部署的结论。

研究存在若干局限性:回顾性性质和部分纸质记录导致无法重建完整的患者流程图及逐步排除计数,也无法可靠识别所有阵发性AF病史患者(仅ITA队列有详细临床记录的子集可确认);纳入时期(ITA 2010–2018, FIN 2007–2018)早于一些近期临床实践进展,如高敏肌钙蛋白检测的更广泛采用和更新的血运重建指南,尽管AMA后AF的核心危险因素已确立且有生物学基础,其预测价值不太可能已实质性改变,但在更新近队列上的验证仍有价值;最后,尽管模型展示了一定程度的预测能力,其直接实施于临床实践仍似乎难以实现。达到的有限精确度意味着高假阳性率,尚不足以为识别的高风险患者亚群实施额外监测和预防措施——如普通病房延长遥测和优化左心室功能障碍及其他危险因素控制——该亚群可能仍然过大。

研究结论:本研究开发并首次跨国验证了基于CICU入院时可获得的常规、非心电学临床参数预测AMI后住院期间AF的机器学习模型。在两个来自不同国家和医疗体系的独立队列中,简单且完全可解释的L2正则化逻辑回归与更复杂分类器性能相当,所识别的风险因素——以高龄、较低LVEF和高血压为首——在不同人群中基本保持一致。尽管如此,有限的精确度、相关的假阳性负担和不完美的校准表明模型尚未准备好直接临床部署。未来工作应集中于更新近队列的前瞻性验证、提高精确度以及概率校准用于绝对风险估计,作为将这些工具整合入CICU风险分层工作流的步骤。
本研究旨在解决急性心肌梗死(Acute Myocardial Infarction, AMI)后住院期间心房颤动(Atrial Fibrillation, AF)预测的临床需求。AF是AMI急性期常见并发症,发生率2%至22%,与新发AF(New-Onset AF, NOAF)相关的短期和长期死亡风险显著增加,包括卒中、心力衰竭复发及死亡。尽管已知高龄、左心室射血分数(Left Ventricular Ejection Fraction, LVEF)降低、心力衰竭征象、炎症标志物升高和高血压等危险因素,但在心脏重症监护室(Cardiac Intensive Care Unit, CICU)环境中实时预测AF仍面临挑战:现有模型多针对严格意义上的首次发作AF,依赖传统统计方法而非现代机器学习(Machine Learning, ML);预测因子常包含CICU入院时无法获得的心电图衍生特征或血管造影信息;模型评估几乎局限于单一队列,缺乏外部验证,更无跨国验证。因此,本研究旨在开发仅依赖CICU入院时可获得的常规、非心电学临床参数的机器学习流程,并首次在意大利和芬兰两个独立队列中进行跨国家验证,以评估模型的泛化能力和风险因素的跨人群一致性。

研究人员开展了一项基于两个回顾性队列的预测模型开发与验证研究。意大利队列(ITA)来自Centro Cardiologico Monzino医院2010至2018年间的2,440例AMI患者,其中240例(9.9%)发生CICU期间AF;芬兰队列(FIN)来自Tampere University Hospital Tays医院2007至2018年间的4,083例患者,其中452例(11.1%)发生AF。患者纳入标准为CICU入院时窦性心律且无持续性/永久性AF病史(阵发性AF史允许保留),排除CICU入院时已存在AF者。预测时间点严格设定为CICU入院时刻,输入变量限定为该时刻可获得的常规人口学、临床病史、正在进行治疗和一线实验室参数,排除冠状动脉造影和血运重建衍生变量。

关键技术方法:(1)机器学习流程构建:包括基于缺失值比例和相关性的特征过滤、z-score标准化、k-近邻缺失值插补、类别不平衡处理(重采样策略包括SMOTE、随机欠采样、编辑最近邻),以及多种候选分类器评估;(2)嵌套交叉验证:内部测试采用10层内循环和10层外循环的嵌套交叉验证(nested Cross-Validation, nested CV),以避免测试集选择偏倚并为训练队列每个样本生成预测;(3)外部验证与联合模型:在ITA和FIN队列间进行双向跨队列测试,并构建联合队列(ITA+FIN)模型;(4)超参数优化:通过随机搜索进行,以平衡准确度为优化标准;(5)特征重要性分析:基于L2正则化逻辑回归系数计算比值比(Odds Ratio, OR)和95%置信区间(95% Confidence Interval, 95% CI),通过双尾Wald检验评估统计显著性;(6)校准分析:评估模型预测概率的校准性;(7)抗凝治疗混杂分析:通过Fisher精确检验和亚组多变量回归评估指示混杂。

研究背景与队列特征分析:AF患者在两队列中均显著更年长、LVEF和估算肾小球滤过率(estimated Glomerular Filtration Rate, eGFR)更低、高血压患病率更高,高敏C反应蛋白(high-sensitivity C-Reactive Protein, HsCRP)和血糖更高。ITA队列既往心血管事件和血运重建更多,正在进行药物治疗更频繁;FIN队列平均体质指数(Body Mass Index, BMI)更高。

初步模型:最佳流程均为编辑最近邻欠采样结合L2正则化逻辑回归分类,无额外特征选择。性能具有可比性,FIN队列内部测试略优(AUROC 0.769),ITA队列内部与外部测试高度相似(AUROC 0.748 vs 0.743),FIN模型外部测试略有下降(AUROC 0.734 vs FIN→ITA 0.723)。联合队列模型AUROC为0.762,与单独模型相当。

特征重要性(初步模型):ITA队列6个独立预测因子,年龄最相关;FIN队列8个独立预测因子,年龄同样最强,新增HsCRP、血糖、甘油三酯及当前吸烟状态;抗凝治疗在两队列均显著但存在指示混杂。

抗凝治疗分析:对ITA队列831例有详细记录患者的分析确认,抗凝治疗与人工瓣膜、阵发性AF史、既往血栓栓塞显著相关,但纳入这些合并症的多变量回归未能消除抗凝治疗的预测显著性(OR 1.32, 95% CI: 1.08–1.65),提示存在残余未测量混杂,故将该变量从最终模型排除。

最终模型(排除抗凝治疗):性能指标与初步模型高度可比,ITA队列内部AUROC 0.740、外部0.735;FIN队列内部0.755、外部0.723;联合队列AUROC 0.749。最优配置一致,仍为L2正则化逻辑回归结合编辑最近邻再平衡。

最终模型特征重要性:核心预测因子高龄、较低LVEF和高血压在两队列中维持强独立预测价值。ITA队列中,非ST段抬高型心肌梗死(Non-ST-Elevation Myocardial Infarction, NSTEMI)和持续阿司匹林治疗与较低AF风险独立相关;FIN队列中,较高HsCRP为额外危险因素,当前吸烟状态为保护因素。部分代谢因素(ITA的糖尿病、FIN的血糖和甘油三酯)未能在最终模型中持续,分别因抗凝混杂移除后失去显著性和内循环缺失值过滤被排除。

校准与临床意义:模型系统性高估绝对AF风险(校准斜率<1, 校准截距<0),这是欠采样和类别权重调整的预期结果,模型输出应作为相对风险分数而非绝对概率。外部测试情景的警报负担分析显示,约37–57/100例患者被标记,其中仅约7–8例实际发生AF,假阳性率约80–85%(阳性预测值约15–20%),表明模型以当前形式尚不适合直接临床部署。

讨论部分,研究人员强调本研究提供了迄今为止基于机器学习预测AMI后住院AF最可靠的性能估计,且首次实现跨国家验证。尽管存在肌钙蛋白水平等队列间差异(可能源于临床路径、检测方法和时间转换差异),核心风险因素(高龄、较低LVEF、高血压)在不同人群中高度一致,模型的内外部测试性能紧密对齐,联合模型表现相当。抗凝治疗的指示混杂问题凸显了常规临床参数无法完全捕获患者衰弱谱系的局限。简单逻辑回归优于复杂黑箱模型的发现提示,此特定任务和特征集下额外复杂性收益有限,但不应推广至其他临床预测任务。校准局限和高假阳性率明确了模型临床部署前需进一步改进的方向,包括前瞻性验证、精确度提升和概率校准。研究结论指出,模型已实现跨人群风险因素识别的有效性,但距离整合入CICU风险分层工作流仍需后续研究。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号