《Neurocritical Care》:Time-Stamped Annotations in High-Frequency Physiological Data: Evaluating an Approach for Assessing Annotation Plausibility in the CENTER-TBI Dataset
编辑推荐:
背景/目的 高频神经监测数据结合时间戳临床标注可为治疗反应提供有价值的信息,但其可靠性受人工记录限制。本研究旨在开发并展示一个三步方法学框架,利用高频数据集评估时间戳临床标注的合理性。该框架整合了参考标注的视觉检查与基于预定生理学标准的自动分类。方法 对创伤性
背景/目的 高频神经监测数据结合时间戳临床标注可为治疗反应提供有价值的信息,但其可靠性受人工记录限制。本研究旨在开发并展示一个三步方法学框架,利用高频数据集评估时间戳临床标注的合理性。该框架整合了参考标注的视觉检查与基于预定生理学标准的自动分类。方法 对创伤性脑损伤国际合作欧洲神经创伤有效性研究(CENTER-TBI)高分辨率数据集中的标注干预事件进行回顾性分析。第一步包括对理疗和吸痰标注进行视觉检查,以评估患者层面标注的整体合理性。第二步采用基于颅内压(ICP)的分类方法应用于渗透疗法标注前的时段,无此前持续性颅内高压(ICP > 20 mm Hg持续≥5分钟)的标注被判定为拒绝。第三步根据标注后ICP趋势将接受的标注分为有效(ICP降低≥10 mm Hg或恢复正常)或无效。结果 在205例患者中共识别出15455条标注干预事件。视觉检查(第一步)将90.2%的文件归类为标注–信号关系具有中度或高度证据,9.8%为低度证据。自动分析(第二步)在76例患者中识别出388条渗透疗法标注;其中140条(36.1%)被拒绝,248条(63.9%)被保留。第三步发现,在有效事件中,67.7%为有效,32.3%为无效。被拒绝事件在低证据文件中的比例(57.3%)显著高于高证据文件(18.0%,p < 0.001)。结论 本研究首次对CENTER-TBI高分辨率数据集中的时间戳标注进行了系统评估。视觉检查与自动分类所获得的一致结果支持了两种方法的可信度,并展示了一个评估生理学合理性的框架——该框架以渗透疗法为例进行验证,但可推广至其他标注干预事件。该算法的普适性仍需外部验证加以证实。
神经重症监护研究中时间戳标注合理性评估框架的开发与验证——基于CENTER-TBI高分辨率数据集
一、研究背景与问题提出
持续高分辨率神经监测技术能够捕捉神经重症监护中快速的生理变化与治疗反应,其与研究框架的整合已推动个体化治疗策略和预测模型的发展。然而,在使用生理数据集时面临的一个关键瓶颈是:治疗和护理操作的相关标注严重稀缺,这使得难以解释所捕获的生理变异来源。此类标注干预事件很少被记录在电子病历系统中,而由床旁工作人员手动录入的标注——通常出现在临床研究环境中——容易出现不准确、不一致和记录延迟等问题,最终可能降低而非提高数据的可解释性。这一问题对于需要干预事件与生理反应之间精确时间对齐的分析尤为关键,例如因果推断或数据驱动模型训练。以监督机器学习为例,其假设训练标签准确,而这一条件在临床环境中很少得到满足。如Sylolypavan等人所指出的,此类不一致性可能损害模型性能,导致错误预测并削弱临床决策支持系统的可靠性。
尽管有概率方法被提出以处理不精确标签,但其数学复杂性及缺乏易于使用的实现限制了实际应用。因此,大多数研究将标注不精确视为研究局限性,而非通过系统验证或修正加以解决。这一现状凸显了更广泛的方法学空白:在高分辨率数据集中缺乏评估临床标注的实用框架。虽然对于回顾性临床标注建立确定的“金标准”不可行,但评估其内部一致性和生理学合理性是有价值且可实现的目标。
在创伤性脑损伤国际合作欧洲神经创伤有效性研究(CENTER-TBI)项目中,预设了干预事件标记以标准化床旁临床干预的标注。工作人员可从九个预设事件类别(如渗透疗法、吸痰和理疗)中选择,通过触摸屏界面完成记录。这种固定结构旨在促进不同中心间标注的一致性和可比性。然而,该过程仍依赖人工操作和临床工作流程,容易受到人为错误的影响。此外,标注也可能被追溯录入,这进一步增加了不准确和时间不精确的风险。这些标注的可靠性问题后来在CENTER-TBI高分辨率子研究委员会中被提出,迄今为止该队列尚无基于事件的生理数据分析公开发表。为此,研究人员首次开发并应用了一个三步方法学框架,以渗透疗法作为代表性干预事件,评估CENTER-TBI高分辨率数据集中临床标注的合理性,旨在识别与预期生理背景和反应模式不一致的标注干预事件。
二、研究方法概述
本研究为对CENTER-TBI高分辨率重症监护数据的回顾性分析,数据来源于2015年1月至2017年12月期间欧盟21个中心前瞻性纳入的成年创伤性脑损伤(TBI)患者,这些患者在重症监护病房(ICU)接受了神经监测。数据集包含连续动脉血压(ABP)、脑实质内颅内压(ICP)和心电图(ECG)监测,以及九个预设类别的人工标注临床干预事件。仅接受脑室外引流(EVD)进行ICP监测的患者被排除,因为在引流管暂闭期间才能获得可靠信号。
研究采用的三步框架包括:第一步,由一名评审者对每位患者的高频数据文件进行视觉检查,重点评估吸痰和理疗标注,根据标注—生理信号关系的证据强度将文件分为高度、中度和低度证据三类;第二步,开发基于ICP的自动分类算法,在渗透疗法标注前分析40分钟基线窗口(标注前后各30分钟和10分钟),将无持续性颅内高压(ICP > 20 mm Hg持续≥5分钟)的标注判定为拒绝;第三步,对具有有效基线的渗透疗法标注分析标注后10至90分钟窗口,将事件分为有效(ICP降低≥10 mm Hg或恢复正常)和无效(ICP持续升高且降低<10 mm Hg)。统计分析采用Pearson卡方检验评估文件级证据分类与事件级自动分类之间的关联,采用Cohen's kappa量化评审者间一致性,并进行了替代ICP阈值(15和25 mm Hg)的敏感性分析。
三、研究主要结果
(一)研究队列与标注分布
在CENTER-TBI高分辨率数据库中的277例患者中,37例因使用EVD被排除;余240例中,210例至少有一条标注干预事件,其中5例因缺少ICP、ABP和ECG必需信号进一步排除,最终纳入205例患者。渗透疗法标注存在于其中76例(37.1%)。排除EVD队列与纳入队列的基线人口学、损伤严重程度和结局特征大致可比。
205例患者原始共记录16023条标注,其中555条落在可用生理监测覆盖时段之外,13条属于分析未涵盖的额外类别(“EVD开放”或“去骨瓣减压”),排除后共分析15455条标注。理疗(n = 4730,30.6%)和吸痰(n = 2966,19.2%)最为频繁,而渗透疗法(n = 388,2.5%)最少。每位患者的标注数量存在很大差异。每个患者每天的标注数在最初24小时最高,随后逐渐下降,在监测的前120小时内保持每天每位患者10条以上。总标注数与6个月扩展格拉斯哥结局量表(GOSE)评分无相关性(Spearman's ρ = 0.09,p = 0.27),标注密度也无显著关联(ρ = 0.14,p = 0.08)。
(二)第一步:视觉检查分类结果
基于对理疗和吸痰事件的视觉检查,123份患者文件(60.0%)被归类为高度证据,62份(30.2%)为中度证据,20份(9.8%)为低度证据。388条渗透疗法事件的分布为:高度证据文件161条(41.5%)、中度证据文件145条(37.4%)、低度证据文件82条(21.1%)。
评审者间一致性:在裁决前,评审者对低证据文件与所有其他文件的识别一致性较高(观察到的一致性94.6%),Cohen's κ为0.69,表明排除偶然因素后具有实质性一致。205份记录中有11份分类不一致,其中仅2份需由第三名评审者裁决。共识评审后,仅7份(3.4%)记录在低度与中度证据之间被重新分类。在123份高度证据文件中对1769条吸痰标注进行的事件级独立评审中,1615条(91.3%)被认为生理学上合理,154条(8.7%)不合理。
(三)第二步:渗透疗法标注的基线分类
在388条渗透疗法事件中,248条(63.9%)满足持续性颅内高压的基线标准,纳入自动评估;其余140条(36.1%)作为无效事件被拒绝。被拒绝事件的ICP值在标注前后均稳定低于20 mm Hg。在有效事件中,35.9%的基线期与标注前10分钟吻合;49.2%的基线被识别在标注前10至30分钟;其余14.9%的基线在标注后10分钟内出现。
(四)第三步:干预后分类
在248条具有有效基线的渗透疗法事件中,分析标注后窗口(+10至+90分钟)的ICP趋势。168条(67.7%)被归类为有效(ICP降低≥10 mm Hg或持续≤20 mm Hg),80条(32.3%)被归类为无效(ICP持续升高且无显著降低)。记录的协同干预与平均ABP趋势的补充分析未显示有效与无效事件之间存在系统性差异。
(五)视觉与自动标注分类的关联
将渗透疗法事件按文件级证据分类分层后,被拒绝事件的比例在高度证据文件中为18.0%,中度证据文件中为44.1%,低度证据文件中为57.3%(χ2 = 44.96,p < 0.0001)。使用15 mm Hg和25 mm Hg替代ICP阈值的敏感性分析得出相似结果,文件级证据分类与基于生理学的事件分类之间的关联在所有阈值下均保持统计学显著。
四、讨论与结论总结
讨论部分指出,临床标注的相关性在于其作为将生理数据与临床意义相连接的背景信息的作用,这对于正确解读高分辨率监测数据至关重要。然而,人工标注干预的可靠性仍是重大挑战,其缺乏时间精度、一致性差且缺乏标准化,可能损害下游分析和预测建模。认知负荷过重、工作流程碎片化、任务责任不清和培训不足是导致标注不准确的关键因素。描述性分析显示标注实践存在显著变异性,这加强了对人工标注进行系统证据评估以及进一步开发自动标注系统的必要性。
本框架的设计充分考虑了临床标注中常见的时间不精确问题。在视觉筛查中允许±20分钟的容差,在自动算法中考虑多个基线窗口。这一策略被证明是必要的,因为在大多数有效渗透疗法事件中,选定的基线段并非紧邻标注时间戳,而是位于更早或有时甚至在其之后。这有助于防止因CENTER-TBI方案允许的追溯标注所导致的时间偏差而造成的错误分类。
选择吸痰和理疗作为参考标注是因为其发生频率高且具有明确的生理学信号特征,适合在文件层面进行视觉筛查。评审者间的一致性表明,即使采用不同评估方法,也可以一致地识别出证据不足的记录。而高度证据文件中事件级审查所显示的高比例合理标注支持此类记录主要包含有效临床标注的解释。虽然此方法耗时,但可在算法验证不可行的干预事件中引入一定程度的信任。
对于渗透疗法,由于治疗背景可使用预设生理学标准加以界定,因此也可在事件层面评估标注合理性。该自动策略适用于具有合理可定义生理阈值的选定干预。框架保守地在仅缺乏合理基线的情况下排除渗透疗法事件,因为仅根据治疗反应无法区分标注不准确与真正的无反应者。这种方法最小化了丢弃有效但无效治疗的风险。大多数被归类为无效的事件来自标注良好的文件并显示持续性ICP升高,提示为真正的无反应者;而被拒绝事件通常表现为持续低ICP值,强化了其属于不合理事件的解释。
研究人员指出,据其所知,这是首个对CENTER-TBI高分辨率数据集中时间戳临床标注进行系统审计的研究。研究结果支持将视觉筛查与生理学分类相结合作为一种实用策略。局限性包括:三层视觉分类未完全独立重复、无法检测漏报标注、治疗反应算法定义存在一定任意性、仅使用EVD监测的患者被排除可能产生选择偏倚(尽管两队列临床特征大致可比)、镇静或血管加压药调整等协同干预可能混杂ICP趋势(补充分析未显示系统性差异)、低证据分类截止值具有实用性考量,以及框架仅在单一数据集针对渗透疗法这一单一干预进行验证,其在不同数据集和患者群体中的普适性有待未来研究。
结论部分提出,研究人员提出了一个实用的三步框架,用于评估高分辨率神经重症监护数据中时间戳临床标注的生理学合理性和内部一致性。通过将参考标注的视觉检查与渗透疗法事件的基于生理学的自动分类相结合,该框架能够识别生理学上不合理的标注。虽然该框架针对渗透疗法进行定制,但相同原则可能推广至其他具有生理学基础标准的干预事件,从而支持更稳健和可解释的基于事件的分析。该研究发表在《Neurocritical Care》。