使用功能性管腔成像探头(FLIP)全景测量进行食管动力分类时初级评估者的准确性

《Neurogastroenterology & Motility》:Accuracy of Novice Raters for Esophageal Motility Classifications Using Functional Lumen Imaging Probe Panometry

【字体: 时间:2026年07月08日 来源:Neurogastroenterology & Motility 2.9

编辑推荐:

  功能性管腔成像探头(Functional Lumen Imaging Probe, FLIP)全景测量通过评估食管胃连接部(Esophagogastric Junction, EGJ)开放及食管收缩模式对食管动力进行分类。既往研究评估了食管动力专家对FLIP全

  
功能性管腔成像探头(Functional Lumen Imaging Probe, FLIP)全景测量通过评估食管胃连接部(Esophagogastric Junction, EGJ)开放及食管收缩模式对食管动力进行分类。既往研究评估了食管动力专家对FLIP全景测量解读的准确性(FLIP动力诊断平均准确率为78%),但非专业人员的解读能力尚不清楚。本研究旨在评估初级评估者使用FLIP全景测量v1.0及新型v2.0(达拉斯共识,Dallas Consensus)动力分类方案的准确性和评估者间一致性。

8名无胃肠病学背景且既往无FLIP或食管动力经验的培训人员解读了40项FLIP研究。简明培训包括视频教程及与食管动力专家复习10项练习研究。准确性通过与两名资深评估者确定的参考标准之间的百分比一致性进行评估。评估者间一致性通过组内相关系数(Intraclass Correlation Coefficient, ICC)和Fleiss' kappa进行评估。

动力诊断准确性均值(95%置信区间)在v2.0为0.73(0.68–0.78),在v1.0为0.78(0.73–0.82)。v2.0有4名评估者、v1.0有5名评估者达到≥78%的准确性,其余评估者准确性范围为55%–75%。EGJ开放分类准确性为0.80(0.75–0.84),收缩反应模式准确性在v2.0为0.78(0.74–0.83),在v1.0亦为0.78(0.74–0.83)。观察到中等至良好的评估者间一致性(ICC 0.80–0.83;kappa 0.55–0.61)。

经简明培训后,部分初级评估者解读FLIP全景测量动力研究时达到了与食管动力专家相当的准确性。虽然准确性的变异突显了改进和充分培训食管动力解读方法的必要性,但非专业人员能够实现准确的FLIP全景测量解读,支持其广泛应用的可行性。
食管动力障碍的准确诊断对于指导临床管理决策至关重要。功能性管腔成像探头(FLIP)全景测量利用阻抗面积描记技术(impedance planimetry),在镇静内镜检查期间通过控制性容量扩张测量食管管腔尺寸及食管扩张性,已成为诊断食管动力障碍的有用工具。FLIP全景测量评估食管扩张后的收缩反应(即继发性蠕动),以及食管胃连接部(EGJ)的扩张性和开放情况,从而提供食管动力评估。FLIP全景测量评估的食管功能方面与高分辨率食管测压(High-Resolution Manometry, HRM)相似但有所不同——HRM评估吞咽相关的一级蠕动和吞咽时下食管括约肌(Lower Esophageal Sphincter, LES)的松弛。因此,FLIP联合内镜可诊断食管动力障碍,而在FLIP或HRM结果"不确定"的情况下,可与其他临床结果(如定时钡餐食管造影,Timed Barium Esophagram, TBE)互补使用以确定诊断。

FLIP在內镜检查过程中的实时解读可为医者和患者提供高效诊断。由于FLIP在內镜检查时完成(这是评估食管症状如吞咽困难患者的典型初始检查),其有潜力提高食管动力障碍诊断的效率。此外,使用FLIP联合内镜可避免HRM的一些局限性,如无法耐受或放置HRM导管,以及预约食管动力实验室完成HMR的延迟等,这些可能导致动力障碍诊断延迟。因此,将FLIP的准确使用扩展至普通胃肠病实践,可为识别和诊断食管动力障碍患者带来显著益处。然而,FLIP在专业动力中心之外的采用仍然有限,这可能反映了技术获取以及非日常解读动力研究的内镜医师实施食管动力解读的潜在顾虑等多种因素。

既往评估测压的研究显示,基于芝加哥分类(Chicago Classification)的贲门失弛缓症亚型分类中,HRM较传统线性描记具有更高的准确性和评估者间一致性,且HRM与FLIP结果具有相关性。就FLIP全景测量而言,既往一项研究报告了15名食管动力专家(具有不同程度的FLIP经验)解读FLIP全景测量动力诊断的平均(5–95百分位)准确性为78%(72%–81%),评估者间一致性为中等至良好,HRM的准确性为82%(78%–84%)。此外,8名食管动力专家在健康受试者中FLIP全景测量参数测量具有良好的评估者内和评估者间可靠性。然而,评估初级评估者解读FLIP全景测量能力的研究尚未完成,这与FLIP全景测量在临床实践中向新用户(特别是非动力专家)扩展和实施相关,也与胃肠病学培训生的动力课程相关。此外,FLIP动力分类方案最近已更新以反映FLIP全景测量动力评估的进展:FLIP全景测量版本2.0(达拉斯共识);因此,采用新标准后的评估者准确性或可靠性解读尚未研究。

本研究旨在评估初级评估者在简明、简单培训后,使用初始v1.0和新型v2.0 FLIP全景测量动力分类方案解读FLIP全景测量研究的准确性。

研究人员开展的研究及结论

研究人员从学术医学培训中心招募了8名评分者(3名第二年内科住院医师、4名第一年内科住院医师和1名第一年医学生),这些人员既往无FLIP或食管动力经验,且未阅读过既往关于动力专家解读FLIP研究的已发表文献。所有受邀评分者均接受邀请并完成研究。研究使用的去标识化FLIP研究来自40名因吞咽困难在西北大学食管中心接受评估的连续成年患者,这些患者被前瞻性纳入母研究(P01 DK117824)。排除了有既往前肠手术、机械性梗阻或解剖异常(如狭窄、食管裂孔疝>3 cm或嗜酸性食管炎)的患者,因为这些可导致继发性食管运动障碍。评分者被告知每位患者因吞咽困难接受评估,无既往前肠手术史,且已完成上消化道内镜检查,无机械性食管梗阻证据。

8名评分者完成研究,均无既往解读FLIP全景测量或HRM的经验,也无实施上消化道内镜检查的经验。评分者报告完成40项研究解读的平均时间为3.6小时(标准差1.1)。

评估者培训

评分者完成了简明培训,包括20分钟的FLIP v1.0和v2.0视频教程,以及获取相关文献。随后,每位评分者独立解读10项FLIP全景测量练习研究。练习研究经选择以代表FLIP全景测量动力模式和分类谱系。练习研究未纳入用于测量评分者准确性的40项病例中。随后,在1小时的集体会议中与食管动力专家(DAC)复习了10项练习研究,专家描述了正确解读。10项训练病例通过wklytics软件(http://www.wklytics.com/nmgi)的html格式输出进行解读,选择该软件是出于便捷性及创建、共享和使用这些绘图的便利性。

FLIP研究方案和分析

使用16-cm FLIP(EndoFLIP EF-322?N; Medtronic)在镇静内镜检查期间进行研究,如前所述。FLIP研究包括逐步10-mL FLIP扩张(每逐步扩张量维持60秒),FLIP导管定位于EGJ(1–3个胃内通道)。解读重点为50-mL、60-mL和70-mL填充量(基于先前描述的FLIP分类方案)。FLIP全景测量研究由评分者作为去标识化的实时FLIP全景测量研究记录进行审阅(FLIP 2.0;堵漏;这些研究在FLIP 300系统可用之前完成)。评分者被指导如內镜检查期间那样查看记录,即连续向前播放记录,允许暂停记录以审阅和/或记录测量值。评分者记录60-mL FLIP填充量期间EGJ扩张性指数(Distensibility Index, DI)值、最大EGJ直径(60–70-mL填充量)、EGJ开放分类、收缩反应模式分类(版本1.0和2.0)以及食管动力分类(版本1.0和2.0)至标准化数据收集表。

为评估准确性,研究参与者的解读与两名资深评估者(JEP和DAC)的群体共识解读进行比较,后者为每项FLIP研究创建参考诊断。100%的研究达成了参考诊断共识。

统计分析

研究人员计算了所有320项回应(8×40)以及按评分者分类的评分者回应相对于参考诊断的混淆矩阵。培训生表现相对于参考诊断的评估重点关注准确性和平衡准确性,计算了总体和按评分者的95%置信区间。78%的准确性,即食管动力专家相对于FLIP全景测量v1.0动力分类参考标准的平均准确性,被用作本研究中初级评估者的主要基准,72%的准确性(食管动力专家中的第5百分位)亦被采用。以连续变量(EGJ-DI、EGJ-DI处压力及最大EGJ直径)计算了评分者数值与参考数值之间的均值(标准差)差异以及标准误(Standard Error, SE)。评估者间一致性通过连续变量的组内相关系数(ICC)和名义变量的Fleiss' kappa统计量进行评估。ICC和kappa值的一致性程度定义如下:轻微一致(0.00–0.20)、一般(0.21–0.40)、中等(0.41–0.60)、良好(0.61–0.80)和优秀(0.81–1.0)。

主要研究结果

FLIP全景测量动力分类解读的准确性

FLIP全景测量动力分类的准确性在FLIP全景测量v2.0为均值0.73(95% CI 0.68–0.78;平衡准确性=0.72),在FLIP全景测量v1.0为0.78(0.73–0.82;平衡准确性=0.77)。4名初级评估者在两种方案中均达到≥78%的准确性,5名评估者准确性>72%。v2.0有3名评估者、v1.0有5名评估者达到≥78%的准确性;v2.0有5名评估者、v1.0有6名评估者达到>72%的准确性。

使用v2.0系统时,所有51项正常动力的评分者诊断其参考标签均为正常。对于v2.0参考诊断为正常的研究,评分者无痉挛性梗阻或非痉挛性梗阻的诊断。在86项不准确的FLIP全景测量v2.0动力诊断中,"可能梗阻"涉及58项(67%)。

使用v1.0时,51/52(98%)正常动力的评分者诊断其参考标签为正常;仅有一项不准确的正常动力评分者诊断被标记为"弱"。对于参考诊断为正常的病例,无梗阻伴弱收缩反应(CR)的评分者标签。在71项不准确的FLIP全景测量v1.0动力诊断中,"不确定"涉及55项(78%)。

FLIP全景测量EGJ开放解读的准确性

评分者相对于参考标准的均值差异(标准差;标准误)为:EGJ-DI为?0.64(0.33;0.16)mm2/mmHg,EGJ-DI处压力为1.9(3.0;1.4)mmHg,最大EGJ直径为?0.4(1.1;0.4)mm。评分者解读EGJ开放的准确性为80%(95% CI 0.75–0.84)。参考诊断为食管开放减少(Reduced Esophageal Opening, REO)的研究中无正常EGJ开放(Normal Esophageal Opening, NEO)的评分者标签,参考标签为NEO的研究中仅有一项REO的评分者标签。因此,64/65(99%)的"不准确"食管开放解读涉及边缘/不确定(v1.0/v2.0)诊断。

FLIP全景测量收缩反应模式解读的准确性

收缩反应模式的总体准确性在FLIP v2.0为均值0.78(95% CI 0.74–0.83),在FLIP v1.0亦为0.78(0.74–0.83)。对于FLIP v2.0,减弱或紊乱收缩反应模式涉及89%的不准确性(57/69)。对于FLIP v1.0,受损/紊乱收缩反应模式涉及74%的不准确收缩反应分类(51/69)。

评估者间可靠性

动力分类的一致性在FLIP v1.0为良好(kappa 0.61),在FLIP v2.0为中等(kappa 0.55)。EGJ-DI(ICC [95% CI] 0.83 [0.75–0.89])和最大EGJ直径(0.82 [0.75–0.89])显示出良好的评估者间一致性。Fleiss' kappa显示EGJ分类(kappa 0.60)以及使用FLIP v1.0和v2.0方案的收缩反应模式(kappa分别为0.62和0.60)具有中等一致性。

讨论部分总结

本研究的主要发现是,既往无食管动力解读经验的医学培训生(即初级评估者)在简明培训后,能够以相当于食管动力专家的水平解读FLIP全景测量研究。63%的初级评估者使用FLIP全景测量动力分类v1.0达到了食管动力专家观察到的平均准确性,而50%使用达拉斯共识的新型FLIP全景测量v2.0达到了类似水平。此外,在全部8名初级评估者中,在正常研究的参考标签与贲门失弛缓症一致(v2.0的痉挛性梗阻和非痉挛性梗阻,或v1.0的弱收缩反应伴梗阻)的研究中,从未发生初级评估者将正常动力误判的情况;也没有在参考诊断为正常动力的研究中出现FLIP贲门失弛缓症模式的评分者标签。因此,当发生"不准确"时,它们通常是FLIP全景测量动力发现谱系中的相邻类别,可能不会产生重大的临床后果。这些发现支持FLIP全景测量的动力解读可以容易地学习,这支持其在一般临床实践中广泛实施的可行性。

建立准确的食管动力诊断对于指导适当和必要的治疗使用非常重要。因此,多项既往研究评估了食管动力研究解读的准确性和评估者间一致性。本研究是首个检验初级评估者解读FLIP全景测量的研究,也是首个使用FLIP全景测量动力分类v2.0(达拉斯共识)评估多评估者解读的研究。研究人员既往的研究利用这同一组40例患者FLIP研究由15名食管动力专家解读,是首个评估有症状患者中FLIP全景测量动力诊断准确性和评估者间一致性的研究,显示使用v1.0方案的FLIP全景测量动力分类的平均(95% CI)准确性为78%(72–81)(该研究在达拉斯共识流程启动前完成)。虽然食管动力专家比初级评估者具有更好准确性并不意外,但值得注意的是,本研究中8名初级评估者有5名在仅经简明培训后使用FLIP全景测量动力v1.0方案达到了专家的平均准确性(78%),6名达到大于食管动力专家第5百分位的准确性。较少初级评估者(50%)使用FLIP全景测量动力分类v2.0达到平均专家等效阈值(注意v2.0的专家解读尚未测量),一致性也略低(v2.0 kappa 0.48 vs. v1.0 kappa 0.61)。v2.0和v1.0之间表现的微小差异可能与v2.0方案中收缩反应模式和动力分类的额外类别(即更多出错可能性)相关。总体而言,这些结果表明FLIP全景测量解读可以容易地学习,即使对于无动力(或专科胃肠病学)培训的医学培训生也是如此。据此,这表明胃肠病学培训生和普通胃肠病学提供者将能够以相似的便利性学习FLIP全景测量解读,如果考虑到本研究中初级评估者之外的额外经验和对胃肠道疾病诊断的培训,其表现可能会改进。这将促进FLIP全景测量在各种临床环境(如社区和学术中心)中的实施。

虽然这是首个评估初级评估者解读FLIP全景测量的研究,但医学培训生(不一定是无既往胃肠病学或动力经验的培训生)使用HRM进行食管动力解读已在既往多项研究中评估。一项对44名胃肠病学专科培训医师的研究显示,完成标准化HRM培训项目(培训生平均花费11.9 [8.6]小时)后,从痉挛性疾病的平均(标准差)准确性63% (27%)到正常动力的80% (27%),63%的培训医师达到"胜任"。另一项包括36名医学培训生(学生、住院医师和专科培训医师)完成30分钟HRM和线性描记测压教程的研究,食管动力诊断的汇总准确性为57%–60.6%。虽然HRM解读未纳入本研究,且既往研究的培训方法与本研究不同,但FLIP全景测量解读的准确性程度(即使在本研究真正的食管动力初识队列中)似乎与非食管动力专家(即具有不同程度胃肠病学和/或动力经验的培训生)解读HRM相当,甚至更胜一筹。本研究中初级评估者的准确性相对于既往减少的培训时间(相较于11.9小时)也值得注意。总体而言,这些发现与既往显示学习者达到动力解读熟练程度存在变异性的研究一致。目前食管动力解读(FLIP或HRM)尚无具体的胜任力基准,因此培训和胜任力评估项目的持续发展仍在进行中。

本研究中另一个值得注意的点是,当初级评估者中出现诊断"不准确"时,不准确解读通常限于不确定或边缘病例(这与既往FLIP全景测量专家解读研究相似),在临床实践中通常会提示补充或替代确证性检测。FLIP全景测量与HRM在不确定病例中的互补作用此前已讨论。此外,无FLIP"类贲门失弛缓症"模式被初级评估者判读为正常的情况。达拉斯共识的一个关键陈述是,正常FLIP全景测量分类时重大动力障碍不太可能,这由其修正的Delphi过程和独立文献综述及总结支持。因此,内镜检查期间使用FLIP全景测量准确识别正常动力可使患者避免不必要的额外检测(包括与HRM相关的不适),并避免治疗延迟。初级评估者在分配正常动力方面的准确性进一步支持了为此目的使用FLIP。

虽然本研究中观察到的准确性率为FLIP全景测量在非食管动力专家中的实施使用提供了希望,但新型和新兴工具用于FLIP全景测量解读仍可能在实际临床实践中提供甚至更好的解读。本研究(及既往研究)使用了FLIP 2.0系统的录制视频,可在实时使用时暂停以获取测量值,但除此之外提供极少的解读输出。更新的FLIP 300系统(Medtronic Inc)允许在內镜检查期间实时暂停和前后滚动研究,这可能改善解读。此外,內镜检查后分析可使用存档或保存的FLIP文件通过开源研究软件进行,如前所述,通过www.wklytics.com/nmgi或新型Mechview平台(https://mechview.wklytics.com/analysis)。MechView平台通过滤除干导管和运动伪影促进解读,并提供层次化决策支持,以指导按照达拉斯共识分配动力分类。此外,人工智能平台已开发并正在完善,预计在未来数年的解读协助和临床决策支持中将发挥宝贵作用。

本研究具有多项显著优势,包括纳入真正的胃肠动力初识评估者队列,以及使用与既往工作相同的40项连续食管动力患者FLIP研究,这促进了食管动力专家与新手的比较。然而,研究也存在局限性,包括与既往食管专家研究相似的局限性。一个局限性是患者病例队列来自贲门失弛缓症高发病率的食管转诊中心,注意到使用符合纳入标准的连续患者模拟了该中心的现实情况(而非选择特定病例),因此纳入了一些非典型和边缘病例。虽然该患者队列可能在一定程度上限制了向其他实践的推广性,但病例确实提供了足够样本量的贲门失弛缓症,这是食管动力中最具行动性的诊断。研究人员的评估者培训过程涉及与食管动力专家的1小时会议,这可能也限制了推广性,但也提示了可用于新FLIP用户的合理潜在培训计划。此外,培训和参考标签由同一位专家执行可能施加一定程度的污染,尽管学习者测压研究中也使用了类似方法。本组初级评估者中未评估HRM解读;虽然这可为该队列的FLIP全景测量解读提供直接比较,但培训生HRM解读已在多项其他研究中评估,因此未纳入本研究。再者,与其他培训生研究不同,本研究未设计用于评估基线能力或观察FLIP全景测量解读的学习曲线。最后,本研究聚焦于FLIP全景测量描记的解读;然而,这可能不完全转化为真实世界的术中FLIP解读,其中还涉及FLIP定位充分性等其他组成部分。

研究结论

总之,与资深评估者建立的参考诊断相比,大多数初级评估者在使用FLIP v2.0和FLIP v1.0分类系统时,表现出与食管动力专家相当的准确性。虽然部分初级评估者能够达到与食管动力专家相似的解读准确性,但学习者之间存在准确性变异,这突出表明需要全面且适应性强或个性化的食管动力解读培训方法。对于FLIP全景测量和HRM的食管动力解读,胜任力基准的开发仍有必要进行持续工作。虽然FLIP全景测量诊断方法和培训平台的持续完善是应当的,但本研究支持FLIP全景测量解读可以容易地学习,即使胃肠病学新手(即超越食管动力新手)也能掌握,这支持在包括非专科提供者在内的一般胃肠病学实践中准确可靠地利用FLIP全景测量。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号