《Current Gastroenterology Reports》:Artificial Intelligence for Diagnosis of Esophageal Manometry: A Narrative Review
综述目的:高分辨率测压术(HRM)作为诊断食管动力障碍的金标准,仍受限于评估者间差异、专家食管病医师可及性有限以及培训基础设施不足。许多消化病学专科培训项目提供的动力培训不足,且专业中心在地理上高度集中。新兴的人工智能(AI)工具具有自动化诊断、增强临床医师解读能力以及推动专家级动力评估民主化的潜力。
近期发现:研究整合了涵盖超过5000例患者的22项研究,横跨三个重叠的发展阶段:用于特征提取与分类的早期机器学习;用于自动化模式识别与动力分类的深度学习;以及新兴的多模态与大语言模型框架,用于增强临床解读与决策支持,诊断准确率介于71%至97%之间。AI整合多模态测压数据可能揭示人眼视觉检查无法察觉的压力特征,指向芝加哥分类(Chicago Classification, CC)之外的新的表型。目前尚无研究证明AI能改善患者预后。AI在动力培训中的作用在很大程度上仍未被探索。
总结:AI-临床医师协作伙伴关系代表了未来数年食管测压解读最有前景的发展路径。AI增强的解读有可能消除学术与社区实践之间的两级诊断差距,通过可扩展的AI监督病例库加速受训人员能力提升,并揭示超越人类解读能力的生理表型。
引言
食管动力障碍影响相当比例的表现有吞咽困难、胸痛和难治性反流的患者。这些疾病包括食管胃连接部(esophagogastric junction, EGJ)功能障碍,如I至III型贲门失弛缓症和EGJ流出道梗阻(EGJOO);以及蠕动障碍,如蠕动缺失、无效食管动力(ineffective esophageal motility, IEM)、远端食管痉挛(distal esophageal spasm, DES)和高收缩食管。高分辨率测压术(HRM)已成为诊断食管动力障碍的基石性工具。HRM生成详细的时空压力地形图记录,其能力超越了传统线性描记。芝加哥分类(CC)现已更新至第四版(CCv4.0),提供了将HRM压力数据转化为临床诊断的结构化算法框架,整合了直立位和仰卧位、激发操作以及精细化的EGJ指标。然而,HRM解读远非简单直接。标准测压方案所获得的大量数据构成了实际挑战。每次检查使用36通道导管,每个导管组件包含432个离散测量点,生成复杂度相当高的时空压力数据集。这种解读负担需要时间和专业知识,而这些资源在不同实践环境中并非均匀可及。
美国神经胃肠病学与动力学会(ANMS)登记系统截至2025年列有107个专门的消化动力实验室,较十年前记录的38个中心有显著增加。但这些实验室仍集中于学术医疗中心和主要城市地区,而非农村和社区环境。建立动力实验室需要大量的基础设施投资和必要的转诊量。实验室相关人员的招聘与培训(从操作人员到计费/编码专员)以及所需设备的购置和维护,在高容量中心之外可能因成本过高而受限。CCv4.0的复杂性要求大量的培训和专业知识。即使在受过培训的专家中,诊断一致性也不尽如人意。Kim等人2018年的一项分析表明,基于HRM的动力诊断的评估者间一致性仅达到中等符合度(Kappa值0.40)。HRM解读的主观因素即使在经验丰富的中心也引入了有意义的诊断不确定性。对于没有专门动力培训经历和/或位于相对低容量社区环境中的消化科医师而言,这种变异性可能更大。
这一问题的严重程度因有据可查的动力培训缺口而进一步加剧。一项针对美国171个成人消化病学专科培训项目的调查发现,仅25%提供专门的消化动力培训。这一发现在一项儿科消化病学专科培训学员的研究中得到进一步证实,75%的受访学员报告在专科培训期间接受的神经胃肠病学培训不足,其中80%接受的专业动力培训时间不超过两周。专门的神经胃肠病学与动力专科培训项目已从2015年的不足10个增长至目前美国约13至15个活跃项目,每年合计培养约15至20名专科医师,这一培养渠道不足以满足日益增长的临床需求。当代HRM数据中蕴含的诊断机会取决于是否存在能够一致、可重复且规模化解读这些数据的工具。人工智能(AI)提供了这些能力。AI涵盖机器学习(machine learning, ML)和深度学习(deep learning, DL),利用特定架构如卷积神经网络(convolutional neural network, CNN)和基于转换器的大语言模型(large language model, LLM)。在消化病学领域,AI已通过实时息肉检测和病变表征在消化道内镜和结肠镜检查中带来变革。虽然将AI应用于其他生理检测模式有所滞后,但这一应用不仅有可能实现测压解读自动化,还可通过将诊断质量与地理集中的专业知识脱钩,以及作为一种新颖的教学工具在培训稀缺的领域中加速能力获取,从而解决结构性可及性问题。
本叙事性综述综合了AI应用于食管测压的现有证据,重点关注诊断准确性、治疗预测、方法学质量以及负责任临床实施前的实际要求。贯穿本综述的核心主题是将AI定位为临床协作者——也就是说,AI可以增强消化科医师的解读范围并放大动力专家的培训能力,而非作为独立于人类判断的自主技术运行。这种人机协作伙伴关系模型对领域应如何开发培训课程、设计验证研究以及应对动力护理中的结构性可及性问题具有直接意义。
方法
本叙事性综述通过结构化、基于PRISMA原则的文献检索进行。其证据基础通过检索PubMed/MEDLINE、Embase和Cochrane图书馆(自建库至2026年3月)确定。鉴于该领域现有研究方法、人群和结局指标的异质性,研究结果以定性叙事综合的形式呈现。纳入和排除标准概述于表1。纳入标准为:将AI、ML或DL应用于解读成人患者任何模态的食管动力数据,并报告可提取的诊断性能指标的研究。病例报告、社论和无全文数据的会议摘要被排除。
图1展示了PRISMA 2020研究识别、筛选和纳入流程图。通过PubMed/MEDLINE、Embase和Cochrane图书馆检索(建库至2026年3月),并辅以手工检索纳入综述的参考文献列表。去重并添加手工检索记录后,318条记录经标题/摘要筛选;260条因未涉及AI应用于测压而被排除。全文文章依据表1中预先设定的纳入/排除标准进行评估,并记录每项排除原因。十二项研究(8项原始研究,4项综述)符合纳入标准并被纳入定性叙事综合。AI = 人工智能。
具体检索词见补充信息。筛选阶段结果限制为英文出版物。PubMed/MEDLINE产生230条记录,Embase产生112条记录,去重前共342条记录。此外还检索了Cochrane图书馆,但未返回相关记录。手工检索纳入综述的参考文献列表以识别额外研究(识别出11条额外记录),纳入研究的特征汇总于表2。系统检索专门设计用于识别将AI或ML应用于食管动力数据的研究。用于可及性和培训基础设施差距背景框架引用的文献[4, 7, 18]通过单独的定向叙事检索确定,不经过PRISMA筛选流程。识别出七篇会议摘要,根据预先设定的标准(缺乏全文同行评审发表)被排除,但在叙事中作为新兴证据引用。
AI分类与术语
对AI术语的工作性理解是解读测压文献的前提。ML广义上指从标记数据中学习模式而无需显式编程的算法。传统ML方法包括随机森林、支持向量机(support vector machine, SVM)和梯度提升。ML提取预定义特征如综合松弛压力(integrated relaxation pressure, IRP)或远端收缩积分(distal contractile integral, DCI),并利用这些特征对检查进行分类。这些方法虽然计算效率高且相对可解释,但高度依赖特征工程的质量和完整性。
DL采用多层人工神经网络,从原始数据中学习特征表示——原始数据转换为AI算法可处理的数值向量。CNN是图像测压研究中占主导地位的DL架构,特别适用于时空压力地形图。无监督DL方法,如变分自编码器(variational autoencoder, VAE),无需标记训练样本即可学习潜在数据表示,这为发现当前分类方案未捕获的新型动力表型提供了可能性。LLM和多模态生成式AI代表了DL范式内最新的前沿,能够同时处理图像和文本数据。
解读AI诊断性能需要熟悉一组与临床医师熟悉的敏感性和特异性有显著差异的统计指标。这些指标源于混淆矩阵(亦称误差矩阵),它简单列出给定诊断类别的真阳性(true positive, TP)、真阴性(true negative, TN)、假阳性(false positive, FP)和假阴性(false negative, FN)。准确率(TP + TN / 总数)是测压AI文献中报告最多的指标,但在类别不平衡数据集中也最具误导性。例如,一个能正确识别所有正常检查但将所有贲门失弛缓症病例错误分类的模型,如果正常类别在数据集中占主导地位,仍可能产生>90%的准确率。
精确率(TP / TP + FP)反映阳性预测正确的频率,类似阳性预测值。召回率(TP / TP + FN)反映捕获了多少真阳性,类似敏感性。F1分数是二者的调和平均数,提供了一个在类别分布不均时特别有用的单一平衡指标。AUROC(受试者工作特征曲线下面积)衡量所有可能决策阈值下的区分能力,不受患病率影响。这些指标之间的区别在临床上具有重要意义。例如,一个总体准确率为95%但对III型贲门失弛缓症召回率较差的系统,可能会系统性漏掉最可能从经口内镜下肌切开术(Peroral Endoscopic Myotomy, POEM)中获益的患者。
高分辨率测压中的人工智能诊断
标志点识别与质量控制
HRM检查的技术质量必须通过解剖标志点识别来保证,特别是EGJ和上食管括约肌。Czako及其同事使用ML同时分类IRP并检测探头定位失败来处理这一基础步骤,IRP分类准确率达97%,两种情况F1分数均超过84%。这一应用具有临床意义,因为探头位置不当是公认的诊断错误来源,而当前软件在不同平台上的处理不一致。自动化检测,特别是在实时记录期间,可显著减少技术不合格的检查数量。
吞咽水平分类
芝加哥分类通过分层、逐步算法运作,首先表征单个吞咽,然后推导出研究水平诊断。Kou及其同事开发了一种DL长短期记忆(long short-term memory, LSTM)模型——一种增强型递归神经网络亚型,通过内部门控机制控制顺序数据中的信息保留和流动——用于吞咽类型识别。该模型在吞咽水平分类中实现83%的测试准确率,在研究水平蠕动分类中实现88%的准确率。Wang及其同事在独立中国队列中应用三维卷积(Conv3D)和双向卷积LSTM(BiConvLSTM)网络捕获动力时间动态,实现91.3%的准确率。后者值得注意,因为它是少数展示出超越主导该文献的北美中心泛化能力的研究之一。值得注意的是,两篇会议摘要——Kern及其同事(DDW 2018)将ML应用于HRM等值线,以及Huang及其同事(DDW 2019)报告的深度学习概念验证——早于该领域所有全文发表。
研究水平诊断与芝加哥分类自动化
HRM AI的方法学里程碑是西北大学Kou及其同事开发的多阶段框架。该模型镜像CC算法架构:基于DL的CNN在吞咽水平操作,随后基于特征的ML模型(XGBoost和人工神经网络)在研究水平操作。这种分层设计嵌入了专家临床医师推理测压数据方式的知识。值得注意的是,IRP子模型采用加权损失函数,对接近15mmHg诊断阈值附近的预测错误施加更大的训练惩罚,对临床后果严重的错分类的惩罚重于无歧义范围内的错误。系统调整IRP截断值和比例阈值几乎未带来准确率提升(标准值为76.6%对比76.2%)。这表明问题不在于使用何种阈值,而在于基于规则的决策树方法本身具有内在的性能限制,任何阈值调整都无法克服。因此,作者用更灵活的机器学习模型(包括CNN和梯度提升树)替代了基于规则的方法,将研究水平诊断准确率提升至接近90%。一种补充性的无监督方法使用变分自编码器(VAE),将原始HRM吞咽数据压缩为概率性潜在表示而无需诊断标签,在来自2,161项HRM检查的超过32,000次吞咽上训练。与该手稿中引用的所有其他研究不同,VAE在训练期间从未被展示CC诊断;它纯粹从压力模式中学习。涌现出的潜在聚类大体重现了CC诊断类别,同时验证了该分类的生物学基础,并揭示了诊断类别之间的边界是连续的而非离散的。这对我们对临界和重叠表型的集体临床理解具有直接影响。
Surdea-Blaga及其同事在罗马尼亚192项HRM研究队列中独立开发了全自动芝加哥分类系统,实现86%的准确率和F1分数。方法学上,这不是单一模型,而是一个两阶段深度学习管线:InceptionV3用于IRP分类,随后DenseNet201用于吞咽障碍分类,其输出输入CC决策树以生成最终诊断。该架构在概念上类似于Kou多阶段框架。两者都镜像CC的分层逻辑,将早期生理参数估计与最终诊断分类分离。关键区别在于Kou操作原始时间序列压力数据,而Surdea-Blaga操作Clouse图的图像表示,反映了HRM AI中的两种主导范式——原始数据与基于图像的分类。罗马尼亚队列也为文献引入了重要的地理多样性。鉴于绝大多数HRM AI开发发生在北美中心并使用Medtronic硬件,该组使用ISOLAB系统和Unisensor导管,其IRP正常上限不同(28 mmHg对比15 mmHg),这引发了参考标准可比性的方法学担忧,而研究未明确解决这一问题。
长期和动态高分辨率测压
Geiger及其同事通过深度学习管线解决了24小时长期高分辨率测压(LTHRM)的分析负担,该管线检测超过94%的相关吞咽事件,并采用无监督聚类将检测到的吞咽组织为不同类别,使临床医师能够聚焦于少量具有代表性的吞咽,以易于管理且临床可解释的摘要形式呈现。这种方法首次使LTHRM在临床上可行,对评估间歇性吞咽困难和术后动力评估在完整昼夜节律周期内具有重要意义。
现有证据基础的方法学批判与局限性
本手稿中审查的所有AI系统均针对基于CCv4.0分类的专家临床诊断进行训练和验证,该分类由经验丰富的食管病医师分配。然而,Kim等人证明该参考标准仅实现中等评估者间一致性(κ = 0.40)。正如Fass、Rogers和Gyawali所强调的,Gong等人也同样指出,现有AI系统将AI解读与专家分析进行比较,而非与基于AI诊断的管理所产生的临床结局进行比较。如果专家诊断本身如评估者间变异性数据明确显示的那样不完美,那么训练AI匹配专家意见只是将现有的诊断不确定性编码为更一致的形式。忠实复制专家意见的AI模型并不能提供更好的诊断;它提供的只是相同主观判断的更一致版本。这创造了一个认识论天花板,除非AI训练目标与临床结局而非专家标签相关联,否则无法克服。
校准在很大程度上仍未得到解决,几乎没有研究报告校准指标如Brier分数或校准曲线。因此,概率输出不能假定反映真实临床概率,临界病例中过度自信的预测仍是一个未量化的风险。重要的是,由于参考标准基于专家意见而非客观生物学真相,即使是校准良好的模型也只能预测与专家当前理解的一致性,而非真正的诊断准确性。另一个担忧是参考标准不一致。研究跨越芝加哥分类3.0和4.0版本,两者在诊断阈值和类别定义上存在显著差异。
至关重要的是,无监督方法如Kou及其同事的变分自编码器模型提示了第二条互补性轨迹:在无诊断标签的原始压力数据上训练的AI可能识别出人类视觉检查不可见的潜在测压特征,可能揭示当前分类框架边界之外的运动表型。在这个意义上,AI最具颠覆性的贡献可能不是自动化专家已经能看到的内容,而是浮现他们无法看到的内容。
ML特定的担忧包括样本量充分性。CCv4.0定义了至少八种不同的运动表型,但大多数模型在192至1,741项研究的数据集上训练,类别分布各异。这些模型因此面临过拟合常见诊断而在罕见但临床显著的疾病(如III型贲门失弛缓症、蠕动缺失和高收缩食管)上表现不佳的风险。没有研究报告类别特定性能指标,使这一局限性难以量化。
方法学透明性也有限。虽然一些研究报告了分层训练-测试分割,但大多数未说明数据集如何划分或类别分布是否保持。加上缺乏外部验证和患者选择流程不明确,这引发了对性能估计过于乐观的担忧,特别是对于罕见诊断。类似地,在源自同一单中心数据集的内部测试集上实现高准确率的模型,对真实世界性能提供的洞察有限。跨机构、患者群体、测压系统和方案变异的泛化性和可重复性仍不确定。
系统性综述者很大程度上看不到的是从未进展到全文发表的会议摘要群体。七篇摘要[19,20,21,22]总计跨越主要国际会议七年,确认了会议阶段AI活动远超已发表证据基础。没有全文同行评审发表,一种报告偏倚形式夸大了该领域的表观质量和成熟度,而Lei Wei-Yi等人确定的MRS差距强调了已发表AI尚未解决的临床重要任务。
证据基础还受到对高容量专家中心的系统性选择偏倚影响。高性能模型,如西北多阶段框架和LTHRM框架,源自具有专家标注者和高程序量的专业动力单位。鉴于只有少数培训项目提供正式动力培训,且北美地区专业动力中心相对较少,大多数真实世界使用者与训练数据中代表的人群存在显著差异。这产生了一个悖论:在专家中心数据上训练的AI可能在其最需要的社区环境中失败。因此,在非专业中心进行外部验证不仅是方法学形式,而是检验AI能否实现其民主化潜力的决定性测试。
最后,据我们所知,尚无AI测压工具获得FDA监管许可或CE标志作为临床诊断设备。算法透明度、失败模式表征和与现有临床工作流程的整合是负责任的临床转化的前提。
未来方向与专家观点
AI在HRM中的中心研究和开发核心可以解决当前文献中存在的方法学不一致,并建立加速AI模型开发的管线。这将具有双重目的:为临床实践和运动培训创建模型。作为内窥镜模式识别领域的一个近期例子,丹麦多中心数据集作为基础模型,包含来自多家医院的匿名通用内窥镜图像,在准确性上优于其他AI模型,展示了中心化数据核心的力量。类似地,现有和未来测压记录的中心化数据集作为病例库,可以帮助AI模型的预训练、推进AI创新工作流程、调查模型错误,并与行业制造商合作将AI与现有测压工具集成。食管测压能力项目——一种针对HRM解读的个性化适应性学习程序——提高了受训者在所有七项核心测压技能集上的表现,但其覆盖面受限于拥有能够监督该项目的专家师资的机构数量有限。实现这一潜力需要专业学会、神经胃肠病学家、教育工作者和AI开发者的审慎合作。
AI监督的培训平台同时充当教师、考官和质量保证机制。当建立在广泛病例库上时,AI培训平台可以提供针对AI基准的受训者解读即时反馈,使病例复杂性适应个体表现轨迹,并识别需要针对性补救的知识缺口,而无需物理访问专门动力实验室或专家导师。也就是说,AI实现了分布式培训架构:受训者通过AI获得解读能力,然后在监督的临床实践中验证该能力。这种理想化模型并未消除专业动力医师的作用;它只是放大了他们的覆盖范围。一位经验丰富的神经胃肠病学家可以策划和验证带注释的病例库,该病例库可培训来自数十个机构的数百名受训者。
与ANMS-ESNM分层能力框架对齐的标准化AI辅助培训课程、AI监督与传统培训模式下受训者结局的前瞻性评估,以及区分AI作为培训工具与AI作为临床诊断设备的监管框架,都是优化和可持续未来模式的必要组成部分。该领域正处于拐点:AI工具已存在,培训缺口有据可查,集体需求明确。所需的是建设桥梁的制度意愿。
多模态数据整合
HRM AI中的近期机会在于能够同时整合多个维度测压数据的系统——压力地形图、阻抗球团传输和临床元数据。当前范式将吞咽水平分类和研究水平诊断视为顺序步骤,但完整的诊断图景需要同时考虑蠕动完整性、EGJ松弛、球团清除和患者报告症状。Popa及其同事的LLM增强系统展示了生成式AI如何开始将原始测压发现置于更广泛的临床叙事中,从而迈向整合性临床推理。Mascarenhas及其同事进一步证明,跨多个设备和中心的同步训练开始解决限制泛化性的平台特定特征分布。没有单一测压参数能捕捉食管运动功能障碍的全部复杂性,而AI综合跨完整检查的高维异质压力数据的能力可能揭示当前分类框架必然模糊的诊断意义交互模式。
护理点实时AI辅助
在检查采集期间提供即时反馈的实时AI,如标记探头位置不当、在诊断标准处于临界状态时提示额外操作,或提醒操作者技术欠佳的吞咽,可以显著改善缺乏专家监督的社区实验室的检查质量。将LLM整合到测压解读中预示了一个未来,AI不仅分类运动模式,还能生成结构化临床报告、综合发现与患者病史,并建议鉴别诊断和管理方案。应用于症状、辅助检测和合并症,这代表了在运动护理中推进患者特异性精准医学以及改善临床一致性的有意义一步。
迈向结局驱动的AI
所需的关键范式转变是从诊断匹配的AI过渡到结局驱动的AI。与其优化模型以匹配专家共识诊断,未来的AI开发应将测压表型与治疗反应和患者报告结局相关联。这镜像了更广泛应用于医疗AI系统的观点,建议开发临床环境模拟器框架,基于操作指标和临床结局评估LLM。建立这一证据基础需要前瞻性队列研究,最终需要随机试验来填补文献中的当前空白。
AI作为均衡器:弥合可及性差距
食管测压中的AI有潜力直接解决本综述中记录的 structural 可及性和培训缺陷。只有四分之一的美国专科培训项目提供正式动力培训,且大多数受训者在完成专科培训时未达到独立测压解读所期望的熟练程度。这创造了一个两级诊断系统:在具有NGM项目的学术动力中心提供专家级护理,而其他所有地方则提供资质不一的解读。
AI的优势可能在于将解读质量与解读专业知识脱钩的能力。当在数千个专家注释研究上训练的AI系统以89-97%的准确率提供CCv4.0诊断时,它有效地将专业动力单位的解读能力扩展到任何配备测压硬件和网络连接的实验室。社区医院或农村实践中的消化科医师可能获得决策支持系统,该系统补充(在直接病例中可能替代)专家监督。这一均衡功能直接类似于AI在其他医学领域已展示的影响。可及性差距的全球维度在低收入和中等收入国家甚至更为突出,这些国家正式动力实验室基础设施稀疏,动力专科培训罕见或缺失。AI辅助解读可以使得这些资源匮乏环境中的社区消化科医师能够执行HRM检查并获得解读指导,而无需将数据发送给远程专家或将患者转诊至远距离。
结论
人工智能在基于HRM的芝加哥分类自动化中展示了令人信服的技术性能。AI在受控研究环境中实现接近专家的诊断准确率,并在某些任务中提供优于人类评估者间一致性的稳定、可重复解读。然而,当前证据基础尚不支持临床实施。外部验证的完全缺失、前瞻性结局数据的缺乏,以及对高容量专家中心的系统性选择偏倚,是负责任临床转化的基本前提。在诊断能力之外,AI作为可及性和培训均衡器具有变革性潜力,将专家级测压解读扩展到最迫切需要的社区中心、培训项目和全球环境,并作为建设下一代具备广泛能力、精通动力和AI素养的从业者的可扩展工具。