《International Journal of Medical Informatics》:Multimodal artificial intelligence-based decision support for stroke classification in medical emergency calls using call transcripts and patient health records: A retrospective diagnostic accuracy study
编辑推荐:
背景:在医疗紧急呼叫中识别卒中具有挑战性,因为信息非结构化、沟通障碍和症状异质性。人工智能(AI)可能改善早期卒中识别;然而,来自紧急呼叫环境的证据仍然有限,且将呼叫转录与结构化临床数据相结合的价值尚不明确。研究人员开发并内部验证了一种基于多模态AI的决策支持
背景:在医疗紧急呼叫中识别卒中具有挑战性,因为信息非结构化、沟通障碍和症状异质性。人工智能(AI)可能改善早期卒中识别;然而,来自紧急呼叫环境的证据仍然有限,且将呼叫转录与结构化临床数据相结合的价值尚不明确。研究人员开发并内部验证了一种基于多模态AI的决策支持系统,用于医疗紧急呼叫期间的卒中分类,并将其性能与紧急医疗通信中心(EMCC)操作员基线进行比较。
方法:研究人员利用2019年和2022年卑尔根EMCC的数据进行了一项回顾性诊断准确性研究。使用了两个数据集:(1)473个EMCC音频文件及配对的人工转录,用于微调基于挪威Whisper的自动语音识别(ASR)模型(2019年);(2)2,627个带标签的紧急呼叫,用于分类模型的开发与评估(2022年)。结构化临床数据包括医院数据、实验室测量值和药物。使用受试者工作特征曲线下面积(AUC)、精确率、召回率和F1-score评估性能。在30、60和90秒处进行流式评估以模拟实时使用。
结果:微调提高了ASR准确性,将词错误率从8.3%降至7.2%。多模态分类模型的卒中类F1-score达到0.77,超过了仅转录模型和操作员基线(0.73)。宏平均F1-score为0.87,AUC为0.86。在假设1.2%卒中患病率的情况下,估计模型每1,000次呼叫会产生约26次虚假警报,而操作员基线为36次。在流式评估中,卒中F1-score从30秒时的0.68增加到90秒时的0.85,性能在第一分钟内趋于稳定。
结论:整合紧急呼叫转录与患者健康记录的多模态AI决策支持系统改善了卒中分类性能,并可能在卒中分诊中为EMCC操作员提供支持。在临床实施之前,需要在更大数据集中进行外部验证。
卒中仍是全球范围内导致死亡和残疾的主要原因之一,其临床结局高度依赖于快速且准确的决策。在急性卒中护理路径中,紧急医疗通信中心(EMCC)是首要接触点,操作员对卒中症状的识别直接影响患者的后续处置。然而,医疗紧急呼叫中相关信息往往非结构化、不完整且含有噪声,同时沟通障碍与症状的异质性进一步增加了识别难度。人工智能(AI)有潜力改善早期卒中识别,但来自真实紧急呼叫环境的证据仍十分有限,且将呼叫转录与结构化临床数据相结合的多模态方法此前未见报道。为此,研究人员利用卑尔根EMCC 2019年和2022年的真实数据,开发并内部验证了一种多模态AI决策支持系统,用于医疗紧急呼叫期间的卒中分类,并系统比较了其与EMCC操作员基线的性能差异。
该系统整合了呼叫音频转录和结构化患者健康记录,后者包括医院病史、实验室测量值和药物处方数据,并以呼叫时间为索引进行时间截断以避免信息泄漏。研究结果显示,多模态分类模型的卒中类F
1-score达到0.77,高于仅转录模型的0.68和操作员基线的0.73;宏平均F
1-score为0.87,受试者工作特征曲线下面积(AUC)为0.86。在假设1.2%的卒中患病率下,模型每1,000次呼叫估计产生约26次假警报,少于操作员基线的36次。流式模拟评估显示,模型性能在呼叫开始后第一分钟内即可达到稳定水平。这些结果表明,将紧急呼叫转录与结构化临床数据相结合,可提高卒中分类的准确性并减少不必要的救护资源消耗,为时间紧迫的卒中分诊提供了潜在的临床决策支持。该论文发表于《International Journal of Medical Informatics》。
在关键技术方法方面,研究人员采用两阶段机器学习流程。样本队列来自卑尔根EMCC 2019年和2022年真实呼叫数据:2019年473例确诊卒中患者的音频与人工转录用于微调基于挪威Whisper的自动语音识别(ASR)模型(NB-Whisper Large);2022年2,627个带标签呼叫(329例卒中,2,298例按年龄分层抽样非卒中)用于分类模型训练与评估。结构化临床数据包括医院诊断(8年回顾)、处方药物(20年)和实验室测量(20年),均以呼叫时间为截断点