《Frontiers in Surgery》:Assessment of brachial plexus and upper-extremity peripheral nerve injuries at the anatomical level using multimodal generative models
编辑推荐:
引言:臂丛神经及其终末分支的损伤在功能和职业层面可能是毁灭性的,因为即使是部分功能丧失也会导致灵巧性和活动能力的重大破坏。臂丛神经由多个相互连接的解剖层次组成,因此全面的解剖学知识对于确定损伤程度和最佳治疗方案至关重要。因此,功能缺损与损伤部位精确定位之间的相
引言:臂丛神经及其终末分支的损伤在功能和职业层面可能是毁灭性的,因为即使是部分功能丧失也会导致灵巧性和活动能力的重大破坏。臂丛神经由多个相互连接的解剖层次组成,因此全面的解剖学知识对于确定损伤程度和最佳治疗方案至关重要。因此,功能缺损与损伤部位精确定位之间的相关性对于避免广泛的手术探查和恢复解剖完整性至关重要。方法:在本研究中,研究人员将来自50个标准化、真实世界启发的虚构基准病例的医学研究委员会(MRC)肌力分级,这些病例涉及不同解剖层面(神经根、干、束、终末分支和联合模式)的臂丛神经和上肢周围神经损伤,呈现给多种多模态生成模型(MM-GMs),即GPT-5(OpenAI)、Gemini 2.5 Pro(Google)、Grok 4(xAI)和Claude Opus 4.1(Anthropic),并评估它们仅基于功能性运动缺陷定位解剖损伤部位的能力。结果:GPT-5取得了最高的总体准确率,39/50正确回答(78.0%;95% CI 64.8–87.2),其次是Grok 4和Claude Opus 4.1,各26/50正确回答(52.0%;95% CI 38.5–65.2),以及Gemini 2.5 Pro,22/50正确回答(44.0%;95% CI 31.2–57.7)。Cochran's Q检验显示模型间存在显著差异,Holm校正的精确McNemar事后比较表明GPT-5优于其他模型。涉及多个解剖部位的联合损伤对MM-GMs具有挑战性,仅20%的回答正确。讨论:总体而言,这一受控基准表明MM-GMs能够将标准化的MRC肌力分级模式分配给臂丛神经和周围神经损伤的解剖层面。然而,不同模型和损伤类别之间的表现差异很大,在临床实施前需要在真实临床队列中进行验证。
**研究背景与问题**
臂丛神经(brachial plexus)起源于脊髓C5至Th1神经根,形成多层交织的神经结构,其损伤可导致上肢功能严重丧失。由于解剖结构复杂,临床定位损伤部位需依赖详尽的解剖学知识,但传统诊断方法(如电神经图、CT/MRI)存在局限性,且臂丛神经损伤罕见,非专科医生常因认知不足导致转诊延误。因此,开发简便工具辅助定位损伤具有重要临床意义。多模态生成模型(MM-GMs)作为先进的人工智能(AI)模型,具备推理和自然语言处理能力,无需预先训练即可执行任务,但其在臂丛神经损伤定位中的应用尚未被探索。本研究旨在评估MM-GMs仅凭医学研究委员会(MRC)肌力分级(M0-M5)定位解剖损伤部位的能力,以期为临床提供支持。论文发表在《Frontiers in Surgery》。
**研究概述**
研究人员构建了50个标准化、真实世界启发的虚构基准病例,涵盖臂丛神经和上肢周围神经损伤的五个解剖类别(神经根、干、束、终末分支及联合模式),每个病例仅提供15项运动的MRC肌力分级。将病例输入四种MM-GMs:GPT-5(OpenAI)、Gemini 2.5 Pro(Google)、Grok 4(xAI)和Claude Opus 4.1(Anthropic),并评估其输出与预设参考标准的一致性。主要终点为正确判断解剖定位,采用Cochran's Q检验和Holm校正的精确McNemar事后比较进行统计分析。
**主要关键技术方法**
- **病例构建与参考标准**:由资深临床团队基于臂丛神经解剖学原则(如节段性神经根支配、臂丛组织、终末支运动支配)构建50个虚构病例,每个病例预设解剖损伤部位作为参考标准,涵盖5个类别(根、干、束、周围神经、联合损伤),每类10例。
- **肌力缺陷模式设计**:将预期运动缺陷转换为MRC分级(M0-M5),涉及15个上肢运动,包括肩关节外展、内旋、外旋,肘关节屈伸、旋前、旋后,腕关节屈伸,手指屈伸、外展、内收,以及拇指对掌。联合损伤通过叠加两个解剖位点的预期运动缺陷构建。
- **提示工程(Prompt Engineering)**:采用系统提示、角色提示、上下文提示、专家模拟、思维链、输出格式化和指令提示等机制,引导MM-GMs按近端到远端顺序(神经根→干→束→周围神经)分析,并规定输出格式(含结构、损伤可能性、置信度、关键临床指标等)。
- **统计方法**:采用Cochran's Q检验分析模型间整体差异,用精确McNemar检验进行配对比较,并用Holm校正,Kendall's W作为效应量。准确率以Wilson score 95%置信区间报告。
**研究结果**
- **总体性能(Overall performance of MM-GMs)**:四种MM-GMs对50个病例的定位准确率存在显著差异。GPT-5正确39/50(78.0%;95% CI 64.8–87.2),Grok 4和Claude Opus 4.1各26/50(52.0%;95% CI 38.5–65.2),Gemini 2.5 Pro正确22/50(44.0%;95% CI 31.2–57.7)。Cochran's Q检验显著(Q=21.26, p<0.001),Holm校正的McNemar事后比较显示GPT-5显著优于其他模型(所有调整后p≤0.01),其他模型间无显著差异。
- **基于解剖类别的分析(Analysis based on grouped anatomical structures)**:MM-GMs对干损伤识别最佳(准确率最高),根和束损伤次之,周围神经损伤稍低,联合损伤最难(仅20%正确)。GPT-5在根、干、束损伤中准确率最高(根损伤达90%),而Claude Opus 4.1在周围神经损伤中表现最佳(略高于GPT-5)。Grok 4表现异质,Gemini 2.5 Pro在所有类别中均较低。
- **单个解剖结构性能(Performance on individual anatomical structures)**:对C5根、上干等近端结构识别准确率约50%,但终末支如尺神经(ulnar nerve)仅15%正确,而腋神经(axillary nerve)和肌皮神经(musculocutaneous nerve)达到完美评分。近端单支神经(如肩胛上神经、腋神经、肌皮神经)比远端神经更易识别,可能与远端神经支配更多肌肉有关。
**讨论与结论**
**讨论总结**:本研究首次探索MM-GMs在有限输入(仅肌力分级)下定位臂丛神经和周围神经损伤的能力,发现不同模型和损伤类别间表现差异显著。GPT-5在直接臂丛损伤(根、干、束)中表现最佳,Claude Opus 4.1在周围神经损伤中较优,而联合损伤对所有模型均具挑战性。近端神经比远端神经更易识别,可能与神经支配肌肉数量有关。研究局限性包括:病例集较小且仅基于运动分级,未与人类专家比较,仅评估单一提示架构。未来需在真实临床队列中验证,并探索多模态数据(如感觉功能)和替代提示策略。
**研究结论翻译**:MM-GMs可用于诊断臂丛神经和周围神经损伤,仅需提供肌力分级;但其有用性直接取决于具体的MM-GM。目前,GPT-5最适合臂丛神经损伤,而Claude Opus 4.1在定位周围神经损伤方面表现最佳。未来对通用MM-GMs或任务特定AI模型的技术改进可能缓解当前局限,并使其在常规周围神经护理中建立微小增量价值之外的作用。