《Neurology and Therapy》:Artificial Intelligence in Neuromuscular Diseases: Opportunities for a Data-Scarce Field
编辑推荐:
神经肌肉疾病(NMDs)包含超过800种不同疾病,影响全球约千分之一的人群,主要临床表现为进行性肌无力、肌萎缩和运动障碍。大多数NMDs的罕见性为通常需要大规模数据集的人工智能(AI)和机器学习(ML)应用带来了根本性挑战。在本叙述性综述中,研究人员综合了20
神经肌肉疾病(NMDs)包含超过800种不同疾病,影响全球约千分之一的人群,主要临床表现为进行性肌无力、肌萎缩和运动障碍。大多数NMDs的罕见性为通常需要大规模数据集的人工智能(AI)和机器学习(ML)应用带来了根本性挑战。在本叙述性综述中,研究人员综合了2018年至2025年间发表的关于AI在NMD谱系中应用的文献,并按临床应用领域进行组织。研究人员考察了AI如何通过遗传变异解读、肌肉磁共振成像分析、基于肌电图的分类和计算病理学推进诊断能力。在疾病监测和预后方面,可穿戴设备衍生的数字生物标志物已获得监管资格认证(美国食品药品监督管理局[FDA]和欧洲药品管理局[EMA]),作为杜氏肌营养不良临床试验终点,而针对肌萎缩侧索硬化(ALS)的AI驱动生存模型已在14个欧洲中心得到验证。使用ML的蛋白质组学和多组学分析已识别出ALS的诊断组合。然而,大多数报告模型是在单中心数据集上开发并进行内部验证的,很少有模型经历了外部或前瞻性验证或临床实施。尽管取得了这些成就,但研究强度在不同NMD亚型之间差异巨大,ALS和杜氏肌营养不良占主导地位,而强直性肌营养不良、先天性肌病和代谢性肌病几乎未被探索。在计算病理学、多中心验证和临床转化方面仍存在关键差距。在本综述中,研究人员讨论了联邦学习、国际合作网络(TREAT-NMD、Solve-RD、EURO-NMD)和基础模型如何应对这些挑战,并为这一数据稀缺领域未来的AI增强临床研究提出方向。
**引言**
神经肌肉疾病(NMDs)构成一大类异质性疾病的集合,影响包括前角细胞、周围神经、神经肌肉接头和骨骼肌的运动单位。进行性肌无力是主要临床表现,通常伴有感觉障碍、疲劳和肌萎缩,疾病进展速率不一。大多数NMDs的患病率为每10万普通人群1–10例。疾病特异性估计突出了流行病学特征:杜氏肌营养不良(DMD)的全球患病率为每10万男性7.1例;肌萎缩侧索硬化(ALS)为每10万人1.57至11.80例;重症肌无力(MG)影响每10万人1.5至17.9例。尽管个别亚型罕见,但遗传性NMDs总体估计患病率可达每10万人111.9例。这些例子跨越不同的病理生理类别——单基因肌肉疾病(DMD)、多因素运动神经元变性(ALS)和抗体介导的神经肌肉接头功能障碍(MG)——因此需要不同的诊断、监测和生物标志物策略,在解读本综述讨论的AI研究时需保持这一区分。绝大多数NMDs符合美国和欧盟(EU)定义的罕见病标准。罕见NMD患者面临漫长的诊断旅程。一项大规模欧洲调查报告从症状出现到诊断的平均延迟为4.7年,56%的患者在首次医疗接触后需要超过6个月。一项研究报告,咨询超过八位医疗专业人员的患者诊断延迟风险显著升高(比值比[OR] 5.15),误诊影响73%的患者(OR 2.48导致延迟延长)。晚发性面肩肱型肌营养不良(FSHD)体现了这一挑战,在一个13例患者队列中,平均诊断延迟达6.7年,且几乎普遍误诊。这些诊断延迟直接转化为治疗干预的延迟,凸显了对决策支持工具的迫切需求。人工智能(AI)和机器学习(ML)可能有助于应对这些挑战,但其在NMDs中的应用遇到一个基本问题:在常见疾病中效果最好的算法依赖于大规模数据集,而罕见病无法提供这些数据。隐私风险和小样本量是显著障碍,只有11.8%的罕见病ML研究在外部数据集上得到验证。旅行模型方法与联邦学习相结合,即使在每个站点仅提供单样本贡献的情况下也显示出可行性,这已在83个国际中心的神经系统疾病分类中得到验证。整合策略,如协调来自异质来源的1221个骨骼肌转录组,揭示了在单个队列中无法检测到的疾病进展谱。在本叙述性综述中,我们按临床领域组织,考察了AI在NMD谱系中的应用。我们评估了克服数据稀缺的策略,评估了诊断和监测应用,识别了疾病亚型覆盖的差距,并为未来研究提出了方向。图1展示了AI在NMD临床路径中的主要应用概览。
**方法**
检索了PubMed、Web of Science、Scopus和Google Scholar数据库,时间范围为2018年1月至2025年6月,重点为2022–2025年期间。检索词结合了NMD相关关键词(“神经肌肉疾病”、“肌营养不良”、“肌萎缩侧索硬化”、“重症肌无力”、“脊髓性肌萎缩”、“肌病”、“神经病变”)与AI相关术语(“人工智能”、“机器学习”、“深度学习”、“神经网络”、“迁移学习”、“联邦学习”、“自然语言处理”)。符合条件的研究包括应用AI/ML于NMD诊断、预后或治疗反应预测的原始研究、系统综述和技术报告。优先考虑描述了明确AI/ML方法并具有定量性能、分析了人类NMD队列(或直接相关的疾病模型)的同行评审研究;排除了无完整全文的会议摘要、缺乏明确AI/ML成分的研究以及无法单独评估NMDs的报告。记录由一位作者(SM)筛选,并由资深作者(SL和HZ)验证,分歧通过共识解决。作为叙述性而非系统性综述,未进行正式的偏倚风险评估或定量荟萃分析;相反,研究局限性在整篇中定性讨论。在整个综述中,使用“AI”作为涵盖经典ML、深度学习(DL)、自然语言处理(NLP)和大语言模型(LLMs)/基础模型的总体术语,以区别于传统统计预测模型,并在涉及解释时注明特定模型类别。通过手动筛选参考文献列表确定了额外参考文献。总共纳入80篇参考文献。
**克服数据稀缺的方法学策略**
将AI应用于罕见病迫使研究人员面对一种不匹配:大多数ML方法依赖数千个标记样本,而许多NMD亚型在任何单一中心影响不到100名患者。四种策略(迁移学习;小样本学习;联邦学习;合成数据生成)已被证明有效,尽管这些策略的成熟度和临床就绪程度差异显著。迁移学习是目前最实用的方法。其原理简单明了——在相关领域的大量数据上训练,然后在小的NMD特定数据集上微调。Hu等人表明,在160万份心电图上预训练将罕见心脏病的检测从受试者工作特征曲线下面积(AUC)0.49–0.70提高到AUC 0.77–0.88。在NMD领域,在通用成像任务上预训练并在来自432名患者的2536张大腿磁共振成像(MRI)扫描上微调的卷积神经网络(CNN)模型对肌营养不良蛋白病分类达到91%的准确率,优于经验丰富的放射科医生(84%准确率)。生物医学基础模型的快速增长意味着NMD领域的研究人员越来越多地受益于已学习通用视觉特征的模型,即使疾病特异性训练数据仍然稀缺。小样本学习通过明确设计从极少示例中学习的算法,进一步推进了迁移学习。SHEPHERD在未诊断疾病网络研究中对465名患者进行了验证,使用超过100,000个节点和100万条边的知识图谱,仅从表型描述中诊断罕见病。原型网络在每类仅十个标记示例的情况下达到88.9%的准确率。这些方法与患者群体极小的NMDs特别相关,尽管尚未在NMD特异性临床工作流程中测试。联邦学习解决了另一个问题:如何在多个医院之间训练模型而无需集中敏感患者数据。在一项三医院念珠菌血症研究中,联邦学习相比本地训练模型将AUC提高了9%,真阳性率提高了24%。对于NMDs,EURO-NMD注册中心已在82个欧洲神经肌肉中心建立了符合FAIR(可查找、可访问、可互操作、可重用)标准的联邦基础设施,为未来多中心AI研究提供了技术骨干。实际挑战仍然是联邦学习需要标准化数据格式和治理协议,而大多数NMD注册中心仍缺乏这些。使用生成对抗网络(GANs)和扩散模型的合成数据生成可以人为扩展小数据集。在一项MS病变检测研究中,GAN增强训练将外部验证AUC从83.6%提高到93.3%,文本引导的扩散模型在生成解剖学上合理的训练图像方面显示出前景。然而,合成肌肉成像数据的生物学有效性仍未得到证实,且这种方法存在放大原始小样本中偏差的风险。
**AI在NMD诊断中的应用**
*遗传变异解读*
AI模型AlphaMissense对全部7100万个人类错义变异中的89%进行分类,精度达90%(以ClinVar档案分类为基准),利用AlphaFold AI系统架构,无需大量疾病特异性训练集。最早的ML方法中,CADD整合超过60个基因组注释来评分全基因组单核苷酸变异和插入缺失的有害性,其CADD-Splice扩展添加了DL衍生的剪接预测。基于DL的SpliceAI工具从前信使RNA(mRNA)序列预测剪接位点,估计罕见遗传病中9–11%的致病突变由隐蔽剪接引起,而基于Transformer的Spliformer DL工具进一步提高了速度和准确性。另一条独立工作路线使用表型信息来缩小搜索空间。Exomiser软件应用在整合人类表型本体(HPO)术语后,在88.2%的病例中将正确的诊断变异列在top-10列表中——而无需表型输入时仅为3–27%。其他工具从不同角度解决同一问题:Phen2Gene从HPO术语优先排序基因;AMELIE挖掘主要文献以对候选基因进行排序;Face2Gene的DeepGestalt从面部照片识别超过200种综合征,top-10准确率为91%,后来由GestaltMatcher扩展到超过1000种疾病。在临床部署层面,Baylor Genetics模型在180例病例中将96.7%的诊断变异排在top-10,在三人组分析中达到98.4%。总之,这些工具表明AI辅助变异解读正接近临床遗传学实验室的实际应用。
*医学影像*
肌肉MRI:基于MRI的AI在NMDs中沿着两条平行轨道发展:自动分割和疾病分类。关于分割,卷积神经网络HRNet在67名NMD患者中实现了平均(±标准差[SD])Dice分数0.91±0.08,并识别了数据集中的所有个体肌肉,但重要警告是当脂肪浸润超过20%时性能下降——而这正是定量评估在临床上最关键的阶段。AI加速T2映射将扫描时间减少了50%以上,同时保持诊断一致性(r=0.99,组内相关系数[ICC] 0.992),这对于经常难以忍受长时间扫描的患者来说是一个实际进步。关于分类,最具临床说服力的结果来自区分36–60个月龄儿童的DMD与贝克尔肌营养不良(BMD),ML算法达到81–91%的准确率,而专家放射科医生的特异性仅为19%。这是一个早期区分直接影响治疗决策的诊断窗口。Swin Transformer在健康对照、BMD和常染色体隐性肢带型肌营养不良(LGMD2)的三分类中达到96%的准确率。基于AI的Myo-Guide平台采取了最广泛的方法,汇集了来自26个中心、20种NMD类型的2961张MRI扫描。其top-3准确率为84.7%(交叉验证),在14个未见病例上为75.0%,超过了最佳专家临床医生(64.3%),尽管小样本头对头比较需要谨慎解读。
肌肉超声:超声AI较不成熟,部分原因是标准化成像方案尚未建立。最大的分割研究使用了来自1283名受试者的3917张图像(精度0.88,召回率0.92),DeepACSA工具提供自动化横截面积测量,ICC为0.97–0.99。更具临床相关性的是ML驱动的FSHD Heckmatt分级:来自290名参与者的25,005张图像,正常分类AUC为0.95,异常分类为0.97,并经过外部验证。通过CycleGAN的合成超声生成可能有助于解决标记数据稀缺,但缺乏临床验证。跨成像方式,分割比诊断分类更成熟,基于MRI的工具目前比超声更接近临床就绪——反映了更大规模的多中心数据集(例如Myo-Guide)以及在少数情况下的外部验证——而超声AI仍受限于图像采集标准化不足。
*电生理学和步态分析*
关于肌电图(EMG)分类的ML报告,区分正常、ALS和肌病信号的准确率范围为67%至99.5%,尽管这一广泛范围反映了异质的研究设计,而非单一稳健基准。使用AdaBoost分类器的步态分析识别神经退行性疾病(包括ALS)的准确率达到99.17%,应用于DMD超声的VGG-19网络在步行功能分类中达到98.53%的准确率。这些数字令人印象深刻,但应谨慎解读:大多数研究使用单中心数据,外部验证有限。
*计算病理学*
尽管数字病理学在肿瘤学中已被广泛采用,但在神经肌肉疾病中几乎未触及。肌肉活检仍然是炎性肌病、代谢性肌病和先天性肌病的诊断金标准,这是一个令人惊讶的差距。活检解读依赖于集中在学术中心的一小部分专业病理学家,这为无法接触这些中心的患者造成了真正的诊断不平等。Kabeya等人展示了可能性:使用来自1400张苏木精/伊红染色切片的4041张裁剪图像,其CNN以AUC 0.996分类了11种肌肉疾病,在受限评估中优于九位医生。然而,该研究也说明了该领域的局限性。公开可用的全切片成像数据集不存在于骨骼肌,迫使所有模型在小的斑块级裁剪上工作,而不是在病理学家实际用于诊断的全切片背景下工作。
**AI在疾病监测和预后中的应用**
*疾病轨迹和生存预测*
ALS生存预测受到的关注远超NMDs中任何其他预后应用,原因很简单:PRO-ACT数据库提供了来自23项临床试验的超过10,700条患者记录(对于罕见病来说是非同寻常的丰富资源)。在该数据库上训练的DREAM Challenge算法实现了C指数0.80–0.81。ENCALS模型采用了不同方法,仅使用八个临床预测因子,在14个欧洲中心、11,475名患者中验证,C指数为0.78。ENCALS的突出之处不在于其准确性,而在于其验证:它仍然是唯一同时具有外部验证和低偏倚风险的ALS生存模型。神经影像学增加了互补视角;在一项研究中,ML模型识别出胼胝体和丘脑的脑萎缩模式作为178名患者的死亡预测因子。ALS这种丰富的数据可用性与大多数其他NMDs形成对比,后者缺乏稳健的数据库和验证模型,强调了基础设施对AI进展的重要性。
*可穿戴数字生物标志物*
可穿戴设备为小队列问题提供了实用解决方案:每位患者的连续数据收集即使从小群体也能生成丰富数据集。KineDMD研究为DMD患者配备了17传感器紧身衣,产生基于运动的行为指纹,优于标准临床量表。这导致了Stride Velocity 95th Centile(SV95C;Sysnav Healthcare,Vernon,法国)获得FDA/EMA资格认证,成为DMD试验首个可穿戴设备衍生的数字主要终点(ICC 0.970),通过增加结局敏感性减少了所需样本量。在ALS中,测量上肢活动的腕戴加速度计与ALSFRS-RSE(ALS功能评定量表修订版自评)评分相关,尽管尚未寻求监管资格。
*治疗反应预测*
机器学习还可以从非常小的队列中识别治疗反应预测因子。脑脊液(CSF)中的microRNA miR-206和miR-133a-3p水平被发现可预测脊髓性肌萎缩(SMA)患者对nusinersen的反应,鉴于年度治疗费用超过100,000美元,这一发现具有直接成本意义。在另一项研究中,随机森林模型在86名患者中预测SMA脊柱侧凸的受试者操作特征-曲线下面积(ROC-AUC)为0.85,电阻抗肌成像与ML对SMA亚型分类达到93%的准确率。对于重症肌无力,一项纳入11项研究的系统综述发现,危机和重症监护病房(ICU)入院预测的AUC为0.765–0.944。
**AI在生物标志物发现中的应用**
*蛋白质组学*
高通量蛋白质组学与ML相结合,可以从NMD研究中典型的高维、小样本数据集中提取诊断特征。Chia等人使用Olink Explore 3072血浆蛋白质组学,对183名ALS患者与309名对照进行分析,诊断AUC达98.3%,并在独立队列中重复,还表明疾病过程在症状出现多年前就影响骨骼肌。在DMD中,使用SomaScan 7K蛋白质组学检测对153名患者进行分析,识别出36种预测临床里程碑(包括丧失行走能力)的蛋白质。在特发性炎性肌病(IIM)中,LASSO衍生的5蛋白组合检测抗MDA5阳性皮肌炎的AUC为0.824。这些蛋白质组学方法值得注意,因为它们在罕见病固有队列规模较小的情况下仍能实现临床相关的区分。
*转录组学和多组学整合*
这些单细胞和多组学研究依赖于ML方法——降维、无监督聚类和潜在因子模型——来解析细胞异质性,即使AI不是其标题框架。单细胞技术开始揭示NMD病理学背后的细胞复杂性。在DMD灵长类动物模型中,单细胞RNA测序(scRNA-seq)同时揭示了纤维-脂肪祖细胞、肌肉干细胞和免疫细胞的缺陷,这是批量转录组学会遗漏的病理广度。Coulis等人通过将scRNA-seq与空间转录组学相结合,精确定位Galectin-3+巨噬细胞通过SPP1/骨桥蛋白信号传导作为肌肉纤维化的关键驱动因素。也许最具启发性的例子是基于MOFA(多组学因子分析,一种无监督ML方法)的多组学分析,对203名IIM患者进行了分析,整合了来自相同肌肉样本的转录组学、蛋白质组学和代谢组学数据,以区分皮肌炎、免疫介导的坏死性肌病和抗合成酶综合征。该研究在44名患者的独立队列中得到验证,这是该领域的罕见情况,并表明组合模式可以补偿单个小型数据集。
*自然语言处理与临床表型分析*
与NMDs相关的许多临床数据被锁定在非结构化文本中(门诊记录、放射学报告、出院小结),因此对大多数ML流程不可见。自然语言处理(NLP)工具开始解锁这一资源。Schrader等人开发了一种基于索赔的算法,从行政数据中识别DMD患者,阳性预测值为91.6%,可用于队列构建和流行病学研究。PhenoBrain是一种基于BERT(双向编码器表示来自变换器)的流程,在罕见病诊断基准上优于50位专科医生和GPT-4(生成式预训练变换器4)(top-3召回率0.513),当与专家输入结合时,召回率升至0.768。通用LLMs也在测试中:GPT-4o在4917个标准化罕见病临床场景中(十种语言)正确将诊断排在首位的情况为19.8%。这些数字仍然有限:排名第一的80%漏检率不会令大多数临床医生满意,但它们建立了一个基线,随着模型在领域特定数据上微调并在临床使用前进行前瞻性评估,该基线可能会改善。
**疾病特异性AI研究格局**
人工智能研究活动在不同NMD亚型之间差异很大,集中在少数资源充足的条件中,而在其他条件中几乎完全缺失。大致出现三个层级:具有大量AI文献的条件(ALS、炎性肌病、MG和DMD/BMD),具有稀疏但新兴活动的条件(SMA、FSHD、LGMD、强直性肌营养不良和腓骨肌萎缩症[CMT]),以及疾病特异性AI基本不存在的条件(代谢性和先天性肌病以及Lambert-Eaton肌无力综合征)。这种梯度更多追踪数据可用性而非临床需求,并跨越遗传/获得性分界,因为研究充分的组包括遗传性(DMD)和获得性(IIM、MG)疾病。这种集中并不令人惊讶:ALS受益于PRO-ACT数据库,包含超过10,700条患者记录,DMD受益于组织良好的注册中心和强大的倡导组织。在ALS中,语音分析已达到临床级性能(智能手机录音构音障碍评估R2=0.92);在DMD中,定量超声散射组学对步行分期实现AUC 0.97–0.98。然而,这些是已经拥有数据基础设施的疾病。真正的问题是AI方法能否被用于没有这些优势的条件。强直性肌营养不良,其心脏、认知和肌肉受累,似乎是整合AI方法的自然适合者,然而没有疾病特异性算法。先天性肌病具有独特的组织病理学特征,易于进行图像分类,然而没有人构建模型。代谢性肌病(庞贝病、麦卡德尔病)和Lambert-Eaton综合征完全缺席AI文献。这些研究强度的差异也反映了每种疾病对AI需求的真实差异,相同的工具并非对所有条件同样有用。在DMD中,基因诊断直接且很少是临床瓶颈;更紧迫的需求是捕获和解释自然史数据,用于监测以及将运动功能与治疗反应相关联,这就是可穿戴数字生物标志物和定量成像主导该领域的原因。相比之下,在ALS中,由于显著的临床异质性和持续的诊断延迟,诊断和分类仍然困难,因此详细和标准化的临床表型分析是前提而非可选改进,最有成效的应用因此是生存预测和患者分层。炎性肌病占据中间位置,其中血清学和组织学分型相对发达,而治疗反应预测则不是。认识到这些疾病特异性要求对于解读表1中总结的研究至关重要,因为一种疾病中解决真正临床瓶颈的模型在另一种疾病中可能是多余的。
**讨论**
这里回顾的研究表明,数据稀缺——长期被认为是罕见病AI的决定性障碍——可能比目前假设的更加不可怕。在数百万通用领域样本上预训练的基础模型可以用极小的NMD特定数据集进行微调,而像SHEPHERD这样的小样本学习框架完全绕过了大型标注队列的需求。我们认为,重要的不是数据集的绝对大小,而是现有数据的创造性利用方式。Myo-Guide平台很好地说明了这一点:通过汇集来自26个中心、20种疾病类型的2961张MRI扫描,尽管每个贡献中心只有适度数量的病例,它仍优于个体专家临床医生。话虽如此,我们必须对文献中报道的头条性能数据保持谨慎。影像学和EMG研究中看到的91–99%的准确率几乎完全来自单中心数据集的内部验证。外部验证在尝试时往往揭示实质性性能下降。只有11.8%的罕见病ML研究在外部数据上测试了模型,更少进行了前瞻性临床评估。ENCALS生存模型之所以突出,正是因为它经过14个独立中心的验证——这一标准应成为常态而非例外。因此,通过转化成熟度视角阅读这些应用是有用的:大多数已发表的NMD模型仍作为探索性算法开发,仅内部验证;少数已实现外部或多中心验证(例如ENCALS生存模型和ML Heckmatt超声分级);极少数已达到前瞻性验证、临床部署或监管资格——SV95C可穿戴终点是主要例外。当前的LLM/NLP应用也应在此转化成熟度框架内解读,因为大多数仍处于探索阶段,尽管回顾性性能有前景。高头条指标(准确率、AUC、Dice或C指数)不应等同于临床实用性,临床实用性还需要前瞻性验证、工作流程整合、可解释性以及相对于当前护理的已证获益。综合来看,这些观察表明,AI在神经肌肉疾病中面临的主要挑战不再是算法开发本身,而是缺乏严格验证、标准化评估框架和高质量多中心数据集。如果不解决这些问题,优秀的算法性能不太可能转化为有意义的临床获益。如表1所示,AI研究在NMD亚型间的分布极不平衡,反映了自我强化的循环。拥有现有数据基础设施的疾病(ALS与PRO-ACT,DMD与有组织的注册中心)吸引更多ML研究人员,他们随后生成更多数据,进一步扩大差距。打破这一循环需要刻意投资于被忽视条件的数数据收集、从研究充分的疾病到罕见病的迁移学习,以及能够跨站点汇集小数据集的联邦方法。临床试验设计是AI可能产生巨大影响的另一个领域。罕见NMD试验常常因患者群体太小而无法达到入组目标。SV95C作为DMD可穿戴衍生数字终点的监管资格是一个里程碑,因为它直接解决了这个问题:通过增加结局测量的敏感性,减少了每项试验所需患者数量。将类似的数字生物标志物方法扩展到ALS、MG和SMA可能是AI对NMD领域最实际的近期贡献。一个相关障碍是欧洲罕见病数据库仍然大部分孤立。不到17%的数据库管理者愿意出于ML目的共享数据,理由是治理、协调和数据质量问题。联邦学习提供了一种实用的变通方法,使模型能够在分散站点间训练而无需原始数据离开医院,但其在NMD研究中的采用仍然有限。在监管方面,美国食品药品监督管理局(FDA)现已授权超过1000种AI/ML医疗器械,欧洲药品管理局(EMA)于2024年9月发布了补充指南。这些框架为临床部署提供了可行路径,尽管迄今没有一种专门应用于NMD诊断工具。除了共享意愿之外,罕见病的临床部署必须处理隐私法规(特别是欧盟通用数据保护条例和美国健康保险携带与责任法案)、异质的国家治理,以及小队列带来的更高重识别风险;联邦和合成数据方法可减轻但不能完全解决这些限制。同样根本的是标准化临床表型分析,我们认为这是NMDs中AI成功开发和临床实施的前提。如果没有跨注册中心的标准化和结构化表型分析,AI模型不可避免地会从不一致的标签中学习,从而限制其可重复性、泛化性和临床适用性。因此,协调和统一的临床数据收集应被视为基本前提,而非AI研究中的下游考虑。我们认为,碎片化的数据基础设施现在已成为比算法创新更大的障碍。除非数据可访问性和互操作性同时改善,否则持续开发日益复杂的AI模型将仅提供有限益处。
**AI如何改进未来研究**
我们为该领域提出五个优先事项。这些对应我们认为应指导该领域的四个问题:哪些应用最接近临床实施?哪些应用技术上可行但临床不成熟?临床采用前应有最低验证标准?哪些NMD亚领域最需要定向投资?基于上述局限性,我们认为未来研究不仅应优先技术创新,还应改进研究设计、数据质量和临床验证。最紧迫的需求是将现有注册中心整合为联邦AI就绪网络。基础设施已存在:TREAT-NMD全球注册网络覆盖全球65个注册中心;Solve-RD研究项目连接51个地点的300多名临床医生,重新分析超过19,000个未解决病例;DARWIN EU注册网络覆盖16个欧洲国家的1.6亿患者记录。缺少的是允许在这些注册中心之上进行联邦模型训练而无需数据集中的技术层。欧盟地平线资助的CoMPaSS-NMD项目说明了这一方向,应用AI驱动的聚类分析来自五个欧洲国家的协调临床、遗传、组织学和影像数据,以完善遗传性NMDs的诊断和患者分层。大语言模型值得作为诊断辅助工具关注,但期望要现实。ChatGPT-4o在未诊断疾病网络病例中实现13.3%的诊断率,约为传统临床审查5.6%的2.4倍。虽然这些初步发现令人鼓舞,但它们也表明当前的LLM/NLP系统对于常规临床使用仍不够准确,在这些诊断挑战性病例中漏检了近87%。检索增强生成和多语言流程可能进一步提高诊断性能;然而,在任何临床部署之前,严格的前瞻性临床评估仍然至关重要。在上述转化成熟度框架内,当前的LLM/NLP应用因此应被视为已证明概念验证性能但尚未达到常规临床实践所需的前瞻性验证、临床实施或监管成熟度水平的探索性技术。可穿戴数字生物标志物应扩展到DMD之外。SV95C资格表明,连续运动数据可将临床试验所需样本量减少多达50%。ALS的上肢加速度测定、MG的面部表情追踪和强直性肌营养不良的握力肌强直量化在技术上均可行,但缺乏使SV95C成功的监管验证工作。根据我们的评估,肌肉活检的计算病理学是最大的错失机会之一。肌肉活检解读仍然依赖少数专家病理学家,皮肌炎束周萎缩、包涵体肌炎镶边空泡和去神经支配纤维群组等疾病的诊断标准已明确且适合自动化检测。瓶颈是缺乏公开可用的、注释的全切片成像数据集。作为朝这个方向的一步,我们团队开发了开放获取、非商业的计算病理学工具包(MyoToolkit; http://myotoolkit.huashanmuscle.com/),用于自动化肌肉活检分析,包括纤维分割和形态学定量。尽管潜力巨大,该领域的进展目前更多受数据可用性而非方法论限制的制约,强调了对公开可及、专家注释的病理数据集的迫切需求。最后,多组学整合应从概念验证转向常规实践。基于MOFA因子分析模型对203名IIM患者的分析表明,结合转录组学、蛋白质组学和代谢组学数据可揭示任何单一模式都无法看到的疾病亚型。随着测序成本持续下降,对于已经在收集组织样本的疾病,几乎没有理由进行单一组学研究。尽管当前证据仍然异质,且疾病间机制理解的深度差异显著,但高通量多组学技术、AI辅助分析方法、标准化多中心研究和国际合作倡议的持续进展可能在未来几年逐步改进研究设计、数据解读和生物标志物发现。因此,当前局限性不仅应被视为挑战,也应被视为未来研究的机会。总之,数据稀缺并未阻止NMDs中AI的有意义进展,但它导致进展缓慢、不均衡且难以验证。前进的道路需要更少的算法新颖性和更多的临床基础设施:共享数据集、联邦网络、标准化终点和前瞻性验证研究。许多构建模块现已到位,但大多数NMDs中的AI应用在确立其获益之前仍需要前瞻性验证和临床实施。该领域现在需要的是协作框架来利用它们。