《Algorithms》:Trustworthy Gait Analysis for Computer-Aided Diagnosis in Parkinson’s Disease and Knee Osteoarthritis: A Targeted Narrative Review of Algorithms and Clinical Validation
编辑推荐:
步态分析正日益被用作计算机辅助诊断(CADx)的动态功能生物标志物,尽管仅凭较强的内部性能并不能确立临床实用性。本定向叙事综述以帕金森病(PD)和膝骨关节炎(KOA)为主要临床背景,同时将跌倒风险及其他行动障碍视为情境性扩展。一项结构化的文献检索和来源验证过程
步态分析正日益被用作计算机辅助诊断(CADx)的动态功能生物标志物,尽管仅凭较强的内部性能并不能确立临床实用性。本定向叙事综述以帕金森病(PD)和膝骨关节炎(KOA)为主要临床背景,同时将跌倒风险及其他行动障碍视为情境性扩展。一项结构化的文献检索和来源验证过程覆盖了截至2026年7月31日的研究。综述语料库包含118篇来源,涵盖临床证据、测量验证、数据集、算法架构和方法学指南。本综述批判性地比较了传感模态、公开和专有数据集、基于特征的模型、CNN/RNN架构、图神经网络、Transformer、状态空间模型以及信任支持方法,包括可解释人工智能、自动化机器学习、联邦学习和多模态融合。采用明确的覆盖规则,对15项实证或测量验证研究进行了通用验证审计。审计证据未显示针对疾病聚焦的步态CADx已成熟开展独立的多中心验证。正式的概率校准和解释稳定性的定量测试也缺失,而公开可用的KOA特异性多模态基准仍然稀缺。基于这些发现,本综述提出了一个六级验证就绪阶梯,其中第3级的独立外部证据是启动受监督临床试点的最低门槛。该框架优先考虑受试者级分离、泄漏控制、校准、具有临床意义的参考标准以及前瞻性工作流程评估。
本综述围绕步态计算机辅助诊断(CADx)这一核心主题,系统梳理了帕金森病(PD)与膝骨关节炎(KOA)两种临床锚定条件下的算法与验证现状,并提出了面向可信临床转化的完整工作流框架。以下按原文章节结构总结其主体内容。
**2. 综述范围与证据基础**
研究采用定向叙事综述设计,而非系统综述或Meta分析。文献检索覆盖PubMed/MEDLINE、IEEE Xplore、ACM数字图书馆、ScienceDirect、SpringerLink等数据库及arXiv、OpenReview等预印本平台,时间窗口为2015年1月至2026年7月31日,并纳入部分早期奠基性文献。证据选择层次明确:优先纳入使用临床标签或已验证步态结果的实证CADx研究,其次为公共数据集报告和测量验证研究,再次为对临床建模有实质影响的步态专用架构研究。纯生物特征或通用动作识别研究仅作为情境性架构证据,不参与临床结论。临床就绪声明采取保守解释,单一内部数据集的高准确率不被视为泛化证据。语料库共118篇来源,按疾病或任务划分:65篇涉及跨领域方法学问题,25篇关注步态或运动分析,17篇聚焦PD或冻结步态,9篇涉及KOA或肌肉骨骼步态,2篇涉及跌倒风险。按模态划分:62篇非模态特异,22篇使用视频/姿态/骨架数据,22篇使用步态变量或混合表征,9篇使用可穿戴/力/其他传感器数据,3篇为多模态。在22篇架构或模型中心来源中,CNN/常规序列模型6篇、GNN 3篇、Transformer 4篇、SSM/Mamba模型4篇、混合或多家族设计5篇。纳入标准包括:直接实证评估步态诊断、严重程度评估、事件检测、预后、治疗反应或康复结局;验证或公开发布步态数据集、测量系统或传感平台;评估与轻量级、图基、Transformer或状态空间建模相关的步态专用架构;或对泄漏、校准、可解释性、AutoML、联邦学习(FL)、外部验证、临床报告或偏倚风险评估相关的方法学分析。直接性规则严格区分方法学相关性与直接临床证据。
**2.4 临床锚定条件与情境性行动障碍**
PD和KOA代表两种不同的步态障碍机制。PD源于神经退行性运动障碍,临床特征包括步幅缩短、步态拖曳、步间变异性增加、冻结步态、上肢摆动减少、转身受损及双重任务行走改变,对时间建模、事件检测和长序列表征提出要求。KOA源于机械性关节疾病、疼痛和代偿运动,表现为防痛步态、膝关节活动范围减少、负荷改变、双支撑时间增加、站立相不对称及髋踝代偿策略,需要算法表征关节级力学并区分疾病相关运动与疼痛回避行为。其他行动障碍(如卒中、正常压力脑积水、腰痛、衰弱和跌倒风险综合征)仅作为情境扩展,不用于支持PD或KOA诊断的直接声明。
**3. 步态数据、临床意义与表征**
**3.1 病理步态的临床与生物力学基础**
步态是周期性运动行为,通常通过站立相和摆动相描述。单纯步行速度或步幅等单一指标临床价值有限,更具信息量的模式常来自时间不对称性、步间变异性、关节间协调性和代偿策略。PD步态异常跨越时空域,但同一患者可能因疾病阶段、用药状态、疲劳、注意力负荷、行走表面和临床环境而表现不同,模型需对个体内变异性具有鲁棒性。KOA的算法需区分疾病相关机械限制与疼痛回避行为,应将关节轨迹、时间变量和负荷相关指标与患者报告疼痛评分和影像标签联合解释。高判别力但缺乏生物力学合理性可能反映混杂因素。
**3.2 数据采集模态**
实验室步态分析(测力台、光学标记运动捕捉、肌电图(EMG))是生物力学参考标准,但不适合大规模筛查或家庭监测。可穿戴惯性测量单元(IMU)、压力鞋垫、智能手机惯性传感器和表面EMG提供高频时间序列数据,适合一维卷积模型、循环模型、TCN和基于特征的机器学习,优势在于生态灵活性,但存在传感器漂移、佩戴误差、放置变异性、校准负担和设备异质性。无标记视频可使用RGB或深度相机,可表示为帧、剪影、光流或由OpenPose、MediaPipe/BlazePose、AlphaPose、DeepLabCut等生成的姿态骨架,但对隐私、公平性和环境变化敏感,光照、相机角度、服装、遮挡、辅助设备、肤色和体型均可降低姿态质量和诊断可靠性。
**3.3 公共与专有步态数据集**
数据集景观在不同临床任务间不均衡。PD有多个公开可穿戴和力信号资源,而KOA特异性开放数据集(具有协调临床标签、多模态测量和官方外部验证协议)仍然稀缺。GaitRec等大型肌肉骨骼数据集规模大但混合了异质诊断和康复状态,不应视为KOA特异性基准。仅包含健康参与者的多模态数据集无法确立疾病CADx有效性。
**3.4 步态CADx的表征选择**
关键算法决策不是传感器或相机选择,而是行走信号在学习前的表征方式。剪影保留全身形状和运动但可能掩盖关节特异性机制;骨架提供可解释的关节图并匹配GNN建模但对姿态估计错误敏感;可穿戴信号捕获直接运动动态但需仔细校准和事件分割;派生表格特征临床可解释但可能丢失深度模型可利用的细微时间模式。表征特异性故障模式应随预测性能一起评估和报告。对15项研究(7项直接临床或任务特异性证据加8项高优先级测量验证或架构研究)的审计显示,没有一项确立了成熟独立的PD或KOA聚焦疾病CADx多中心验证。一项研究使用外部临床采集设置进行测量验证但未确认机构独立性;另一项报告了跨数据集验证但外部数据集和结果文档不足。无研究报告正式概率校准作为主要验证结果;一项研究评估了解释一致性但未提供解释保真度或稳定性的正式定量指标。受试者级分离在多项研究中明确记录,但报告不一致。
**4. 步态CADx的学习架构**
**4.1 从基于特征的流水线到深度学习**
特征模型在样本量小或临床定义步态变量可用时仍是必要基线。逻辑回归、支持向量机、随机森林和梯度提升可展示高容量模型是否在步行速度、步态节律、不对称性、关节活动范围和疾病严重程度之外增加价值。CNN-RNN和时间卷积流水线在结构匹配输入数据时最合适,关键考虑因素是时间窗口长度、步态周期对齐、视角归一化、传感器放置以及模型是否学习疾病相关运动而非参与者身份或采集伪影。架构比较应使用强表格基线和通用无泄漏评估协议,并一致报告置信区间、校准和计算成本。
**4.2 时空、图基、Transformer和状态空间模型**
骨架图保留解剖连接性并显式建模关节间协调。近期研究扩展ST-GCN家族,通过自适应图、跨时空建模、轻量级图块和Transformer引导姿态表征。主要优势是关节关系的结构化表征,但有效性仍对姿态估计误差、图错误设定、遮挡以及从动作识别基准到细微临床表型的有限迁移敏感。Transformer捕获全局时间依赖和跨模态上下文,但复杂性与序列长度呈二次方增长,通常需要大量数据和计算。GaitPT和近期ViT方法在生物特征基准中展示高效时空表征,但生物特征rank-1准确率仅提供情境性算法证据。选择性状态空间模型(SSM),包括Mamba,提供近似线性的序列扩展和内容依赖状态更新,适合长或可变时长行走序列。SkelMamba引入解剖引导的空间、时间和时空扫描用于神经运动分析,MambaGait结合显式步态表征与隐式状态空间建模,Gait2Hip-60比较LSTM、Transformer和Mamba骨干用于生物力学预测,但预印本状态和有限外部评估不支持临床就绪声明。SSM可能减少内存使用和延迟,但隐藏状态动态更不透明。
**4.3 最小算法公式与可信工作流**
诊断流水线应报告为显式算法组件。设Xi为受试者i的步态序列,xi,t可表示视频帧、骨架向量、IMU信号、压力轨迹、EMG片段或派生特征。通用预测函数为p?_i = softmax(fθ(φ(Xi))),此仅为示例性多分类公式。骨架图可表示为G=(V,E),图更新规则H^(l+1) = σ(Σ_k A_k H^l W_k^l)仅适用于骨架图输入。无泄漏受试者级学习目标要求Strain ∩ Sval = Strain ∩ Stest = Sval ∩ Stest = ?。AutoML搜索目标(a*, λ*) = argmin L_val(a, λ; D_train, D_val)应在受试者级或访视级分区下计算。联邦平均FedAvg规则θ^(r+1) = Σ_{k=1}^K (n_k/n) θ_k^(r+1)需考虑站点异质性、设备差异和亚组性能。期望校准误差ECE = Σ_{m=1}^M (|B_m|/n)|acc(B_m) ? conf(B_m)|应结合校准图、截距和斜率、Brier评分及阈值特异性预测值报告。算法1总结了从原始步态采集到校准预测、解释、隐私保护学习和验证就绪报告的最小步骤。
**5. 临床转化的信任支持组件**
**5.1 用于生物力学合理解释的XAI**
LIME和SHAP可估计表格步态变量的局部或全局贡献。Grad-CAM、LRP、显著性图、积分梯度和注意力可视化可识别有影响的像素、帧、关节或时间片段。但解释不能确立模型有效性,解释可能因随机种子、相关步态变量、相机视角和姿态估计流水线而变化。XAI方法应根据输入表征和临床问题选择,并评估稳定性、保真度和生物力学合理性。临床相关性不能仅从视觉合理性确定,应评估扰动保真度、种子和折叠稳定性、姿态质量敏感性、亚组一致性和泄漏风险。
**5.2 用于可重复模型选择的AutoML**
AutoML可在可重复搜索协议下比较线性、树基和深度学习模型,尤其当输入为派生步态变量时。模型选择应嵌套在受试者级训练折叠内,预处理在每个折叠内单独拟合,最终流水线在外部评估前锁定。负责任AutoML报告应指定候选算法、超参数范围、计算预算、优化指标、嵌套验证设计、随机种子和最终模型重拟合规则。仅优化AUROC可能产生临床不适用模型。主要风险是泄漏:许多步态数据集包含同一参与者的多个帧、步幅或试验,随机帧级分割可能将同一参与者数据放入训练和测试集。泄漏控制必须扩展到预处理和模型选择,姿态归一化、缩放、特征选择、时间窗口化和增强策略应仅使用训练折叠拟合。
**5.3 联邦学习、联邦评估与独立站点验证**
临床步态数据集通常小、不平衡且站点特异。FL可支持分布式模型开发而不集中原始视频或可穿戴数据,但联邦训练不等同于联邦评估或外部验证。2025年FOGSense研究使用62名PD参与者的公共数据集,采用受试者级分层训练/验证/测试分区(70%/10%/20%),重复三次,模拟五个联邦客户端,但仍是公共数据模拟,未确立独立多站点临床泛化性。非IID异质性应以临床有意义术语描述,包括患者群体、标签定义、传感器配置、行走协议和工作流程差异。研究应报告全局和客户端级性能、校准、亚组错误和个人化程度。FL不应被视为固有隐私保护,标准FL减少原始数据集中化但模型更新可能泄露敏感信息,可能需要安全聚合、差分隐私、审计日志和治理协议。
**6. 整合验证就绪与临床部署**
**6.1 泄漏、混杂、类别不平衡与外部验证**
受试者级分离不消除年龄、性别、体型、用药状态、疼痛、步行速度、疾病严重程度、合并症、辅助设备使用、相机视角、服装或站点特异性采集的混杂。预测单元应在模型开发前定义,帧、步幅、试验、受试者和站点级预测回答不同临床问题。所有重复观察必须保持在同一分区内。外部队列应独立于模型选择和超参数调整。类别不平衡通常临床结构化,应报告类别计数、平衡准确率、宏F1分数、每类敏感性、精确率-召回曲线和置信区间。六级验证就绪阶梯(图4)从Level 0(无有效受试者级测试的技术可行性)到Level 5(监控部署、漂移监测、安全审查、审计追踪和模型更新治理)。Level 3要求独立外部证据,是受监督临床试点的最低门槛。
**6.2 校准与不确定性感知评估**
校准评估预测概率与观察结果频率的一致性。偶然不确定性反映不可约变异性或标签模糊性,认知不确定性反映有限模型知识,数据质量不确定性来自姿态失败、传感器脱落或注释错误,分布偏移不确定性发生在测试人群或采集系统与开发环境不同时。校准应在独立数据上使用ECE、Brier评分、校准图、校准截距和斜率以及阈值特异性阳性和阴性预测值评估。校准方法和操作阈值应仅使用训练或验证数据拟合,然后在最终测试集上无调整评估。不确定性估计应导致明确临床行动,选择性预测可延迟低置信度或不熟悉病例给临床医生,共形预测可提供预测集或区间,数据质量门可拒绝受姿态置信度低或传感器故障影响的记录。
**6.3 临床工作流程、治理与监管解释**
近期研究展示了非诊断应用:智能手机视频量化PD严重程度和用药反应,无标记系统验证KOA和PD的步态测量,便携式视频支持假肢诊所评估,移动无标记应用自动化慢性病成人功能测试。但这些研究支持监测和工作流程整合,不确立普遍诊断可迁移性。报告标准如CONSORT-AI、SPIRIT-AI、DECIDE-AI、TRIPOD和PROBAST及其更新版本应被遵循。无标记视频的治理尤为重要,原始步态记录可能识别参与者并捕获旁观者、家庭环境、辅助设备或敏感残疾相关信息。隐私保护流水线应区分原始媒体保留和派生特征保留,指定去标识化和加密程序。部署后监测应包括漂移检测、校准监测、失败捕获跟踪、不良事件审查和显式重训练触发。
**7. 局限性、研究优先事项与结论**
**7.1 综述局限性**
本综述采用定向叙事设计,无前瞻注册协议、无重复筛选、无全源偏倚风险评估或Meta分析。PD和KOA为主要条件,发现不应直接推广至卒中、共济失调、脑瘫、衰弱或所有跌倒风险人群。直接临床证据比更广泛方法学文献有限,尤其对于AutoML、SSM、多模态融合和FL。许多实证研究依赖小规模单中心队列、不一致临床标签和异质预测单元。
**7.2 优先研究议程**
数据集标准化和直接临床证据:建立多中心PD和KOA基准,具有协调诊断标签、严重程度分层、用药和疼痛状态、辅助设备注释和官方受试者/站点级评估协议。外部验证和临床有意义结局:超越内部疾病分类,转向独立站点验证和跌倒、疾病进展、治疗反应和康复结局。高效可解释长序列建模:在相同数据分割、计算预算、校准指标和解释稳定性测试下比较轻量级GNN、Transformer和SSM。混杂控制和亚组鲁棒性:确定预测是否依赖年龄、步行速度、辅助设备使用、相机环境或站点特征。不确定性感知决策支持:评估选择性预测、共形覆盖、数据质量拒绝和临床升级。联邦多站点证据:区分联邦训练、联邦评估和独立验证,报告客户端级性能、非IID行为、隐私风险、通信成本和少数站点校准。
**7.3 结论**
步态CADx为可信临床AI提供了严苛测试案例,因为步态信号动态、重复、传感器依赖且受临床和环境因素强烈影响。现有证据支持可穿戴、无标记、图基、Transformer、SSM、多模态和联邦方法的技术可行性,但临床成熟度不均衡,独立多站点证据仍有限。信任支持方法不应被误认为信任证据。XAI需要稳定且生物力学有意义的解释;AutoML需要嵌套受试者级验证;FL需要客户端级分析和独立站点测试;多模态融合需要增量临床价值证据;校准不确定性应导致预定义延迟或升级路径。本综述的主要贡献是连接临床任务、传感模态、步态表征、算法架构、信任支持组件和验证就绪的有界、证据感知框架。独立外部证据被提议为受监督临床试点的最低基础,前瞻性工作流程评估和监控部署则需要更强就绪声明。这些阈值代表本综述提出的综合,需要前瞻性验证才能被视为共识标准。