《Nature Neuroscience》:Simultaneous speech and gesture decoding for multimodal communication in paralysis
编辑推荐:
卒中与神经退行性疾病可损害语音及非语言手势,限制自然交流。脑机接口(BCI, brain–computer interfaces)旨在将神经活动转化为外部设备指令以恢复功能,但既往工作多孤立解码语音或手势。研究人员使用单枚高密度皮层脑电(ECoG, elect
卒中与神经退行性疾病可损害语音及非语言手势,限制自然交流。脑机接口(BCI, brain–computer interfaces)旨在将神经活动转化为外部设备指令以恢复功能,但既往工作多孤立解码语音或手势。研究人员使用单枚高密度皮层脑电(ECoG, electrocorticography)植入阵列,在瘫痪参与者中实现语音与手势的同步解码。研究人员首先在三名参与者中可靠解码孤立的上肢与口面运动;随后采用并行语音与手势解码器,使参与者通过同时或孤立尝试语音和手势来控制个性化虚拟化身(avatar)。在孤立与同步数据上联合训练模型,可提升跨行为情境的性能。这些发现表明,单枚皮层植入体可支持多效应器控制,并向为瘫痪者提供更自然交流的BCI迈进。
研究背景方面,自然交流常由发声与上肢手势等多效应器(multi-effector)并行参与,而卒中、肌萎缩侧索硬化(ALS, amyotrophic lateral sclerosis)等可导致语音与肢体运动同时受损。现有BCI多聚焦孤立解码语音或光标、面部表情、手动手势等,尚不清楚单枚植入体能否在自然交流式并发情境中稳定解码语音与身体手势。感觉运动皮层(SMC, sensorimotor cortex)存在粗粒度躯体拓扑(somatotopy),但电极或神经元尺度上口面与手部表征部分重叠,使得并发行为的解码更具挑战。该研究发表于《Nature Neuroscience》,核心问题是:ECoG记录下,语音与手势并行解码是否可行,以及何种训练策略可支撑隔离与同步情境中的可靠解码。
主要关键技术方法上,研究纳入BRAVO临床试验三名慢性植入参与者,使用单枚高密度ECoG覆盖SMC。研究人员提取70–150 Hz高伽马活动(HGA, high-gamma activity)绘制多效应器感觉运动地图,采用门控循环单元(GRU, gated-recurrent unit)神经网络分别建立语音与手势分类器,并设置语音仅做(S-only)、手势仅做(G-only)、语音加手势同步(S+G)三种行为情境;通过孤立数据、同步数据及混合数据训练比较泛化性,引入跨模态训练将异模态试次标为静息以降低误触发,最终将并行解码输出映射至个性化全身虚拟化身进行实时闭环控制。
研究结果部分保留小标题如下。Neural representations of multiple body groups for driving a multi-effector BCI:研究人员通过HGA地图显示,单枚ECoG阵列可粗略按躯体拓扑采样口面、手臂与头眼表征,并可解码多组身体运动,证明单植入体具备驱动多效应器BCI的表征基础。Decoder performance depends on behavioral context:研究人员发现语音相关与手势相关神经活动在前中央回部分重叠;仅用孤立数据训练的模型在S+G测试上表现不及用S+G数据训练的模型,说明解码性能具有行为情境依赖性。Training on a combination of isolated and simultaneous behavior improves model generalization:研究人员将孤立与同步试次混合训练,混合模型在隔离与并发测试中均保持较高准确率;电极贡献分析显示同步训练改变共享电极权重,嵌入空间分析表明跨情境同类别分布更靠近,且留一组合分析显示模型可泛化至训练中未同现的语音手势配对。Cross-modality training reduces false positive rate (FPR) and false negative rate (FNR):研究人员将异模态试次纳入静息类,跨模态训练使对侧模态误激活降至近0;仅孤立训练模型在同步试次上漏检率升高,而上下文包容训练在隔离与同步情境均降低FPR与FNR。Decoded speech and gesture outputs can control a virtual avatar in real time:研究人员将并行解码映射至化身,G-only复制任务中Bravo-6实时手势准确率81.8%,同步任务中手势66.0%、语音70.0%;对话范式下仍保持较高准确率且误触发率低,证明实时多效应器头像交流可行。
讨论部分总结为,单枚ECoG可采样部分重叠的口面与上肢表征,并发解码不可由孤立训练自动泛化,混合训练与跨模态训练是实用路径;前中央回效应器表征非完全分离,群体层面仍可区分多行为,但并发会改变群体模式。研究局限包括词汇量小、同侧运动解码较弱、参与者少致病因异质性难评估。
研究结论部分翻译为:本研究借助单枚ECoG植入体考察多效应器语音与手势BCI的可行性。不同效应器在SMC上引发独特但部分重叠的空间模式。通过覆盖广泛感觉运动区,研究人员显示单枚ECoG栅格可在三名参与者中解码多种上肢、口面与构音运动。研究人员展示了一个概念验证的实时接口,可解码同步语音与上身手势,以驱动个性化全身化身实现表达性交互。这些发现共同支持从单枚植入体进行同步多效应器解码的可行性,是迈向重度肢体与发声道瘫痪者更灵活、更具表达性交流的一步。