《Biomimetics》:Bio-Inspired Gaze and Neural Command Fusion for Assistive Smartphone Interaction
编辑推荐:
本文介绍了一种辅助智能手机交互系统,该系统结合了移动凝视追踪与基于脑电图(EEG)的脑机接口(BCI)命令。Android应用程序通过前置摄像头、MediaPipe面部标志、TinyTrackerS TFLite模型、时间平滑以及从模型输出到屏幕坐标的校准映射
本文介绍了一种辅助智能手机交互系统,该系统结合了移动凝视追踪与基于脑电图(EEG)的脑机接口(BCI)命令。Android应用程序通过前置摄像头、MediaPipe面部标志、TinyTrackerS TFLite模型、时间平滑以及从模型输出到屏幕坐标的校准映射来估计用户的凝视。凝视点用于定位目标屏幕区域,而BCI层使用Emotiv Cortex命令进行点击、滚动和后退操作。FastAPI和MongoDB后端管理配置文件、校准数据、验证报告、运行时数据和WebSocket控制事件。Android可访问性(Accessibility)用于执行所选操作,必要时使用原始点击回退。该系统在36名学生志愿者中进行了短时患者辅助任务测试。评估中,36个凝视映射中有33个被提升为活动配置文件。平均静态平均误差为390.02像素,平均静态p95误差为789.09像素。BCI命令成功率:点击为89.58%,滚动为72.22%,后退为77.78%。Android层确认了234个已接受控制事件中的228个。平均可用性得分为4.21分(满分5分)。
**研究背景与问题**
智能手机已成为日常通信、信息获取、娱乐和社会参与的核心工具,但其交互界面主要依赖触摸手势、稳定手部控制和精确手指运动。对于严重运动障碍、上肢受限、瘫痪或随意运动减少的用户,这种交互模式难以独立使用。现有移动辅助工具(如语音访问、开关控制、扫描界面、屏幕阅读器和放大功能)在多数场景中有用,但未能完全解决所有交互需求。语音可能受疲劳、言语障碍或环境噪声影响,而基于开关的交互在重复选择任务中可能缓慢且费力。脑机接口(BCI)技术为非侵入式辅助交互提供了可能,但仍受限于用户特异性信号变异、疲劳、头戴设备接触质量和训练一致性。凝视追踪作为补充输入通道,能自然指示用户注意力区域,但存在“Midas触摸”问题(凝视不等于意图)。因此,研究人员提出将凝视与BCI融合,以分离空间选择与意图确认,实现更可靠的免手交互。
**研究内容与结论**
研究人员开发了一种混合凝视-BCI辅助智能手机交互系统,将移动凝视追踪与基于EEG的BCI命令触发相结合。系统通过Android应用程序实现凝视估计(使用前置摄像头、MediaPipe面部标志、TinyTrackerS TFLite模型、时间平滑和校准映射),BCI层基于Emotiv Cortex接收训练的心理命令(点击、滚动、后退),后端(FastAPI和MongoDB)管理配置文件、校准数据、验证报告和WebSocket控制事件,Android可访问性服务执行语义目标选择或原始点击回退。在36名学生志愿者的短时患者辅助任务评估中,33个凝视映射被提升为活动配置文件,平均静态均方误差为390.02像素,p95误差为789.09像素;BCI命令成功率:点击89.58%、滚动72.22%、后退77.78%;Android层确认了234个接受控制事件中的228个(确认率97.44%);平均可用性评分4.21/5。研究结论表明,系统在受控设置下可实现短时混合交互,但需进一步验证长期使用和临床适用性。该论文发表在《Biomimetics》。
**关键技术方法**
1. **凝视估计与校准管线**:基于Android前台服务,使用MediaPipe提取面部标志,裁剪面部区域输入TinyTrackerS TFLite模型(轻量级凝视估计模型),输出经一欧元时间平滑后,通过多项式映射(包含交叉项,采用Ridge回归,正则化参数λ=0.12)转换为屏幕坐标。校准分静态基线验证(25个目标)和旋转手机验证,合格阈值(平均误差≤420 px,p95误差≤900 px)后映射被提升至活动配置文件。
2. **BCI命令触发与过滤**:通过Emotiv Cortex API加载训练的心理命令(点击、滚动、后退),决策门采用三重条件:最小置信度≥0.60、连续三次检测、冷却间隔800–1000 ms。连续检测计数在置信度不足时重置,避免意外触发。
3. **后端与Android执行**:FastAPI后端管理凝视校准会话、验证报告、设备配置文件和WebSocket控制事件。Android可访问性服务查询界面元素树,基于凝视位置选择语义目标(考虑几何距离和边界接近度),并临时稳定目标选择。若无法找到语义目标,启用原始点击回退。样本队列来源:36名学生志愿者,在受控室内环境完成约55分钟个体测试。
**研究结果**
- **3.1 参与者级实验结果**:通过后端遥测、自动任务摘要、匿名问卷和纸质观察表记录,结果按凝视校准、BCI命令、Android执行和可用性分表呈现,为聚合分析提供基础。
- **3.2 聚合凝视校准与验证结果**:36名参与者中,23人需至少一次重新校准,33个映射被提升。平均静态均方误差为390.02 px,p95误差为789.09 px,均低于实验接受阈值。3名参与者使用最新会话局部映射和回退机制完成任务。
- **3.3 BCI命令与任务完成结果**:点击命令成功129/144次(89.58%),滚动成功26/36次(72.22%),后退成功28/36次(77.78%)。总体BCI命令成功183/216次(84.72%)。任务超时率:60/360步(16.67%),实际任务时长83–142秒(上限160秒)。
- **3.4 Android执行与交互可靠性**:收到234个接受控制事件,228个被确认(确认率97.44%)。点击类型执行中,101次通过语义可访问性点击完成,35次使用原始点击回退。凝视目标选择正确111/144次(77.08%)。
- **3.5 可用性结果**:五分量表平均得分4.21(范围2.6–4.8),表明大多数参与者对交互体验持积极评价,但未区分命令类型满意度。
**讨论与结论**
讨论部分指出,系统在受控设置下可行,但存在局限性:评估采用学生志愿者而非临床用户;任务短(最多160秒)且未模拟真实手机使用场景;凝视精度以像素报告而非视觉角度,且固定Ridge正则化参数未适配每会话数据;BCI命令成功率差异可能源于训练质量或心理分离度,但未进行神经生理学可分离性分析;决策门保守可能导致有效命令被拒;BCI训练耗时22分钟,日常使用成本高;安卓回退机制未分析意外激活。未来工作需延长测试时间、多设备验证、直接对比其他辅助方法、优化校准和BCI阈值、纳入真正辅助需求用户。
**结论翻译**:本文介绍了一种已实现的混合凝视-BCI系统,用于辅助智能手机交互。该系统结合了移动凝视追踪、凝视校准、基于EEG的命令触发、FastAPI后端路由、Android可访问性执行和简化的患者辅助应用。在36名学生志愿者的评估中,主要系统组件在短时受控任务中协同工作。大多数凝视映射被提升为活动配置文件,平均静态验证误差低于所选实验阈值。BCI命令结果显示点击、滚动和后退的成功率不同,其中点击命令在本协议中成功率最高。Android执行层显示出高确认率,而原始点击回退在语义目标执行不可用时仍有实用价值。可用性评分表明大多数参与者认为系统在测试中可理解且可用。然而,结果应视为早期可行性评估,而非临床验证。研究使用了学生志愿者、受控室内设置和短时交互序列。未来工作应在更长时间、更多手机型号以及真正辅助需求用户中测试系统,并进一步改进凝视校准稳定性、BCI命令分离性和Android界面语义目标选择的鲁棒性。