综述:实时基于视觉的老年人跌倒检测系统:系统综述

《Sensors》:Real-Time Vision-Based Fall Detection Systems for the Elderly: A Systematic Review

【字体: 时间:2026年08月11日 来源:Sensors 4.0

编辑推荐:

  跌倒对各年龄段老年人构成威胁,使医疗系统超负荷,并降低生活质量。基于视觉的跌倒检测近期通过深度学习取得了进展,然而大多数提出的模型缺乏在物理硬件上的验证,且未报告推理时间指标。本研究遵循PRISMA和Kitchenham指南进行系统综述,旨在填补这一空白。研究

  
跌倒对各年龄段老年人构成威胁,使医疗系统超负荷,并降低生活质量。基于视觉的跌倒检测近期通过深度学习取得了进展,然而大多数提出的模型缺乏在物理硬件上的验证,且未报告推理时间指标。本研究遵循PRISMA和Kitchenham指南进行系统综述,旨在填补这一空白。研究人员专注于那些在指定设备上报告推理速度的基于视觉的系统。研究人员基于真实跌倒中关键跌倒阶段报告的持续时间,使用10帧每秒(fps)的阈值来定义实时性能。从IEEE Xplore、ACM Digital Library、Web of Science核心合集和PubMed(2019–2024年)的588条记录中,仅有11篇符合所有纳入标准,这凸显了有多少研究在物理硬件上验证了实时性能。研究结果表明,基于卷积神经网络(CNN)的架构主导了算法选择,边缘设备主导了部署平台,而优化仍然是受约束硬件上实现实时推理的核心。在这些研究中,研究人员识别出两个持续存在的局限:缺乏与老年人进行的真实世界测试,以及依赖使用模拟跌倒的小型、受控数据集。
1. Introduction
引言部分指出,65岁及以上人口比例在1974年至2024年间几乎翻倍,并将在2074年再次翻倍。虽然寿命延长反映了社会进步,但也增加了医疗系统的负担,推动了过去二十年老年健康研究的稳定增长。跌倒检测是这一趋势中尤为活跃的领域。超过30%的老年人跌倒会导致严重伤害,如髋部骨折或脑震荡,许多甚至导致死亡。有效的跌倒检测系统可以降低这些伤害率并减轻医疗系统压力。Mubashir等人将跌倒检测系统分为三类:可穿戴式、环境式和基于视觉的。可穿戴系统使用加速计和陀螺仪,但存在电池寿命短、需定期维护以及老年人忘记佩戴等问题。环境系统依赖环境传感器,但安装成本高且依赖特定环境设置。基于视觉的系统使用摄像头,避免了可穿戴设备的依从性和维护问题以及环境系统的安装限制,但存在隐私问题,且性能取决于摄像头位置、光照和遮挡条件。基于视觉的跌倒检测日益依赖深度学习模型,如卷积神经网络(CNN)和长短期记忆网络(LSTM),这些模型直接从原始数据中提取表征,无需手动特征工程,提高了跨场景和受试者的适应性。由于跌倒可能导致严重伤害或死亡,系统必须低延迟运行。然而,现有模型主要在离线设置下评估,缺乏实时部署或在线数据传输,通常未解决光照变化或摄像头位置等实际挑战。本综述旨在填补这一空白,系统性地审查在物理硬件上展示实时推理并报告可测量部署指标(如帧每秒fps)的基于视觉的跌倒检测系统。文章结构如下:首先总结先前综述,然后提出研究问题并概述方法,包括数据源、搜索策略和选择标准,接着描述质量评估过程,结果部分回答每个研究问题,最后讨论关键发现并指出未来工作方向。

2. Related Work
相关工作部分总结了近期关于跌倒检测的综述文章,并指出本综述所填补的空白。Islam等人将基于深度学习的跌倒检测系统分为三类:基于CNN的、基于LSTM的和基于自编码器的系统,并总结了所用数据集,强调了深度学习跌倒检测的挑战,但未评估设备特定约束或推理时间指标。Wang等人调查了跌倒检测系统的完整数据管道,发现22项基于视觉的研究中仅有一项展示了实时警报传输,尽管40.9%声称具有实时性能但缺乏实证证据。Gutiérrez等人审查了2015年至2020年间发表的基于视觉的跌倒检测系统,分析了系统架构、输入信号和分类方法,强调了数据集碎片化以及研究与实际应用之间的差距。Alam等人综述了用于辅助生活的基于深度学习的跌倒检测,按模型类型分类,分析了实现细节、评估指标和优化参数,指出了多人和遮挡场景处理能力差、隐私考虑有限以及安全措施薄弱等限制,推荐边缘计算以增强安全性,但未分析特定边缘设备或实时推理所需的优化权衡。Gaya-Morey等人进行了系统综述,涵盖跌倒检测和老年人人类活动识别,涉及深度学习与实际部署的研究问题,包括硬件需求和隐私问题,发现50%的研究缺乏隐私保护措施,强调了基于部署条件选择模型和数据集可用性对可重复性的重要性,但主要关注输入硬件和隐私,而非推理性能或处理优化。表1总结了这些综述。尽管这些研究讨论了基于视觉的跌倒检测的各个方面,但只有Gaya-Morey等人采用了系统综述方法,且其范围包括跌倒检测和人类活动识别。Islam等人一般性地讨论了实时使用,但未评估设备特定约束或推理时间指标。本综述的区别在于:它专门关注具有验证实时性能的基于视觉的跌倒检测系统,不仅审查所用算法,还审查部署硬件、优化策略及其引入的权衡。本综述中使用的“基于视觉”是指任何主要输入来自一个或多个摄像头的空间分辨图像或视频数据的系统,包括RGB、RGB-D、热成像和事件摄像头,排除了环境传感器(如被动红外探测器)。

3. Methods
方法部分采用了Kitchenham系统文献综述方法,并遵循PRISMA 2020指南报告发现。研究预先定义了研究问题、搜索策略和纳入/排除标准,本节完整报告。研究问题包括:RQ1:实时基于视觉的跌倒检测系统中最常实现哪些算法?RQ2:用于基于视觉的跌倒检测系统的部署平台有哪些,这些选择如何影响实时性能?RQ3:在基于视觉的跌倒检测系统中应用了哪些优化策略来实现实时推理,它们引入了哪些权衡?数据源选择了四个数据库:IEEE Xplore、ACM Digital Library、PubMed和Web of Science。搜索策略通过将通用短语(“fall detection”, “fall accident”)与技术术语(“deep learning”, “CNN”, “machine learning”)和部署相关关键词(“real-time”, “deployment”)配对,并使用NOT运算符排除包含‘radar’, ‘accelerometer’, ‘gyroscope’, ‘wearable’或‘WiFi’的标题,同时排除综述文章。搜索仅限于标题字段,最终返回588条记录。研究选择由两位作者独立进行,根据预先定义的纳入和排除标准筛选。语言仅限于英文,方法仅保留使用机器学习或深度学习的基于视觉的工作,排除结合其他模态的融合系统,目标人群仅针对老年人跌倒检测,排除其他人群,目标仅针对跌倒检测系统,排除活动识别或跌倒风险评估,实时能力要求报告至少10帧每秒(fps)的推理速度,该阈值基于真实跌倒中关键跌倒阶段平均持续约2秒的报道。质量评估由两位作者独立进行,标准包括:实现细节、比较评估和评估透明度,每项研究得分至少为2分才能保留。

4. Results
结果部分,在去除重复、应用纳入标准并进行质量评估后,从最初的588篇文章中确定了11项研究。表3提供了这些研究的概述。针对RQ1(算法):所有11项研究均使用基于CNN的模型,分为三类:CNN分类器、CNN目标检测器和混合流水线。CNN分类器进行端到端二分类,输入类型包括基于Kinect深度数据的骨架特征、合成运动编码的单帧RGB图像以及来自动态视觉传感器(DVS)的事件时空立方体。目标检测器将跌倒检测视为目标检测任务,使用轻量级模型如NanoDet-Lite、YOLO变体和SSD-MobileNetV1,这些模型具有MobileNetV1、ShuffleNet或微型架构等轻量级骨干网络,以适应边缘部署的计算约束。混合方法将CNN用于中间任务(如姿态估计或特征提取),再由LSTM或基于规则的辅助模型做出最终决策。针对RQ2(部署平台):11项研究中有9项选择边缘设备作为主要硬件平台,其中5项在NVIDIA Jetson开发板上执行推理,4项使用仅CPU的边缘设备,包括Raspberry Pi、LattePanda和一块ARM开发板,其余2项部署在GPU加速的台式机上。Jetson开发板配备GPU,而Raspberry Pi和LattePanda依赖CPU推理,需要轻量级模型和进一步优化。台式GPU报告了最高吞吐量,但功耗和物理尺寸使其不适合家庭部署。所有平台上的检测精度在84%到99%之间,由于数据集、模型、设备和评估协议的巨大异质性,无法建立推理速度与精度之间的关系。针对RQ3(优化策略与权衡):研究识别出三类优化策略:模型剪枝与压缩、推理框架选择以及硬件特定加速。模型剪枝方面,Tsai等人将网络从490万参数剪枝至3.5万,在Jetson TX2上达到15帧每秒(fps)且保持精度;Prasad等人使用常数稀疏度剪枝,将3D-CNN的计算量减少约30至46倍,但内存占用约翻倍。推理框架选择方面,Chen等人使用ncnn在Raspberry Pi 4B上达到22.03帧每秒(fps);Hwang等人将PyTorch模型转换为ONNX,在RTX 3080上将吞吐量从162提升至204帧每秒(fps)。硬件特定加速方面,Tohidypour等人应用了TensorRT INT8量化、虚拟内存和线性内存分配以及GStreamer流水线,将启动时间从17分钟降至2分钟以下,推理达到30帧每秒(fps)。这些研究通常未比较优化前后的检测性能,仅Tsai等人明确报告剪枝保持了精度。

5. Discussion
讨论部分首先分析了数据集特征与局限。所有可验证的数据集均在受控环境中记录,且不包含老年人:所有跌倒均由年轻志愿者模拟。这引发了关于模型对老年人泛化能力的疑问,因为老年人的跌倒动态在速度、姿势和保护性反应上有所不同。NTU RGB+D是一个通用动作识别数据集,跌倒作为六十个动作类别之一;其余数据集专为跌倒检测构建,包含跌倒和类似跌倒的动作(如坐下、躺下或蹲下)。一个数据集(AIHub Airport)无法验证,其超链接失效。Prasad等人未收集原生事件记录,而是将RGB视频转换为事件流,凸显了大规模动态视觉传感器(DVS)数据集的稀缺性。跌倒事件本质上是罕见事件,导致数据集不平衡,增加了过拟合风险。研究者指出,数据集仅覆盖少数场景和受试者,可能导致模型学习背景模式而非跌倒动态;真实条件如部分遮挡或模糊身体部位很少出现在训练数据中;在基准数据集上训练的模型无法泛化到真实环境中的未见动作。研究还发现,大多数研究未报告详细的摄像头规格,建议未来研究报告此类信息并探索具有板载处理能力的摄像头。未来工作应优先考虑包含老年人在真实家庭环境中进行跌倒和日常活动的数据集,并利用合成数据生成和迁移学习来扩展训练数据多样性。评估协议方面,各研究差异很大,多数未定义拆分策略,未进行跨数据集评估,共享基准和评估协议将提高可重复性和可比性。隐私与警报机制方面,四项研究采用了保护隐私的输入模态或处理策略:使用动态视觉传感器(DVS)、Kinect深度数据或板载推理并删除历史帧。仅两项研究集成了警报系统,但未报告通知延迟、严重性分级或警报可靠性。总体而言,警报仍是基于视觉的跌倒检测系统中未充分探索的组件。研究从性能、功耗和价格数据中识别出三种部署概况:低成本家庭部署(Raspberry Pi)、平衡性能与便携性(NVIDIA Jetson)和高吞吐量但不适合家庭部署(台式GPU)。本综述的局限包括:纳入标准要求报告推理速度,这从588项研究减少至11项,可能反映了该子集而非整个领域的空白;2024年无一项研究符合所有纳入标准;搜索截止于2024年底,未包含2025年及之后的研究。

6. Conclusions
结论部分总结了本综述:从588条记录中仅有11项符合所有纳入标准,证实了在基于视觉的跌倒检测领域中,经过部署验证的系统仍然罕见。三个主要发现:第一,基于CNN的架构主导算法选择,常使用轻量级骨干网络支持边缘部署;第二,边缘设备主导部署平台,包括NVIDIA Jetson、Raspberry Pi、LattePanda和基于ARM的硬件;第三,受限设备上的实时推理依赖于模型剪枝、量化、推理框架选择和硬件特定加速等优化策略,但仅有一项研究明确报告了优化是否保持了检测精度。此外,研究识别出两个更广泛的局限:所有研究未在真实环境中对老年人进行测试,且主要依赖使用模拟跌倒的小型受控数据集,这降低了当前系统泛化到实际老年护理环境的信心。鼓励研究人员在报告检测精度的同时报告部署指标(如推理延迟和内存使用),该领域需要跨数据集评估的基准,最好在真实环境中使用老年人,并利用迁移学习从通用动作识别模型中获益。区分跌倒与视觉上相似的动作(如坐下或蹲下)仍是一个关键挑战,高效的视觉语言模型可能改善场景理解,但其内存和计算需求对资源受限设备构成挑战。这些步骤将推动基于视觉的跌倒检测从离线基准向实际老年护理部署迈进。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号