《Robotics》:Collision Avoidance with Deep Learning in a Digital Twin for Industrial Collaborative Robot Manipulation
编辑推荐:
安全的人机协作仍是制造业中的关键挑战。传统安全方法(如防护笼和接近传感器)往往不足以应对动态的人机交互。本文提出了一种基于数字孪生(Digital Twin, DT)的碰撞避免框架,用于工业协作机器人操控。该系统集成了RGB-D感知、基于Ultralytics
安全的人机协作仍是制造业中的关键挑战。传统安全方法(如防护笼和接近传感器)往往不足以应对动态的人机交互。本文提出了一种基于数字孪生(Digital Twin, DT)的碰撞避免框架,用于工业协作机器人操控。该系统集成了RGB-D感知、基于Ultralytics YOLO26s-pose的人体姿态估计、基于卡尔曼滤波(Kalman filter)的3D手臂跟踪、短期运动预测以及基于二次规划(QP)的反应式运动控制。从RGB-D图像中检测到的人体手臂关键点被重建为3D坐标,变换到机器人基坐标系,并在临时遮挡期间通过带运动学约束的卡尔曼滤波进行跟踪。通过评估预测的人机间隙来触发减速、停止或避碰指令。该框架在UR10e机器人、Intel RealSense D435相机、Unity3D数字孪生和ROS通信环境下实现。受控实验室实验证明了该集成框架在跟踪人体手臂运动、预测接近风险和触发保护性机器人响应方面的概念可行性。研究结果并未表明其在复杂工业或多参与者环境中的部署就绪性。
### 研究背景与问题
工业环境中人机协作的安全性一直是制造领域的关键挑战。尽管协作机器人(cobot)日益普及,但工作场所事故仍时有发生。传统安全方案如物理围栏和接近传感器限制了系统灵活性和人机交互的紧密性。数字孪生(Digital Twin, DT)技术通过实时虚拟建模为安全监控提供了新途径,但现有DT应用多集中于可视化、状态监测和预测维护,鲜少涉及安全关键的人机协作决策。当前面临三个实际问题:RGB-D人体姿态测量在遮挡时易丢失或失真;仅依赖当前距离的安全决策存在响应滞后;感知到的风险难以转化为物理上可行的机器人控制指令。本研究旨在构建一个闭环感知-预测-控制架构,将深度学习方法、卡尔曼滤波、短时运动预测和优化控制集成到DT框架中,实现主动安全干预。
### 研究内容与结论
研究人员提出了一个集成框架,首先通过RGB-D相机获取图像,使用Ultralytics YOLO26s-pose模型估计人体手臂2D关键点,结合深度信息重建3D坐标,并利用眼对手(eye-to-hand)标定矩阵变换至机器人基坐标系。为应对测量噪声和临时遮挡,采用恒定速度卡尔曼滤波器(CV-Kalman)结合运动学约束(上臂和前臂长度恒定、手部位置由前臂方向推断)进行连续状态估计,并对短期运动进行预测。预测的人手与机器人连杆间的最小距离(即预测间隙)用于触发减速、停止或避碰指令。控制器采用基于NEO(二次规划)的反应式运动控制(QP/NEO),在满足避障、关节限位和自碰撞约束的同时,生成可行的关节速度指令。实验在UR10e机器人、Intel RealSense D435相机、Unity3D数字孪生和ROS通信环境下进行,验证了系统的可行性。结果表明,集成框架在临时测量丢失期间能维持手臂轨迹估计,预测间隙能提前反映人机接近风险,并触发分级保护响应。与直接RGB-D基线相比,集成配置提高了手臂跟踪可用性(左手96.7%,右手97.5%),降低了加速度和加速度变化率均方根(RMS),减少了机器人停止时间占比(从20.66%降至7.06%),并提高了平均速度指令(从33.95%升至70.21%)。受控遮挡实验中,预测传播方法在1.0s和1.5s遮挡下均优于零阶保持(ZOH)参考,平均均方根误差(RMSE)降低。在线计算总耗时分别为11.17ms(无预测)和24.55ms(有预测),满足30Hz相机流要求,但未计入ROS通信和驱动器延迟。该研究发表于《Robotics》期刊,证明了概念可行性,但未达到工业部署就绪水平。
### 主要技术方法
研究人员采用了以下关键方法:(1)RGB-D感知与姿态估计:使用Ultralytics YOLO26s-pose模型从RGB-D图像中获取2D关键点,结合深度图重建3D坐标;(2)眼对手标定:采用Tsai–Lenz算法计算相机与机器人基坐标系间的变换矩阵;(3)卡尔曼滤波与运动学约束:对每个3D关节使用恒定速度卡尔曼滤波器,并施加长度约束和手部推断;(4)短期运动预测:基于滤波后的位置、速度和衰减加速度预测未来手臂位置,并计算预测间隙;(5)QP/NEO反应式控制:构建二次规划问题,最小化关节速度范数,同时满足避障、关节限位等不等式约束。实验样本为单参与者受控实验室环境,未涉及多参与者。
### 结果与讨论
**4.1 实验设置**
实验采用UR10e六自由度机械臂、Intel RealSense D435相机,工作站配备Intel Xeon Gold 6234 CPU、64GB RAM和NVIDIA Quadro RTX 6000 GPU。数字孪生在Unity3D 2021.3.18f1中实现,姿态估计使用YOLO26s-pose检查点,机器人控制通过ROS Melodic管理。
**4.2 相机标定精度**
采用眼对手配置,使用13×8棋盘格(方格尺寸20mm)标定,通过15个机器人位姿采集数据,并用Tsai–Lenz算法求解。独立验证集(10张图像)的平移误差中位数小于对应阈值,旋转误差中位数约0.515°。除两个位姿外,误差较小,表明标定精度足够。
**4.3 人体手臂骨架估计结果**
实验参数包括:YOLO26s-pose输入尺寸、检测阈值0.25、关键点阈值0.25,深度窗口中值接受范围0.25–3.50m,局部标准差阈值0.12m。卡尔曼滤波器初始协方差为0.05,预测超时1.5s。在测量丢失期间,预测模式占试验时间26.8%(左手)和26.6%(右手),总可用性达96.7%和97.5%。受控遮挡下,左手RMSE为0.292m,右手为0.167m。预测间隙曲线能提前反映距离减小趋势,系统在警告/危险区域约占用试验的相应比例,停止区域约对应比例,平均速度指令约相应值。
**4.4 受控遮挡恢复比较与解释限制**
对比ZOH和提出的方法,在1.0s和1.5s遮挡下,于低速、中速、高速三种运动速度下,所提方法均降低了RMSE,平均RMSE从0.231m降至0.184m(1.0s)和从0.322m降至0.217m(1.5s)。0.25m安全阈值是基于手臂平均速度0.650m/s和经验不确定性选择的,0.5s预测水平对应约0.325m位移,允许提前反应。
**4.5 人机安全响应**
实时视图和数字孪生同步显示了关键点检测和距离监控。当距离低于0.25m阈值时,最近关节标记为红色并触发停止。实验验证了物理机器人、数字孪生和控制系统间的信息交换。
**4.6 反应式运动控制与避碰**
仿真与物理执行对比表明,QP控制器生成的轨迹在避开虚拟障碍物后成功引导末端执行器到达目标。定性一致性支持了优化公式的可行性。
**4.7 集成配置比较与计算延迟**
在线感知-预测流水线在未启用预测时总计11.17ms,启用后24.55ms,预测增加13.38ms,主要由间隙评估和运动预测贡献。对应更新率约89.5Hz和40.7Hz。离线QP/NEO轨迹生成时间为85.10±28.13ms,未计入在线周期。研究未测量ROS通信和驱动器延迟,因此不能证明完整的端到端30Hz性能。
### 讨论与结论
本研究提出的框架将RGB-D姿态估计、卡尔曼滤波、短期预测和QP控制耦合到数字孪生中,实现了主动安全干预。受控实验证明了概念可行性,但存在局限:未量化各模块独立贡献;预测仅与无预测和ZOH比较;未评估端到端延迟、末端精度、任务成功率等。因此,该研究是可行性验证而非工业部署就绪。未来将在更复杂环境(多参与者、动态遮挡、变光照)中评估替代预测器,并进行模块消融和完整延迟测量。研究结论为:集成框架在临时测量丢失下维持手臂轨迹,预测间隙提前触发保护响应,在线计算满足实时性要求,但需进一步验证工业适用性。