综述:AI驱动的四足机器人:从基础运动到高级仿生行为

《Frontiers in Neurorobotics》:AI-driven quadruped robots: from fundamental locomotion to advanced biomimetic behaviors

【字体: 时间:2026年07月24日 来源:Frontiers in Neurorobotics 3.5

编辑推荐:

  四足机器人因其能够穿越不平坦地形、支持野外部署以及执行轮式或履带式平台难以完成的任务而受到越来越多的关注。人工智能(AI)的最新进展进一步扩展了它们的能力,从手动设计的步态控制转向基于学习的运动、感知感知自适应、动态运动技能、自主恢复、操作、能量感知运行、故障

  
四足机器人因其能够穿越不平坦地形、支持野外部署以及执行轮式或履带式平台难以完成的任务而受到越来越多的关注。人工智能(AI)的最新进展进一步扩展了它们的能力,从手动设计的步态控制转向基于学习的运动、感知感知自适应、动态运动技能、自主恢复、操作、能量感知运行、故障诊断和人机交互。然而,关于AI驱动四足机器人技术的文献分布在不同的技术主题、机器人平台、验证设置和性能指标上,使得难以评估不同方法的成熟度和实用价值。为满足这一需求,本综述提供了以AI为中心且面向部署的四足机器人技术概述。通过使用Web of Science、IEEE Xplore、ACM数字图书馆、ScienceDirect和SpringerLink进行了系统性文献检索,涵盖了大约2000年至2025年发表的研究。经过筛选和资格评估,纳入了287项研究进行详细综述。本综述首先考察了AI驱动的运动,包括强化学习(RL)、非RL机器学习方法、基于模型的方法和混合策略,关注鲁棒性、仿真到现实迁移、传感器使用、计算需求和硬件验证。然后总结了AI支持的高级行为,包括跳跃、跌倒预防和恢复以及物体操作,重点关注报告的定量性能、冲击管理和可靠性。最后,讨论了影响实际部署的系统级主题,包括故障诊断、高效节能控制、共享自主性、信任感知和可解释交互以及安全感知的人机协作。通过根据机器人能力、验证成熟度和部署挑战组织文献,本综述有助于阐明AI驱动四足机器人技术的当前进展、局限性和未来方向。
**1 Introduction**
介绍了四足机器人因其在不平坦地形上的稳定性、野外部署能力及执行复杂任务的优势而受到关注。人工智能(AI)尤其是深度学习(DL)和强化学习(RL)的进步,使其从手动步态控制转向基于学习的运动(locomotion)、感知自适应、动态技能、自主恢复、操作、能量感知、故障诊断和人机交互(HRI)。新兴方向包括视觉-语言-动作(VLA)建模,如CognitiveDog、QUAR-VLA等系统,但低层运动学习仍较成熟,VLA在可靠性、延迟、计算和安全约束方面尚存挑战。

**1.1 Related review papers**
比较了12篇代表性综述,涵盖地形适应性、腿部结构、控制方法(如模型预测控制MPC、RL)、硬件进展等,指出现有综述多聚焦单体领域,缺乏对AI驱动四足机器人整体能力的系统整合。

**1.2 Purpose of this review**
提供以AI为中心、面向部署的综述,按机器人能力(运动、跳跃、跌倒恢复、物体操作、故障诊断、能效、HRI)组织文献,比较算法选择(无模型RL、基于模型方法、非RL机器学习),关注验证成熟度、传感器使用、鲁棒性、计算需求及定量性能,旨在厘清当前进展、局限和未来方向。

**2 Methodology**
**2.1 Search strategy and boolean queries**
搜索2000-2026年文献,使用Web of Science、IEEE Xplore等数据库,采用核心查询(“quadruped robot*” AND “artificial intelligence”等)及应用查询(跳跃、跌倒恢复、物体操作等)和RL特定查询。

**2.2 Screening process**
设定纳入标准(聚焦四足或相关腿式系统、包含AI/RL/感知组件、提供实证数据或硬件实验、同行评审)和排除标准(纯概念、不相关、重复、无法获取全文)。最终纳入287篇。

**2.3 Quality assessment and evidence coding**
采用分类质量评估框架,按验证成熟度(V0-V2)、可复现性(R0-R2)、鲁棒性评估(B0-B2)、定量报告(Q0-Q2)、部署相关性(D0-D2)编码,帮助读者判断方法成熟度。

**3 Quadruped locomotion**
**3.1 Deep reinforcement learning methods**
深度强化学习(DRL)通过试错交互学习步态策略,但面临安全收集经验、仿真到现实迁移(sim-to-real)、奖励设计、稳定性等挑战。本节综述了奖励塑造、动作空间设计、迁移学习、模型增强等主题。

**3.1.1 Comparative perspective on major RL algorithms**
比较了PPO(on-policy,稳定但样本密集)、SAC(off-policy,样本高效但对奖励敏感)、TD3/DDPG(确定性策略,适合连续控制)、模型辅助RL(可解释但依赖模型精度)、进化策略(简单但效率低)等范式,强调在四足机器人中的典型应用(鲁棒步态、跳跃、操作、能量优化等)。

**3.1.2 Reward function design and tuning**
奖励函数设计决定步态质量。常用惩罚项(如关节力矩、碰撞、倾斜)引导稳定行走;模仿学习(Imitation Learning)通过奖励匹配参考运动(如动物运动捕捉)获得自然步态。课程学习(Curriculum Learning)逐步增加难度;教师-学生(Teacher-Student)框架利用特权信息训练,再蒸馏到学生策略;约束RL(Constrained RL)确保安全。

**3.1.3 Sim-to-real transfer and domain randomization**
由于实物训练风险高,多采用物理仿真训练后部署。域随机化(Domain Randomization)随机化仿真参数(质量、摩擦、电机增益等)增强鲁棒性;系统辨识(System Identification)精确校准仿真参数;结合在线自适应和混合方法(如贝叶斯优化)进一步改善迁移。动作空间设计(如基于中枢模式发生器CPG的参数化)影响迁移效果。

**3.1.4 Model-based enhancements and alternative optimization**
基于模型的方法(如质心模型、模型预测控制MPC、混合RL-OC、CPG)提高样本效率和可解释性。进化策略(ES)和增强随机搜索(ARS)作为梯度无关的替代方案,避免局部最优。无监督RL通过内在目标发现多样行为,指向通用策略。

**3.2 Other AI methods**
除RL外,其他AI方法包括:MPC与卷积神经网络(CNN)结合预测地形参数;高斯过程潜变量模型(GP-LVM)处理触觉数据;多层感知机(MLP)预测接触力;交叉模态自监督学习预测摩擦和刚度;机器视觉与人工神经网络用于腿足校准。这些方法在感知与自适应方面提供实际增益。

**4 Advanced motion capabilities**
**4.1 Jumping**
**4.1.1 Trajectory optimization and motion planning**
早期采用梯度优化、混合整数凸规划等离线规划跳跃轨迹,但计算慢。元启发式方法(如差分进化DE)实现3D能量最优轨迹;在线规划框架(如DLC)结合DE、拉丁超立方采样和构型空间剪枝,实现近实时跳跃重规划。层次规划将跳跃嵌入长距离运动,利用学习分类器选择可行跳跃。

**4.1.2 Control algorithms and stabilization strategies**
生物启发控制(如CPG)产生鲁棒节律跳跃;弹簧负载倒立摆(SLIP)模型调节腿刚度。基于模型的先进控制(如Port-Hamiltonian框架与IDA-PBC)确保能量整形和稳定极限环。辅助执行器(如反作用轮)用于空中姿态控制,改善着陆精度。

**4.1.3 Reinforcement learning for jumping locomotion**
无模型DRL(如SAC)通过两阶段训练(起飞、飞行/着陆)和目标引导奖励实现定向跳跃;结合好奇心模块增强探索。混合方法将轨迹优化与RL结合,学习跟踪和适应轨迹的反馈策略,对扰动和建模误差鲁棒,实现零迁移硬件部署。

**4.1.4 Perception and high-level planning integration**
集成深度相机或激光雷达(LiDAR)构建高程图,高层规划器选择跳跃时机和轨迹;部分可观测马尔可夫决策过程(POMDP)处理传感器噪声和不确定性,提升鲁棒性。

**4.2 Falling prevention and recovery**
**4.2.1 Fall prediction and proactive balance control**
基于可捕获性(Capturability)的预测算法以95%准确率提前0.4秒预警跌倒;模型预测控制(MPC)优化未来落脚点和质心运动;动态步态稳定方法实时调整落脚位置。Guardians as You Fall框架通过监督学习检测不稳定姿态,主动触发安全跌倒控制器。

**4.2.2 Safe falling and mid-air landing control**
接触隐式轨迹优化规划全身轨迹,减少冲击速度(减少3倍)。反应式着陆控制器基于变高度SLIP模型实时优化落脚。主动翻滚策略(如GYF)将机器人引导至安全姿态。附加自由度(如手臂)用于缓冲;仿生空中重定向(如猫翻转反射)通过摆腿实现零角动量旋转。

**4.2.3 Post-fall recovery and self-righting**
基于无模型DRL的恢复策略学习利用任意接触点重新站立,无需预定义序列。分层学习(如GYF)在安全倒下后执行站起来策略。轮腿协调进一步降低关节扭矩消耗。

**4.3 Object manipulation**
**4.3.1 Reinforcement learning for quadruped manipulation**
DRL训练腿作为操作器(如Pedipulate系统),实现足部跟踪目标位置,自动发现支撑调整。干扰预测控制结合RL估计操作器对平衡的影响并补偿。

**4.3.2 Imitation learning and demonstration**
遥操作映射人类手臂运动到四足机器人手臂,收集演示用于模仿学习。

**4.3.3 Hierarchical and multi-modal learning strategies**
层次RL框架分离足部操作和稳定行为,由高层协调器集成。多模态学习融合视觉和本体感觉,实现端到端感知操作,但尚未完全成熟。

**5 Reliability, efficiency, and interaction**
**5.1 Human-robot interaction (HRI)**
**5.1.1 Dynamic gesture teleoperation**
基于CNN的动态手势识别实现直观遥操作;惯性测量单元(IMU)可穿戴设备提供物理引导。

**5.1.2 LLM-driven expressive motion generation**
大语言模型(LLM)根据文本输入生成机器人手势和运动,增强表达力和非编程交互。

**5.1.3 Adaptive proxemics and spatial interaction**
基于深度学习的行人检测和跟踪,结合黄金比例舒适区算法和速度轮廓,调节社交距离。

**5.1.4 Human stress response and perceived safety**
通过心电图(ECG)和皮肤电活动(EDA)信号分析,结合机器学习分类应激反应;行为建模分析机器人姿态对感知安全的影响。

**5.1.5 Multimodal language–vision–action systems**
CognitiveDog平台融合语言指令和视觉场景生成导航或操作动作;增强现实(AR)界面可视化机器人意图和路径,降低认知负荷。共享自主性结合意图预测、信任感知交互、可解释AI和安全管理。

**5.2 Fault diagnosis and recovery**
支持向量机(SVM)用于步态模式识别;信息熵(IE)、相关向量机(RVM)和高斯扰动布谷鸟搜索算法(GCS)构成故障诊断框架。深度学习(如噪声激励生成对抗网络NE-GAN、CNN-GRU-Attention混合网络)提取时空特征。DreamFLEX等学习型控制器实现容错运动。

**5.3 Energy efficiency**
通过RL添加惩罚项(关节力矩、速度、功率)优化能耗。层次控制器调整支撑比;Policy Search Transfer Optimization (PSTO) 和DDPG方法最小化能耗;步态启发RL和足部奖励鼓励高效模式。能效需与速度、地形、负载、电池状态和热约束共同评估。

**6 Challenges and future directions**
**6.1 Further closing the sim-to-real gap**
需要在线自适应和动态域适应算法,如元学习(Meta-RL)学习仿真动力学先验,以适应复杂行为和环境变化。

**6.2 Integration of perception and locomotion**
多模态传感器融合(视觉、LiDAR、触觉)需建模传感器延迟和噪声,通过特权训练引导鲁棒策略。

**6.3 Generalization and multi-task learning**
多技能集成需要技能库、元学习、层次强化学习(HRL)和基础模型训练,实现跨任务泛化。

**6.4 Sample efficiency and real-world training**
提高样本效率,发展约束RL和安全探索,利用云训练和仿真-物理反馈循环,结合贝叶斯优化进行安全策略微调。

**6.5 Scaling to extreme environments**
极端环境(高温、辐射、低重力)要求超可靠自主和高效运动,需要能量优化策略和长视距风险感知规划,最小化人为干预。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号