《Advanced Intelligent Systems》:Benchmarking Data-Driven Control of Octopus-Inspired Soft Arms in Underwater Environment
编辑推荐:
尽管经过十多年研究,章鱼仿生腱驱动软体臂在水下环境中仍然难以控制。占主导地位的数据驱动方法——强化学习(Reinforcement Learning, RL)和模仿学习(Imitation Learning, IL)——需要成千上万至数百万个训练样本,依赖特定
尽管经过十多年研究,章鱼仿生腱驱动软体臂在水下环境中仍然难以控制。占主导地位的数据驱动方法——强化学习(Reinforcement Learning, RL)和模仿学习(Imitation Learning, IL)——需要成千上万至数百万个训练样本,依赖特定任务的处理流程,并且很少基于共享基线进行评估,这使得可重复性和跨研究比较实际上非常困难。研究人员证明,仅通过精心设计数据收集策略和输入特征空间,就可以获得一种样本高效、可泛化且可重复的监督策略。研究人员提出了DS-Adjust,一种参数随机化的数据收集算法,可在数分钟内在物理机器人上产生平滑、加加速度有界的驱动信号,覆盖连续的速度区间,从而无需仿真框架。训练一次的策略可零样本泛化到多样化的目标任务跟踪与路径跟踪任务、主动水动力扰动、基于频率的域偏移以及随机性场景,在所有测试场景中实现了约为手臂特征长度1.3%–3.6%的误差。该流程已在三种不同的腱驱动软体臂上进行了水下和空气环境验证。消融研究表明,显式动作历史而非位置状态观测,是捕获这类机器人记忆相关粘弹性动力学的关键输入设计选择。与内部和外部类似解决方案的基准测试表明,该方案以比同类数据驱动解决方案低两到三个数量级的样本成本实现了具有竞争力的精度。
该研究发表于《Advanced Intelligent Systems》,针对水下环境中腱驱动章鱼仿生软体臂控制困难、现有数据驱动方法样本效率低、任务特化且缺乏共享基线的问题,提出了一套统一、可重复的数据收集、策略训练与系统评估流程。研究背景方面,软体臂因欠驱动、非线性材料特性和时变动力学而难以控制,水下环境进一步引入非定常水动力效应;传统RL和IL方法需要数十万至数百万次交互,且很少在共享任务和指标下评估,导致可重复性与跨研究比较困难。研究人员设计了DS-Adjust参数随机化数据收集算法,在物理机器人上直接采集平滑、加加速度有界的驱动数据,以约4000个物理样本训练一个基于长短期记忆(Long Short Term Memory, LSTM)的监督策略,实现目标跟踪和路径跟踪的零样本泛化,并对扰动、频率域偏移和传感器故障具有鲁棒性。该流程在三种不同构型的腱驱动软体臂上得到验证,样本成本比同类数据驱动方案低两到三个数量级,同时保持有竞争力的精度。
主要关键技术方法如下:研究人员采用DS-Adjust算法,在物理机器人上直接生成参数随机化的驱动序列,通过动态采样驱动上限、增量步长和保持步数,覆盖连续速度区间,避免仿真与真实差距;输入特征采用显式动作历史与期望目标组合,部署时对预测动作进行步长约束,实现闭环零样本控制;评估场景包括目标任务分布、路径任务分布、主动水动力扰动、频率域偏移以及噪声或部分故障编码器,每个任务重复三次以检验可重复性;消融研究结合Wilcoxon符号秩检验和Holm–Bonferroni校正进行统计验证;最后与内部和外部数据驱动及模型驱动方法进行基准比较。样本来源为三种物理软体臂平台,即单模块三纵向肌腱手臂、单模块三螺旋肌腱手臂和双模块六纵向肌腱手臂,分别在水下与空气环境中采集和测试,每类任务分布包含20个目标或路径,单次策略训练约需30分钟。
研究结果方面,总体跟踪性能显示,训练后的策略在无扰动水下环境中对两个随机目标分别达到平均稳态误差(Mean Steady State Error, MSSE)约为特征长度1.33%和3.11%的精度,总误差降低(Total Error Reduction, TER)超过87%;对三维螺旋路径跟踪,在无扰动和扰动条件下均达到约特征长度2.8%–3.6%的平均跟踪误差(Mean Tracking Error, MTE),且全部为无需重新训练的零样本表现。域偏移与扰动鲁棒性方面,当机器人驱动频率从2Hz提高到10Hz时,目标跟踪MSSE保持在12.3±1.6mm左右;在10Hz与水动力扰动同时存在时,MSSE为11.7±1.9mm,路径跟踪MTE约为10.21±4.48mm,表明策略可泛化到高频动态区间并在主动扰动下保持稳定。跨平台与环境泛化方面,针对螺旋肌腱手臂水下、螺旋肌腱手臂空气环境以及六纵向肌腱双模块手臂带噪声或部分故障编码器水下三种新设置,仅需按相同流程重新训练即可获得稳定性能;唯一的性能退化出现在噪声或部分故障编码器条件下,MSSE从约3%升至3.99%,该退化归因于闭环评估中输入特征被污染而非策略本身失效。输入特征消融研究方面,仅输入位置状态观测的策略MSSE约为150mm,比完整策略差约13倍;加入单个历史动作后误差约降低一半,但将位置历史替换为单个历史动作后MSSE降至24±3mm;完整采用显式动作历史与期望目标的策略MSSE为11.2±1.6mm。Wilcoxon符号秩检验表明,动作历史输入显著优于纯位置输入,且位置观测作为输入反而损害性能。基准对比方面,与内部和外部数据驱动方案相比,本工作以约4000个物理样本达到有竞争力精度,而同类方法样本量从1.2万到500万不等;模型驱动方法虽精度接近,但需要软体动力学数学建模专业知识和较复杂的复现流程。
讨论部分指出,零样本泛化并非偶然,而是DS-Adjust三项参数随机化共同作用的结果:动态变化的驱动上限避免构型空间重复采样;随机增量步长隐式覆盖连续速度区间,使单一固定频率数据集能够迁移到不同驱动频率;随机保持步数引入额外时间多样性,防止策略依赖固定驱动周期。与随机游走和随机目标两种最简数据收集方案相比,DS-Adjust产生更平滑、更有界、速度分布更多样的驱动,其每步加加速度最低,速度变异系数最高,从而保留并采样了软体臂固有的速度相关动力学。研究还强调,软体臂存在显著行为随机性,但该策略在多次独立重复试验中标准差保持较低,且到达目标后能够维持精度,说明闭环反馈足以抑制外界扰动。研究结论部分可概括为:本工作为水下环境腱驱动章鱼仿生软体臂提供了一种可重复、样本高效的数据驱动控制流程。DS-Adjust算法在物理平台上生成平滑、加加速度有界且覆盖连续速度区间的驱动,通过参数随机化隐式编码频率相关动力学,使标准监督策略无需重新训练或在线优化即可零样本泛化到任务分布、水动力扰动和域偏移。关键发现有三点:其一,数据采集阶段的构型空间多样性比模型架构或训练流程对泛化影响更大;其二,输入特征中的显式动作历史是捕获此类粘弹性软体臂记忆相关动力学的决定性因素,位置状态观测反而起反作用;其三,该流程以远低于现有数据驱动方法的样本成本实现竞争性精度,并能在多个平台和环境间保持可重复性。未来工作将扩展至全身与形状控制、分布式协调和任务空间力控制,并探索自适应特征编码及更复杂水动力环境的评估。