受生物启发的相位感知技能图用于具备可提示控制的鲁棒长程机器人操作

《Biomimetics》:Bio-Inspired Phase-Aware Skill Graph for Robust Long-Horizon Robotic Manipulation with Promptable Control

【字体: 时间:2026年09月04日 来源:Biomimetics 4.2

编辑推荐:

  长程机器人操作需要在不确定性下协调多个运动基元(motor primitive),尤其在富接触与动态变化环境中。现有端到端视觉运动策略(visuomotor policy)常缺乏显式时间结构,导致执行脆弱且扰动后恢复能力有限。受生物运动控制中通过相位分解与反馈

  
长程机器人操作需要在不确定性下协调多个运动基元(motor primitive),尤其在富接触与动态变化环境中。现有端到端视觉运动策略(visuomotor policy)常缺乏显式时间结构,导致执行脆弱且扰动后恢复能力有限。受生物运动控制中通过相位分解与反馈依赖转移组织可复用基元的启发,研究人员提出一种生物启发的相位感知框架,将执行表示为基于感知的运动相位间的结构化转移。该框架集成三模块:多模态相位与基元检测器(Multimodal Phase-and-Primitive Detector, PPD),从视觉、本体感知与力–力矩信号中提取语义与物理一致的相位;多模态感知技能图(Multimodal Perception Skill Graph, MPSG),编码可行相位转移并支持跳过、回滚与恢复;可提示相位控制(Promptable Phase Control, PPC),将语言指令转换为图级排序约束以实现任务重排而无需重训底层策略。在四项多阶段任务上的实验表明鲁棒性提升,受扰条件下平均成功率从25.0%提升至73.8%,相对单体化Action Chunking with Transformers(ACT)基线。
研究背景与动机
长程机器人操作需在接触丰富且环境动态不确定下协调多个运动基元(motor primitive,指可达、抓握、抬起、释放等可复用动作单元)。生物运动控制系统通过皮层与皮下回路的相位级组织实现鲁棒适应,而当代端到端视觉运动策略(visuomotor policy)与大型视觉–语言–动作模型常将感知、规划与控制纠缠于单一表征,缺乏显式相位表示,导致长程执行中误差累积与扰动后恢复能力弱。既有技能分解方法多依赖离线定义的技能边界或固定执行图,无法在运行时依据物理反馈重配置。真实操作中任务可行性随接触状态、力转移与几何不确定性演化,因此亟需一种感知锚定、相位级、支持动态重配的执行表示。该研究发表于《Biomimetics》,提出功能抽象自生物运动组织的四原则:意图与执行分层分离、可复用基元组合、感觉反馈依赖相位转移、扰动后局部校正。
主要技术方法
研究人员在Franka Emika Panda 7自由度臂与Gello遥操作平台采集四项真实长程任务(顺序拾放、富接触插拔、多物重排、对称态歧义操作)各20条多模态演示(多视角RGB、关节位姿速度、夹爪态、外力矩),以16/4划分训练/验证共64/16幕,另采20幕手工标注作独立测试集。核心方法含三模块:多模态相位与基元检测器(PPD)以OpenCLIP ViT-B/32编码双视角图像、轻量多层感知机编码五维接触向物理描述(夹爪态+力矩幅值/帧差/方向差/四帧方向一致性),融合后经变点检测与MS-TCN细化出语义物理一致相位段;多模态感知技能图(MPSG)将段转为节点(含节点级ACT策略与多模态感知锚),边含标称/跳过/回滚/恢复转移,执行时以感知门控得分(Perceptual Gating Score)结合经验转移先验做图遍历,含平局破例、 admissible集耗尽回滚、恢复计数防环(K=3)、可行性门禁;可提示相位控制(PPC)用Kimi K2.6 API将语言解析为JSON图操作(掩码/指针/重连/强跳),经语法与节点存在性校验后转为临时图约束,不改动底层ACT权重。所有阈值与图结构评估前冻结。
研究结果
语义相位分割消融:在三项模态配置(仅视觉V、视觉+本体V+Prop、视觉+本体+力矩V+Prop+T)离线比对人工标注边界,V+Prop+T取得最高容差边界F1(±25/±50帧)、帧精度与mIoU,表明本体与外力矩提供互补时间锚,尤在遮挡插拔与对称态歧义任务中抑制纯视觉过分割。
相位感知执行与失败恢复:于名义条件D1与扰动条件D2(外完子任务、部分执行后状态重置、物体位移、视觉遮挡)各20试,对比单体ACT、扁平基元序列、SayCan式规划器与MPSG-Control。MPSG-Control在D2平均成功率25.0%→73.8%提升,过早转移率(PTR)显著低于基线;Task4因对称歧义致ACT/扁平序列误进相,MPSG靠相位一致跟踪缓解。结构消融去掉回滚致TSR大降,去感知门控致PTR飙升,扁平序列最弱,证感知门控与回滚互补。
通过硬拓扑约束的结构可控性:PPC与LC-ACT(阶段条件化ACT)、Flat Planner比,于Open→Close→Open重排案,PPC序依从100%(20/20)且任务成功率75%(15/20),LC-ACT序依从30%成率45%,Flat Planner序依从100%成率55%,表明语言作硬图级序约束优于软条件,且不需重训节点ACT。
讨论与结论翻译
讨论指出显式相位抽象在底层技能与高层控制间引入中间层,使局部运动稳定而全局结构可据感知转移适应;接触丰富任务中力–力矩变化比图像更可靠地标相边界;MPSG相较扁平序列能抑过早转移、跳冗余相、回滚至可恢复前驱;PPC暴露相位图为语义干预接口,在Open–Close–Open内作硬序约束胜软条件基线。局限含图依赖演示恢复迹、基元词表预定义、PPC仅验重排非新技插入、遍历配准较简。
结论翻译:本文呈递MPSG-Control,一种功能生物启发、相位感知、用于多阶段机器人操作结构化执行的框架。该框架将演示任务表示为感知锚定运动相位间转移而非单体视觉运动轨迹。多模态相位与基元检测器用视觉、本体与力–力矩观测辨相位段;多模态感知技能图将段组织为含标称/跳过/回滚/恢复转移的节点级技能策略;可提示相位控制将语言指令转为对已有图节点的序约束。于四项任务、既定平台与扰动协议内,多模态相位感知较删减模态变体提升分割精度;受扰下感知门控图执行较单体与定序基线过早转移更少、成功率更高;提示实验证Open与Close基元可按open→close→open序执行而不重训节点策略。结果支持显式相位组织对评估任务有用,但不证对任意长程问题普适鲁棒;语言实验证已有基元库内重排而非开放语言理解或未见技能获取。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号