《Intelligent and Converged Networks》:Exoskeleton Locomotion Mode Prediction in Construction Using GPT-4o: Zero-Shot Learning from Vision and Speech
编辑推荐:
可穿戴外骨骼可增强作业能力与支撑性能,但在适应动态施工环境时面临挑战,尤其在梯子攀爬、楼梯通行、低矮空间移动和障碍通行等任务中的运动模式预测方面。研究人员利用智能眼镜采集视场帧与语音指令,构建多模态框架,比较对比语言-图像预训练(CLIP, Contrasti
可穿戴外骨骼可增强作业能力与支撑性能,但在适应动态施工环境时面临挑战,尤其在梯子攀爬、楼梯通行、低矮空间移动和障碍通行等任务中的运动模式预测方面。研究人员利用智能眼镜采集视场帧与语音指令,构建多模态框架,比较对比语言-图像预训练(CLIP, Contrastive Language-Image Pre-training)、ImageBind与GPT-4o在零样本学习与监督微调下的表现。微调CLIP取得90.05%的F1值,GPT-4o零样本达到87.87%,接近微调CLIP;微调ImageBind为78.84%。结果表明,GPT-4o无需任务特定训练即可凭借视觉与语音的多模态理解,在复杂施工场景中展现较强适应性,为可扩展外骨骼控制提供依据。
《Intelligent and Converged Networks》刊发的该研究面向建筑施工场景下下肢外骨骼运动模式预测问题。施工行业存在劳动力短缺、体力负荷高和安全要求严格等压力,且施工现场具有光照变化、遮挡频繁、任务切换频繁等动态特征。既有外骨骼控制研究多聚焦平地行走等日常步态,较少覆盖梯子、障碍物、低矮空间等复杂施工运动;传统方法依赖惯性测量单元(IMU, Inertial Measurement Unit)、压力鞋垫等单模或结构化监督学习,对动态环境适应性不足。因此,研究人员提出融合语音与视觉意图感知的新框架,检验大语言模型(LLM, Large Language Model)在零样本条件下能否替代或接近监督微调模型。
关键技术方法方面,研究人员使用Tobii Pro Glasses 2采集施工人员视场视频与语音,样本为受控环境中完成施工相关运动任务的参与者;语音经Whisper medium转为文本,视觉采用命令前后5秒视场帧并构造3×3网格图像;数据通过GPT-4生成指令、XTTS v2合成语音、RandomOverSampler与颜色抖动扩充以缓解类别不平衡。模型端比较CLIP、ImageBind与GPT-4o,其中GPT-4o采用思维链(CoT, Chain-of-Thought)提示,在图像、文本及图像-文本设置下做零样本运动模式分类。
研究结果如下。
3 提出研究方法论
研究人员搭建由智能眼镜触发“语音+视场帧”采样的多模态预测流程,定义垂直/施工梯上下、楼梯上下、平地/低矮空间导航、障碍跨越、坐立等12类运动标签,并以ELAN做音视频时间对齐标注。
3.1 数据采集
在模拟机械夹层噪声环境中采集数据,Tobii Pro Glasses 2以1920×1080、25 fps记录视场,音频重采样至16000 Hz;语音指令触发前2秒至后3秒的5秒窗口,以兼顾意图形成与任务启动线索。
3.2 数据生成与增强
研究人员用GPT-4少样本生成每类100条指令,筛选后用XTTS v2合成多说话人语音并加入环境噪声;少于20样本的类在分层划分后的训练集内过采样,配合颜色抖动降低过拟合风险。
3.3 数据预处理
视场帧生成550×550的3×3网格,Whisper medium转写语音;环境声压测得LAeq=73.6 dBA,语音到文本时延约200±50 ms,证明0.5 Hz高层控制回路中语音解析不占主导延迟。
3.4 多模态预测建模
CLIP零样本用图文嵌入余弦相似平均;微调CLIP加全连接分类头并及时序自注意力。ImageBind微调融合图像-文本或图像-音频嵌入。GPT-4o零样本用CoT提示,从网格图像与指令中逐步推理出12类闭合标签。
4 训练设置与模型评估
CLIP用clip-vit-large-patch14-336,微调15轮、学习率5×10-5;ImageBind用imagebind_huge,20轮、学习率1×10-5;GPT-4o用gpt-4o-2024-05-13,温度0.7、top-p 0.9,以加权F1与混淆矩阵评估。
5 性能评估
5.1 总体性能
微调CLIP图像-文本加权F1为90.05%,GPT-4o零样本图像-文本为87.87%,微调ImageBind图像-文本为78.84%;纯图像零样本CLIP仅0.51%,说明视场帧本身不等于动作标签,而语音指令提供明确意图语义。
5.2 类别性能
梯子上下:微调CLIP接近完美,GPT-4o能判方向但难区分施工梯与垂直梯。平地/低矮空间:ImageBind微调与GPT-4o图像-文本表现较好,模糊指令会导致低矮空间误判为下楼。坐立:语言模态贡献大,纯图像几乎失效。楼梯上下:ImageBind微调与GPT-4o均超90%,但梯与楼梯因横档/踏步视觉相似会互错。障碍跨越:GPT-4o图像-文本对跨管达100%,跨箱92.31%,通用指令下视觉补别障碍类型是关键。
6 关键发现讨论
多模态通常优于单模态,但拼接融合未总最大化各模优势;遮挡下GPT-4o经CoT输出推理路径可暴露不确定性。研究人员指出应加入校准误差(ECE, Expected Calibration Error)、模式切换延迟、稳定性代理指标等量化人-机器人交互指标。零样本大模型泛化好但细粒度弱,微调小模型任务性能好但泛化受限;云侧GPT-4o与边侧CLIP混合部署可兼顾实时性与推理能力。5秒窗口限制长时序理解,未来需用记忆增强与检索增强生成(RAG, Retrieval-Augmented Generation)。
结论部分翻译如下:
本研究构建融合视场帧与语音指令的多模态框架,面向梯子攀爬、楼梯通行、低矮空间移动和障碍通行等动态施工任务中的运动模式预测。图像-文本设置下,微调CLIP以90.05%加权F1最优;采用零样本CoT的GPT-4o紧随其后,为87.87%;微调ImageBind为78.84%。图像与文本融合稳定优于单模态,GPT-4o的CoT能有效从指令与视场时序中推断用户意图。音频模态经ImageBind未明显增益。多数模型可判垂直方向,但零样本CLIP除外。研究证明视场+语音融合可提升施工外骨骼运动预测,GPT-4o具备作为动态施工现场可扩展控制方案的潜力。局限包括场景未覆盖极端光照、密集遮挡与全天候工况,且5秒静态窗口限制时序推理;后续应做现场验证、不确定性门控、时序记忆与检索增强。