
-
生物通官微
陪你抓住生命科技
跳动的脉搏
自动驾驶电动汽车安全纵向控制与车网互动能量管理的分层深度强化学习与模型预测控制框架
《Scientific Reports》:A hierarchical deep reinforcement learning and model predictive control framework for safe longitudinal control and vehicle-to-grid energy management in autonomous electric vehicles
【字体: 大 中 小 】 时间:2026年09月09日 来源:Scientific Reports 4.9
编辑推荐:
摘要当前自动驾驶电动汽车(AEV)控制方法将纵向运动和能量管理视为解耦的问题:基于规则的控制器(RBC)缺乏对动态定价的适应能力,而纯深度强化学习(DRL)方法无法保证生产部署所需的硬性安全约束。本文提出了一种分层框架,同时解决了这两项局限性,将纵向控制和车网互动(V2G)功
当前自动驾驶电动汽车(AEV)控制方法将纵向运动和能量管理视为解耦的问题:基于规则的控制器(RBC)缺乏对动态定价的适应能力,而纯深度强化学习(DRL)方法无法保证生产部署所需的硬性安全约束。本文提出了一种分层框架,同时解决了这两项局限性,将纵向控制和车网互动(V2G)功率调度统一在单一架构中。在上层,一个软演员-评论家深度强化学习(SAC-DRL)智能体学习牵引指令和V2G调度的联合策略,由多组分奖励引导,平衡安全性、舒适性、能源效率和电网收益。在下层,一个模型预测控制器(MPC)以10 Hz的频率强制执行硬性物理和安全约束,为所学习的SAC策略(一个没有内置物理约束概念的神经网络)提供其自身无法单独提供的形式化保证。该框架通过基于城市交通仿真(SUMO)平台的高保真联合仿真进行实验评估,涵盖200个测试回合,涉及多种动态驾驶条件:交通密度200–800 veh/h,初始荷电状态(SoC)从0.40–0.80,环境温度0–45°C,以及可变的分时电价(TOU)。与RBC基线相比,所提出的框架实现了0.139 kWh/km的净能耗(降低25.7%),0.063美元/趟的V2G收益(比RBC提高65.8%),零安全违规,以及所有测试回合中100%的约束满足率。控制回路延迟平均为11.5 ms,满足100 ms的硬性实时预算——SAE J2735和ISO 26262规定的最大控制周期——留有77.6%的余量,使其能够在生产AEV嵌入式处理器上进行车载部署,并对实时交通和定价信号进行实时适应。