今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

自动驾驶电动汽车安全纵向控制与车网互动能量管理的分层深度强化学习与模型预测控制框架

《Scientific Reports》:A hierarchical deep reinforcement learning and model predictive control framework for safe longitudinal control and vehicle-to-grid energy management in autonomous electric vehicles

【字体: 大 中 小 】 时间:2026年09月09日 来源:Scientific Reports 4.9

编辑推荐:

   摘要当前自动驾驶电动汽车(AEV)控制方法将纵向运动和能量管理视为解耦的问题:基于规则的控制器(RBC)缺乏对动态定价的适应能力,而纯深度强化学习(DRL)方法无法保证生产部署所需的硬性安全约束。本文提出了一种分层框架,同时解决了这两项局限性,将纵向控制和车网互动(V2G)功

  

摘要

当前自动驾驶电动汽车(AEV)控制方法将纵向运动和能量管理视为解耦的问题:基于规则的控制器(RBC)缺乏对动态定价的适应能力,而纯深度强化学习(DRL)方法无法保证生产部署所需的硬性安全约束。本文提出了一种分层框架,同时解决了这两项局限性,将纵向控制和车网互动(V2G)功率调度统一在单一架构中。在上层,一个软演员-评论家深度强化学习(SAC-DRL)智能体学习牵引指令和V2G调度的联合策略,由多组分奖励引导,平衡安全性、舒适性、能源效率和电网收益。在下层,一个模型预测控制器(MPC)以10 Hz的频率强制执行硬性物理和安全约束,为所学习的SAC策略(一个没有内置物理约束概念的神经网络)提供其自身无法单独提供的形式化保证。该框架通过基于城市交通仿真(SUMO)平台的高保真联合仿真进行实验评估,涵盖200个测试回合,涉及多种动态驾驶条件:交通密度200–800 veh/h,初始荷电状态(SoC)从0.40–0.80,环境温度0–45°C,以及可变的分时电价(TOU)。与RBC基线相比,所提出的框架实现了0.139 kWh/km的净能耗(降低25.7%),0.063美元/趟的V2G收益(比RBC提高65.8%),零安全违规,以及所有测试回合中100%的约束满足率。控制回路延迟平均为11.5 ms,满足100 ms的硬性实时预算——SAE J2735和ISO 26262规定的最大控制周期——留有77.6%的余量,使其能够在生产AEV嵌入式处理器上进行车载部署,并对实时交通和定价信号进行实时适应。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:自动驾驶电动汽车|纵向控制|车网互动|深度强化学习|模型预测控制|能量管理

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号