《PLOS One》:Multi-agent meta-reinforcement learning based on contrastive predictive coding—For rapid adaptive traffic control after emergencies
编辑推荐:
应急信号控制必须在不给普通交通造成过度延误的情况下,让应急车辆通过交叉口。许多现有控制器仍依赖人工设计的交通特征,而不熟悉的应急模式往往需要额外训练,控制策略才能可靠调整。针对这一场景,研究人员开发了一种基于对比预测编码(CPC)的多智能体元强化学习框架,用于
应急信号控制必须在不给普通交通造成过度延误的情况下,让应急车辆通过交叉口。许多现有控制器仍依赖人工设计的交通特征,而不熟悉的应急模式往往需要额外训练,控制策略才能可靠调整。针对这一场景,研究人员开发了一种基于对比预测编码(CPC)的多智能体元强化学习框架,用于交通状态表示。CPC将高维交通序列压缩为紧凑表示,供交叉口智能体在少样本策略自适应过程中使用。智能体通信按距离和传输时延进行加权,分层应急优先级控制根据事件严重程度调整信号决策。在iTETRIS仿真平台上使用CityFlow Emergency数据集进行的测试,在高优先级场景中实现了25.3秒的应急响应时间、每车80.5秒的平均普通车辆延误以及98.2%的应急成功率。在消融实验中,移除CPC导致最大的单项性能损失,而全模块配置在贡献分析中对响应时间减少的贡献为44.3%。总体而言,该框架在保持应急车辆优先通行的同时,在所评估的应急条件下将普通交通所受影响控制在相对有限的范围内。
论文解读
随着城市交通网络日益密集,应急车辆通行管理难度增大。现有信号控制多采用固定配时或半自适应规则,突发事件下反应慢、协调差。既往研究表明,急救医疗延误每增加1分钟,死亡风险可能提高7%。多数控制方法依赖人工设计的交通特征,如车辆密度和延误,难以充分表达高维观测中的时空变化;多智能体强化学习(MARL)也需要大量交互样本适应新环境,且很少将应急事件类型直接接入决策过程。因此,