今日动态 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通首页  >  今日动态  >  正文

面向汽车制造智能生产排程的可解释强化学习

《Scientific Reports》:Explainable reinforcement learning for smart production scheduling in automotive manufacturing

【字体: 大 中 小 】 时间:2026年09月09日 来源:Scientific Reports 4.9

编辑推荐:

   摘要汽车工厂必须决定下一步加工哪一批次,而且必须快速做出决策。车间状况不断变化,因此最佳选择很少一目了然。强化学习可以支持这些决策,但训练好的策略就像黑箱一样,管理者无法看到它选择某一批次的原因。本研究对一个由CMA-ES策略搜索训练的策略进行解释,并找出与其选择相关的因素。

  

摘要

汽车工厂必须决定下一步加工哪一批次,而且必须快速做出决策。车间状况不断变化,因此最佳选择很少一目了然。强化学习可以支持这些决策,但训练好的策略就像黑箱一样,管理者无法看到它选择某一批次的原因。本研究对一个由CMA-ES策略搜索训练的策略进行解释,并找出与其选择相关的因素。我们应用了基于队列的SHAP分析和注意力分析、队列约束的反事实分析、决策树替代模型以及启发式重叠分析,针对MiniPlant和AMT2020两个基准系统进行了研究。SHAP结果表明,加工时间和机器利用率对调度得分的归因贡献最大。反事实分析指向不同的变量:在MiniPlant中是剩余循环时间和订单优先级以及队列长度,在AMT2020中则是换模时间和剩余循环时间。在MiniPlant中,决策树替代模型与策略匹配良好,F1分数为0.8234至0.8456,准确率为0.9042至0.9674。在AMT2020中匹配效果较弱,F1分数为0.5645至0.6732,尽管准确率仍保持在0.9345至0.9743的高水平。该策略的行为与标准规则相似,在装配线队列中与SRPT规则一致的比例为35.60%,与FIFO规则一致的比例为25.10%。在喷漆车间,该策略与换模规则一致的比例达到78.5%,与EDD规则的三方匹配率达到40.00%。两种分析视角存在分歧,因此得分归因不应被解读为因果影响。本工作从多个角度描述了一个已训练的策略,并表明仅凭解释无法证明性能更优。

相关新闻
生物通微信公众号
生物通新浪微博
微信
新浪微博
我要投稿
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:强化学习|调度策略解释|可解释性|SHAP分析|反事实分析|汽车制造

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号