
-
生物通官微
陪你抓住生命科技
跳动的脉搏
面向汽车制造智能生产排程的可解释强化学习
《Scientific Reports》:Explainable reinforcement learning for smart production scheduling in automotive manufacturing
【字体: 大 中 小 】 时间:2026年09月09日 来源:Scientific Reports 4.9
编辑推荐:
摘要汽车工厂必须决定下一步加工哪一批次,而且必须快速做出决策。车间状况不断变化,因此最佳选择很少一目了然。强化学习可以支持这些决策,但训练好的策略就像黑箱一样,管理者无法看到它选择某一批次的原因。本研究对一个由CMA-ES策略搜索训练的策略进行解释,并找出与其选择相关的因素。
汽车工厂必须决定下一步加工哪一批次,而且必须快速做出决策。车间状况不断变化,因此最佳选择很少一目了然。强化学习可以支持这些决策,但训练好的策略就像黑箱一样,管理者无法看到它选择某一批次的原因。本研究对一个由CMA-ES策略搜索训练的策略进行解释,并找出与其选择相关的因素。我们应用了基于队列的SHAP分析和注意力分析、队列约束的反事实分析、决策树替代模型以及启发式重叠分析,针对MiniPlant和AMT2020两个基准系统进行了研究。SHAP结果表明,加工时间和机器利用率对调度得分的归因贡献最大。反事实分析指向不同的变量:在MiniPlant中是剩余循环时间和订单优先级以及队列长度,在AMT2020中则是换模时间和剩余循环时间。在MiniPlant中,决策树替代模型与策略匹配良好,F1分数为0.8234至0.8456,准确率为0.9042至0.9674。在AMT2020中匹配效果较弱,F1分数为0.5645至0.6732,尽管准确率仍保持在0.9345至0.9743的高水平。该策略的行为与标准规则相似,在装配线队列中与SRPT规则一致的比例为35.60%,与FIFO规则一致的比例为25.10%。在喷漆车间,该策略与换模规则一致的比例达到78.5%,与EDD规则的三方匹配率达到40.00%。两种分析视角存在分歧,因此得分归因不应被解读为因果影响。本工作从多个角度描述了一个已训练的策略,并表明仅凭解释无法证明性能更优。