《Visual Informatics》:Visual analytics of transfer learning with LSTM for modeling multi-condition industrial processes
编辑推荐:
长短期记忆(Long Short-Term Memory, LSTM)网络凭借其强大的序列建模和非线性拟合能力,已在工业过程中得到广泛应用。为克服多工况工业时间序列建模中的样本量有限和冷启动等额外挑战,研究人员常采用迁移学习技术。然而,迁移过程仍存在严重的可解
长短期记忆(Long Short-Term Memory, LSTM)网络凭借其强大的序列建模和非线性拟合能力,已在工业过程中得到广泛应用。为克服多工况工业时间序列建模中的样本量有限和冷启动等额外挑战,研究人员常采用迁移学习技术。然而,迁移过程仍存在严重的可解释性不足和负迁移效应问题,这可能削弱其在实际应用中的可靠性。针对这些问题,研究人员首先提出了一套基于拓扑数据分析(Topological Data Analysis, TDA)的可视分析方法。这些方法旨在提取高维模型权重的分布模式,分析迁移学习过程中的权重变化,并揭示其演化的潜在规律。基于这些方法,研究人员进而设计并实现了一个名为MCTVis的新型交互式系统。该系统能够对模型权重状态与工况特征之间的潜在关联进行多层次分析。最后,研究人员在真实工业控制过程建模上开展了两个完整的案例研究,以证明所提方法的有效性和系统的实用价值。
传统流程工业如石油炼制、化工、电力生产中,对控制过程进行有效建模是提升智能化生产水平的关键。随着传感器数据采集与存储技术进步,工业控制过程中积累了海量历史数据。由于采样得到的控制参数具有强时间特性,以长短期记忆(Long Short-Term Memory, LSTM)网络为代表的数据驱动深度模型被广泛用于控制单元建模。然而,生产需求变化导致控制过程常呈现多工况特征,即整体采样数据可按功率负荷、蒸汽温度等关键参数划分为多个相对稳定的数据子集。LSTM在单一稳定工况下表现良好,但对整个多工况控制过程建模时,复杂时序模式会显著降低性能;而对每个工况独立建模则存在冷启动问题,训练效率低下。为此,研究人员引入迁移学习,将一个已有工况下学到的知识迁移到新工况,以提高学习效率与性能。不过,LSTM的复杂门控与多层结构使其迁移过程难以理解,且可能出现负迁移——迁移后模型性能大幅下降,这削弱了模型在实际应用中的可靠性。
针对上述问题,研究人员提出一套基于拓扑数据分析(Topological Data Analysis, TDA)的可视分析方法,用于提取高维模型权重的分布模式、分析迁移过程中的权重变化并揭示其演化规律;进而设计并实现了交互式系统MCTVis,支持多层次分析模型权重状态与工况特征之间的关联。主要贡献包括:面向工况特征提取与权重拓扑归纳的可视化方法,集成多视图的MCTVis系统,以及在真实多工况工业过程建模中的完整案例研究。
在方法上,研究人员采用KNN估计不同工况下各控制参数的概率分布,并计算Jensen-Shannon散度(Jensen-Shannon Divergence, JSD)量化工况特征相似度;提取LSTM四个门控组件的输入权重合并为高维点云,基于TDA的Mapper算法构造权重拓扑图(以L2范数为滤波函数、DBSCAN聚类),并用持续同调(Persistent Homology, PH)计算持续图(Persistence Diagram, PD)及平均切片Wasserstein(Sliced Wasserstein, SW)距离定量比较拓扑差异;系统MCTVis以多视图协调方式支持交互分析。案例数据来自某电厂DeNOx过程一个月的真实历史数据(采样间隔1秒,按功率负荷分为10个工况)及公开ETT数据集,采用参数迁移学习策略,工况特定模型为四层LSTM,统一模型为五层LSTM作为对比。
研究结果包括以下方面。6.1 观察工况特征与迁移质量的关系:通过对比D4→D5、D6→D0、D4→D6三个迁移过程,发现高整体特征相似度并不能保证良好迁移性能。D4→D5整体相似度较高,损失稳定收敛;D6→D0相似度低,迁移难以收敛;D4→D6整体相似度与D4→D5相当,但早期收敛困难,进一步逐特征分析发现输入参数AirVol分布差异较大。这表明逐特征散度分析有助于定位导致负迁移的关键特征。6.2 理解迁移过程中的LSTM机制:通过Mapper拓扑图观察四个门控权重的结构演化,发现细胞状态候选门的拓扑结构在迁移中变化最复杂,与其存储和更新长期信息的功能一致;输入门有一定变化,其余门相对稳定。整体拓扑复杂度随训练轮次增加而增加。D4→D6迁移中早期拓扑变化更剧烈,后期趋于稳定。特征灵敏度拓扑摘要显示,主分支的权重变化较小,而离群节点中对AirVol敏感的神经元权重比例显著增加,反映出模型向目标工况特征调整。不同隐藏层比较中,较高隐藏层的权重拓扑SW距离波动显著大于较低隐藏层,说明低层保持基础特征,高层更针对目标任务进行较大调整。6.3 解释和诊断迁移学习:(1)解释成功迁移:在D4→D5迁移中,多数神经元保留源工况信息,少量神经元进入新的子簇并调整对AirVol和O2特征的权重,集中于高权重区间,与目标工况的敏感性一致。(2)诊断负迁移:D6→D0负迁移案例中,低层隐藏层仍显示学习潜力,但高层隐藏层拓扑变化小、激活分布呈饱和状,主导神经元簇的权重分布几乎不变,只有少数神经元对NO
x CAL特征有明显调整。专家假设高层过度特化于源工况,使用Glorot初始化仅重初始化高层权重后,模型收敛更稳定且最终误差降低。6.4 专家反馈:四位专家(E1–E4)认为MCTVis有效支持了迁移性检查、权重演化观察和负迁移诊断,并提出了增强交互、跨层比较与用户引导等优化建议。
讨论部分指出,相较于现有工作关注激活拓扑,该研究提供了权重拓扑演化的详细分析,可直接关联隐藏层权重变化与模型性能,并可扩展到更多隐藏层及其他架构(如Transformer的多头注意力权重投影)。当前局限包括用户学习曲线、Mapper参数调优依赖手动、以及向其他架构的泛化问题,未来工作将引入自动参数配置、交互式模型改进模块,并扩展至预训练与Transformer模型。研究结论可翻译为:该工作提出了一套可视分析方法,旨在解决基于LSTM的多工况工业过程建模中可解释性有限和负迁移的问题;基于这些方法构建的集成可视分析系统能从工况数据中提取关键特征并揭示模型权重的拓扑模式,使用户直观探索LSTM内部动态,辅助分析潜在负迁移现象;两个真实工业控制过程建模案例研究证明,MCTVis为分析迁移行为、诊断负迁移并指导模型改进提供了一种可解释且实用的途径。