《ACS Omega》:Data-Driven Approach for Bioreactor Monitoring and Prediction in Monoclonal Antibody Production
编辑推荐:
单克隆抗体(monoclonal antibody, mAb)生产的上游生物制药过程会产生高维、不规则采样且含大量缺失值的时间序列数据,这可能限制数据驱动模型的稳健性和可复用性。在本研究中,研究人员针对一个先前发表的工业补料分批(fed-batch)mAb生产
单克隆抗体(monoclonal antibody, mAb)生产的上游生物制药过程会产生高维、不规则采样且含大量缺失值的时间序列数据,这可能限制数据驱动模型的稳健性和可复用性。在本研究中,研究人员针对一个先前发表的工业补料分批(fed-batch)mAb生产过程数据集开发了一套数据驱动工作流。该工作流涵盖从数据清洗与插补到模型基准测试与可解释性的全面数据分析,以实现mAb生物反应器的软测量和预测建模。首先,利用八种监督式机器学习(machine learning, ML)回归器以及经时间工程化处理的时变特征,进行缺失值插补及其评估。在八种ML模型中,轻量梯度提升机(Light Gradient Boosting Machine, LightGBM)提供了最佳的插补数据,并被用作所有变量的插补模型。与先前发表的双混合插补方法相比,基于LightGBM的插补流程精确保留了所有观测测量值,并更准确地再现了数据的边际分布和多元几何结构。利用该插补数据集,研究人员对三十四种单一模型和堆叠(stacked)ML模型在两个工业相关任务上进行了基准测试:(i)利用同期过程变量对mAb滴度进行逐点软测量;(ii)利用第1–7天的数据对最终mAb滴度进行早期预测。与线性和基于核的模型相比,非线性基于树的集成模型在软测量中测试集R2最高达0.98,在早期预测中达0.93。然而,堆叠集成相对于最佳单一树模型仅提供了适度但一致的精度和稳健性提升。最后,置换变量重要性、Shapley加性解释(Shapley additive explanations, SHAP)和偏依赖分析表明,培养时间(elapsed culture time)、总细胞密度、培养体积、谷氨酰胺和谷氨酸是预测滴度最重要的变量,而在所研究的操作范围内,葡萄糖和pH等严格控制变量贡献较小。这是首个将现代基于ML的插补、广泛模型基准测试和可解释人工智能结合于工业mAb数据集,以开发软传感器和早期预测模型的研究。总体而言,该工作流为工业mAb上游开发中处理缺失数据和构建软传感器提供了一个简单、可复用且可解释的框架,并具有减少分析负担、加快反馈以及支持mAb上游过程数据驱动决策的潜力。
论文解读:单克隆抗体生产中生物反应器监测与预测的数据驱动方法
单克隆抗体(