《Spectrochimica Acta Part A: Molecular and Biomolecular Spectroscopy》:Application of a semi-supervised learning framework combining principal component constraint enhancement in near-infrared spectroscopy of
Rhizome Coptidis
编辑推荐:
•开发了SACPA-SSLCNN-TKSVR框架,用于近红外(NIR)对黄连的预测分析。•该方法适用于小数据集以及标注数据不足的情况。•该方法在运行时间方面具有非常显著的优势。引言黄连是一种常见于中国南方的多年生草本植物,广泛应用于中医药领域。它对胃部虚弱引起的呕吐、脾虚引起
- •
开发了SACPA-SSLCNN-TKSVR框架,用于近红外(NIR)对黄连的预测分析。
- •
该方法适用于小数据集以及标注数据不足的情况。
- •
该方法在运行时间方面具有非常显著的优势。
引言
黄连是一种常见于中国南方的多年生草本植物,广泛应用于中医药领域。它对胃部虚弱引起的呕吐、脾虚引起的腹泻以及肾虚等症状具有显著疗效。该植物的主要成分是各种生物碱,包括小檗碱、黄连碱和掌叶防己碱。其中小檗碱最为重要,占总生物碱含量的70%至90%,并具有抗炎、抗菌和降血糖等多种药理特性[1]、[2]、[3]。然而,由于不同产地的气候、种植方法和加工技术存在差异,活性化合物(尤其是小檗碱)的含量可能显著不同。因此,黄连成分分析仍然是当代医学研究的关键焦点[4]。传统化学分析方法,如高效液相色谱、核磁共振和质谱,通常会损坏样品,需要长时间的准备工作且耗时较长,难以实现快速检测[5]。因此,需要开发快速、无损的检测方法。
近红外光谱(NIR)因其无损、快速、方便和无污染等优势而被广泛应用于多个领域。其工作原理基于检测780–2526 nm区域中含氢基团分子振动跃迁的泛频和组合带。与记录超过2500 nm基本振动的中红外光谱不同,NIR主要捕捉伸缩振动的第一和第二泛频,以及ν+δ(伸缩振动和弯曲振动)等组合模式。在该光谱范围内,C—H基团在1600–1800 nm处呈现第一泛频吸收,在2100–2400 nm处呈现组合带;与C—O相关且涉及O—H弯曲的组合带出现在1900–2100 nm附近;而含有C—N基团的组合模式表现为N—H弯曲与C—N伸缩的组合模式,接近2000–2200 nm[6]。结合数学校准方法,该技术可实现材料成分分析。作为一种间接化学分析方法,建立将光谱数据与参考值联系起来的预测模型是NIR应用的基础。然而,在实际应用中会面临环境条件、操作员差异和仪器差异等挑战。此外,数据具有高维度、强共线性和高噪声水平的问题[7]、[8]。因此,建模方法必须提供高预测精度、稳健性和可转移性。
偏最小二乘回归(PLSR)是NIR领域中广泛应用的建模方法。该方法有效降低了近红外数据的维度,解决了多重共线性问题,并快速提供可靠的预测结果[9]、[10]。然而,当光谱信号与目标参数呈现复杂、非线性的关系时,PLSR的预测性能会受到限制。作为一种线性模型,PLSR在复杂场景中抑制冗余信息和噪声的能力有限[11]、[12]。因此,迫切需要开发更具表达力的建模框架,以提高预测精度和稳健性,同时不过度消耗计算资源。
数据增强是一种通过不同程度地转换数据集来增强预测能力和稳健性的方法,从而扩大样本量、多样化数据,并丰富模型的表达能力[13]。光谱扰动技术——包括平移、缩放、添加高斯噪声和线性乘法——因其简单性、可控参数和明确的物理意义而被广泛应用于近红外光谱领域[14]、[15]。然而,需要注意的是,该方法容易受到原始光谱中噪声和冗余信息的影响。当对不相关的光谱区域施加扰动时,噪声和冗余信息可能会被放大。此外,高维光谱空间中的无约束扩展过程可能会产生偏离真实光谱化学特征的样本[16]。因此,迫切需要优化该方法,以确保扩展数据保持物理一致性和分布有效性。
另一种增强模型预测能力和稳健性的方法是特征提取,即从数据集中提取与目标变量相关的信息,从而优化建模过程并提高预测精度和稳定性[17]。卷积神经网络(CNN)体现了这一技术。与其他方法不同,CNN将局部光谱波段作为其卷积核的输入窗口。通过执行卷积和池化操作,它们有效捕捉相邻光谱波段之间的局部特征,同时反映全局吸收特性,实现光谱信息的多尺度表示[18]、[19]。这一能力使它们特别适合近红外应用。然而,CNN的有效性在很大程度上受标注数据的影响。在NIR场景中,手动标注数据成本高昂且难以获取,这直接影响CNN的性能[20]。因此,研究人员开始探索利用部分标注数据来增强CNN能力的方法。在此背景下,半监督学习(SSL)获得了显著关注。SSL采用联合建模,利用部分标注样本和无标注样本,引导模型更有效地学习数据的整体分布结构[21]。因此,许多研究人员尝试将半监督学习与卷积神经网络融合,以减少其对标注数据的依赖。然而,现有研究主要集中在分类问题上,对连续变量预测任务的探索不足[22]、[23]。此外,现有研究忽视了在不同标注样本比例下CNN与不同尺度卷积核的融合效果。因此,该领域迫切需要深入探索,以扩展NIR知识库。
数据预测是连续变量回归任务中最关键的步骤,直接决定整个建模过程的有效性。支持向量回归(SVR)作为广泛使用的回归模型,由于其对高维共线特征的不敏感性以及通过核函数有效捕捉非线性关系的能力,特别适合近红外光谱中小到中等数据集的预测[24]。高斯径向基函数(RBF)核作为一种增强的高斯核,兼具高效性和快速训练速度,常与SVR结合形成RBF-SVR用于快速光谱分析[25]。然而,在实践中,SVR方法并不总能产生最优结果。现有研究通过引入优化算法和粒子群优化技术增强了RBF-SVR的预测性能[26]、[27]。然而,这些努力忽视了将RBF与其他核函数(如线性核)集成是否能够产生更优越的结果。此外,相关研究尚未深入探索快速的核超参数优化方法。因此,有必要分析将替代核函数纳入SVR并结合快速参数优化是否能够带来积极的改进。
本文提出了SAPCA-SSLCNN-TKSVR框架,用于近红外数据集的预测分析,尤其是黄连数据集。SAPCA的全称为光谱增强主成分分析(Spectral Augmented Principal Component Analysis);SSLCNN的全称为半监督学习卷积神经网络(Semi-Supervised Learning Convolutional Neural Networks);TKSVR的全称为双核支持向量回归(Twin Kernel Support Vector Regression)。该框架旨在提高预测能力,同时保持较低的模型复杂度和高稳定性,从而满足实际应用需求。首先,开发了一种结合主成分分析(PCA)与光谱扰动增强的数据增强方法。PCA约束确保增强样本保持在真实光谱分布范围内。该方法应用于预先分割的训练集、验证集和测试集,既防止了数据泄漏,又为后续模型训练提供了充分的数据支持。随后,开发了一个基于半监督学习(SSL)的特征提取卷积神经网络(CNN)模块。设计了多尺度、并行卷积层架构以拓宽感受野。结合三阶段训练模式,该方法能够生成高质量伪标签,即使在标注数据有限的情况下也能高效提取特征。最后,部署了基于贝叶斯优化的自适应双核支持向量回归(SVR)进行预测。在SVR中同时使用RBF核和线性核(Linear)函数,实现了更全面的数据捕捉。贝叶斯优化快速筛选最优超参数,显著减少了手动参数调整或网格搜索方法的时间成本,同时确保预测精度。
章节摘要
样本采集、分割与评价指标
收集了来自中国重庆市石柱县的78个黄连样本,在商业种植基地种植四年,于十月底晴朗的一天收获,此时黄连品质最佳,根部饱满。用蒸馏水彻底清洗后干燥、研磨,并在60°C下储存后进行测量和分析。为确保研究的有效性,测定了黄连中的小檗碱含量。
软件环境
实验环境包括以下硬件:Intel i5-12600KF处理器、32 GB内存和NVIDIA GeForce RTX 5060显卡。操作系统为Windows 11,所有实验均使用Python 3.8编译器进行。深度学习模型使用CUDA 12.9、PyTorch 2.4.1和驱动程序版本576.88开发。其他计算任务使用了PyCharm中的以下库:pandas 2.0.3、numpy 1.23.5、scikit-learn 1.3.2以及其他相关包。
结论
本文提出了SAPCA-SSLCNN-TKSVR框架,用于近红外光谱(NIR)分析研究,专门设计用于分析NIR数据集,尤其是黄连数据集。该框架由三个模块组成。第一个模块是SAPCA,在约束的PCA下重建原始光谱,有效抑制随机噪声和冗余信息,同时保持主要光谱结构。随后,在重建的光谱空间中引入光谱扰动,以实现(原文截断)
利益冲突声明
作者声明,他们没有已知的竞争财务利益或个人关系可能影响本论文中报告的工作。
致谢
本工作由国家自然科学基金资助(项目编号:62365008)。
安楠 | 张玉京 | 陈华洲