《Molecules》:Reliable Quantification of Powdered Ginger Adulteration by Vis–NIR Spectroscopy and Chemometrics
编辑推荐:
摘要:由于经济利益驱动的姜粉掺假行为(通常掺入低成本谷物面粉)日益成为食品真实性与质量控制领域令人担忧的问题。本研究旨在开发并验证一种快速、可靠且非破坏性的方法,用于定量测定姜粉掺假,该方法采用可见-近红外(Vis–NIR)光谱技术结合化学计量学建模。研究人员
摘要:由于经济利益驱动的姜粉掺假行为(通常掺入低成本谷物面粉)日益成为食品真实性与质量控制领域令人担忧的问题。本研究旨在开发并验证一种快速、可靠且非破坏性的方法,用于定量测定姜粉掺假,该方法采用可见-近红外(Vis–NIR)光谱技术结合化学计量学建模。研究人员将姜粉样品分别掺入小麦粉、玉米粉和大米粉,掺假浓度范围为5%至50%(w/w),并特别关注低至中掺假区间(10–25%),该区间内的可靠定量对于食品欺诈检测尤为重要。研究人员在可见光区(400–700 nm)、近红外区(700–2500 nm)及组合Vis–NIR区(400–2500 nm)采集光谱数据,采用Savitzky–Golay滤波进行预处理,并分别使用偏最小二乘回归(PLSR)、支持向量回归(SVR)和随机森林回归(RFR)进行评估。此外,研究人员还比较了线性判别分析(LDA)、支持向量机(SVM)和随机森林(RF)在样品分类中的表现。在所评估的方法中,LDA利用近红外光谱区域实现了最高的分类准确率(>95%),而基于近红外光谱区域建立的PLSR模型提供了最佳的定量性能,验证集决定系数高于0.99,预测误差低于1%,RPD值大于13。结果表明,Vis–NIR光谱结合化学计量学建模能够准确区分真实样品与掺假样品,并在无需样品制备或化学试剂的情况下可靠定量姜粉中的面粉掺假。所提出的方法构成了一种快速、环境友好且经济高效的分析策略,在常规质量控制和食品欺诈预防方面具有巨大潜力。
研究背景及问题:食品掺假是指为获取经济利益而故意实施的欺诈行为,包括用低成本材料替代或稀释正宗原料、虚假标签以及歪曲产品地理或植物来源等。食品欺诈破坏消费者信任,造成重大经济损失,扭曲合法贸易,并在未申报的过敏原、有毒着色剂、污染物或不适宜原料进入食品链时对公共健康构成严重威胁。香料因其较高的商业价值、广泛的国际贸易、天然的成分变异以及常以粉末或加工形式销售的特点而尤为脆弱——在这些形式中,原始的形态特征已不可见。姜(Zingiber officinale Roscoe)作为广泛使用的烹饪原料、调味剂和传统药用产品,其粉末形式很容易被小麦粉、玉米粉、大米粉、大豆粉或鹰嘴豆粉等廉价材料稀释掺假。这种掺假不仅降低了商业品质,还可能引入未申报的过敏原,尤其是含麸质谷物或致敏豆类。常规的食品真实性鉴定方法如色谱法、质谱法、分子生物学法和免疫学法虽具有高灵敏度与化学特异性,但通常需要样品制备、提取程序、专业操作人员、实验室基础设施、较长的分析时间以及溶剂和试剂的消耗。近红外光谱技术因其非破坏性、几乎无需样品制备、不产生化学废物且能同时捕获复杂食品基质中多种成分信息的特点,已成为快速筛查和质量控制的重要技术。然而,针对姜粉掺假可靠定量的专门研究仍然有限,尤其是在同一实验设计下系统评估不同谷物面粉掺杂物、光谱区间、预处理策略以及线性和非线性回归方法的研究更为缺乏。
研究内容与结论:本研究旨在开发和验证一种快速、非破坏性的Vis–NIR光谱方法,用于定量测定姜粉中掺入小麦粉、玉米粉和大米粉的掺假水平。研究人员将三种市售姜粉混合制备均匀的姜粉基质,分别以5%至50%(w/w)的浓度梯度掺入小麦粉、玉米粉、大米粉及三种面粉的等比例混合物,并额外制备了8%、18%、28%和38%掺假水平的独立外部验证样品。光谱采集覆盖400–2500 nm波长范围,光谱数据经Savitzky–Golay平滑结合一阶导数预处理后,采用三种分类算法(LDA、SVM、RF)进行掺假判别,采用三种回归算法(PLSR、SVR、RFR)进行掺假定量,并评估了Boruta特征选择算法的影响。研究结果表明,LDA利用NIR区域光谱实现了最高的分类准确率(>95%),而基于NIR光谱区域建立的PLSR模型提供了最佳的定量性能,验证集决定系数高于0.99,预测误差低于1%,RPD值大于13。研究证实,Vis–NIR光谱结合化学计量学建模能够在无需样品制备和化学试剂的情况下准确区分真实与掺假姜粉样品,并可靠定量谷物面粉掺假水平。该研究发表在《Molecules》期刊上,其重要意义在于为姜粉常规质量控制和食品欺诈预防提供了一种快速、环保且经济高效的分析策略,同时也表明增加模型复杂度并不必然提升预测性能——在评估条件下,常规PLSR方法优于或等同于更复杂的机器学习算法。
关键技术方法:研究人员主要采用了以下关键技术方法:(1)Vis–NIR光谱采集技术,使用FOSS XDS Rapid Content? Analyzer在400–2500 nm波长范围内以0.5 nm采样间隔获取漫反射光谱,每个样品测量两次取平均以减少采样变异;(2)Savitzky–Golay预处理方法,采用九点窗口和二阶多项式进行平滑结合一阶导数变换,以减少仪器噪声和基线漂移并增强与掺假相关的光谱特征;(3)三种定量回归建模方法——偏最小二乘回归(PLSR)、支持向量回归(SVR)和随机森林回归(RFR),其中PLSR通过评估15个候选潜变量数值进行优化,SVR采用径向核函数并通过两阶段网格搜索优化代价参数C和gamma,RFR通过网格搜索优化mtry参数而ntree固定为500;(4)三种监督分类算法——线性判别分析(LDA)、支持向量机(SVM)和随机森林(RF),LDA无可调超参数直接训练,SVM和RF的超参数优化策略与对应回归模型相同;(5)Boruta特征选择算法,以最大500次迭代和p<0.01显著性阈值识别统计相关的光谱变量;(6)模型优化与评估策略,采用训练集(70%样品)结合重复5折交叉验证进行模型优化,使用验证集(30%样品)评估模型最终性能,并额外使用独立制备的含8%、18%、28%和38%掺假水平的样品进行外部验证。样品来源方面,三种市售有机姜粉购自西班牙当地零售商(Alpi品牌的Nature Vegan和Nature产品以及Frisafran品牌的Eco Powder产品),小麦粉、玉米粉和大米粉购自西班牙当地超市(玉米粉由Harimsa公司供应)。所有光谱预处理和化学计量学分析均使用R语言(版本4.5.1)完成,采用prospectr、caret、pls、e1071、randomForest、vip和ggplot2等程序包。
2.1 姜粉样品分类结果(LDA、SVM和RF):研究人员首先评估了Vis–NIR光谱数据区分真实姜粉与不同谷物面粉掺假样品的能力。五种样品类别包括纯姜粉、掺小麦粉姜粉、掺玉米粉姜粉、掺大米粉姜粉和掺三种面粉混合物姜粉。结果显示,线性判别分析(LDA)持续提供最佳分类性能,在完整Vis–NIR光谱数据集(D283×4200)和NIR光谱数据集(D283×3600)上无需Boruta特征选择即达到95%以上的验证准确率和超过0.91的F1分数。仅使用NIR区域获得的相当性能表明,大部分判别信息与样品化学组成相关的吸收带有关,而非可见光区捕获的颜色差异。相比之下,SVM和RF模型均表现出明显的过拟合迹象——两种算法在训练集上达到很高准确率但验证性能大幅下降,尤其是RF模型对训练数据达到完美分类但验证准确率显著降低。仅基于可见光谱区域开发的模型分类性能明显较差,确认颜色信息不足以可靠区分掺假姜粉样品。Boruta特征选择未能改善任何算法的分类性能,在大多数情况下反而导致验证准确率轻微下降,表明被丢弃的波长仍含有有助于样品判别的互补信息。外部验证集的混淆矩阵进一步证实了基于NIR数据集且未使用Boruta的LDA模型所实现的高分类准确率。
2.2 回归模型优化结果(PLSR、RFR和SVR):研究人员使用完整光谱数据集及Boruta降维后的数据集评估了三种回归模型的定量预测性能。在所有评估模型中,PLSR一致提供最高预测性能,表明掺假水平与光谱数据之间存在线性关系。最佳结果来自未经Boruta特征选择的完整Vis–NIR光谱数据集(D283×4200)和NIR光谱数据集(D283×3600),验证集决定系数R2高于0.99,RMSE低于1%,RPD值超过13。完整光谱与仅使用NIR区域获得几乎相同的结果表明,最相关的分析信息包含在近红外区域,而可见区域对预测性能贡献相对较小。Boruta特征选择的效果因回归算法而异:对PLSR而言,变量消除一致降低了预测性能;对SVR而言,未经特征选择时模型表现出严重过拟合(训练R2=0.996但验证R2=0.410,RPD=1.06),而Boruta特征选择后预测性能大幅提升(验证R2=0.964,RPD=4.81),表明SVR对高维光谱数据中无关和高度共线变量的存在更为敏感;RFR展现出最稳定的行为,无论是否应用Boruta,验证R2始终接近0.97,表明该集成学习方法对冗余光谱变量相对不敏感,但其预测精度始终低于PLSR。仅基于可见光谱区域开发的模型预测性能最差,进一步确认近红外区域包含了用于姜粉掺假水平建模的最丰富光谱特征。PLSR模型的预测值与参考值关系图显示,训练集和验证集样品紧密分布在1:1参考线附近,决定系数分别为0.996和0.995,RMSE均低于1%,训练集与验证集样品的相似分布表明模型无过拟合且泛化良好,整个0–50%掺假范围内无系统性高估或低估现象,预测误差在全部浓度区间内保持均匀一致。
讨论部分总结:本研究的结果确认了光谱方法在姜粉掺假检测与定量方面的潜力,并在多个方面进行了扩展。与以往研究相比,本研究考虑了四种掺假情景(单独掺入小麦粉、玉米粉、大米粉及三种面粉的混合物),系统评估了可见光区、NIR区及组合Vis–NIR区域,并在线性和非线性方法之间进行了直接比较。值得注意的是,研究人员使用独立制备的、未经模型开发浓度水平(8%、18%、28%和38%)的样品进行了额外外部验证,在未见过的中间掺假水平上额外评估了模型性能。需要指出的是,本研究所使用的姜粉基质是通过混合三种不同市售姜粉制备而成,但姜粉的自然变异性(不同品种、地理来源、生产批次、加工条件导致的含水量、碳水化合物、酚类及挥发性成分差异,以及粒径分布差异)可能影响Vis–NIR光谱响应。因此,进一步验证应纳入更多来自不同产地和制造商的独立市售姜粉,并分别对各基质进行掺假操作,以评估天然原料变异对模型性能的影响。
研究结论:本研究表明,Vis–NIR光谱提供了足够的谱学信息,可用于姜粉中不同谷物面粉掺假的可靠检测与定量。所开发的化学计量学模型成功区分了真实样品与掺假样品,并在广泛的浓度范围内准确估算了掺假水平。在所评估的回归方法中,偏最小二乘回归(PLSR)结合NIR光谱区域提供了最高的预测性能,实现了高于0.99的决定系数和低于1%的预测误差,从而确认了其在定量真实性评估中的适用性。所提出的方法代表了传统分析技术的一种快速、非破坏性、无需试剂且经济高效的替代方案,适用于姜粉的常规质量控制。研究结果还表明,增加模型复杂度并不必然改善预测性能——在评估条件下,常规PLSR方法优于或等同于更复杂的机器学习算法。