基于多光谱成像(Multispectral Imaging, MSI)与机器学习(Machine Learning, ML)的西洋参(Panax quinquefolius L., PQL)真伪鉴别研究

《Journal of Food Composition and Analysis》:Authentication of American ginseng based on multispectral imaging and machine learning

【字体: 时间:2026年07月30日 来源:Journal of Food Composition and Analysis 5.3

编辑推荐:

  西洋参(Panax quinquefolius L.,PQL)是一种高价值药材,由于其高市场价值以及正品与非正品产品在视觉上的高度相似性,经常遭受掺假和伪造。这种相似性给快速、无损的真伪识别带来了重大挑战。为了克服传统感官评价和理化方法效率低、主观性强的问题,

  
西洋参(Panax quinquefolius L.,PQL)是一种高价值药材,由于其高市场价值以及正品与非正品产品在视觉上的高度相似性,经常遭受掺假和伪造。这种相似性给快速、无损的真伪识别带来了重大挑战。为了克服传统感官评价和理化方法效率低、主观性强的问题,本研究提出了一种基于多光谱成像(Multispectral Imaging, MSI)结合机器学习(Machine Learning, ML)的PQL真伪及劣变加工快速识别方法。研究人员成功将正品PQL与三种代表性的非正品场景区分开来,包括低质PQL、形态相似的非五加科人参切片(模拟物种替代掺假)以及煮干处理的PQL。结果表明,光谱预处理和特征选择策略显著影响分类性能。在所有评估的模型中,SG-PCA-RF(Savitzky-Golay滤波-主成分分析-随机森林)组合取得了最佳的综合性能,测试集准确率达到98.10%,同时具有较高的F1-score和Kappa系数值。SG-LDA-SVM(Savitzky-Golay滤波-线性判别分析-支持向量机)组合也表现出较强的稳定性和泛化能力。总体而言,所提出的方法为PQL及其他药材的真伪识别和品质评价提供了一种快速、无损且可靠的解决方案。
研究背景与意义
西洋参(Panax quinquefolius L.,PQL)属于五加科人参属植物,其根部具有重要的药理活性,包含多糖、氨基酸及皂苷类等活性成分,在缓解疲劳、增强免疫力、抗氧化及心血管保护等方面具有功效,广泛应用于保健品与功能性饮料中。由于PQL生长周期长、生态环境要求高及国际市场需求旺盛,价格居高不下,导致商业流通中出现多种形式的造假与掺假,典型手段包括以低龄冒充高龄、以形态相似的普通人参(Panax ginseng)切片替代、以及对提取过活性成分的次品进行再加工销售。传统化学检测方法如高效液相色谱法(High-Performance Liquid Chromatography, HPLC)和超高效液相色谱串联质谱法(Ultra-High Performance Liquid Chromatography coupled with Quadrupole-Orbitrap High-Resolution Mass Spectrometry, UHPLC/Q-Orbitrap MS)虽能准确检测成分,但需破坏样品、流程复杂且成本高,难以适应市场中完整药材切片的快速现场无损筛查。可见/近红外(Visible/Near-Infrared, VIS/NIR)光谱技术虽已应用于农产品与药材检测,但现有研究多集中于粉末样品、产地溯源或深度学习框架,针对完整商品化PQL切片在真伪、质量退化、物种替代及加工改变等多场景下的系统性比较研究尚显不足。因此,研究人员开展了基于VIS/NIR多光谱成像结合常规机器学习对完整PQL切片进行快速无损鉴别的研究,旨在解决传统方法效率低、破坏样品的问题,并为市场监管提供技术手段。该研究发表于《Journal of Food Composition and Analysis》。
主要关键技术方法
研究人员收集了四类共600份样本,每类150份,包括正规渠道正品PQL、市场低质PQL、形态相似人参切片及煮干处理PQL,样本涵盖多批次与供应商以逼近市场异质性。利用基于积分球的VIS/NIR多光谱成像系统在365–980 nm范围采集反射光谱,通过黑白板校正计算反射率Rc=(I0-D)/(W-D)。数据预处理采用Savitzky–Golay(SG)平滑与多元散射校正(Multiplicative Scatter Correction, MSC)。特征处理分别采用连续投影算法(Successive Projections Algorithm, SPA)与竞争性自适应重加权采样(Competitive Adaptive Reweighted Sampling, CARS)进行波长选择,以及主成分分析(Principal Component Analysis, PCA)与线性判别分析(Linear Discriminant Analysis, LDA)进行降维。分类模型选用支持向量机(Support Vector Machine, SVM)、随机森林(Random Forest, RF)、偏最小二乘判别分析(Partial Least Squares-Discriminant Analysis, PLS-DA)及K近邻(K-Nearest Neighbor, KNN),以准确率(Accuracy)、精确率(Precision)、F1-score及Kappa系数评估,按物理样本7:3划分训练集与测试集。
研究结果
3.1. Chemical composition and spectral analysis of PQL
在可见光区(约365–700 nm),PQL样本反射率差异主要与表面色泽及加工物理变化相关,煮干样(P3)在400–600 nm反射率较低可能与非酶褐变有关,而低质PQL(P1)与相似人参(P2)在可见区与正品重叠,表明仅凭颜色不足以判别。在近红外(Near-Infrared, NIR)700–970 nm区,四类样本差异显著,该区域关联O-H、C-H、N-H键的倍频与合频吸收及组织散射。740–750 nm关联O-H伸缩振动高阶倍频及水与羟基化合物变化;850 nm关联C-H伸缩振动高阶倍频及皂苷、淀粉等有机物;970 nm关联O-H伸缩振动二阶倍频及水分状态。煮干处理改变了氢键网络、淀粉糊化及细胞壁结构,共同导致关键波段光谱差异,为波长选择提供化学与结构基础。
3.2. Spectral collection and preprocessing results
原始光谱在短波区受光照不均与表面散射影响存在噪声与基线漂移。SG平滑在抑制随机噪声的同时保留了光谱曲线形态与关键吸收特征;MSC校正了散射引起的偏移但可能衰减结构与成分相关的振幅信息。预处理后NIR区(750–950 nm)样本间光谱差异更清晰,曲线分布更集中,未改变基本形态但增强了与化学成分相关的特征信息。
3.3. Analysis of dimensionality reduction and wavelength selection
LDA监督分析显示SG预处理后类内分布更紧凑、类间边界更清晰,尤其正品与煮干样分离明显,表明SG在保留类别差异局部特征上优于MSC。PCA无监督分析显示煮干样偏离其他类别,但正品、低质与相似人参间存在重叠,说明仅靠自然方差不足以完全区分。SPA选择的波长较少且集中,CARS保留波长分布更广但可能引入冗余。所选波长主要集中在700–970 nm的NIR关键吸收区,部分CARS波长在500–600 nm补充表观颜色差异信息。
3.4. Analysis of machine learning classification results
SG预处理下模型整体性能优于MSC。SG-PCA-RF取得最高测试准确率98.10%±0.44%,F1-score与Kappa亦高;SG-PCA-SVM为97.86%±0.47%;SG-LDA-SVM为97.38%±0.71%,稳定性强。LDA利用类别标签最大化类间散度,表现稳定;PCA保留最大方差方向未必最具判别性。SPA波长选择较CARS更稳定,CARS引入的额外变量可能导致部分分类器如KNN泛化下降。RF与SVM鲁棒性强但部分RF与KNN组合训练集完美而测试集偏低,存在过拟合风险。混淆矩阵显示SG-PCA下SVM与RF对四类识别精度高,尤其正品与煮干样分离好,KNN与PLS-DA在相似类别间易混淆。
讨论与结论翻译
PQL是一种高价值药材,由于其价格溢价和强劲需求,市场上经常遭受掺假和伪造。正品与劣质产品在视觉上的高度相似性使得在实际质量控制中快速和无损的真伪识别成为一个持续的挑战。
在本研究中,建立了一个基于VIS/NIR光谱的机器学习框架,以实现正品与劣质PQL的快速和无损识别。通过系统地整合光谱预处理、特征优化和多种分类策略,全面评估了不同掺假场景下多光谱数据的判别潜力。结果表明,SG-PCA-RF更适合需要最高分类准确率的应用场景,而SG-LDA-SVM提供了强大的稳定性和泛化性能。总体而言,本研究验证了使用多光谱成像结合常规机器学习对正品PQL与三种代表性非正品场景(包括低质量PQL、用作模拟物种替代掺假剂的视觉相似人参切片以及煮干处理的PQL)进行快速分类的可行性。
与HPLC等传统破坏性化学分析方法相比,所提出的框架为PQL的市场监管和质量控制提供了一种无损、用户友好且快速的技术途径。因此,在提高完整商品化切片的筛选效率和支持相关产品的消费者保护方面具有潜在价值。
也应承认若干局限性。首先,当前研究侧重于三种代表性的掺假或质量退化场景。市场上可能还存在其他掺假剂或劣质加工方法,例如添加其他五加属物种、淀粉基人工产品或化学处理修饰外观。尽管所提出的多光谱成像框架尚未针对这些额外掺假剂进行验证,但该方法是固有可扩展的。随着适当参考样本的收集及后续模型再训练或迁移学习,相同方法可适用于检测更广泛的掺假类型。
其次,本研究未对代表性样本进行正交化学验证,如HPLC分析皂苷含量。样本类别是基于专家目视鉴定、供应商提供的信息及已知加工历史分配的,这些是初步筛选的实用方法,但缺乏色谱法提供的定量化学确认。未来工作将纳入基于HPLC的皂苷谱分析或相关化学参考方法以验证样本分类并揭示光谱特征与特定化学成分之间的相关性。
第三,尽管采用了物理样本级7:3训练-测试划分和交叉验证策略,但未包含从不同批次、季节、采集时段或仪器收集的真正的独立外部验证数据集。在真实商业或现场条件下,样本温度、湿度、表面状况及长期仪器状态可能影响光谱响应。未来工作应在较长时间跨度和多样采集环境下收集独立外部验证数据集,纳入严格的定期黑白参考校准,并探索模型更新或迁移学习策略以提高对新样本群体和仪器条件的鲁棒性。
最后,本研究中未进行计算模型间的形式统计比较检验,如McNemar检验、重复划分下的配对t检验或Wilcoxon符号秩检验。未来研究应进一步扩大样本量与多样性,进行模型性能的形式统计比较,比较轻量级深度学习架构(如一维卷积神经网络)与常规机器学习模型,并探索将该法集成至便携式或在线检测设备中以增强实际应用潜力。
要不要我帮你把这篇论文解读提炼成一个适合汇报用的简要大纲?
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号