基于相关性引导的深度建模学习用于半夏地理来源鉴别的紧凑多光谱特征

《Molecules》:Learning Compact Multispectral Signatures for Geographical-Origin Authentication of Pinellia ternata via Correlation-Guided Deep Modeling

【字体: 时间:2026年09月09日 来源:Molecules 5.1

编辑推荐:

  药用植物材料的地理来源认证仍然具有挑战性,因为多光谱变量通常高度共线性,且样本分组可能使可靠的模型验证复杂化。现有的基于相关性的特征选择策略也需要仔细适应多分类问题,以避免类别标签的人为排序和模型开发过程中的信息泄漏。因此,本研究旨在开发一种紧凑且泄漏受控的多

  
药用植物材料的地理来源认证仍然具有挑战性,因为多光谱变量通常高度共线性,且样本分组可能使可靠的模型验证复杂化。现有的基于相关性的特征选择策略也需要仔细适应多分类问题,以避免类别标签的人为排序和模型开发过程中的信息泄漏。因此,本研究旨在开发一种紧凑且泄漏受控的多光谱学习框架,用于地理来源判别。本研究分析了来自甘肃西和、四川内江、四川成都和重庆垫江的800个半夏(Pinellia ternata)物理样本(每个来源200个样本)。每个物理样本由31个平均灰度强度表示,这些强度根据Otsu分割的多光谱感兴趣区域(region of interest, ROI)计算。通过仅估计训练数据中的one-vs-rest波段相关性和波段间冗余,构建了Pearson相关性引导的深度多层感知器(Pearson-correlation-guided deep multilayer perceptron, PCG-DeepMLP)。关键的方法创新是一个统一的多分类感知的相关性-冗余光谱学习框架,其中类别特定的one-vs-rest Pearson相关性与波段间冗余控制相结合,并嵌入到泄漏受控的分组模型开发中。通过在每个训练分区上专门学习光谱子集,然后再进行非线性分类,该框架产生了紧凑且互补的多光谱特征,同时保持了多分类结构和留出组的严格独立性。模型和特征选择设置通过每个训练分区内的三折分组交叉验证选择。PCG-DeepMLP保留了9–21个波段,并在七个模型中实现了最高的平均准确率(0.9812 ± 0.0135)、宏F1(0.9812 ± 0.0135)、马修斯相关系数(Matthews correlation coefficient, MCC;0.9752 ± 0.0179)和宏AUC(0.9994 ± 0.0006)。其宏F1在Holm校正后高于1D-CNN、1D-ResNet、全波段MLP、PLS-DA和随机森林。性能通过严格的分组嵌套内部验证方案估计,每个外部测试折都保持与特征选择、预处理和模型优化隔离。这些发现表明,多分类感知的相关性-冗余学习可以在紧凑且稳定的光谱表示中保留互补的半夏来源判别信息,从而实现准确的地理来源认证,同时为减少通道采集和未来独立的多样本批次验证提供了原则性基础。
半夏是化学成分复杂的药用材料,其质量控制因物种替代、表型异质性和代谢物丰度变异而困难。已有代谢组学研究表明,不同产地半夏的化学成分存在显著差异,地理来源成为影响药材质量和商业价值的重要属性。传统形态学鉴别难以满足客观、快速的需求,而多光谱结合多变量分类为来源鉴别提供了可能。然而,多光谱变量常高度共线,样本分组结构可能使模型验证不可靠,且基于相关性的特征选择在多分类问题中需要避免人为标签排序和信息泄漏。因此,本研究旨在构建一个紧凑且泄漏受控的多光谱学习框架。

研究人员从甘肃西和、四川内江、四川成都和重庆垫江四个产地各采集200个(共800个)半夏物理样本,利用自建多光谱成像平台获取31个波段的图像,经过辐射校正和Otsu分割后,提取每个样本感兴趣区域的平均灰度强度作为特征。他们提出了Pearson相关性引导的深度多层感知器(PCG-DeepMLP),在训练数据内计算one-vs-rest波段相关性和波段间冗余,以选择互补波段,并在分组感知的嵌套交叉验证中评估模型。结果显示,PCG-DeepMLP保留了9–21个波段,其中9个波段在所有外部折中稳定出现,跨越紫外、可见和近红外区域;其平均准确率、宏F1、马修斯相关系数(MCC)和宏AUC均优于七种比较模型,且经Holm校正后显著优于多个基线模型。这表明多分类感知的相关性-冗余学习能产生紧凑而稳定的多光谱来源判别特征,为准确认证提供基础,并支持减少通道采集和独立多批次验证。该论文发表于《Molecules》。

关键技术方法如下:样本队列来自四个产地各200个,每20个样本构成一个采集盘,每产地10盘。主要方法为,在训练折内计算每个波段与每个类别的one-vs-rest Pearson相关系数,取最大绝对值作为相关性得分并排序;随后基于与已选波段的相关性阈值进行冗余控制,形成紧凑子集;模型超参数在三折分组交叉验证中优化。比较模型包括PCG-DeepMLP、全波段MLP、一维卷积神经网络(1D-CNN)、一维残差网络(1D-ResNet)、偏最小二乘判别分析(PLS-DA)、RBF-SVM和随机森林。统计采用配对Wilcoxon检验和Holm校正,以及200次置换检验。

研究结果如下:

2.1 数据集完整性与光谱结构:通过数据完整性检查确认无缺失、重复,每个来源200样本;类别平均曲线形状相似但幅度和局部形状不同;one-vs-rest Pearson相关随波段和类别变化,说明整数编码不适合;波段间共线性强,需要冗余控制。

2.2 潜在空间分离:主成分分析(PCA)显示前两主成分解释94.3%方差但四类重叠;线性判别分析(LDA)显示明显类别分离,甘肃西和与四川成都重叠最大。

2.3 嵌套分组模型比较:在10外折分组验证中,PCG-DeepMLP准确率最高(0.9813±0.0135),宏F1也最高(0.9812±0.0135),RBF-SVM次之;配对Wilcoxon检验显示PCG-DeepMLP显著优于多个模型。

2.4 PCG-DeepMLP判别与稳定光谱证据:模型在不同折中选择9–21个波段,其中9个波段(对应365、380、420、465、520、585、680、770和940 nm)在所有折中保留,说明选择稳定性高;混淆矩阵显示主要混淆对为甘肃西和-四川成都。

2.5 鲁棒性检查:宏F1在各留组索引上为0.9625–1.0000;200次置换标签检验得到p=0.00498,证实存在强非随机多变量来源信号。

2.6 折外决策置信度:正确分类的中位最大概率为1.000,错误为0.914;归一化预测熵正确为0.000,错误为0.214;概率矩阵显示主要模糊区域为甘肃西和-四川成都。

2.7 多光谱ROI均值中的来源信息:数据支持光谱特征与来源相关,但不应将光谱对比直接解释为化合物测量,需要化学分析辅助。

2.8 分组感知验证的重要性:分组留出避免了同盘样本同时进入训练和测试,减少了采集层泄漏;但所有样本来自同一实验数据集,泛化还需独立批次验证。

2.9 Pearson引导、紧凑性与模型选择:one-vs-rest编码避免了人为类别顺序,训练内选择避免泄漏;PCG-DeepMLP性能高归因于光谱差异、冗余控制和非线性学习;1D-CNN和1D-ResNet表现较低是因为数据仅31个点,缺乏空间信息;RBF-SVM同样强大,说明任务由紧凑非线性判别结构主导。

2.10 实际意义与数据集背景:稳定波段子集可用于简化传感器设计,但需要波长映射;当前数据未独立平衡采样年、收获阶段等因素,因此测量差异应视为来源相关特征而非纯地理因果标记;预测指标支持溯源中的分析鉴别环节。

讨论部分强调了分组验证和紧凑特征选择的意义,指出所有样本来自同一实验数据集,独立多批次和跨仪器验证是必要的。结论部分可翻译为:本研究确立了多光谱特征与半夏地理来源判别之间的明确联系。31波段ROI谱揭示了可重复的来源相关光谱差异,而跨越紫外、可见和近红外波段的稳定选择表明判别依赖于分布在不同光谱区间的互补信息。研究结果进一步表明,将多分类感知的Pearson相关性、波段间冗余控制和非线性学习相结合,能够在分组感知验证下提供紧凑而稳定的地理来源判别表示。局限是证据来自单个实验数据集,跨独立批次、采集时期和仪器的泛化需进一步评估。未来将集中于独立多批次和跨仪器验证,以及所选波长的物理化学解释。在当前数据集和分组验证框架内,PCG-DeepMLP为地理来源判别提供了有效的分析方法,其稳定波段子集为后续减少通道采集设计提供了基础。高预测性能支持溯源中的来源认证环节,而全面溯源还依赖来源连续性、独立验证以及生产和采集条件下的鲁棒性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号