基于图像与生化多模态表型分析的奇亚(*Salvia hispanica* L.)基因型可解释分类

《Journal of the Science of Food and Agriculture》:Image-based and biochemical multimodal phenotyping for explainable classification of chia (Salvia hispanica L.) genotypes

【字体: 时间:2026年09月02日 来源:Journal of the Science of Food and Agriculture 4.0

编辑推荐:

  中文摘要 **背景**:本研究开发了一种可解释的机器学习框架,整合形态学、颜色和生化特征用于奇亚(*Salvia hispanica* L.)基因型分类。研究人员构建了一个包含四个基因型、1200粒种子图像的数据集,从中提取了17个形态学和颜色特征。此外,

  
中文摘要
**背景**:本研究开发了一种可解释的机器学习框架,整合形态学、颜色和生化特征用于奇亚(*Salvia hispanica* L.)基因型分类。研究人员构建了一个包含四个基因型、1200粒种子图像的数据集,从中提取了17个形态学和颜色特征。此外,还补充了六个样本水平的生化性状——粗蛋白、粗脂肪、粗灰分、粗纤维、碳水化合物和总糖——这些数据来自相应的试验单元种子样本,最终形成包含23个变量的整合数据集。研究人员采用10种机器学习算法,在重复10折交叉验证下对该数据集进行比较评估,所有预处理步骤均仅限于各训练折内执行,以避免数据泄漏。

**结果**:XGBoost取得了最佳性能,准确率达86.99%,马修斯相关系数(Matthews correlation coefficient, MCC)为0.820,受试者工作特征(receiver operating characteristic, ROC)曲线下面积为0.975,精确率–召回率曲线(precision–recall curve, PRC)面积为0.933;Simple Logistic紧随其后,准确率为86.85%,ROC和PRC面积分别为0.974和0.933。Friedman检验确认了算法间存在显著差异(P = 2.47 × 10?120),事后比较将XGBoost和Simple Logistic归入同一最优性能组。蛋白质、粗纤维、灰分和脂肪是最具影响力的生化性状,而颜色参数中的色调和饱和度以及形态特征中的形状指数和几何平均直径也贡献显著。G1基因型的蛋白质(27.62%)和粗纤维(40.62%)含量相对较高,是最容易被稳定区分的类别,XGBoost和Simple Logistic对其的F值分别达到0.954和0.955,而G2与G3之间更大的表型重叠导致了更频繁的相互误分类。

**结论**:这些研究结果表明,多模态表型分析结合可解释机器学习,为奇亚基因型分类提供了一种实用且具有生物学可解释性的决策支持方法。? 2026 The Author(s). *Journal of the Science of Food and Agriculture* published by John Wiley & Sons Ltd on behalf of Society of Chemical Industry.
**基于图像与生化多模态表型分析的奇亚基因型可解释分类研究解读**

**一、研究背景与问题的提出**

奇亚(*Salvia hispanica* L.)作为一种功能性食品原料,近年来受到全球日益广泛的关注。奇亚种子富含ω-3脂肪酸(尤其是α-亚麻酸),蛋白质含量约为18%–24%,膳食纤维含量约为23%–34%,同时含有 polyphenols(多酚类化合物)等抗氧化物质。其可溶性纤维、蛋白质、生物活性肽及酚类化合物共同构成了其营养与功能价值。除直接食用外,奇亚种子还被越来越多地应用于烘焙产品、肉类替代品和素食配方中,充当无麸质质构改良剂、脂肪替代品和抗氧化成分,在食品与营养保健品产业中的重要性持续上升。

准确表征奇亚基因型间的变异,对于育种、种子鉴定和质量评估具有重要意义。基因型变异可体现在种子 coat color(种皮颜色)、形状、表面结构和大小等特征上,而生化组成的差异则为基因型表征提供了另一维度。然而,传统的基于肉眼检查的种子分类方法劳动强度大、依赖操作者经验,且在大规模样本评估时难以扩展。图像处理技术为量化种子特征提供了一种快速、非破坏性的手段,结合机器学习(machine learning, ML)算法可实现自动化种子分类。尽管ML已被应用于观赏南瓜、西瓜、玉米和饲草等多种作物的基因型及品种级种子分类,但针对奇亚种子基因型的相关研究仍十分有限。此外,现有分类研究多侧重于总体预测性能,对基因型特异的误分类模式和模型决策贡献变量的信息提供不足。在这一背景下,本研究旨在评估一种整合图像衍生形态学、颜色特征与生化性状的多模态表型分析方法,用于奇亚种子基因型的可解释分类。

**二、主要关键技术方法**

研究人员在土耳其巴勒克埃西尔大都会市药用和芳香植物中心(约39.503° N,26.980° E,海拔约15 m)的田间试验中,于2023和2024两个生长季种植了四个奇亚基因型(G1、G2、G3、G4)。试验采用随机完全区组设计,设三次重复,每小区100株。每个基因型每个生长季的每个重复中选取50粒完整、无畸变的种子用于图像分析,共获得1200粒种子图像(4基因型 × 2季节 × 3重复 × 50粒);同时从对应的100 g种子样本中取样用于生化分析,确保单粒种子图像与其来源试验单元的生化剖面保持直接关联。图像采集使用高分辨率平板扫描仪,以1200 dpi光学分辨率扫描并获得PNG格式图像。图像处理流程包括RGB图像灰度化、高斯滤波去噪、基于阈值的分割、形态学操作精化二值掩膜、连通组件与轮廓分析提取单个种子感兴趣区域(region of interest, ROI)。从每粒种子图像中提取11个形态学描述符(面积、周长、长度、宽度、圆度、形状指数、球形度、几何平均直径、长宽比、充实度、离心率)和6个颜色特征(RGB三通道平均强度、HSV空间的色调与饱和度、灰度平均强度)。生化分析采用凯氏定氮法测定蛋白质、索氏提取法测定脂肪、重量法测定灰分和粗纤维、差减法计算总碳水化合物、水提干燥法测定总糖含量。最终将上述23个变量(11个形态学 + 6个颜色 + 6个生化)整合为输入矩阵。分类评估采用重复分层10折交叉验证(10次重复 × 10折 = 100次训练-测试组合),所有数据依赖的预处理步骤(如缩放和插补)仅拟合于训练折,以防数据泄漏。共比较了10种机器学习算法:随机森林(Random Forest, RF)、极限随机树(Extra Trees)、梯度提升(Gradient Boosting, GB)、AdaBoost、极端梯度提升(eXtreme Gradient Boosting, XGBoost)、决策树(Decision Tree, DT)、k近邻(k-nearest neighbors, kNN)、多层感知机(Multilayer Perceptron, MLP)、基于序列最小优化的支持向量机(SMO-SVM)和Simple Logistic回归。模型性能通过准确率、Kappa统计量、精确率、召回率、F1值、MCC、ROC曲线下面积(ROC-AUC)和PRC面积(PRC-AUC)等指标综合评估。使用Friedman检验和Nemenyi事后检验进行统计算法比较。对于树系集成模型和Simple Logistic,直接使用模型内置的特征重要性(基于Gini不纯度或标准化系数幅值);对于kNN、SMO-SVM和MLP,则计算排列重要性(permutation importance),即每次随机打乱一个特征20次后记录分类准确率的下降量。

**三、研究结果**

**总体分类性能**:XGBoost取得最高数值准确率(86.99%),Simple Logistic以86.85%紧随其后,RF为85.95%。但Nemenyi事后检验表明这三个性能最优算法之间无统计学显著差异。MCC方面三者相近(XGBoost 0.820、Simple Logistic 0.822、RF 0.823)。XGBoost的ROC面积最高(0.975),Simple Logistic(0.974)、Gradient Boosting(0.972)、Extra Trees(0.971)和RF(0.971)也表现优异。PRC面积方面XGBoost和Simple Logistic均达0.933。DT和AdaBoost表现最弱,准确率分别为72.30%和69.46%。Friedman检验确认了算法间存在极显著差异(χ2 = 585.688,P = 2.47 × 10?120)。通过上述多种指标的综合评估得出,XGBoost、Simple Logistic和RF提供了最强的总体分类性能。

**基因型水平分类结果**:G1基因型在所有模型中获得了最高的分类成功率。以Simple Logistic为例,对G1的精确率、召回率和F值分别达到0.956、0.955和0.955;XGBoost对G1的精确率为0.951、召回率0.958、F值0.954。G1在所有高性能模型中的ROC面积均超过0.994,表明G1与其余基因型具有极强区分度。相比之下,G2和G3之间出现了明显的分类困难,归一化混淆矩阵显示误分类恰好集中在这两个类别之间。RF模型中G2和G3的召回率分别为0.819和0.802,较弱模型如DT和AdaBoost中G2/G3的F值更是降至0.649–0.681之间。G4的区分度居中,XGBoost、Gradient Boosting和Simple Logistic对其的F值在0.851–0.856之间,ROC面积介于0.973–0.975。通过基因型水平的热图分析得出,G1在各算法中均保持一致的高分类性能。

**特征重要性与可解释性发现**:通过特征重要性分析发现,蛋白质、粗纤维、灰分和脂肪是多个高性能模型中排名靠前的变量。表1数据表明,G1在多项生化指标上与其他基因型存在显著差异,如蛋白质(27.62%)、粗纤维(40.62%)、灰分(7.67%)和脂肪(37.73%)含量均最高,这可能解释了G1始终被高精度区分的原因。颜色特征方面,G3具有最高的色调值(43.507°),G2具有最高的饱和度(70.825%),这些差异在模型的重要性剖面中有所体现。形态学特征如形状指数、圆度和几何平均直径也对模型预测有所贡献。

**排列重要性分析**:对kNN、SMO-SVM和MLP进行的排列重要性分析提供了补充视角。kNN模型中,蛋白质、粗纤维和灰分被置换后准确率显著下降;SMO-SVM模型中蛋白质、灰分和碳水化合物最具影响力;MLP模型中蛋白质、粗纤维和灰分的排列重要性最高。这些结果表明,尽管不同模型的决策机制各异,生化变量、形态学特征和颜色相关特征均对基因型区分有所贡献。

**四、讨论与结论**

本研究证明,形态学、颜色和生化特征可以整合用于奇亚基因型的分类。这种多模态整合方法相比任何单一特征组,能够更全面地表征基因型间的变异。值得注意的是,Simple Logistic尽管结构相对简单,其性能在统计学上与领先的集成模型相当,这表明整合特征集中的判别信息具有足够的结构化程度,可被不同的学习策略捕获。基因型间的分类差异——特别是G2与G3之间的显著重叠——反映了真实存在的表型相似性,这一现象也与prior研究(如番石榴种质和燕麦属物种的研究)中报道的形态-生化变异导致的基因型区分困难相呼应。生化参数,尤其是蛋白质、粗纤维、灰分和脂肪,被多个模型赋予了较高的重要性权重,但这应被理解为试验单元水平的组成差异,而非单粒种子水平的直接生化判别。图像衍生的形态学和颜色特征(色调、饱和度、圆度、几何平均直径、形状指数)同样为基因型区分提供了补充信息。可解释人工智能(XAI)方法通过识别与模型预测最相关的变量,增强了分类过程的透明度。本研究的方法创新在于利用可解释ML方法整合图像形态学特征、颜色参数和生化数据,此类多模态奇亚表型研究在文献中仍属少见。重复交叉验证和多种评价指标的使用提供了全面的性能评估。

研究结论指出:XGBoost、Simple Logistic和RF实现了最强的总体分类性能,三者间无统计学显著差异。Simple Logistic的可比性能进一步表明,整合特征集中的判别信息可被不同学习策略捕获,包括相对简单的线性模型。在基因型层面,G1始终以较高的分类性能被稳定区分,而G2和G3表现出更大的表型重叠,误分类更为频繁。特征重要性和排列重要性分析突显了多项生化变量,特别是蛋白质、粗纤维、灰分和脂肪,以及图像衍生的颜色和形态特征如色调、饱和度和形状指数。由于生化变量在试验单元水平上测量,其贡献应被解释为相应种子样本的组成信息,而非单粒种子的生化测量值。总体而言,将图像衍生信息与生化信息结合可解释的机器学习,为奇亚基因型分类提供了有效框架。在更广泛的遗传材料和环境条件下进行进一步验证,对于评估该方法在高通量种子表型分析和育种应用中的潜力将是必要的。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号