区域环境主导的恩施州鲜茶叶代谢组学特征及机器学习地理起源判别

《Food Chemistry: X》:Metabolomic signatures and machine learning-based geographical origin discrimination of fresh tea leaves from Enshi Prefecture

【字体: 大 中 小 】 时间:2026年09月25日 来源:Food Chemistry: X 6.5

编辑推荐:

  本研究将常规化学成分分析与基于超高效液相色谱-四极杆飞行时间质谱(UHPLC-QTOF-MS)的非靶向代谢组学相结合,对采自湖北省恩施土家族苗族自治州巴东、恩施、鹤峰、利川、宣恩和咸丰六个核心产茶县的47份鲜茶叶样品进行了系统分析。结果显示,区域环境对鲜叶代谢

  
本研究将常规化学成分分析与基于超高效液相色谱-四极杆飞行时间质谱(UHPLC-QTOF-MS)的非靶向代谢组学相结合,对采自湖北省恩施土家族苗族自治州巴东、恩施、鹤峰、利川、宣恩和咸丰六个核心产茶县的47份鲜茶叶样品进行了系统分析。结果显示,区域环境对鲜叶代谢表型的决定性影响超过海拔和遗传背景。不同产地呈现显著差异的化学特征:鹤峰(HF)以高氨基酸含量为特征,巴东(BD)以高可溶性糖和咖啡因含量为特征,咸丰(XF)以高茶多酚含量为特征,宣恩(XE)以高黄酮含量为特征,利川(LC)则表现为高黄酮和低茶多酚的组合,而恩施(ES)呈相对平衡的代谢状态。海拔对核心代谢物的影响有限且缺乏系统性。通过加权基因共表达网络分析(WGCNA)和机器学习建模,研究人员构建了随机森林(RF)判别模型,在内部测试集中取得100%的分类准确率;基于Shapley加法解释(SHAP)方法识别出腺苷等多种候选判别代谢物。该研究为恩施州鲜茶叶的地理起源判别提供了代谢组学依据,并为区域茶叶品质形成机制研究奠定了基础。
茶叶品质形成主要取决于鲜叶原料的物质基础和产地环境的“风土(Terroir)”效应。中国恩施土家族苗族自治州地处北纬30°,具有独特的亚热带季风气候和土壤条件,其鲜叶代谢物被赋予区域性识别特征。然而,已有研究多集中于成品茶,鲜叶原料在不同山地微环境下的代谢差异尚未充分表征。为此,研究人员提出假设:不同产地鲜叶在化学组成和整体代谢谱上存在可检测差异;这些差异涉及多个代谢途径的协同变化,而非孤立化合物;且区域相关代谢特征可为机器学习产地判别提供足够信息。

研究人员从恩施州巴东(BD)、恩施(ES)、鹤峰(HF)、利川(LC)、宣恩(XE)和咸丰(XF)六个核心产茶县采集47份鲜叶样品(涵盖17个品种),结合基础化学分析和超高效液相色谱-四极杆飞行时间质谱(UHPLC-QTOF-MS)非靶向代谢组学表征了区域差异。通过加权基因共表达网络分析(WGCNA)识别与产地相关的代谢模块,并整合差异代谢物构建支持向量机(SVM)、极限梯度提升(XGBoost)和随机森林(RF)判别模型,以Shapley加法解释(SHAP)定量评估代谢物贡献。

关键技术方法简述:样本为2024年4月1–5日于47个地理定位点采集的鲜茶叶,按四分法取样并微波固定、冻干。环境数据提取自国家青藏高原数据中心1km分辨率月均温与降水数据集。采用国家标准方法测定茶多酚、游离氨基酸、儿茶素、咖啡因等理化指标;UHPLC-QTOF-MS在正负离子模式下采集数据,经TIC归一化等预处理后获得1713个代谢物。统计方法包括方差分析(ANOVA)、Spearman相关、主成分分析(PCA)、偏最小二乘判别分析(PLS-DA)、WGCNA及三种机器学习算法,并采用五折交叉验证和内部测试集评估。

3.1 基础化学品质差异及与海拔的相关分析
3.1.1 特征化学成分分析
化学分析显示六个产地的鲜叶化学成分存在显著差异(P<0.05)。HF产地总游离氨基酸和茶氨酸含量最高,而茶多酚较低,呈典型高氨基酸低多酚特征;BD的可溶性糖和咖啡因含量显著高于其他产地;XF总茶多酚含量最高;XE总黄酮含量显著偏高;LC高黄酮但低茶多酚,且没食子酸低;ES各成分相对均衡。儿茶素组分方面,BD同时富含EGCG、EGC和GC,XF和XE保持较高酯型儿茶素,LC富含EC,ES以GCG为主。这表明区域环境与鲜叶化学组成的地理分化紧密相关。

3.1.2 主要化学成分与海拔的相关模式
Spearman相关与非线性拟合显示,15种核心成分中仅ECG(P=0.04)和总茶多酚(P=0.03)与海拔呈弱负相关,其余均无显著线性趋势。说明在本样本范围内,海拔不是主导这些化合物变化的因素。

3.2 代谢谱的地理分化及海拔相关变异
3.2.1 代谢数据降维和可视化
基于UHPLC-QTOF-MS共注释到1713个代谢物,涵盖氨基酸及其衍生物、有机酸、黄酮、酚酸、生物碱等14类。PCA显示BD与其余产地显著分离,PLS-DA将样品分为三簇,UMAP进一步实现六产地完全分离,表明代谢谱含有产地判别信息。海拔分组比较发现仅13个代谢物在所有配对比较中显著差异,占总数不到1%,且变化幅度有限,方向不一致,进一步支持海拔影响较小。

3.2.2 与地理起源相关的差异代谢物筛选与特征化
通过PLS-DA(VIP>1.5,P<0.05)共筛选出135个差异代谢物,其中多酚类45个、肽类33个、有机酸14个、萜类12个等。XE和XF呈现多类别协同高积累,黄酮、儿茶素衍生物、生物碱、有机酸、核苷和糖类均高水平;BD特异性富集脂质和多种有机酸;ES相对低多酚而高肽类(如Phe-Lys-Tyr)和亚麻苦苷;LC和HF处于中间但保留个体特异性,如LC中百里醌和3-甲基己二酸升高。

3.3 基于代谢网络的预测建模与机制分析
3.3.1 WGCNA分析
WGCNA将代谢物划分为多个模块,并与产地关联。XE和XF均与ME#BE94BD等模块正相关,该模块含多酚、脂质、有机酸和核苷,表明两产地代谢差异是跨化学类别的协调变化;BD与含脂质和有机酸的模块正相关,但与另一脂质模块负相关,反映不同脂质亚群的方向性调控;ES与富含肽的模块正相关,凸显肽相关代谢特征。

3.3.2 地理起源判别模型构建
3.3.2.1 模型性能评估与算法选择
比较三种模型,SVM准确率80%,XGBoost为90%,RF在内部测试集上准确率达100%(95% CI:91
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号