挥发性有机化合物谱与机器学习算法整合构建酱香型白酒判别模型

《Journal of Food Composition and Analysis》:Integrating Volatile Organic Compound Profiles with Machine Learning Algorithms to Construct a Discrimination Model for Jiangxiangxing Baijiu

【字体: 时间:2026年07月12日 来源:Journal of Food Composition and Analysis 5.3

编辑推荐:

  本研究开发了一种用于酱香型白酒(JXXB)分类的靶向且高效的策略,具体针对酱香型白酒(大曲)(JXXB-D)、酱香型白酒(其他)(JXXB-O)以及食用酒精勾调酒(EABL)。该方法学将挥发性化合物的化学特征谱与机器学习算法相结合。研究人员测定了82种挥发性化

  
本研究开发了一种用于酱香型白酒(JXXB)分类的靶向且高效的策略,具体针对酱香型白酒(大曲)(JXXB-D)、酱香型白酒(其他)(JXXB-O)以及食用酒精勾调酒(EABL)。该方法学将挥发性化合物的化学特征谱与机器学习算法相结合。研究人员测定了82种挥发性化合物的浓度,并将其转换为气味活性值(OAV),以更好地反映其实际分类贡献。采用了随机森林(Random Forest)、CatBoost和朴素贝叶斯(Na?ve Bayes)分类器,所有模型在使用全组分数据及其OAV时均表现出优异的分类性能。为简化方法,研究人员应用多模型特征重要性评估,成功鉴定出20种核心组分(包括醇类、醚类、吡嗪类、醛/酮类和酯类)。仅基于这20种标志物构建的简化模型仍保持了与全模型相当的分类指标,实现了较高的准确率(>0.95)、精确率(>0.95)和曲线下面积(AUC,受试者工作特征曲线下面积)(>0.95)。这些关键组分的分布模式与不同生产工艺的理论预期相一致。所建立的方法仅需检测有限数量的组分,因此可作为一种实用、经济且快速的解决方案,适用于中小企业质量控制及监管部门的常规检验,从而满足白酒行业的重要需求。
该文发表于《Journal of Food Composition and Analysis》,围绕酱香型白酒不同产品类型的快速鉴别问题,建立了一个将挥发性有机化合物(VOC,volatile organic compound)谱与机器学习相结合的判别框架。研究背景在于,酱香型白酒作为风味高度复杂的蒸馏酒,其不同类别之间在市场端存在显著的价格差异和工艺差异。依据中国国家标准,酱香型白酒可分为酱香型白酒(大曲)(JXXB-D)和酱香型白酒(其他)(JXXB-O);此外,市场上还存在以这两类产品与食用酒精勾调形成的食用酒精勾调酒(EABL)。由于不同类别产品之间缺乏清晰、低成本且高效率的边界判别工具,一些经营者可能通过掺假、误标等方式获取商业利益,进而损害消费者权益。因此,建立一套兼具科学性、可操作性和推广性的分类方法,具有明确的产业和监管意义。

当前针对酱香型白酒分类的手段主要包括感官评价和仪器分析两大类。感官评价受评酒人员的专业经验、个体生理心理状态以及描述一致性影响较大,难以满足一线监管和常规筛查对客观性与稳定性的要求。另一方面,气相色谱-质谱(GC-MS)、液相色谱-质谱(LC-MS)、同位素分析和红外光谱等技术虽具有较高精度,但普遍存在设备成本高、标准品需求多、样品处理和数据分析复杂、对技术人员要求高等限制,不利于中小酒企和基层检测机构常态化应用。在这一背景下,研究人员提出以有限数量的关键风味标志物替代全组分复杂分析的思路,通过筛选真正具有判别贡献的化学指标,构建简化而可靠的分类模型,从而弥合主观感官法与高门槛仪器法之间的应用鸿沟。

为实现这一目标,研究人员系统收集了来自贵州省核心产区、酒精度统一为53% vol 的样品,并结合厂家捐赠与市场购买渠道构建样本集合。样品经初步分组后,辅以5名认证高级白酒品酒师按照国家标准进行复核、盲评和一致性判定,最终纳入JXXB-D 107份、JXXB-O 46份和EABL 52份样品。随后,研究人员采用GC-MS对82种挥发性化合物进行定性与定量分析,并进一步依据气味阈值将浓度数据转换为气味活性值(OAV,odor activity value),以增强对不同化合物实际感官贡献的刻画。基于原始浓度数据与OAV数据,研究人员分别构建随机森林、CatBoost和朴素贝叶斯三类模型,用于多维交叉验证和特征筛选,最终建立简化判别模型。

主要技术方法可概括如下:研究以贵州省核心产区53% vol酱香型白酒为样本来源,经感官复核后纳入JXXB-D、JXXB-O和EABL三类样品;采用气相色谱-质谱(GC-MS)在选择离子监测(SIM)模式下对82种挥发性化合物进行绝对定量,并将浓度换算为气味活性值(OAV);使用主成分分析(PCA)进行初步数据探索,随后构建随机森林、CatBoost和高斯朴素贝叶斯分类模型,并以多模型特征重要性平均值筛选20种核心标志物,再通过交叉验证和袋外评估(OOB)检验模型泛化能力。

在结果部分,论文首先报告了“3.1. Principal Component Analysis of Volatile Compounds”。研究人员分别基于82种挥发性化合物的原始浓度数据和OAV数据进行主成分分析(PCA)。结果显示,两类数据在不同样品类型之间均能表现出一定程度的分离趋势,但PC1、PC2和PC3累计解释率均低于65%,明显低于通常用于衡量模型充分性的80%–95%范围。这表明在多变量、高复杂度样本条件下,PCA对酱香型白酒类别区分的解释力有限,难以充分揭示复杂工艺差异背后的化学信息。尤其是部分JXXB-D样本分散程度较高,也反映出同一工艺体系内不同批次或不同厂家的质量差异。该结果支持后续引入更高效机器学习模型的必要性。

在“3.2. Adaptability Verification of Random Forest Model with Experimental Data”部分,研究人员验证了随机森林模型对实验数据的适用性。针对数据划分比例、是否打乱数据以及交叉验证设置等关键参数进行了优化。结果显示,在未进行数据打乱和交叉验证时,训练集与测试集样本类别分布失衡,导致模型性能下降,甚至出现某一类别未被纳入训练集而发生系统性误判的情况。引入数据打乱及3折、6折、8折交叉验证后,模型在训练集和测试集上均获得优异表现,准确率为0.968–1,精确率为0.968–1,AUC为0.999–1。基于OAV的数据集也获得了相近的结果。这说明随机森林能够有效处理该研究中的高维风味数据,并实现三类白酒样品的高精度分类。

在“3.3. Validation with CatBoost and Na?ve Bayes Classifier Models”部分,研究人员进一步利用CatBoost和朴素贝叶斯模型对分类结果进行交叉验证,以降低单一模型带来的偏差风险。由于随机森林测试已表明不同交叉验证折数对结果影响不大,后续统一采用6折交叉验证。结果显示,CatBoost和朴素贝叶斯模型在处理浓度数据时同样取得了优异性能,准确率为0.958–1,精确率为0.962–1,AUC为0.968–1;OAV数据结果亦相当。三类基于不同计算原理的模型均显示出高水平预测能力,表明本研究获取的挥发性组分数据中确实包含能够稳定区分JXXB-D、JXXB-O和EABL的特征信息。

在“3.4. Reconstructing Machine Learning Models Based on Key Characteristic Components from Multiple Models”部分,研究人员将研究重点转向模型简化与可推广性。考虑到全组分模型虽然精度高,但在非专业机构中的推广受限,因此研究人员整合了3次随机森林和1次CatBoost运行所得的特征重要性结果,并同时考虑浓度数据与OAV数据,计算82种化合物的平均特征重要性。基于这一综合排序,筛选出前20种挥发性核心组分,用于重建新的分类模型。结果表明,仅使用这20种组分构建的模型,仍可获得准确率0.972–1、精确率0.954–1、AUC 0.977–1的优异指标,与82组分全模型基本相当。进一步利用随机森林的袋外评估(OOB)对20组分模型进行二次验证,准确率、召回率、精确率、F1值和AUC均超过0.97,OOB分数分别达到0.993和1,显示模型具有很强的泛化能力。研究人员还进行了6次独立重复运行,除1次测试结果略低外,其余各项指标均高于0.95,说明该模型稳定性较高,软件随机化规则带来的偏差可以忽略。

在“3.5. Distribution of 20 Core Components in Three Baijiu Types and Theoretical Feasibility Analysis”部分,研究人员从化学组成和工艺机制层面对20种核心标志物的合理性进行了讨论。结果显示,20种标志物中有14种在JXXB-D中占优势,另外6种在JXXB-O中占优势,而EABL中未发现优势组分。这一分布规律与三类产品内在组成特征一致,即JXXB-D风味物质最为丰富,JXXB-O次之,EABL最少。研究还指出,JXXB-D中的优势组分包括仲戊醇、3-辛醇、2-己酮、苯乙酮、异戊酸乙酯、糠醛、5-甲基-2-糠醛、5-甲基-2-乙酰基呋喃、2-甲基吡嗪、2,3-二甲基吡嗪、2-乙基-3,5-二甲基吡嗪、2-乙基-3,5,6-三甲基吡嗪、二乙氧基甲烷和1,2-二甲氧基苯等,这些组分与高温堆积、反复发酵、蒸馏及长期贮存等大曲酱香工艺特征相一致。相对地,JXXB-O的特征组分包括乙酸苯乙酯、乳酸异戊酯、2,3-丁二醇、丙醛、壬酸乙酯和癸酸乙酯等,其形成与粉碎高粱、糖化酶参与和较快发酵过程密切相关。研究据此认为,机器学习筛选出的核心指标不仅具有统计判别价值,也与不同生产工艺下的风味形成机制具有较好的对应关系,不过作者同时指出,这种对应目前仍属于初步支持,尚不能直接视为因果证据。

讨论部分的核心在于,本研究并非试图完全替代传统分析流程,而是力图筛选并界定一组最小化、可判别的化学标志物集合,以服务于白酒产品分类。在实际应用中,这20种核心化合物的定量仍依赖GC-MS,但相较于同时分析82种挥发性物质,简化方案仅需少量标准品和更短检测时间,能够显著降低标准物质消耗、减少技术操作复杂度,并充分利用现有实验室基础设施。对于中小型酿酒企业和地方监管实验室而言,这一策略更具有现实可行性和成本效益。

研究结论部分可译述如下:本研究针对主流JXXB-D、JXXB-O和EABL的分类与区分需求,通过整合化学分析与机器学习,建立了一种基于关键标志物的高效识别策略。研究同时采用原始浓度数据及其转换后的OAV进行分析,从而更科学地评估各组分的实际风味贡献。在此基础上,应用随机森林、CatBoost和朴素贝叶斯等多模型进行交叉验证。结果表明,基于全部82种挥发性组分构建的模型具有优异分类性能,准确率、精确率和AUC均超过0.95。进一步通过多模型特征重要性评价,筛选出20种核心风味组分,包括醇类、醚类、吡嗪类、醛/酮类和酯类,并据此建立简化模型。该模型在显著降低分析复杂度和检测资源需求的同时,仍保持较高分类准确性。这些核心组分的分布模式与不同生产工艺的理论预期高度一致,例如JXXB-D表现出较高的吡嗪类水平,从而验证了其作为分类化学标志物的科学可靠性。总体而言,该研究为基于现有GC-MS条件构建低成本、快速、实用的酱香型白酒鉴别方案提供了明确依据,对白酒品类快速区分、中小企业质量控制及日常市场监管具有重要应用价值。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号