基于您提供的文档内容,以下是针对四个问题的依次回答: 中文标题 基于机器学习驱动的识别致癌物高级预测系统

《Scientific African》:Advanced predictive systems for identifying carcinogens powered by machine learning

【字体: 时间:2026年07月19日 来源:Scientific African 3.7

编辑推荐:

  提升致癌物分类的精确度对于改进化学品安全评估和风险评估至关重要。机器学习(Machine Learning, ML)技术在化学信息学(Cheminformatics)中日益被用于识别分子描述符与致癌结果之间的关系。然而,许多现有研究依赖于有限的描述符集或评估少

  
提升致癌物分类的精确度对于改进化学品安全评估和风险评估至关重要。机器学习(Machine Learning, ML)技术在化学信息学(Cheminformatics)中日益被用于识别分子描述符与致癌结果之间的关系。然而,许多现有研究依赖于有限的描述符集或评估少量预测模型。在这项研究中,研究人员通过整合多样化的分子指纹和描述符(包括径向基函数(Radial Basis Function, RBF)描述符、MaxsolH、MaxsolO、MaxssO以及若干基于键的特征,如B01(C–O)、B02(C–C)和B07(C–O))开发了一个综合数据集。多类描述符的整合提供了更详细的分子结构表征,并能够更系统地评估其对致癌性预测的影响。为了研究这些描述符的预测能力,研究人员应用了几种机器学习算法将致癌潜力分类为二元结果。这些算法包括k近邻(k Nearest Neighbors, KNN)、决策树(Decision Tree)、极端梯度提升(Extreme Gradient Boosting, XGBoost)、轻量级梯度提升机(Light Gradient Boosting Machine, LightGBM)、逻辑回归(Logistic Regression)、装袋分类器(Bagging Classifier)、自适应提升(Adaptive Boosting, AdaBoost)、梯度提升(Gradient Boosting)、类别提升(Categorical Boosting, CatBoost)、多层感知机(Multilayer Perceptron, MLP)、投票分类器(Voting Classifier)和二次判别分析(Quadratic Discriminant Analysis, QDA)。研究人员实施了一个比较建模框架来评估这些算法的预测性能,并确定最适合致癌性预测的模型。结果表明,集成提升算法实现了最高的预测性能。特别是,极端梯度提升(XGBoost)达到了0.9656的训练准确度(Accuracy),而轻量级梯度提升机(LightGBM)获得了0.9394的测试准确度。除模型比较外,研究人员还进行了皮尔逊(Pearson)相关性分析以识别最具影响力的分子描述符。在所研究的特征中,B07(C–O)表现出与致癌性的中等负相关(?0.43),其次是B08(C–O)(?0.41)和B10(C–C)(?0.40)。这些值表明在该数据集内存在轻度至中度的反向统计趋势,而非直接的机制因果关系,可作为预测模型有用的探索性特征。总体而言,本研究利用集成分子描述符集对多种机器学习算法进行了全面评估,并强调了基于键的特征对致癌性评估的预测相关性。所提出的方法有助于开发数据驱动的计算工具,以支持致癌物分类并协助研究人员在化学信息学和计算毒理学(Computational Toxicology)中优先进行进一步毒理学评估的化学化合物筛选。
论文解读文章
研究背景方面,2022年全球塑料材料产量约达400.3百万公吨,其中近40%用于包装材料生产。这些包装产品由聚合物、化学添加剂及涂层粘合剂等多种成分组成,添加剂如抗氧化剂、阻燃剂和增塑剂虽赋予功能益处,但塑料中也可能含有未反应单体、加工助剂或残留添加剂等无意残留物,这些物质可能迁移至食品化妆品或环境中。许多塑料添加剂具有毒理学特性并与严重健康结果相关,如邻苯二甲酸盐和双酚A(Bisphenol A, BPA)被认定为内分泌干扰物,某些阻燃剂可引发肝毒性,暴露于稳定剂染料和增塑剂可能导致皮肤反应。部分塑料相关化合物被正式归类为致癌物,如氯乙烯与肝癌相关,热应力可加速塑料内化学转化释放挥发性烃类化合物造成DNA损伤即遗传毒性(Genotoxicity)。环境因素如湿度、pH、材料老化和紫外线(Ultraviolet, UV)暴露显著影响塑料降解及有害化学物质释放。传统致癌性评估依赖体内啮齿动物生物测定和体外测定,耗时昂贵且具伦理挑战,现有计算致癌性预测研究多聚焦有限描述符集或少量算法缺乏统一框架下的系统比较,因此研究人员开展此项研究以整合多样描述符并系统评估多类机器学习算法提升预测精度。
研究人员开展了基于机器学习的致癌物分类预测框架研究,得出集成提升算法表现最优的结论,重要意义在于为化学安全评估和计算毒理学提供数据驱动的工具支持,该研究发表于《Scientific African》。
关键技术方法方面,研究人员使用源自化学信息学存储库的11553种化合物综合数据集,涵盖36个分子描述符包括RBF、MaxsolH、MaxsolO、MaxssO及B01(C-O)等键特定描述符,由alvaDesc v2.0.6从化合物二维结构计算并在建模前归一化至[0,1]范围。数据按分层策略分割为70%训练集、15%验证集和15%独立测试集,并采用5折交叉验证。研究人员选用十二种分类算法包括KNN、决策树、XGBoost、LightGBM、逻辑回归、BaggingClassifier、AdaBoost、梯度提升、CatBoost、MLP、投票分类器和QDA,通过网格搜索进行超参数优化,利用准确度、精确度、召回率、F1分数和ROC曲线下面积(Area Under Curve, AUC)评估性能,并运用Pearson相关分析和SHAP(SHapley Additive exPlanations)值进行特征解释,模型依据OECD(Organisation for Economic Co-operation and Development)的QSAR(Quantitative Structure-Activity Relationship)验证原则评估。
研究结果部分保留小标题说明如下:
Approach and analysis of statistical data即方法与统计分析,研究人员选择距离基方法、树基算法、提升集成、线性分类器和神经网络模型以提供全面评估,这些算法适用于分子描述符衍生的结构化数值数据集且在类似分类问题中表现可靠,能提供特征重要性分析洞察特定分子描述符对致癌性预测的贡献。
Foundation in machine learning即机器学习基础,详细算法定义移至补充材料,主文提供简要方法论背景,所选算法代表适用于描述符基化学数据集的多样化广泛应用分类方法,能在中等样本量下有效处理结构化数值描述符并提供鲁棒性能,许多模型具可解释性允许分析特征重要性,鉴于研究聚焦中等样本量的描述符数据集,经典和集成机器学习算法提供了可靠且计算高效的预测建模框架。
Statistical Analysis of Data即数据统计分分析,数据集含约6400非致癌物和5200致癌物样本分布较平衡,支持可靠训练评估。描述符涵盖2D原子对、原子类型E态指数、原子中心片段、官能团计数、连接性指数、环描述符、构成指数和扩展拓扑化学原子(Extended Topochemical Atom, ETA)指数等家族,量化与致癌性等毒理学终点相关的结构、电子、拓扑和组成属性。
Pearson Correlation Analysis即皮尔逊相关分析,研究人员进行Pearson相关分析检验分子描述符与致癌性间统计关系,评估各描述符与目标变量的线性关联强度方向,系数介于–1至+1。结果显示B07(C–O)呈中度负相关(?0.43),B08(C-O)和B10(C-C)分别为?0.41和?0.40,这些|r|<0.5的幅度代表数据集中度统计对齐而非直接生物因果或分子机制,作为树基算法建立非线性分类边界可利用的共享统计模式,研究人员补充应用SHAP分析提供模型感知的非线性特征贡献解释,其识别的最具影响力描述符与Pearson分析突出者模式一致支持发现稳健性。
Modeling evaluation即建模评估,研究人员采用准确度、精确度、召回率和F1分数等量度,准确度是正确分类实例占总样本比例,精确度是预测为正例中实际正例比例,召回率是实际正例中被正确识别比例,F1分数是两者调和均值。在毒理学预测中假阴性尤为关切因其将致癌物误判非致癌物带来健康风险,故召回率即灵敏度是关键指标。
Results and Discussion即结果与讨论,超参数优化通过网格搜索统一执行,各算法关键参数如BaggingClassifier的n_estimators、决策树和XGBoost的max_depth、KNN的k值、LightGBM和CatBoost的num_leaves等均经调整。混淆矩阵显示基于梯度的提升模型尤其是XGBoost和LightGBM分类最平衡,假阴性和假阳性均较低,KNN和逻辑回归判别力较弱。表1显示XGBoost训练准确度0.9656±0.0024、测试准确度0.9399±0.0039,LightGBM训练准确度0.9497±0.0031、测试准确度0.9394±0.0042,CatBoost测试准确度0.9329±0.0046,集成模型优于传统方法,提升方法受益于组合多决策树捕捉非线性关系。ROC曲线表明XGBoost和LightGBM的AUC最高曲线靠近左上角具强判别力和泛化性,BaggingClassifier和CatBoost具竞争力但稍低,逻辑回归和QDA的AUC较低。SHAP摘要图显示B07[C–O]、MaxssO和B04[C–C]影响最大,全局特征重要性基于平均绝对SHAP值确认B07[C–O]平均影响最高次之MaxssO、B04[C–C]、MaxdO和RBF,SHAP解释较相关分析更可靠因考虑非线性与交互。研究人员指出模型符合OECD的QSAR五原则包括定义终点、明确算法、定义适用域(Applicability Domain, AD)、拟合稳健预测性及机制解释,适合作化学品安全评估。局限性包括描述符表示可能未完全捕获空间关系、数据集规模和多样性限制、主要聚焦经典集成而未用图神经网络,未来可整合大数据集、深度学习架构和图表示及混合框架,外部验证限于同库分割未来需脚手架拆分和独立库验证。
总结讨论部分,研究人员强调计算毒理学方法如QSAR和机器学习作为早期筛选工具补充传统监管测试而非替代,可在权重证据法中整合支持初步危害评估与化合物优先排序。所开发框架系统分析多样描述符并在统一流程比较算法,支持监管毒理学工作流中QSAR筛选策略。
结论部分翻译为:评估化学化合物的致癌潜力是化学安全研究的重要方面,尤其在药物、农业及工业应用中。传统上此类评估依赖实验数据和专家评价,通常耗时且资源密集。机器学习的最新进展使得利用分子描述符提高致癌物分类效率和准确度成为可能。在本研究中,研究人员通过整合若干分子描述符(包括径向基函数描述符、MaxsolH、MaxsolO、MaxssO以及B01(C–O)、B02(C–C)和B07(C–O)等键特定特征)构建了一个综合数据集。这些描述符代表了影响化合物与生物系统相互作用的重要化学和结构特征。描述符的多样性有助于提高模型预测能力同时减少过拟合可能性。研究人员应用了若干机器学习算法来建模分子描述符与致癌性之间的关系,这些算法包括k近邻、决策树、极端梯度提升、轻量级梯度提升机、逻辑回归、装袋分类器、自适应提升、梯度提升、类别提升、多层感知机、投票分类器和二次判别分析。结果表明极端梯度提升和轻量级梯度提升机在评估模型中达到最高预测性能,例如极端梯度提升达到96.56%的训练准确度而轻量级梯度提升机达到93.94%的测试准确度。皮尔逊相关分析进一步证明若干分子描述符在致癌性预测中的重要性,其中B07(C–O)表现出与致癌性的中等负相关(?0.43),其次是B08(C–O)(?0.41)和B10(C–C)(?0.40),表明数据集分类内存在轻度至中度的反向统计关联。相反B06(C–N)和B09(C–N)等描述符呈较弱线性关联暗示其在初步筛选中独立作用有限。重要的是这些值代表统计趋势而非直接生物因果。总体而言结果表明机器学习模型结合分子描述符可为致癌物分类提供有用计算支持,此类方法可协助研究人员和毒理学家优先进行进一步实验评估和风险评估的化合物。从理论角度本研究通过展示特定分子键描述符如何借助机器学习技术与致癌结果系统关联为计算毒理学日益增长的研究做出贡献,结果进一步洞察影响致癌性的结构特征并强调基于键的描述符在预测建模中的相关性。从实践角度所提建模框架可支持研究人员毒理学家和监管机构早期识别和优先处理潜在致癌化合物,通过提供计算筛选方法结果可能有助于减少广泛实验测试需求并协助药物开发化学品安全评估和环境风险评估中的决策过程。作者为Kusum Yadav|Lulwah M. Alkwai|Shahad Almansour|Basem Abu Zneid|Tabib Shahzada,单位College of Computer Science and Engineering. University of Ha'il. Ha'il. Kingdom of Saudi Arabia。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号