《International Journal of Molecular Sciences》:Biopesticidal Potential of the Cannabis sativa L. Metabolites: A Denoised, Docking-Informed QSAR Model
编辑推荐:
植物代谢物是新生物农药的重要来源,但其化学多样性超出实验筛选能力。大麻(Cannabis sativa)是发现此类化合物的理想作物,其代谢组尚未被系统评估生物农药潜力。研究人员利用大麻化合物数据库(CCD)中5211种标注为大麻代谢物的化合物,采用图基分子预测
植物代谢物是新生物农药的重要来源,但其化学多样性超出实验筛选能力。大麻(Cannabis sativa)是发现此类化合物的理想作物,其代谢组尚未被系统评估生物农药潜力。研究人员利用大麻化合物数据库(CCD)中5211种标注为大麻代谢物的化合物,采用图基分子预测与蛋白-配体互作分析相结合的框架。初始优先化使用在分子图并增补RDKit描述符上训练的定向消息传递神经网络(DMPNN)。DMPNN预测与基于残基水平Vina互作项的CatBoost衍生对接一致性评分整合,较单独结构模型假阳性率降低约60%。用随机矩阵理论(RMT)框架识别信息性配体-残基互作。DMPNN选出1010种DMPNN阳性化合物(评分更一致于DS2农药参照集而非DS3乙酰胆碱酯酶(AChE)非活性参照集),经CCD注释过滤保留44种次生代谢物,按最终集成评分排序。与参照农药比,大麻代谢物数据集水平预测中位口服LD50更高、器官特异性毒性警示更少(非所有终点)。该结构+对接信息工作流鉴定出少量化学多样高分大麻化合物,可优先实验验证。
研究背景方面,合成农药高强度使用导致土壤与水体长期污染、非靶标生物下降及生物多样性减少,害虫对常用药剂快速抗性化,形成用量与危害递增的恶性循环。植物代谢物降解快、环境蓄积低、作用机制复杂,可延缓抗性,而工业大麻(Cannabis sativa L.)代谢组已被充分表征,含大麻素、萜类、黄酮、酚酸与脂质等数千种结构多样特化代谢物,且叶片、花序等非纤维生物质富含有用分子却未高值化利用。已有研究多聚焦单体或粗提物,整个大麻代谢组的生物农药潜力未被系统评估;对五千余化合物逐一经实验评价在成本与劳力上不可行,因此亟需结合化学信息学、分子对接与机器学习(ML)的计算优先化策略。研究人员据此对CCD来源大麻化学空间做代谢组尺度候选发现,并用独立蛋白-配体互作信息校正单纯结构相似带来的假阳性,论文发表于《International Journal of Molecular Sciences》。
主要关键技术方法上,研究人员构建三套数据:CCD来源大麻代谢物集DS1、农药库(BPDB/PPDB)注册农药集DS2、PubChem中AChE非活性集DS3;用Chemprop实现的有向图神经网络DMPNN以分子图+RDKit描述符区分DS2/DS3;用Vina-GPU 2.0对六国标蛋白面板做分子对接并记残基项能量(Residue-Term Energy, RTE);以随机矩阵理论(RMT)基于Marchenko–Pastur分离随机与结构相关成分做降噪和残基选择;用CatBoost与线性支持向量机(SVM)判RTE能否区分农药与操作负类;最终集成评分为DMPNN评分与RTE/CatBoost评分之积,再做CCD次生代谢物注释过滤与毒性评估。
2.1 初始化学空间作为计算筛选的代表性基础:经标准化后DS1共5027个唯一结构,DS1以脂质为主,DS2化学超类更异质,DS3组成不同于前两者;该分布证明建模与虚拟筛选所用数据集具化学多样性,流程将5211→5027→DMPNN阳性→44次生代谢物逐步缩围。
2.2 分子对接揭示农药与AChE非活性化合物间靶标特异性差异:对六国标蛋白(GluCl、AChE1、TuUGT202A2、TuGSTm12、agGSTe2、OR28)做对接取残基水平互作描述符;五靶中标DS2农药互作能显著优于DS3,OR28呈反向,说明面板捕获可重复靶标特异性剖面,DS1中位结合能跨二者区间,故RTE不作二元活性指示而作风理一致性测度。
2.3 RTE描述符提供区分DS2与DS3的补充信息:CatBoost与SVM在各靶及六靶合并特征上均超随机,合并后ROC–AUC进一步提升;虽不及DMPNN精度,但证明残基互作签名含正交信息,集成后假阳性率降低且保留高ROC–AUC,对接一致性组件下调结构像但互作支持弱者的排名。
2.4 集成优先化鉴别化学多样前景候选:1010个DMPNN阳性中经CCD过滤得44个次生代谢物,t-SNE显示高分者不与农药孤立成簇而部分重叠,单萜、黄酮、生物碱在高分区更多;最终前十含异冰片基硫氰乙酸酯、大麻酚甲醚、blumenol A、stigmasta-5,22-dien-3β-ol-7-one、Δ9-四氢大麻色原酸、麦角固醇、friedelanol、γ-curcumene、α-bisabolol、大麻萜酚单甲醚,跨植物大麻素、萜、甾体、三萜多类,证明模型捕获得数类农药样化学区而非单骨架。
2.5 数据集水平毒理比较:5027个DS1对1709个DS2在11个终点比较;大鼠/小鼠预测中位口服LD50 DS1更高,肝毒与药物性肝损伤(DILI)预警更少,但Ames阳性比例DS1更高;96小时黑头呆鱼LC50 DS1明显更安全,水溞(Daphnia magna)LC50两集相近;心毒约65%在模型适用域外故不参与比较。
2.6 终选候选的毒理评估:前十代谢物对大鼠/小鼠LD50高于十种合成农药对照,肝毒、Ames致突、致癌、DILI预测频率更低;部分仍有不利终点,大麻萜酚单甲醚在所用模型内无致突/致癌/肝毒/DILI信号;研究人员另用开放MCP服务器复现Syntelly工作流,支架离散验证更保守,生殖毒建模稳健性有限故不主导安全结论。
2.7 DMPNN阳性与高分代谢物的实验存在证据:1010个DMPNN阳性中30个(3.0%)匹配CCD“Detected and Quantified”;其余可为“Expected but not quantified”或有独立GC/MS、色谱质谱报道,故定量记录缺失不等于植物中不存在,候选应先证存在与组织丰度再提取和生物测定。
讨论部分总结:研究人员强调结构模型与残基互作模型是两套独立表示,乘积式集成更保守;DS3仅为AChE非活性操作负类而非真非农药集,六蛋白面板不覆盖全部农药机制,刚体对接不顾受体柔性、去立体化学标签会丢信息,故RTE是互补证据而非实验药效/安全证明。毒理模型适用域不均,自然来源不等于安全;出现证据、组织丰度、提取收率与经济性不在本工作筛选准则内。高分候选跨紧凑萜衍、植物大麻素、倍半萜、甾体/三萜,说明不同结构可通过疏水性、杂原子分布与残基互作组合满足标准,但非已验证药效团。
结论部分翻译:本研究对大麻化合物数据库中的大麻(Cannabis sativa)化合物做了系统AI辅助计算评估,以鉴定具有类似DS2农药参照集的结构和互作剖面特征的化合物。所提集成计算流程将结构信息与蛋白-配体互作的机理表示相结合;整合两独立证据源使候选优先化更保守、更有依据。基于机器学习的计算排序鉴定出CCD来源、跨数类结构的高集成评分大麻化合物。研究人员将这些化合物作为实验测试候选而非已证实具杀虫活性的化合物提出。因候选来自已建立工业作物,后续研究可助推未充分利用大麻生物质的更高值利用,但此类应用可行性仍待确立,关键因素包括代谢物丰度、提取收率、分离成本与可放大性。数据集水平比较显示,相较农药参照集,若干急性与器官特异性毒性终点的机器学习预测较有利,但这些差异具终点特异性,不意味着天然来源可代安全。未来研究应聚焦优先化化合物的实验验证及其实际生物农药开发可行性评估。