从化学骨架到预测毒性:一种骨架感知的流程用于可靠的独活属呋喃香豆素计算机模拟优先级排序

《International Journal of Molecular Sciences》:From Chemical Scaffold to Predicted Toxicity: A Scaffold-Aware Pipeline for Reliable In Silico Prioritization of Heracleum Furanocoumarins

【字体: 时间:2026年09月08日 来源:International Journal of Molecular Sciences 5.6

编辑推荐:

  计算机模拟方法为天然化合物生成了大量毒性预测,然而这些预测之间的相互一致性及其向新结构的可转移性很少被验证,预测结果也常常被不加批判地接受。研究人员以独活属(Heracleum)的呋喃香豆素作为天然产物的模型类,开发了一个可重现的计算流程,该流程评估的不是预测

  
计算机模拟方法为天然化合物生成了大量毒性预测,然而这些预测之间的相互一致性及其向新结构的可转移性很少被验证,预测结果也常常被不加批判地接受。研究人员以独活属(Heracleum)的呋喃香豆素作为天然产物的模型类,开发了一个可重现的计算流程,该流程评估的不是预测本身,而是其可靠性。研究人员分析了两个数据集:一个扩展参考集(DS1,来自PubChem的2008个化合物)和一个经分类学验证的天然集(DS2,102个独活属化合物)。该流程结合了骨架分析、针对44个脱靶蛋白的分子对接、重对接、十个表型毒性终点的预测、骨架分辨的可分性测试以及骨架感知的机器学习。化学空间集中在两个骨架周围,描述符空间相对于这两个骨架在全部13个轴上呈非随机组织(错误发现率(FDR)校正后p < 0.01),表明预测的毒理学特征主要由分子结构决定。平均对接分数仅对应于多维结合谱的第一主成分,而十个终点彼此大致独立。至关重要的是,骨架可分性不能预测可转移性:结构决定的信号仅在未见过的新骨架上被部分重现,且在不同终点上的程度不同。多标准优先级排序确定了21个最优先的实验验证候选物。对于此类化合物,未经骨架感知验证,不能假定计算机模拟评估的可靠性。
本研究发表于《International Journal of Molecular Sciences》,以伞形科独活属(Heracleum)的呋喃香豆素为对象,提出并验证了一种骨架感知的计算机模拟优先排序流程。呋喃香豆素是独活属植物中一类具有显著生物活性的次级代谢产物,在补骨脂素联合紫外线A(PUV-A)疗法及抗肿瘤、抗菌药物开发中具有应用前景,但同时具有光敏性皮炎等毒性。已知数百种呋喃香豆素,但实验毒性数据仅覆盖少数化合物,传统体内外研究成本高、周期长。为弥补这一空白,多种计算机模拟(in silico)毒性预测方法应运而生,包括基于结构警报的专家系统、定量构效关系(QSAR)模型、机器学习模型以及吸收、分布、代谢、排泄和毒性(ADMET)综合预测平台。然而,这些方法产生的预测结果之间的相互一致性及向新化学结构的可转移性极少被验证,预测结果常常被直接采信。因此,需要一种能够评估预测本身可靠性的计算流程。

研究人员开发了一个可重现的计算流程,应用于两个数据集:扩展参考集(DS1,2008个来自PubChem的化合物)和经分类学验证的天然集(DS2,102个独活属化合物)。流程结合了骨架分析、分子对接、重对接、十个毒性终点预测、骨架分辨可分性检验及骨架感知机器学习。结果显示,化学空间集中于两个主要骨架;描述符空间相对于骨架在13个轴上均呈非随机组织(FDR校正后p < 0.01),表明预测毒理谱主要由分子结构决定;平均对接分数仅对应多维结合谱的第一主成分;十个终点彼此大致独立;骨架可分性并不能保证预测的可转移性。基于透明的多标准分层排序,从102个天然化合物中筛选出21个优先候选物。

关键技术方法可概括为:基于RDKit库的Bemis–Murcko骨架分析和SMARTS子结构匹配;参数化t-SNE可视化化学空间;使用AutoDock Vina 1.2.5对2055个配体与44个脱靶蛋白进行分子对接,并通过重对接实验验证协议;使用ADMETLab 3.0预测十个表型毒性终点;采用置换检验(10,000次)评估骨架类别间Kolmogorov–Smirnov(KS)距离的显著性;构建弹性网络和随机森林模型,比较随机分割与骨架分割交叉验证下的可迁移性;基于PAINS和Brenk结构警报及多标准进行分层优先排序。数据集来源为PubChem数据库(DS1)和“Furanocoumarins in Apiaceae”数据库(DS2,覆盖60种独活属植物)。计算使用Python 3.9.6及相关包,随机种子为42。

研究结果如下:

2.1 数据集构建:通过SMARTS匹配确认,DS1中1004个化合物属于线性补骨脂素型,997个属于角型异补骨脂素型,两者在DS1中均有充分代表;DS2中89个(87.3%)化合物携带呋喃香豆素核心,11个(10.8%)为简单香豆素,2个不属于这两类。该结果表明两个经典结构类型均得到充分覆盖。

2.2 化学空间的结构覆盖:骨架分析显示,补骨脂素和异补骨脂素两个骨架分别覆盖DS1的54.8%和DS2的55%以上;DS1有330个独特Bemis–Murcko骨架,DS2有38个。天然化合物在DS1空间中集中分布,表明结构同质性较高,结构多样性主要来自外周修饰而非新环系。

2.3 脱靶结合全景:对2055个配体与44个蛋白的对接分数进行主成分分析(PCA),第一主成分解释61.2%方差,与平均对接分数高度相关(ρ=0.927),而第二、三成分反映结合选择性;需四个主成分方可解释80%方差。重对接实验中,57.1%的复合物顶位姿RMSD<2.0?,85.7%可在五个位姿内恢复近天然构象。结论为:平均对接分数仅捕捉整体亲和力,忽略选择性轴。

2.4 预测毒性全景:十个ADMET毒性终点中,基因毒性和眼刺激在标尺上端饱和,分辨力低;眼腐蚀、皮肤致敏、神经毒性、呼吸毒性的分辨力较高。相关分析显示两个相关性模块:器官毒性簇(肾、耳、肝、血液)和眼部毒性簇。PCA表明第一主成分仅解释29.6%方差,需六个成分解释80%,说明各终点大体独立,不能简化为单一“整体毒性”指标。

2.5 描述符空间的骨架分辨组织:对13个轴(十个毒性终点和PC1–PC3)进行置换检验,所有轴的骨架可分性均显著超过随机预期(p_FDR<0.01),其中PC1的KS为0.832最强,神经毒性(0.509)、眼腐蚀(0.445)、肾毒性(0.379)和耳毒性(0.350)次之。该测试表明描述符空间相对于骨架非随机组织,但反映的是化学一致性而非外部队列验证。

2.6 骨架感知的机器学习:对神经毒性和眼腐蚀两个终点训练弹性网络和随机森林模型,比较随机分割与骨架分割交叉验证性能。结果显示,强制执行骨架分离折叠后,所有模型性能下降:随机森林对神经毒性的R2从0.645降至0.444,对眼腐蚀从0.670降至0.308;眼腐蚀的泛化差距约为神经毒性的两倍。这表明标准随机验证高估了真实泛化能力,骨架可分性不等于可转移性。

2.7 独活属化合物的分层优先排序:对102个天然化合物,基于
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号