新技术专栏 返回首页
会员注册 登录 生物通快讯免费订阅
  • 首页 今日动态 人才市场 新技术专栏 中国科学人 云展台
    BioHot
    • 定制我的BioHot
    • 进入我的BioHot
    • 进入我的集采
    • 肿瘤癌症研究
    • 免疫/基因/细胞疗法
    • 神经生物学
    • 健康与疾病
    • 衰老机制与长寿
    • 单细胞技术
    • 基因编辑-CRISPR
    • RNA研究
    • 肠道菌与人体微生态
    • 细胞代谢
    • AI生物信息学
    • COVID
    云讲堂直播 会展中心 特价专栏 技术快讯 免费试用

  • 生物通官微
    陪你抓住生命科技
    跳动的脉搏

生物通 | 新技术专栏
生物通首页  >  新技术专栏  >  正文

仅凭实体与上下文描述符预测药物组合协同作用类别的防泄漏基准评估

《BMC Bioinformatics》:A leakage-controlled cold-start benchmark for drug-combination synergy classification

【字体: 大 中 小 】 时间:2026年10月03日 来源:BMC Bioinformatics 4.4

编辑推荐:

   摘要背景实验筛选仅能覆盖所有可能药物组合的极小一部分。大多数协同作用预测模型依赖丰富的分子和组学输入特征,而仅凭预处理前的身份与上下文描述符能恢复多少信号的报道则较为匮乏。我们提出一个可复现、防数据泄漏的基准测试,探讨在不使用任何实测剂量-反应读出值的情况下,仅凭化合物身份、

摘要

背景

实验筛选仅能覆盖所有可能药物组合的极小一部分。大多数协同作用预测模型依赖丰富的分子和组学输入特征,而仅凭预处理前的身份与上下文描述符能恢复多少信号的报道则较为匮乏。我们提出一个可复现、防数据泄漏的基准测试,探讨在不使用任何实测剂量-反应读出值的情况下,仅凭化合物身份、细胞系、组织、研究、临床开发阶段及靶点注释等特征,能否有效预测协同作用的类别。基于DrugComb v1.5数据集(包含\(\mathrm{739,964}\)项实验,涵盖\(26\)项研究、\(17\)种组织、\(288\)条细胞系和\(\mathrm{4,268}\)种化合物),我们依据零交互效价(ZIP)分数在常规的\(\pm 10\)阈值下衍生出三分类终点,并排除所有由响应数据导出的变量。逻辑回归基线模型与类别加权梯度提升模型(LightGBM)分别在预定义分组划分和冷启动划分下进行评估。

结果

在标准测试集上,LightGBM达到\(0.782\)准确率、\(0.805\)平衡准确率、\(0.703\)宏F1、\(0.545\)Cohen's \(\kappa \)以及\(0.922\)宏一对余下AUC,配对McNemar检验显示其优于逻辑回归(\(p\mathrm{ < 0.001}\))。精确率-召回率分析表明,罕见的拮抗和协同类别相对于其先验概率约有六倍富集。然而,在分布偏移下性能急剧下降:面对未见药物时平衡准确率降至\(0.694\),面对未见细胞系时降至\(0.482\),面对完全未见研究时降至随机水平;无研究消融实验表明这并非由研究标识符驱动。置换重要性分析识别出细胞系身份是最主要的预测因子,而基于(细胞系,药物)的基率查找可恢复\(0.778\)的平衡准确率,与完整模型仅差\(0.027\),表明标准划分下的性能主要反映了条件记忆而非所学到的药理学知识。

结论

对于已知实体,即便不使用分子特征也能实现有用的协同作用分诊,但标准划分部分衡量的是对实体特定基率的记忆,可能实质性地高估冷启动部署性能。该基准提供了防泄漏的下界参考,可用于衡量富含分子和组学特征的模型,并论证了冷启动评估应与常规随机或分组划分一同报告。

背景

实验筛选仅能覆盖所有可能药物组合的极小一部分。大多数协同作用预测模型依赖丰富的分子和组学输入特征,而仅凭预处理前的身份与上下文描述符能恢复多少信号的报道则较为匮乏。我们提出一个可复现、防数据泄漏的基准测试,探讨在不使用任何实测剂量-反应读出值的情况下,仅凭化合物身份、细胞系、组织、研究、临床开发阶段及靶点注释等特征,能否有效预测协同作用的类别。基于DrugComb v1.5数据集(包含\(\mathrm{739,964}\)项实验,涵盖\(26\)项研究、\(17\)种组织、\(288\)条细胞系和\(\mathrm{4,268}\)种化合物),我们依据零交互效价(ZIP)分数在常规的\(\pm 10\)阈值下衍生出三分类终点,并排除所有由响应数据导出的变量。逻辑回归基线模型与类别加权梯度提升模型(LightGBM)分别在预定义分组划分和冷启动划分下进行评估。

结果

在标准测试集上,LightGBM达到\(0.782\)准确率、\(0.805\)平衡准确率、\(0.703\)宏F1、\(0.545\)Cohen's \(\kappa \)以及\(0.922\)宏一对余下AUC,配对McNemar检验显示其优于逻辑回归(\(p\mathrm{ < 0.001}\))。精确率-召回率分析表明,罕见的拮抗和协同类别相对于其先验概率约有六倍富集。然而,在分布偏移下性能急剧下降:面对未见药物时平衡准确率降至\(0.694\),面对未见细胞系时降至\(0.482\),面对完全未见研究时降至随机水平;无研究消融实验表明这并非由研究标识符驱动。置换重要性分析识别出细胞系身份是最主要的预测因子,而基于(细胞系,药物)的基率查找可恢复\(0.778\)的平衡准确率,与完整模型仅差\(0.027\),表明标准划分下的性能主要反映了条件记忆而非所学到的药理学知识。

结论

对于已知实体,即便不使用分子特征也能实现有用的协同作用分诊,但标准划分部分衡量的是对实体特定基率的记忆,可能实质性地高估冷启动部署性能。该基准提供了防泄漏的下界参考,可用于衡量富含分子和组学特征的模型,并论证了冷启动评估应与常规随机或分组划分一同报告。

订阅生物通快讯

订阅快讯:
免费订阅退订

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号