
-
生物通官微
陪你抓住生命科技
跳动的脉搏
TCM-Complexity:复杂度感知与阶段自适应的药物-靶点相互作用预测主动学习框架
《BMC Bioinformatics》:TCM-Complexity: a complexity-aware hybrid active learning framework for drug–target interaction prediction
【字体: 大 中 小 】 时间:2026年10月05日 来源:BMC Bioinformatics 4.4
编辑推荐:
摘要背景药物-靶点相互作用(DTI)预测是计算机辅助药物发现和药理机制阐明中的关键任务。高质量的DTI标注通常依赖于昂贵的湿实验,有限的实验资源使得难以获取大规模、可靠的标注数据集。因此,在有限的标注预算下有效评估候选样本的效用并提高数据利用效率仍是关键挑战。主动学习为降低标
药物-靶点相互作用(DTI)预测是计算机辅助药物发现和药理机制阐明中的关键任务。高质量的DTI标注通常依赖于昂贵的湿实验,有限的实验资源使得难以获取大规模、可靠的标注数据集。因此,在有限的标注预算下有效评估候选样本的效用并提高数据利用效率仍是关键挑战。主动学习为降低标注成本提供了有前景的解决方案;然而,现有方法主要关注模型预测不确定性或样本分布特征,未能充分利用复杂生物表征空间中嵌入的潜在结构信息。
为克服这些局限性,我们提出了TCM-Complexity,一种复杂度感知且阶段自适应的DTI预测主动学习框架。该框架构建了联合药物-靶点嵌入空间,以表征候选样本的局部结构复杂度,并将此信息作为新颖的样本选择准则纳入考量。通过整合模型预测信息与数据结构特征,开发了一种两阶段探索-挖掘策略,以在不同学习阶段动态优化样本选择。
在DAVIS、BioSNAP和TCMSP三个公开DTI数据集上的实验评估表明,在标注预算为训练池20%的主要随机划分实验中,TCM-Complexity在大多数评估指标上取得了最佳整体性能。与最强基线方法TCM相比,ROC_AUC的最大改进为1.87%,PR_AUC的最大改进为1.79%。在评估的设置中,该方法还达到了全监督模型超过90%的预测性能,最大相对性能接近98%。额外的冷药物、冷靶点和多随机种子分析表明,性能优势的大小取决于数据集和评估指标。
在评估的有限标注设置下,TCM-Complexity能够提高DTI预测性能和样本利用效率。通过综合考虑模型预测信息和候选样本的局部结构复杂度,该框架为在受限标注资源条件下进行计算药物发现提供了一种互补的结构感知主动学习策略。
药物-靶点相互作用(DTI)预测是计算机辅助药物发现和药理机制阐明中的关键任务。高质量的DTI标注通常依赖于昂贵的湿实验,有限的实验资源使得难以获取大规模、可靠的标注数据集。因此,在有限的标注预算下有效评估候选样本的效用并提高数据利用效率仍是关键挑战。主动学习为降低标注成本提供了有前景的解决方案;然而,现有方法主要关注模型预测不确定性或样本分布特征,未能充分利用复杂生物表征空间中嵌入的潜在结构信息。
为克服这些局限性,我们提出了TCM-Complexity,一种复杂度感知且阶段自适应的DTI预测主动学习框架。该框架构建了联合药物-靶点嵌入空间,以表征候选样本的局部结构复杂度,并将此信息作为新颖的样本选择准则纳入考量。通过整合模型预测信息与数据结构特征,开发了一种两阶段探索-挖掘策略,以在不同学习阶段动态优化样本选择。
在DAVIS、BioSNAP和TCMSP三个公开DTI数据集上的实验评估表明,在标注预算为训练池20%的主要随机划分实验中,TCM-Complexity在大多数评估指标上取得了最佳整体性能。与最强基线方法TCM相比,ROC_AUC的最大改进为1.87%,PR_AUC的最大改进为1.79%。在评估的设置中,该方法还达到了全监督模型超过90%的预测性能,最大相对性能接近98%。额外的冷药物、冷靶点和多随机种子分析表明,性能优势的大小取决于数据集和评估指标。
在评估的有限标注设置下,TCM-Complexity能够提高DTI预测性能和样本利用效率。通过综合考虑模型预测信息和候选样本的局部结构复杂度,该框架为在受限标注资源条件下进行计算药物发现提供了一种互补的结构感知主动学习策略。