基于可解释机器学习与多维蛋白质描述符的β-内酰胺酶亚类精准分类及边界变异优先化用于抗菌药物耐药性监测

《Frontiers in Pharmacology》:Interpretable machine learning classifies β-lactamase subclasses and prioritizes boundary variants for antimicrobial resistance surveillance

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Pharmacology 5.4

编辑推荐:

  摘要专业翻译 引言: 抗菌药物耐药性(antimicrobial resistance, AMR)是一项重大的全球健康威胁,而β-内酰胺酶介导的β-内酰胺类抗生素失活仍是治疗失败的主要原因。因此,快速识别新出现的β-内酰胺酶变异体并加深对其功能多样性的理解,对

  
摘要专业翻译 引言: 抗菌药物耐药性(antimicrobial resistance, AMR)是一项重大的全球健康威胁,而β-内酰胺酶介导的β-内酰胺类抗生素失活仍是治疗失败的主要原因。因此,快速识别新出现的β-内酰胺酶变异体并加深对其功能多样性的理解,对于耐药性监测和治疗开发至关重要。 方法: 研究人员在此开发了一种可解释的机器学习(interpretable machine learning)框架,利用多维蛋白质描述符对主要A类β-内酰胺酶亚类(TEM、SHV和CTX-M)进行分类,并将其与非β-内酰胺酶水解酶区分开来。研究人员评估了基于序列组成、理化性质、残基可及性和结构拓扑学的描述符,以确定一个仅含30个描述符的最小面板,同时保留生物学可解释性。 结果: 所选描述符提供了强大的判别能力,并与空间位阻环境、疏水性、柔性、溶剂暴露和残基相互作用模式相关联,这与它们在底物识别和催化中的作用一致。将数据投影到降维描述符空间后,识别出位于亚类边界附近的过渡变异体,包括CTX-M/SHV趋同区域以及具有部分β-内酰胺酶样特征的非β-内酰胺酶水解酶。代表性案例研究表明,一些表面上的错误分类可能反映了注释不一致、支架趋同或早期适应轨迹,凸显了可供实验跟进验证的候选对象。使用271个独立注释为非β-内酰胺酶水解酶的蛋白质进行外部验证,显示出96.95%的特异性,仅出现有限的假阳性分配。大多数错误分类的统计支持较弱,表明置信度过滤可进一步提高筛选性能。 讨论: 总体而言,本研究表明,基于紧凑描述符的模型能够对β-内酰胺酶相关蛋白进行准确且可解释的分类,同时识别出与抗菌药物耐药性监测相关的新兴边界变异体。该框架为蛋白质注释、耐药性演化监测以及未来抑制剂开发提供了一种可扩展的方法。

论文解读文章

一、研究背景与科学问题

抗菌药物耐药性(antimicrobial resistance, AMR)已被公认为全球健康、粮食安全和可持续医疗体系面临的最严重威胁之一。2019年细菌性AMR全球直接导致超过100万人死亡,若缺乏有效应对措施,预计到2050年耐药性感染每年可导致高达1000万人死亡。在众多耐药机制中,β-内酰胺酶介导的β-内酰胺类抗生素酶促灭活仍是最具临床后果的机制之一。Ambler A类丝氨酸β-内酰胺酶是一个高度适应性酶家族,包括TEM、SHV、CTX-M、KPC、SME、GES等相关谱系。历史上,TEM和SHV变异体是最早广泛传播的质粒介导β-内酰胺酶,而CTX-M酶随后成为全球占主导地位的超广谱β-内酰胺酶(extended-spectrum β-lactamases, ESBLs),重塑了肠杆菌目(Enterobacterales)的耐药性流行病学。
尽管经过数十年的生化和结构研究,预测新观察到的β-内酰胺酶变异体的功能行为仍具挑战性。基于序列同一性、系统发育或人工注释的传统分类系统提供了有价值的谱系信息,但往往无法解析底物谱、催化效率、抑制剂敏感性或突变潜力的细微变化。单个氨基酸替换可以改变活性位点静电、环区流动性、溶剂可及性或残基堆积,而这些变化难以仅通过序列比较识别。相反,远缘相关蛋白可能在序列相似性有限的情况下趋同于相似的催化微环境和耐药表型。这为监测计划、基因组注释流程和计算药物发现工作造成了实际瓶颈。
现有抗菌药物耐药基因(antimicrobial resistance gene, ARG)注释模型可分为深度学习模型(如DeepARG)、基于序列比对特征或profile隐马尔可夫模型(hidden Markov model, HMM)的分类器(如AMRFinder+)以及利用预训练Transformer嵌入的蛋白质语言模型(protein language model, pLM)(如PLM-ARG)。然而,这些方法存在准确性与可解释性之间的权衡:深度学习架构和pLM表征往往作为功能黑箱运行,而profile HMM虽提供局部基序可解释性,但缺乏精细的家族内亚类判别能力。因此,文献中仍缺乏轻量级、免比对、能够进行精确亚类分类同时保留人工生化可解释性的框架。

二、研究内容与核心结论

研究人员开发了一种可解释的多维描述符框架,用于表征A类β-内酰胺酶及相关细菌水解酶。通过整合序列组成特征、理化自相关项、残基可及性指标和拓扑信息描述符,生成统一表征,同时捕获全局支架组织和局部催化环境。通过系统特征约简和可解释机器学习,确定了一个仅含30个描述符的最小面板,足以将主要A类β-内酰胺酶亚类与非β-内酰胺酶水解酶(文中以"NON"表示)区分开来,同时保留生物学可解释性。除分类外,该框架还揭示了占据亚类间边界区域的过渡蛋白,识别了潜在的注释不一致,并检测到具有部分β-内酰胺酶样特征的非典型酶。在分类学多样的独立蛋白上进行了外部验证,进一步检验了模型在真实筛选条件下的特异性。

三、关键技术与方法

研究人员构建了一个经多阶段筛选的A类β-内酰胺酶数据集。从UniProt知识库检索TEM、SHV和CTX-M序列,经结构域完整性验证(Pfam和InterPro)、序列长度和分子量筛选后获得486条序列,再以100%序列同一性阈值进行CD-HIT去冗余,最终获得274个非冗余代表蛋白(73个TEM、70个SHV、131个CTX-M变异体)。同时构建了274个非目标细菌蛋白的硬阴性对照数据集(NON),涵盖细胞壁肽酶和青霉素结合蛋白(penicillin-binding proteins, PBPs)、经典丝氨酸水解酶/酯酶/脂肪酶、内酯酶/脱乙酰酶/非靶标β-内酰胺酶以及磷酸酶/核酸酶。结构表征方面,220个变异体(80.3%)通过DIAMOND比对获得实验结构模板,其余54个变异体使用AlphaFold3建模(平均pLDDT≥90)。描述符体系涵盖氨基酸组成、二肽/三肽组成、分组组成、理化性质、CTD描述符、自相关描述符、结构几何、二级结构、拓扑网络(残基接触网络)和活性位点描述符,总计9314维。通过PCA降维、ANOVA统计筛选和SHAP特征归因,确定30个最小描述符面板。分类采用多项逻辑回归(multinomial Logistic Regression),以70:30序列感知策略划分训练集(n=384)和独立测试集(n=164),并执行严格的计算防火墙确保零数据泄漏。

四、研究结果

4.1 数据集构建、分类学代表性与结构覆盖
去冗余统计显示各亚类均存在强单例富集:TEM含62个单例簇(84.9%)、SHV含61个(87.1%)、CTX-M含107个(81.7%),表明数据集保留了真实的序列多样性。物种组成方面,TEM亚类以大肠杆菌(Escherichia coli)为主(n=29),SHV高度集中于肺炎克雷伯菌(Klebsiella pneumoniae)(n=54/70),CTX-M宿主范围最广,涵盖大肠杆菌(n=58)、肺炎克雷伯菌(n=25)及多种克吕沃尔菌属(Kluyvera)物种,后者作为CTX-M家族的祖先来源具有重要进化意义。
4.2 蛋白质语言模型潜在表征评估
研究人员对ProtT5(序列衍生)和ESM-3(结构感知多模态)嵌入进行了基准测试。方差过滤未检测到零方差描述符,但相关分析显示ProtT5中存在514个高度相关描述符对(|r|>0.90)、ESM-3中558个、组合表征中1101个,表明大量嵌入维度捕获了重叠变异。PCA显示集成数据集仅需18个主成分即可解释90%总方差。UMAP投影显示亚类间具有清晰的拓扑分离。然而,pLM衍生表征未能在分类性能上超越约简后的可解释描述符集,因此未纳入最终预测框架。
4.3 描述符空间约简与机制归因
PCA分析确定了描述符空间的内在维度层次。通过主成分载荷提取、唯一性过滤、成对相关分析和ANOVA统计验证(p<0.05),获得约简的高影响描述符集。SHAP归因分析进一步提取了最小可解释描述符子集,涵盖活性位点可及性、静电分布、疏水堆积和结构连通性等机制相关描述符,直接关联底物特异性和催化效率。
4.4 多维投影与分类验证
PCA和UMAP投影显示,约简描述符空间形成了TEM、SHV、CTX-M和NON四个清晰且连贯的功能簇。多项逻辑回归模型在独立测试集上实现了高分类准确率。Z检验(p<0.05)将预测分为显著分类和模糊分类两类,后者代表占据功能景观边界区域的过渡或中间状态变异体。
4.5 外部验证
在包含271个独立蛋白的外部验证数据集中,模型实现了96.95%的特异性。该数据集包含非靶标β-内酰胺酶(AmpC、OXA、CphA、L1、L2、DIM、PER-1、SME、PenA、PenP、PenPC、BlaZ、BOR)、青霉素结合蛋白和转肽酶/羧肽酶、脂肪酶/酯酶/角质酶/脱卤酶、金属水解酶/磷酸酶/磷酸二酯酶、酰胺酶/氨基水解酶、DNA修复/核酸酶/RNA加工酶、糖苷酶/碳水化合物活性酶等类别。大多数错误分类的统计支持较弱,表明置信度过滤可进一步提高筛选性能。
4.6 计算基础设施与可扩展性
下游执行(30个描述符计算和模型推断)在标准台式工作站上每查询所需时间小于0.5秒。描述符提取和矩阵运算呈线性扩展(O(N)),支持预建模序列的高通量筛选。主要计算瓶颈在于上游阶段对完全未收录变异体进行AlphaFold3结构预测,需要专用高性能计算基础设施。

五、讨论总结与研究结论

本研究通过整合序列组成、理化性质、残基可及性和结构拓扑学的多维描述符,建立了一个可解释的机器学习框架,能够准确区分TEM、SHV和CTX-M三个主要A类β-内酰胺酶亚类并识别非β-内酰胺酶水解酶。30个最小描述符面板在保留生物学可解释性的同时提供了强大判别能力,描述符与空间位阻环境、疏水性、柔性、溶剂暴露和残基相互作用模式相关,与底物识别和催化中的已知作用一致。投影到降维描述符空间识别出亚类边界附近的过渡变异体,包括CTX-M/SHV趋同区域和非β-内酰胺酶水解酶的部分β-内酰胺酶样特征。案例研究表明,部分表面错误分类可能反映注释不一致、支架趋同或早期适应轨迹。外部验证显示96.95%的特异性,表明该框架可有效区分目标亚类与结构或功能相似的非靶标酶。
该框架为蛋白质注释、耐药性演化监测和抑制剂开发提供了一种可扩展方法。通过将描述符水平特征与已知耐药机制联系起来,该工作为抑制剂设计和下一代抗菌药物开发提供了转化基础。与活性位点空间位阻、静电、柔性和溶剂暴露相关的描述符有助于合理化某些支架在拓宽底物范围或逃避抑制中的作用。更广泛地说,该研究展示了可解释人工智能如何补充分子药理学,加速针对耐药细菌病原体的发现策略。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号