超越天然氨基酸:通过化学特征编码将免疫原性风险评估扩展至修饰肽——瓜氨酸化案例研究

《Frontiers in Immunology》:Beyond natural amino acids: extending immunogenicity risk assessment to modified peptides through chemical feature encoding. A case study on citrullination

【字体: 时间:2026年09月09日 来源:Frontiers in Immunology 7.0

编辑推荐:

  引言:肽类疗法正越来越多地被用于治疗疑难疾病,但免疫原性风险限制了其临床成功。计算机模拟工具能够通过预测肽-MHC II类结合(pMHCII)进行免疫原性筛选,然而当前方法未考虑为改善肽特性而常规引入的非天然氨基酸的化学性质。方法:研究人员提出了一种机器学习方

  
引言:肽类疗法正越来越多地被用于治疗疑难疾病,但免疫原性风险限制了其临床成功。计算机模拟工具能够通过预测肽-MHC II类结合(pMHCII)进行免疫原性筛选,然而当前方法未考虑为改善肽特性而常规引入的非天然氨基酸的化学性质。方法:研究人员提出了一种机器学习方法,将化学指纹与序列信息相结合,用于预测包含天然氨基酸(NAA)和非天然氨基酸(NNAA)的肽的MHC II类结合。研究人员评估了肽水平指纹与残基水平指纹(直接编码和基于相似性的指纹),后者在编码化学多样性的同时保留位置信息,共涉及31种不同的表示。结果:肽水平指纹因丢失位置信息而表现不佳,而残基水平指纹在基于NAA的肽上达到了与基于序列的编码(BLOSUM62和one-hot)相当的性能,同时准确识别了结合核心和基序。以瓜氨酸化肽为案例研究,研究人员观察到不同编码策略之间具有相似的线性相关性能,残基水平指纹在定量预测准确性方面略有改善。瓜氨酸很少出现在经典锚定位置,提示显式化学编码的优势可能对发生在结合关键位置的修饰更为显著。讨论:所提出的框架允许纳入多种修饰(包括合成氨基酸),并与现有泛等位基因架构兼容。虽然显式化学编码的全部优势仍有待证明,但该框架旨在随着实验数据的可获得来捕捉这些效应,从而为新兴肽类疗法的免疫原性风险评估提供支持。
肽类疗法在治疗糖尿病、癌症和多发性硬化等挑战性疾病中日益重要,但免疫原性风险限制了其临床成功。为改善药代动力学和生物活性,药物化学家常引入非天然氨基酸(NNAA),然而这些修饰对免疫原性的影响尚不清楚。现有的计算机模拟预测工具主要基于20种天然氨基酸(NAA)训练,难以准确预测含NNAA肽的MHC II类结合。已有方法如稀疏编码或占位符“X”无法捕捉NNAA的化学多样性。化学指纹(如ECFP、MAPC)能够描述包括NNAA在内的分子结构,但尚未用于肽-MHC II类结合预测。为此,研究人员开展了一项研究,系统评估化学指纹作为分子表示在MHC II类结合预测中的有效性,并以瓜氨酸化为案例进行验证。

研究人员提出了一种结合化学指纹与序列信息的机器学习方法,基于NNAlign模型架构,比较了肽水平指纹与残基水平指纹(直接编码和相似性指纹)共31种表示,用于预测含有NAA和NNAA的肽的MHC II类结合。结果显示,残基水平指纹在NAA肽上的性能与BLOSUM62和one-hot编码相当,并能准确识别结合核心和基序;而肽水平指纹因丢失位置信息而性能较差。以瓜氨酸化肽作为案例,残基水平指纹在定量预测准确性上略有优势,且当瓜氨酸化肽参与训练时优势更明显。该研究为含非天然修饰肽的免疫原性风险评估提供了灵活、化学信息感知的框架,论文发表于《Frontiers in Immunology》。

在技术方法上,研究人员使用了来自IEDB的NAA结合亲和力数据(包含14个HLA-DR等位基因)及瓜氨酸化肽数据(DRB1*01:01和DRB1*04:01),MHC I类数据来自Reynisson等人,人类蛋白质组背景序列来自UniProt,瓜氨酸化位点集合来自Rebak等人。分子表示包括BLOSUM62、one-hot、NNAAIndex、10种肽水平化学指纹,以及构建的直接编码指纹(Ffps)和基于Tanimoto相似性的相似性指纹(Sfps)。预测模型为NNAlign前馈神经网络,通过滑动窗口提取9-mer核心,采用嵌套交叉验证集成优化超参数,评估指标包括PCC、R2和RMSE。

结果部分:

3.1 直接编码和基于相似性的指纹在NAA肽上匹配序列编码:通过比较15个HLA-DR限制性肽的已知结合核心,肽水平指纹的预测核心错误率高达80-100%,而残基水平指纹能正确识别80-100%的核心。在结合亲和力预测上,FAP(原子对指纹)和SMAPC(MAPC相似性指纹)表现最佳,优于NNAAIndex。基于整体性能,研究者选定FAP、SMAPC、one-hot和BLOSUM62四种编码进行后续分析。

3.2 预测结合基序与已知模式一致:对于MHC II类,预测基序显示P1、P4、P6、P9为锚定位置,P1以疏水性残基为主;对于MHC I类,锚定残基位于P2和P9。序列标志图与HLA-A*03:01和HLA-B*07:02的已知基序一致,表明残基水平指纹能准确捕获结合基序。

3.3 残基水平指纹在非锚定位点的瓜氨酸化上显示出与序列编码相当的性能:在含瓜氨酸化肽的数据集上,四种编码的PCC相近,但FAP和SMAPC的R2略高。当训练集中逐渐加入瓜氨酸化肽(25%-100%)时,残基水平指纹的R2改善,PCC稳定。位置分布分析显示,当瓜氨酸被显式编码或替换为精氨酸时,它很少出现在四个典型锚定位置(P1、P4、P6、P9),这解释了性能相似的原因,并提示化学编码的优势可能体现在修饰发生在关键锚定位置时。

3.4 实现:研究团队将模型集成到一个预测工具中,可接受NAA和NNAA(如[Cit])肽序列,输出结合分数和预测结合核心。

讨论部分:该研究首次将化学指纹应用于pMHCII结合预测。残基水平指纹保留了位置信息,同时编码化学多样性,且与泛等位基因架构兼容。目前NNAA实验数据稀缺,尤其是合成氨基酸的pMHCII结合数据,限制了评估。直接编码指纹维度高(9×256)可能增加过拟合风险,但可灵活引入新NNAA;相似性指纹维度低(9×22)需预分配占位符。未来可结合深度学习嵌入或替代相似度度量。研究结论:通过结合化学指纹与序列编码,该框架为pMHCII结合预测补充了显式化学编码,支持在早期发现阶段对含NNAA的新型肽疗法进行免疫原性风险评估,包括治疗性肽、合成肽疫苗和抗体药物偶联物。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号