综述:机器学习用于TCR库表位注释和模式发现

《Immunological Reviews》:Machine Learning for TCR Repertoire Epitope Annotation and Pattern Discovery

【字体: 时间:2026年07月21日 来源:Immunological Reviews 10.6

编辑推荐:

  T细胞是适应性免疫的核心,通过T细胞受体(TCR)识别称为表位的抗原肽。TCR库的巨大多样性和交叉反应性使得直接从库测序中解读抗原特异性变得极具挑战性。高通量测序能够大规模分析TCR,但不能直接揭示其靶标表位,因此需要计算方法来弥补这一差距。本综述概述了两种互

  
T细胞是适应性免疫的核心,通过T细胞受体(TCR)识别称为表位的抗原肽。TCR库的巨大多样性和交叉反应性使得直接从库测序中解读抗原特异性变得极具挑战性。高通量测序能够大规模分析TCR,但不能直接揭示其靶标表位,因此需要计算方法来弥补这一差距。本综述概述了两种互补策略,即自下而上方法和自上而下方法,用于注释TCR特异性。自下而上方法从经过整理的TCR-表位数据库中预测TCR-表位特异性,通过基于距离、基于特征或深度学习模型识别重复出现的模式。虽然这些方法对充分表征的表位有效,但受到训练数据偏倚、缺乏阴性数据以及对未见表位泛化能力差的限制。自上而下方法则从库水平信号(如序列相似性、富集和TCR趋同性)推断抗原驱动的反应。这些方法能够在没有先验表位知识的情况下发现疾病或暴露相关的TCR特征,但对技术噪声和生物混杂因素敏感。这两种方法互补,因为自下而上提供机制特异性,而自上而下能够在复杂数据集中进行发现。它们的整合,以及多模态建模和改进的基准测试,是推进TCR-表位注释和理解适应性免疫反应的关键。
**1 Introduction**
T细胞通过T细胞受体(TCR)识别主要组织相容性复合体(MHC)分子呈递的抗原肽,这是适应性免疫的核心。TCR库具有极高的理论多样性(估计达1015至1061种序列),同时存在交叉反应性(一个TCR识别多个表位,一个表位被多个TCR识别)。高通量适应性免疫受体库(AIRR)测序可大规模分析TCR序列,但无法直接提供其靶标表位,必须依赖计算方法。本文综述了两种互补策略:自下而上方法(从实验验证的TCR-表位数据库中学习模式,预测单个TCR的特异性)和自上而下方法(从库水平信号如克隆扩增、序列相似性和趋同性中推断抗原驱动反应)。两种方法各有局限,但整合后有望提升TCR-表位注释的准确性。

**2 Bottom-Up Approaches**
**2.1 Training Datasets and Data Biases**
**2.1.1 Positive Training Data**:多数模型训练于VDJdb、McPAS-TCR和免疫表位数据库(IEDB)等公共数据库,这些数据偏向于免疫显性病毒表位和β链序列,导致对肿瘤新表位等覆盖不足。数据质量因实验噪声和标准不一而变化,影响模型性能。**2.1.2 Negative Training Data**:真实阴性数据缺乏,常用随机阴性(从无关库采样)或打乱阴性(随机重组正例对)。随机阴性可能引入分布偏差,打乱阴性因交叉反应而可能包含假阴性,两者均不理想,限制了模型泛化。

**2.2 Encodings for TCR and Epitope Sequences**
TCR表示通常聚焦于互补决定区3(CDR3)β链,但可扩展至V/J基因、CDR1/2及配对αβ链。编码方式包括独热编码、理化性质(疏水性、电荷等)、k-mer及基于Transformer的语言模型嵌入。模型可分是否包含表位序列,交互模型(如同时编码TCR和表位)更利于泛化至未见表位。

**2.3 Modeling Approaches for Bottom-Up Prediction**
**2.3.1 Distance-Based and Clustering Approaches**:基于序列相似性(如编辑距离)聚类,如ClusTCR和TCRdist,无需训练,可解释性强,但无法捕捉非线性关系。**2.3.2 Feature-Based Machine Learning Models**:如随机森林,学习特征与特异性关联,可分表位特异模型(每表位独立训练)和泛特异模型(同时预测多个表位)。**2.3.3 TCRex as a Feature-Based Prediction Model**:TCRex是随机森林模型,针对100个表位(93病毒、7癌症)训练,使用CDR3理化性质和V/J基因,从健康个体背景库生成阴性,通过富集分析判断特异性。在急性髓系白血病(AML)研究中,结合ClusTCR聚类,发现应答患者中WT1表位特异性TCR库多样性更高。**2.3.4 Deep Learning Models**:卷积神经网络(CNN)和Transformer可整合多输入(αβ链、表位信息),但数据需求大、可解释性差,性能未必优于简单模型。

**2.4 Seen Versus Unseen Epitopes**
“已见表位”指训练数据中存在的表位,模型表现良好,但受限于实验数据。“未见表位”难度大,因序列相似性不保证TCR识别相似、MHC背景多变及交叉反应,模型性能显著下降。

**2.5 Models That Can Generalize Across Different Epitopes**
**2.5.1 ImmuneWatch DETECT as Pan-Specific Model**:DETECT采用概率模型与基序聚类,对所有表位进行泛特异注释,基于大型专有数据库,在2023 IMMREP基准测试中表现最佳,适用于已见和未见表位。在多发性硬化(MS)研究中,发现EB病毒(EBV)特异性TCR在患者中显著富集,而髓鞘反应性TCR减少。**2.5.2 ImRex to Include Both Interaction Partners**:ImRex(Interaction Map Recognition)是CNN,将TCR CDR3和表位序列的理化性质差异转化为相互作用图,学习高阶交互模式,特别适合未见表位预测。**2.5.3 The Next Step in Bottom-Up TCR-Epitope Predictions**:TCRex(表位特异)、DETECT(泛特异)和ImRex(交互建模)形成互补,随数据增长可全面分析TCR库抗原特异性。

**2.6 Benchmarking and Improving Future Models**
IMMREP挑战(2022、2023、2025)提供了标准化评价框架,表明配对αβ链信息和多序列上下文(V/J基因、CDR1/2)可提升性能,但已见与未见表位间存在明显差距,需要更标准的数据集和评价协议。

**3 Top-Down Approach**
**3.1 Enrichment-Based Approaches**
通过统计检验识别在特定队列中显著富集的TCR序列,如Emerson CMV研究,从数百人库中鉴定巨细胞病毒(CMV)相关TCR,并在独立队列中验证。本实验室在比利时队列中复现了这些信号,显示CD4+记忆库中CMV相关TCR的鲁棒性。

**3.2 Sequence Similarity and Clustering**
聚类方法(如ClusTCR)将相似TCR分组,增加统计功效,再结合bottom-up注释(如TCRex)推断表位。黄热病疫苗研究中,接种后特定TCR簇扩增,并被注释为针对免疫显性表位LLWNGPMAV。

**3.3 Convergence as a Less Biased Antigen-Driven Repertoire Signature**
趋同性指独立重组事件产生相同或高度相似TCR,是更特异的抗原选择指标。本实验室开发的TRIASSIC方法,基于ClusTCR距离计算,在多疾病队列中识别趋同TCR簇。在自身免疫性关节炎研究中,发现HLA-B27相关关节炎患者中富集TRBV9相关簇,并通过DETECT注释提示EBV反应性。

**3.4 Top-Down Challenges**
**3.4.1 Technical Variability and Sequencing Bias**:技术因素(如10× Genomics与5′ RACE)引入偏差,可超过CD4+与CD8+库差异,需显式建模。**3.4.2 Biological Confounding and Cohort Heterogeneity**:HLA基因型、感染史(CMV、EBV)、年龄和地理背景等混杂因素可掩盖疾病信号。**3.4.3 Statistical Challenges and False Discovery**:大规模多重检验和生成概率偏差(如公共克隆型)增加假阳性风险。**3.4.4 Interpretation and Specificity Limitations**:top-down方法不直接提供表位特异性,需结合bottom-up注释和实验验证。**3.4.5 Toward Robust Top-Down Inference**:引入生成概率模型、交叉验证和互补注释可提高鲁棒性。

**4 Integration of Multiple Data Modalities**
**4.1 Multi-Level Pattern Sharing**
网络融合(如SNF)和潜在变量方法(如CCA、PLS)整合多模态数据(TCR、转录组、微生物组),识别跨模态共享模式。例如,CCA可关联TCR趋同得分与转录特征,生成机制假说。

**4.2 Linking T Cell Phenotypes and Environmental Factors to the Repertoire**
STEGO联合TCR与单细胞RNA-seq,揭示抗原驱动T细胞的功能状态(效应、记忆、耗竭)。在克罗恩病(CD)中,结合TRIASSIC、ClusTCR和细胞表型,发现黏膜相关恒定T细胞(MAIT)相关趋同簇。AIRRWAS框架整合TCR与微生物组,鉴定与细菌属相关的TCR簇,并在微生物刺激实验中验证功能响应。

**4.3 Tracking Immune Exposure and Epidemiology**
在COVID-19研究中,bottom-up模型预测SARS-CoV-2表位,发现非重症患者早现交叉反应TCR并快速产生特异性TCR,而重症患者延迟。大规模多模态研究(394人)显示免疫状态、微生物组和转录组正交,但炎症是共同驱动。CMV与免疫衰老研究中,整合TCR库、表观遗传和CMV血清状态,发现虚弱个体有CD4+库多样性降低和CMV相关CD8+ T细胞增加。

**5 Conclusions and Future Perspectives**
TCR-表位注释面临库多样性、交叉反应、HLA限制和数据质量等多重挑战。bottom-up与top-down方法互补,整合可结合发现与机制解释。未来需扩大数据规模与多样性(配对αβ链、肿瘤新表位等),改进模型(结构特征、语言模型、预训练),并加强多模态整合。从转化角度,可实现精准免疫监测、肿瘤反应性T细胞识别和自身免疫克隆发现。最终趋向统一分析框架,连接分子特异性、库水平模式和群体变异。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号