综述:基于公共T细胞受体从外周血TCR库中学习个体免疫谱系

《Immunological Reviews》:Machine Learning of Personal Repertoires From Public T Cell Receptors

【字体: 时间:2026年07月28日 来源:Immunological Reviews 10.6

编辑推荐:

  T细胞受体(TCR)谱系记录了个体的免疫学历史,但任意个体中绝大多数独特的互补决定区3(CDR3)序列属于私有序列,无法为其他个体提供有效信息。然而,一小部分序列在不同无关供体间可预测地重复出现,这些公共TCRβ序列由多种机制独立产生:胸腺阳性选择对高度共享的

  
T细胞受体(TCR)谱系记录了个体的免疫学历史,但任意个体中绝大多数独特的互补决定区3(CDR3)序列属于私有序列,无法为其他个体提供有效信息。然而,一小部分序列在不同无关供体间可预测地重复出现,这些公共TCRβ序列由多种机制独立产生:胸腺阳性选择对高度共享的自体肽-MHC配体库的富集作用、常见外来抗原选择的进一步扩增,以及收敛重组(CR),三者共同构成了个人谱系可被计算解析的基础——它们提供了共享的坐标系,使得原本不可比对的谱系得以对齐和比较。本综述以公共TCR序列为核心展开论述。研究人员通过对一个包含15亿条序列的元谱系(7943份样本,41项研究)开展新型测量,量化了五个相互关联的特性:该序列空间是有限的,其Chao2估计上限约为1.97×109条氨基酸CDR3β序列和8.25×109条核苷酸CDR3β序列,其中约22.5%的氨基酸序列和12%的核苷酸序列已被观测到;在[0, 7943]样本范围内,稀疏曲线已相对于初始速率线性外推发生弯曲,弯曲因子分别为×3.3(氨基酸)和×1.6(核苷酸);公共性是队列规模的统计量,其分布的重尾随样本量N从200增至7943呈可预测的扩展;超公共序列约占独特氨基酸CDR3的0.014%,却承载了总观测质量的8.45%;在N≈7900时,已在其他供体中观测到的CDR3的再捕获率分别达到73.3%(氨基酸)和36.2%(核苷酸)。随后,研究人员追溯了利用公共序列作为特征的计算方法的演进脉络:频率向量、序列相似性网络、自监督Transformer嵌入模型(CVC、Beaker、TCR-BERT、SCEPTR),以及研究人员自主开发的基于锚点的图神经网络(GraffiTee)。研究人员总结了这些方法在癌症检测、自身免疫病、感染性疾病、免疫治疗监测及免疫衰老等领域的表现,同时指出了限制其泛化能力的结构性混杂因素(HLA、年龄、性别、测序平台)。研究人员将谱系水平分类与TCR-pMHC结合预测及抗原身份识别相联系,并探讨了当前能力与通用TCR诊断之间的差距。
1 引言:作为适应性免疫可读层的公共谱系
适应性免疫系统具备两个特性,使其天然适合计算分析。首先,其特异性编码于离散的分子字母表(重排的TCR及其B细胞对应物序列)中,可通过高通量测序直接从血液中读取。其次,该特异性由随机过程产生,其理论序列空间(1015至1019个可能的αβ配对)远超人体T细胞总数(约1011),直观上意味着任意两人不应共享过多受体。第一个特性邀请研究人员"阅读"谱系,第二个特性则暗示由于缺少共同坐标轴,不同个体的谱系无法直接比较。这一悖论的解除源于V(D)J重组的表观随机性实际上受到结构、偏倚和选择的塑造。某些CDR3氨基酸序列被许多无关个体独立产生,这一现象被称为TCR公共性。公共克隆型在单个个体中仅占独特序列的小部分,但在高频克隆中系统性富集,且在功能上富集针对常见抗原(病毒性、微生物性、半不变性及肿瘤相关性)的受体。研究人员将公共TCR的重复出现视为使谱系可计算的核心机制,它是共享的词汇,使得每个个体免疫历史的"个人文本"可在同一页上被解读。本综述以公共TCR序列为主角,所讨论的频率向量分类器、相似性图网络特征、自监督Transformer语言模型和基于锚点的图神经网络等方法的价值,均在于其使公共序列变得可解析。所综述的临床应用——从外周血癌症检测到免疫治疗反应预测再到免疫衰老时钟——均建立在同一个基本主张之上:个体与公共克隆群体的关系编码了关于疾病、衰老和免疫状态的信息。生物学基础已快速成熟,计算工作亦并行发展。2026年的关键问题已不再是公共谱系是否携带临床有意义信号,而是该领域的可重复性、抗原水平可解释性和平台标准化能否赶上信号本身的发展速度。
2 公共TCR序列的生物学
2.1 随机重组与可重复性的意外
人类TCRβ链通过V(D)J重组组装,从约65个功能性V基因、2个D基因和13个J基因中组合选择,连接区由末端脱氧核苷酸转移酶(TdT)介导的外切酶修剪和模板非依赖性N核苷酸添加共同塑造。可能的CDR3β氨基酸序列组合数远超人类一生中产生的T细胞数量。严格按此生成过程解读,每个个人谱系应基本唯一,供体间重叠接近于零,不存在用于比较供体的共享坐标。早期采样研究与此一致:Robins等人编目的数千万条外周血CDR3序列中,任意两供体间的绝对重叠很小。但后续研究表明实际重叠远高于独立均匀重组下的偶然预期。两名健康成人间共享的独特CDR3氨基酸序列比例虽小但可复现,且这些共享序列在各自供体中不成比例地属于最丰富的克隆;约一百条CDR3β氨基酸序列几乎出现在每个成年人类样本中(该数字为深度和样本量依赖的数量级估计而非固定计数)。主导机制解释是收敛重组(CR):相同氨基酸序列由不同核苷酸重排产生。术语上需注意,除非明确提及配对αβ数据,本文中"公共TCR"指TCRβ(单链)序列,"公共克隆型"亦为该单链操作意义上的用法,不等同于严格意义上完全配对的αβ克隆。由于配对α链通常共同决定特异性,共享β链序列不等同于共享αβ克隆型;配对受体的联合生成概率远低于单链,因此跨个体的真正配对链共享远比本文量化的β链共享更为罕见。单链公共性应被理解为群体水平的坐标系,而非共享抗原特异性的断言。
第二个期望-现实差距推动了从生物学到分类学的转变。即便承认公共TCR存在,人们可能预期它们是信息中性的——恰恰因其跨供体重现而被认为是抗原无关的、易生成的或"管家型"序列。实证结果相反:将供体投影到公共克隆参考集并降维后得到的表征中,临床组别清晰分离,任务涵盖实体瘤检测、自身免疫病和感染性疾病严重度评估。公共TCR不仅是共享的,还携带群体特异性信息。
V(D)J生成过程模型为解释这些观察提供了正确的零分布。IGoR框架拟合重组事件的片段和连接区参数,允许估计每条序列的生成概率Pgen;OLGA实现使其可在大规模下计算。由此获得了对"公共"的定量定义:若一条CDR3序列在多个个体中以高于仅由Pgen预测的频率被观测到(经样本量和测序深度校正),则该序列为公共的。这比经典定义(仅要求跨无关个体共享序列)更严格,区分了由易生成导致的共享与由选择导致的共享。该定义既解释了为何短CDR3及胚系近端V/J使用在公共克隆中富集(因其具有高Pgen),也解释了为何部分低Pgen序列仍为公共的,表明存在超越随机重组的选择压力。
HLA对公共性的影响亦被证实。Emerson等人将特定公共克隆型与巨细胞病毒(CMV)血清状态及特定HLA I类等位基因相关联,证明相当比例的公共克隆具有HLA限制性,其生成、胸腺选择和外周扩增依赖于供体HLA背景。这对任何基于公共克隆特征的分类器均有结构性影响。
2.2 大规模收敛重组:15亿序列图谱
收敛重组(CR)的生物学基础是:密码子简并性、V(D)J片段使用偏倚以及连接区多样性约束(特别是TdT介导的N核苷酸添加的能和立体偏好)共同使得某些氨基酸序列远比其他序列更易生成。CR既是生成偏倚(某些序列更频繁出现),也是过滤器(存活胸腺和外周选择的序列在高中CR集合中非随机分布)。主要驱动力是V(D)J重组本身的强非均匀性,使得少数重排的概率比平均值高出数个量级;密码子简并性允许不同核苷酸重排收敛于同一氨基酸序列,但真正使CR具有定量重要性的是每条序列生成概率分布的偏斜,而非仅靠简并性。
研究人员实验室近期对迄今最全面的CR实证表征进行了量化。整合的元谱系包含来自41项独立研究的7943份批量Rep-seq样本,超过15亿条生产性TCRβ序列。该队列累计库存包含444,419,040条独特CDR3β氨基酸序列和992,109,350条独特核苷酸序列。各CDR3长度下,独特核苷酸序列数始终超过独特氨基酸序列数,证实CR并非统计边缘案例而是谱系组织的普遍原则。需注意,元谱系的量化基于序列发生率(每条CDR3在各供体中的存在与否)和(供体,CDR3)观测对,而非UMI校正的克隆丰度。由于组成研究采用异质性方案,仅部分使用唯一分子标识符,供体内克隆大小在队列间不可比,因此公共性被量化为供体发生率而非合并克隆计数。
该15亿序列宇宙有五个核心定量特性。2.2.1 宇宙是有限的,且已知其已发现比例:基于7943份样本的Chao2样本外推估计,氨基酸CDR3β宇宙规模约为1.97×109条序列,核苷酸宇宙约为8.25×109条。当前队列已发现约22.5%的氨基酸宇宙和12.0%的核苷酸宇宙。达到氨基酸宇宙50%预计需要约23,100份样本,90%需78,700份,99%需158,400份;核苷酸宇宙对应里程碑分别为44,500、148,600和297,600份样本。需注意,各样本测序深度差异显著,Chao2估计以样本而非等大小文库为抽样单位,且里程碑外推远超已观测比例,依赖稀有序列尾部的形状,因此应视为数量级下限而非点预测。2.2.2 稀疏曲线在观测窗口内已发生弯曲:在[0, 7943]样本范围内,发现曲线远低于初始速率线性外推:线性参考每样本新增182,500条氨基酸CDR3,但观测曲线最终落后×3.3倍;核苷酸对应差距为×1.6倍(线性速率193,900条/样本)。Heaps定律拟合得U(n)∝nβ,β≈0.81(氨基酸)和β≈0.92(核苷酸),均小于1,与饱和行为一致。弯曲在观测范围内即可检测,非外推产物。2.2.3 公共性是队列规模统计量,非离散类别:随着样本量N从200增至7943,每CDR3发生率互补累积分布函数显示尾部持续延伸而非平坦化。这意味着公共性不是附加于序列的是/否标签,而是所考察队列的定量函数:更大队列揭示更多共享序列,适当的公共克隆参考集规模随其计算所用队列规模增长。这是结构性事实而非抽样缺陷。2.2.4 重尾携带不成比例的信号:在N=7943时,氨基酸超公共序列(在≥1000/7943供体中观测到)占独特序列的0.0140%,却占总(供体,CDR3)观测对的8.45%,富集约600倍。完整分层为:私有(1供体)79.03%/26.69%;罕见(2-9)17.88%/19.57%;公共(10-99)2.82%/23.74%;很公共(100-999)0.26%/21.55%;超公共0.0140%/8.45%。核苷酸超公共序列仅占独特序列0.0005%但占信号0.51%,富集约1000倍。基于公共端尾的分类器本质上索引了种群TCR观测质量的很大份额。2.2.5 再捕获率体现了公共克隆参考集的操作稳定性:随着N从1增至7943,氨基酸曲线单调升至73.3%,核苷酸曲线升至36.2%。在数千供体队列中,四分之三的观测CDR3氨基酸序列已在另一供体中被见过;核苷酸水平对应约三分之一。两条曲线约37个百分点的差距直接衡量了CR在氨基酸水平贡献的公共性,该贡献在核苷酸水平不可见。这一差距是将氨基酸水平公共克隆参考集视为稳定群体水平特征而非队列特异性偶然事件的操作基础。
这五项测量共同解释了为何5000条最高收敛序列与5000条最高公共序列仅重叠约32.7%。高重组简并性强烈倾向于使序列成为公共的,但非前提条件。相当比例高公共性低CR评分序列表明,胸腺对共享自pMHC的强阳性选择、反复外来抗原暴露或其他外周扩增形式可独立驱动序列在种群中流行。公共TCR至少包含两个重叠群体:易生成的,和难丢失的。
2.3 CR网络的长度依赖性拓扑
对同一元谱系的分长度分析揭示了同义核苷酸变异位置分布的显著结构转变。短CDR3长度(8-10个氨基酸)下,各位置熵分布呈单峰且尖锐集中于中心连接区,反映组合受限序列空间中单一重组焦点。随CDR3长度增加,熵景观向双峰转变,两个空间分离的同源变异峰对应于V-D和D-J连接区。这种分叉反映了RAG介导切割的物理结构,并直接证明双峰熵结构是D段驱动长度扩展的涌现结果而非分析方法强加的假设。图论分析(最小生成树、网络岛和谱拉普拉斯算子)显示,CR网络从短CDR3长度下的紧凑鲁棒突变枢纽,转变为长长度下稀疏脆弱的独立重组事件集合。CR富集的公共克隆型形成以枢纽为中心的网络,具有保守的V/J侧翼结构和渐进的中心残基多样化(通常涉及甘氨酸或酪氨酸替换)。随机CDR3对照网络缺乏这种密集聚类和保守的逐步中心残基模式。这种拓扑约束的异质性为种群尺度上观察到的公共克隆型出现的长依赖性序列特异性差异提供了机制基础。
2.4 公共TCR的选择:胸腺、抗原、半不变性
若CR生成了频繁重组的候选池,选择则决定了哪些候选变为可观测的公共序列。三种选择机制明显:首先是胸腺阳性选择,清除自pMHC反应性差的序列("忽视死亡"),发生于外周抗原接触前。其次是抗原驱动的外周扩增,识别常见遭遇抗原(慢性潜伏病毒、微生物组衍生肽、跨患者共享的肿瘤新抗原)的受体在连续供体中优先扩增。第三是所谓构成性公共机制:半不变T细胞群,其受体结构作为发育程序内置入免疫系统。
Mandl等人2026年综述提出胸腺选择机制的精细化解释:初始T细胞池并非等待外来抗原的惰性受体储库,而是通过自肽-MHC的紧张性相互作用持续校准。皮质胸腺上皮细胞(cTEC)通过专用蛋白水解机制(β5t胸腺蛋白酶体、组织蛋白酶L和胸腺特异性丝氨酸蛋白酶TSSP)产生特化的自身免疫肽组,该cTEC限制性配体组在共享主要HLA等位基因的个体间大体相同。对该共享配体组的阳性选择因而作为群体水平过滤器:CDR3结构以适当亚阈值亲和力结合共享自肽库的TCR(通过CD5和Nur77等替代标记读出)在供体间被优先准入初始池。胸腺迁出后,二级淋巴器官中持续的紧张性自pMHC参与继续调节相同被选克隆的应答性。对公共TCR生物学的含义直接:CR提供材料(相同CDR3氨基酸序列在许多供体中被生成),但对大体共享的自免疫肽组的正选择提供富集。这与前述观察一致:67.3%的高公共性序列不在最高收敛集合中;且公共性与HLA相关。每条公共TCR必须先被生成;问题是何种机制将其提升至跨供体高流行度。两条非互斥路径:序列易生成且反复出现(高CR),因此在许多供体中独立产生;或序列生成概率适中但经历共同选择(共享自pMHC调谐,继而可能被外来抗原放大),因此在出现的供体中得以保留和扩增。两者不互斥但概念上不同,预测了不同的HLA依赖模式和队列稳健性。
黏膜相关恒定T(MAIT)细胞表达TRAV1-2/TRAJ33(或TRAJ12、TRAJ20)α链,配对受限的β链谱系,识别核黄素途径代谢物抗原,由非经典分子MR1呈递。不变自然杀伤T(iNKT)细胞表达TRAV10/TRAJ18 α链,识别CD1d呈递的脂质抗原。这两类群先天设计为CDR3多样性低,因此是典型公共的。它们在癌症分类研究中作为最具判别力的公共克隆被过度代表,与其一致,也暗示癌症分类器检测的并非传统意义上的肿瘤抗原特异性T细胞扩增,而是这些类先天群体的扰动。
常规公共克隆(区别于半不变群体)通常为HLA限制性和抗原特异性。已建立的数据库(VDJdb、McPAS-TCR和Adaptive ImmuneCODE发布的MIRA锚定COVID-19 TCR)提供了从公共克隆到其同源表位的显式映射。截至2026年,这些数据库中约104至105条独特CDR3β序列至少具有一个实验验证的肽-HLA伙伴,相对种群中公共克隆广度而言较小,但足以约束公共克隆分类器的解释。
3 公共序列作为特征:谱系如何变得可计算
3.1 启发性洞见
公共/私有二元性使得谱系机器学习成为可能,因为原始序列集层面的两个谱系几乎不相交。朴素比较(重叠CDR3氨基酸序列计数)发现每对供体间共同基础极少,无共享坐标系。但若固定一个公共CDR3序列参考集并将每个供体谱系投影到该参考集(通过频率、相似性、嵌入距离、图成员关系等),则每个谱系都是同一轴上的向量(或图)。个性化成本仅针对共享骨架支付。分类、回归和无监督结构发现均变得可行。所有下述方法均遵循同一逻辑结构,区别在于公共序列参考集的选取方式、各供体完整谱系与该参考集的关联方式,以及每种表征最适合捕捉的生物信号类型。
3.2 公共克隆的直接频率特征
最直接的方式是以固定公共CDR3β氨基酸序列列表为列,各供体频率为矩阵条目。所得设计矩阵适用于任何标准分类算法。研究人员首次将该框架应用于卵巢癌外周血检测,使用XGBoost在精选公共CDR3特征集上实现了交叉验证折和队列划分下0.93-0.98的AUC。降维揭示仅需三到四个公共TCR特征即可实现高精度分类。乳腺癌队列中加入CVC衍生嵌入特征后,外周血乳腺癌分类器AUC达0.96。结直肠癌(CRC)中,单细胞scCVC增强的公共克隆特征支持风险分层,AUC为0.85。三个生物学观察值得注意:最具判别力的特征反复富集MAIT和iNKT相关序列,表明外周血癌症分类信号的相当部分源自类先天T细胞池的扰动;所需特征极少意味着靶向面板检测(仅测序数百个CDR3位点)可能足以满足某些临床应用,相应降低成本;直接频率特征仍可与更复杂的学习表征竞争,本身就证明负载信号在于公共克隆本身而非应用于其上的表征机制。
3.3 公共克隆的序列相似性邻域
直接频率特征将每个公共克隆视为独立标记。但CDR3序列携带相似性结构:相差一两个氨基酸位置的受体常共享抗原特异性。研究人员团队提出的克隆吸引子框架将TCR谱系表示为图,节点为CDR3序列,边连接处于小Levenshtein或汉明距离内的序列。图的连通分量("吸引子")聚类可能共享抗原特异性的序列,可从吸引子的数量、大小和连通性导出谱系水平特征。更成熟的工具包括GLIPH和GLIPH2(通过基序相似性、V基因使用和CDR3长度兼容性聚类CDR3),以及GIANA(通过等距变换实现近邻搜索,比TCRdist快约600倍)。ALICE和TCRdist形式化了相对于背景生成模型的邻域富集。从本综述角度看,这些方法均以不同方式将公共序列(或其短编辑变体)作为参考集,并从供体与该集的关系中产生每供体特征。
3.4 公共谱系的嵌入
序列相似性计算廉价但表征浅层:仅捕获局部编辑距离,非功能或生物物理相似性。自然下一步是学习CDR3序列的连续嵌入,使功能相关受体在嵌入空间中邻近。自监督Transformer语言模型通过掩码语言建模在大型TCR序列语料库上训练,已成为标准工具。研究人员团队开发了此类模型家族:CVC是基于BERT的编码器,在约500万条批量TCRβ CDR3序列上训练并微调产生768维嵌入,无监督情况下恢复TCR公共性、J基因使用和CDR3长度作为连续轴。scCVC在420万条配对单细胞TCR序列上训练,额外捕获表达各受体的T细胞亚群信息。Beaker是最新成果,将掩码语言建模目标扩大约两个量级:3800万参数,在4.65亿条CDR3β序列上训练,采用ALiBi位置偏倚。Beaker嵌入空间以接近完美保真度编码TCR公共性,预测与观测样本计数的Spearman相关性达0.967,较CVC(0.752)显著提升。其他团队的TCR-BERT、BertTCR、DeepTCR、DeepRC和SCEPTR均采用不同归纳偏置追求同一目标。值得注意的是,通用蛋白质语言模型(尤其是ESM-2和ProtBert)在TCR特异性任务上并不稳定优于简单序列距离基线,有时甚至劣于TCRdist。这表明TCR特异性信号未被通用蛋白质表征所包含,与CDR环和连接区残基的结构保守性局限于局部、且其重组统计特性未在更广蛋白质组中体现有关。
3.5 公共TCR作为锚点:GraffiTee和基于图的表征
GraffiTee架构明确将公共TCR用作图构建的锚点。具体而言:从约3.78亿条独特CDR3β序列的公共性参考数据库中选出样本计数最高的100条序列作为通用锚点。对每个供体谱系,所有生产性CDR3β序列用Beaker嵌入,并通过余弦相似性检索各锚点的20个最近邻,每谱系产生约800个独特节点。在这些节点上构建k近邻图,训练图注意力网络(GAT)从图中分类供体疾病状态。消融实验显示,当GAT仅接收V和J基因独热编码作为节点特征(图拓扑由Beaker余弦相似性定义)时分类性能最优;加入Beaker嵌入反而降低性能。这表明在此架构中,Beaker的贡献是定义图拓扑(哪些序列靠近哪些锚点),而非丰富每节点描述。决定性算法创新是使用公共TCR作为训练良好潜在空间中的通用参考点,而非潜在表征本身。该方法的独立竞争性验证来自AIRR-ML-2025适应性免疫分析挑战赛,获胜提交即基于此锚定GNN框架。作为盲评外部管理竞赛,该结果构成独立确认,证明公共克隆锚定表征在真实世界AIRR分类任务上优于替代方法。
4 公共序列分类器的成就
本节综述公共序列分类器迄今产生的临床和生物读数。需注意,绝大多数结果来自内部交叉验证而非独立前瞻性验证。内部交叉验证系统性高估性能,领域内积累了大量未能在外部队列复现的乐观报告。诊断或预后主张的金标准是前瞻性验证,极少研究满足此标准。建议将报告的AUROC视为研究内估计而非可迁移准确度。
4.1 外周血癌症检测
卵巢癌外周血TCR谱系梯度提升分类器在健康对照和患者间实现0.93-0.98的AUC,特征以MAIT和iNKT相关序列为主。Yu等人在466名高级别浆液性卵巢癌患者的前诊断样本中发现可复现的公共TCR信号,最早可在临床诊断前4年检测到。Li等人在肺癌研究中识别327个癌症相关RFU,76%与HLA相关,I期灵敏度约50%;与ctDNA和循环蛋白联用后TCR评分可增加最多20个百分点灵敏度。乳腺癌对应结果为AUC 0.96。CRC中框架支持风险分层,AUC 0.85。GraffiTee将癌症检测边界扩展至更具临床野心的任务:仅凭外周血TCRβ区分转移性CRC与非转移性CRC,在125例患者队列上AUROC达0.852,较最强非图基线高出约19个点。Yuan等人应用多层机器学习框架同时分类癌症类型、转移状态和疾病分期,从单一模型实现GI癌组织TCR数据的多任务分型和分期。需注意,"公共克隆区分癌症与健康"不等同于"公共克隆区分肿瘤特异性与非特异性应答"。区分癌症队列与健康队列的信号理论上可能反映年龄、性别、吸烟或共病驱动的谱系扰动而非肿瘤驱动。组内年龄和性别分层分析未消除疾病类别信号,但来自独立人群的匹配对照仍是开放需求。
4.2 跨物种保守性作为生物学验证
乳腺癌相关公共TCR的跨物种比较显示,患者外周血中过表达的CDR3β氨基酸序列与乳腺肿瘤小鼠谱系中过表达的序列显著重叠。重要的是,共享氨基酸序列在两物种中由完全不同的核苷酸重排编码。相同重组结果通过独立路径达成。这是正交尺度的CR:结构约束的TCR-抗原相互作用在暴露于可比肿瘤抗原的进化距离遥远的免疫系统中独立产生相同CDR3氨基酸解决方案。作为公共克隆分类信号反映真实抗原选择而非重组偏倚产物的论证,这是决定性证据。
4.3 自身免疫病与感染性疾病
1型糖尿病(T1D)中,GraffiTee在2072个T1D相关TCR谱系上实现0.801的AUROC,超过DeepRC原始结果(0.79)约8.5个点。系统性红斑狼疮(SLE)和类风湿关节炎(RA)中,Liu等人早期工作显示V/J基因使用频率单独即可区分877名SLE患者、206名RA患者和439名健康对照,AUC高于0.99。Zhang等人的EAMIL框架结合PrimeSeq高频序列选择、ESM基CDR3嵌入和门控注意力,SLE达AUC 98.95%,RA达97.76%,并可按SLEDAI评分分层并定位器官损伤。COVID-19方面,GraffiTee在514个免疫CODE衍生划分上区分住院与非住院病例,AUROC 0.896,较最强非图基线高出7.9个点。Park等人分析47亿条序列,识别收敛COVID-19相关CDR3模式,机器学习分类器感染状态近完美AUROC;严重疾病以免疫耗竭和广泛克隆扩增为特征,中度疾病显示细胞毒性亚群选择性扩增。最具架构雄心的成果是MaLID,整合BCR重链和TCRβ特征,六分类预测(COVID-19、HIV、狼疮、T1D、流感疫苗接种反应、健康)在外部验证队列上多类AUROC达0.986,可解释特征重现已知SARS-CoV-2、流感和HIV抗原特异性应答。
4.4 连续生物标志物:免疫时钟
T-Time框架识别一组年龄相关TCR克隆型,其频率模式在年轻和老年供体间系统性差异,结合氨基酸基序频率预测时序年龄。深度回归器实现6.96-7.50年的平均绝对误差(MAE),与已建立的蛋白质组和甲基化时钟相当,且仅基于单一生物底物(TCRβ谱系)和单一样本类型(血液)。T-Time建立在Britanova等人基础观察之上:TCRβ多样性在约6至70岁间近似线性下降,与胸腺输出和初始T细胞周转相关。T-Time将其从描述性推进至预测性:识别频率轨迹携带年龄信息的特定公共克隆型,并在回归器中结合基序水平特征产生每供体年龄估计。三项发现具超越时钟本身的意义:存在约1.6-3.5年的基线"免疫年轻"女性优势,在急性COVID-19感染期间减弱;探索性应用显示治疗性高血压与免疫衰老减速相关,而多种自身免疫和神经精神疾病趋向加速免疫衰老;青年相关克隆型构成成分独特的"专才"群体,具刚性生化约束,而年龄相关克隆型趋近更通用的分子特征,与从胸腺来源谱系向数十年慢性抗原暴露塑造谱系的转变一致。Hu等人的RFU框架独立证实了血液TCR作为免疫年龄读数的有效性,eRFU以约每年2%的速度在普通人群中下降,在免疫抑制条件下加速丧失,年轻供体骨髓移植后部分逆转,确立eRFU丰度为功能性而非仅相关性衰老读数。eRFU主要由TRAV1-2+ MAIT细胞表达,正是卵巢癌分类中最具判别力特征的同一群体,表明MAIT细胞克隆丰度是免疫监视能力和免疫衰老的共同轴。
4.5 治疗动力学:预先存在的克隆作为生物标志物
TCR适应性指数(TAI)量化头颈部鳞状细胞癌双重免疫检查点抑制剂治疗前后预先存在克隆的协调谱系通量。TAI是预先存在克隆绝对对数扩增率之和,经追踪克隆数和各时间点测序深度归一化。治疗开始后第7天测量的TAI与临床结局显著相关;与肿瘤反应性评分整合后进一步改善反应预测。生物学前提是有效免疫治疗动员并重组织既定谱系,且该动员在治疗前临床反应显现前即可检测。早期小鼠抗CTLA-4免疫治疗工作将同一观察框定为TCR"时间戳":不同治疗后时间点采样的谱系携带特征性时间签名,机器学习分类器预测反应的准确性随采样时间系统性变化,在第7天附近达峰。临床含义明确:采血时机非自由参数,TCR基反应生物标志物的信息窗口窄于月度门诊随访且与当前免疫治疗随访计划重叠不佳。TAI和"时间戳"结果与领域内并行工作一致:ICI反应涉及克隆替换(新T细胞克隆扩增而非预存肿瘤浸润克隆放大),早期治疗后动力学可诊断反应,诊断克隆部分为预先存在、部分为新出现,公共克隆追踪捕获预先存在组分的通量,而新生组分留待scTCR-pMHC追踪。
5 混杂因素与当前分类器的局限
5.1 HLA限制性公共性
公共性依赖HLA。Emerson 2017年分析将公共克隆与特定HLA I类等位基因和CMV血清状态关联。下游分类器直接受影响:无论何种方式构建的公共克隆参考集,均过度代表其源种群HLA背景的特征克隆。若疾病队列与匹配对照的HLA组成存在差异(即使轻微),部分表观疾病信号将反映HLA而非疾病。现有癌症和自身免疫队列均未在种群水平平衡HLA,公共克隆参考数据库偏向欧洲血统HLA背景。诚实解读是报告的部分AUROC反映了HLA驱动的谱系分层而非肿瘤或自身免疫生物学。HLA平衡队列的独立验证尚未大规模开展,是本领域的首要下一步。
5.2 年龄、性别和CMV/EBV血清状态
年龄是第二大谱系塑造力量。除T-Time时钟的绝对输出外,任何队列的年龄分布均在公共克隆子空间留下印记:老年谱系以CMV和EBV驱动克隆的克隆扩增为主导,初始前体耗竭,CDR3长度分布特征性偏移。癌症队列系统性老于健康对照;自身免疫队列通常不如此。性别亦然:女性和男性谱系在基线组成上存在差异。CMV血清状态可能是成人中最大的个体谱系塑造变量,却在TCR分类出版物中罕有报告。这些混杂因素原则上可通过分层分析或将年龄、性别、血清状态作为协变量纳入监督训练来解决,但实际上多数已发表基准中控制不完整。组内年龄分层分析显示疾病类别信号仍然存在,但剩余信号幅度小于标题AUROC。这一细微差别在图表中很少传达,摘要中常被省略。
5.3 测序平台和流程效应
TCRβ谱系至少在三种实质不同平台上测序:Adaptive immunoSEQ(多重PCR加合成模板校正)、5'RACE方案(如Takara)、UMI标记扩增子方案(SMARTer/MiGEC系列)。下游序列提取流程(MiXCR、immunoSEQ Analyzer等)在引物修剪行为、V/J基因分配和克隆型归并规则上不同。净效应是同一生物样本经不同平台和流程处理产生非完全相同的克隆型表。在某一平台上训练的分类器通常难以迁移至另一平台,报告的AUROC不能跨平台合并而无仔细归一化。在前瞻性平台盲法验证成为常态前,领域标题数字携带未披露的不确定性,保守估计为数个AUC点。
5.4 队列组成、批次和可重复性
许多TCR分类队列来自多个来源,各有其入组和测序方案。当收集来源与疾病状态相关时(因每位合作者通常仅贡献病例或对照而非两者),批次效应与标签混淆。实证上,若干已发表TCR分类器在训练平台数据上AUROC接近1.0,在独立集合上接近0.6。研究人员团队的分类器亦非免疫于此:多数出版物中报告的保留AUROC来自统一队列内划分,而非真正独立前瞻性验证。更强的可重复性证据正在积累,但仍为本领域最频繁的失败点。合理的工作立场是:在仔细控制下,公共克隆分类器可在0.7-0.9 AUROC范围内可靠检测疾病类别信号;高于0.95的标题数字常包含部分混杂贡献;通往临床转化的路径在于前瞻性独立验证而非单纯方法学创新。
6 公共克隆识别什么:桥接分类与抗原身份
达到0.85 AUROC的疾病分类器本身不告知哪些抗原驱动信号。频率或图位置与疾病相关的克隆之所以公共,可能是因为HLA限制性CMV/EBV/肿瘤相关、半不变MAIT/iNKT、或仅仅易生成。区分这些可能性需要第二条计算免疫学脉络:预测给定TCR识别的肽-HLA复合物。
6.1 表位标记TCR数据集
三个资源主导实证基础:VDJdb是经实验验证的肽-HLA伙伴TCR序列策展数据库;McPAS-TCR为补充策展,部分聚焦病理背景;ImmuneCODE将COVID-19队列批量TCRβ测序与MIRA检测配对,后者通过高吞吐功能读数刺激供体T细胞、按活化分选并测序。截至2026年,这些数据库共同覆盖约104至105条独特CDR3β序列,至少具有一个验证表位,各代表数十至数百个不同肽-HLA靶点。表位覆盖以少数免疫显性抗原(CMV pp65 HLA-A*02、EBV BMLF1、SARS-CoV-2刺突蛋白)为主,长尾为单靶点条目。公共克隆参考集与这些表位标记数据集的交集非平凡。任何元谱系中最高公共CDR3β序列的非可忽略比例至少具有一个注释表位伙伴;反之,VDJdb/McPAS条目的很大比例本身具有一定程度的公共性。这不是巧合(免疫显性抗原引发公共应答),它为疾病分类与抗原身份提供了实证桥梁。
6.2 TCR-pMHC结合预测
当公共克隆无注释伙伴时,替代方案是计算预测其特异性。最新技术包括NetTCR-2.0/2.1/2.2(卷积编码器分别处理CDR3和肽序列,BLOSUM编码输入,后扩展至配对链输入)、ERGO/ERGO-II(LSTM和自编码器骨干,显式处理未见肽)、TITAN(跨TCR和肽的双模注意力)、PanPep(通过元学习解决未见肽泛化问题)以及基于结构的方法(特别是针对TCR-pMHC复合物的AlphaFold-Multimer微调)。近期基准测试达成清醒共识:在训练集包含的肽上,最佳方法表观AUC较高;在未见肽上,性能跨架构崩溃:无一方法可靠地从训练未见过的肽泛化。数据依赖性严重到报告数字更多取决于训练/测试划分协议而非架构选择。实践中,TCR-pMHC结合预测对VDJdb/ImmuneCODE中充分代表的肽可靠,对其他所有肽不可靠。
6.3 分类-识别桥梁
这对公共克隆疾病分类器的含义有两面。一方面,任何疾病分类器中最具判别力的公共克隆可与表位标记数据库交叉引用,产生部分机制解释:约10%-30%的高重要性公共克隆至少具有一个注释表位伙伴,主要为CMV/EBV抗原、HLA-A*02限制性MART-1和其他肿瘤相关抗原、以及MAIT相关MR1配体。最强的实验依据来自Li等人,证明来自多个癌症相关RFU的TIL TCR物理结合HLA呈递的肿瘤抗原肽,且76%的癌症相关RFU与特定HLA等位基因相关。这是超越数据库相关的因果确认,是领域内最接近闭环分类器输出与其机制基础的工作。另一方面,剩余70%-90%无注释,且结合预测工具对其不可靠。疾病分类器信号中被机制性归因于特定抗原的比例目前仍然有限。
缩小这一差距的路径包括:更高通量实验表位发现(MIRA类及条形码四聚体筛选在种群尺度),扩大标记集缺口方向的覆盖;谱系分类器和表位预测模型的联合训练,使抗原归属问题成为损失函数一部分而非事后交叉引用;来自大规模TCR-pMHC复合物预测的结构先验(TCR感知的AlphaFold),至少为未注释公共克隆提供信息性后验结合估计。
7 迈向通用TCR诊断
7.1 已实际部署的应用
两种TCR基检测已进入临床使用,均为Adaptive Biotechnologies产品。clonoSEQ检测通过追踪患者特异性肿瘤克隆型测量淋巴恶性肿瘤(CLL、ALL、多发性骨髓瘤)微小残留病,是迄今最成熟的TCR临床产品。T-Detect COVID使用MIRA框架识别SARS-CoV-2相关公共CDR3β克隆,提供独立于血清学的既往感染信号,获FDA紧急使用授权。T-Detect Lyme作为后续产品针对伯氏疏螺旋体感染推进。这些检测均未使用语言模型嵌入或图神经网络的完整装置,而是依赖本综述核心的概念操作:精选疾病相关公共克隆集,针对每患者谱系进行查询。这意味着公共克隆框架在临床使用中已有存在证明,拥有通过FDA的监管路径。同时也令人警醒:第3节中更复杂的任何方法尚未进入临床使用;已进入使用的均为概念上最简单的方法。更复杂的方法是否将通过前瞻性验证任务的更优表现证明其额外复杂性合理,仍有待证明。
7.2 仍需完成的五件事
第一,HLA平衡、平台平衡队列中疾病分类器的前瞻性独立验证。第二,TCRβ测序方案和处理流程的标准化,使在一平台训练的分类器可在可接受性能损失内迁移至另一平台(或统一平台)。第三,大规模配对αβ测序,因为第6节的许多结合预测限制在α链信息存在时可缓解。第四,与BCR谱系整合;许多临床关注疾病涉及协调和体液与细胞应答,纯TCR读数系统性遗漏BCR主导信号。第五,针对谱系衍生生物标志物特性的监管和报销路径,其维度高于当前FDA伴随诊断模板设计容量。样本模态是第六个部分正交的轴:外周血为默认且将保持为人群筛查首选;组织和引流淋巴结TCR测序携带更丰富的疾病特异性信号但侵入性更高、通量更低。
7.3 本综述的立场
公共TCR序列是个人与另一人共享的适应性免疫系统组成部分。它们在任意个体独特CDR3库中占比小,却不成比例地占据频率质量的大份额。其存在是偏倚重组、结构约束选择和(对半不变群体而言)发育程序的后果。其效用是使个人谱系可计算,是原本不可比对的谱系得以对齐的共享词汇。围绕这一事实已生长出富有成效的研究脉络:从频率向量分类器,经由相似性图和自监督语言模型表征,抵达明确使用公共序列作为群体水平参考点进行患者水平推断的锚定图神经网络。这些方法合计在外周血TCR数据上于癌症检测、自身免疫病、感染性疾病严重度和转移方面达到0.85以上的AUROC;预测时序年龄在7年内;在治疗开始后一周内检测治疗反应。同时,领域已成熟到足以认识这些数字确立和不确立的内容:HLA、年龄、性别和测序平台仍控制不足,疾病分类器信号的抗原水平解释滞后于分类器准确性。
8 开放问题
8.1 谱系分类器的抗原水平可解释性:最大差距在于预测AUROC与机制归因的脱节。需要谱系水平分类与TCR-pMHC结合预测的联合发展。
8.2 HLA表征与祖先覆盖:公共克隆参考集目前偏向欧洲血统HLA背景。若无校正,疾病分类器在代表性不足祖先队列上表现更差且有偏。这需要数据收集层面的投入而非方法层面解决。
8.3 边缘处的公共性与个人性:公共克隆框架依赖供体间谱系交集。交集小的场景(罕见病、高度个体化癌症新抗原情境、儿童早期谱系)框架可能杠杆有限。认识到其失效场景而非强行推广是善用它的部分。
8.4 因果与关联签名:分类器中存续的关联至多证明疾病状态与谱系状态共变。疾病导致谱系改变、谱系改变易感疾病、或第三因素导致两者,无法由分类指标解决。需要纵向队列的患病前和患病后采样来区分因果与关联成分。
8.5 自监督的下一个数量级:Beaker为3800万参数模型,训练于4.65亿条序列。未来2-3年内,训练于109至1010条序列、含配对αβ链并可能配对BCR数据的模型可预见。其能力边界本身为开放问题。它们将改善序列水平公共性预测和抗原特异性粒度,但不会单独解决队列混杂、HLA不平衡或临床验证问题。方法学进步速度不应与临床进步速度混淆,后者受限于数据而非参数。
8.6 配对αβ与多模态整合:迄今大部分工作仅针对TCRβ。α链信息原则上并依已发表基准可大幅改善抗原特异性预测。单细胞配对链数据正在积累但仍占总可用谱系数据的很小部分。扩大配对αβ队列的领域范围努力(并以与β链数据同等严谨性标准化其分析)已逾期。
9 结论
公共T细胞受体序列是适应性免疫系统中个体间共享的部分。它们在任意个体独特CDR3库中占比小,却不成比例地占据频率质量的大份额。其存在是偏倚重组、结构约束选择和(对半不变群体而言)发育程序的后果。其效用是使个人谱系可计算,是原本不可比对的谱系得以对齐的共享词汇。围绕这一事实已发展出富有成效的研究脉络,目前在外周血TCR数据上于癌症检测、自身免疫病、感染性疾病严重度和转移方面达到0.85以上的AUROC;预测时序年龄在7年内;在治疗开始后一周内检测治疗反应。同时,领域已成熟到足以认识这些数字确立和不确立的内容。诊断愿景下的可证伪科学赌注是:人类TCR谱系的公共组分在总体上是一个足够稳定的群体水平坐标系,可支撑跨队列推断、跨平台标准化和前瞻性临床验证。多条证据线索(乳腺癌相关公共克隆的跨物种保守性、MAIT/iNKT信号跨癌症队列的可复现性、clonoSEQ和T-Detect作为已部署检测的存在)支持这一赌注。但无一单独确证它。未来十年将给出答案。本领域需要从未来十年获得的不是更多方法论狂热,而是更有纪律的复现:HLA平衡队列中的前瞻性验证分类器、平台盲法跨流程比较、以及闭合预测AUROC与机制归因回路的联合谱系-抗原模型。公共克隆锚定分析的概念贡献是本文希望传达的核心。临床贡献仍有待赢得。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号