基于深度学习的癌症相关T细胞受体(caTCR)特征识别研究进展:从序列表征到临床转化的系统综述与外部基准评估

《Seminars in Cancer Biology》:Recent Advances in Unlocking T Cell Signatures in Cancer Through Deep Learning

【字体: 时间:2026年09月21日 来源:Seminars in Cancer Biology 20.3

编辑推荐:

  摘要专业翻译 T细胞受体(T-cell receptors,TCRs)能够识别包括癌症抗原在内的多种抗原,为免疫学 profiling 和早期检测提供了有前景的途径。随着癌症诊断日益转向微创方法,深度学习已成为推动这一转变的有力工具。从外周血样本中识别癌症相关

  
摘要专业翻译 T细胞受体(T-cell receptors,TCRs)能够识别包括癌症抗原在内的多种抗原,为免疫学 profiling 和早期检测提供了有前景的途径。随着癌症诊断日益转向微创方法,深度学习已成为推动这一转变的有力工具。从外周血样本中识别癌症相关TCR(cancer-associated TCRs,caTCRs)为传统基于活检的方法提供了一种引人注目的替代方案,能够实现更具可扩展性和非侵入性的癌症筛查。在本综述中,研究人员检视了十二种最先进的caTCR检测框架,详细阐述了其概念创新与方法工作流程。研究人员还在自有数据上对部分公开可用的预训练模型进行了有限的外部基准测试,并分析了其性能。研究人员进一步讨论了caTCR及其检测方法在生物学和方法学上的局限性,并评估了其在临床环境中被采用的可能性。通过强调近期进展与现存局限,本手稿旨在为该领域提供一个均衡的视角,并为未来研究提供信息,以推动更稳健、更具可解释性且更具临床相关性的基于caTCR的诊断工具的发展。

论文主体内容专业总结

1. 引言

1.1. 利用TCR组库进行非侵入性癌症检测

深度学习已在医学诊断成像等领域展现出接近甚至超越资深临床医生的性能。在免疫学领域,深度学习已被应用于探索适应性免疫受体组库(Adaptive Immune Receptor Repertoire,AIRR),特别是T细胞受体(TCRs)。TCRs是T细胞表面识别抗原(包括癌症新抗原)的异二聚体蛋白,由长链(beta或delta)和短链(alpha或gamma)组成。大多数TCR研究聚焦于互补决定区3(Complementarity-Determining Region 3,CDR3),因其是TCR中多样性最高的区域,也是直接抗原识别和结合的部位。深度学习在TCR研究中的应用主要分为两类:一是预测TCR与抗原肽之间的结合亲和力,二是在免疫组库中识别/分类癌症相关TCR(caTCRs)。该综述聚焦于从给定样本/组库中分类caTCR的方法。其核心设想是:临床医生获取外周血样本,进行高通量TCR测序,并利用这些模型判断癌症可能性,从而实现微创、可扩展的癌症筛查方式。

1.2. 癌症中TCR动态的生物学基础

在肿瘤微环境(Tumor Microenvironment,TME)中,肿瘤浸润淋巴细胞(Tumor-Infiltrating Lymphocytes,TILs)并非随机进入组织,而是通过TCR介导的对人白细胞抗原(Human Leukocyte Antigen,HLA)所呈递新抗原的识别而被选择性招募和扩增。因此,TCR序列特征、肿瘤抗原景观和T细胞功能状态通过免疫选择压力相互关联,形成可被数据驱动模型学习的非随机统计关联。近年研究表明,TILs并非严格的组织驻留群体——在肿瘤内经历抗原驱动的激活和克隆扩增后,部分TILs可重新进入循环,在肿瘤、引流淋巴结和外周血之间转运。利用TCR测序,可在不同组织和时间点追踪相同的TCR克隆型,建立肿瘤内抗原识别事件与外周 compartments 中可观察TCR序列之间的分子对应关系。此外,空间转录组学和新兴的空间TCR profiling 技术(如Spatial VDJ、SPTCR-seq、Stereo-XCR-seq)可在保留组织背景的同时捕获受体序列,但这类方法尚未商业化成熟,数据集有限,限制了其在大规模建模中的适用性。

2. caTCR模型的生物学可解释性

caTCR模型的预测能力依赖于识别氨基酸序列中的特定生物学模式。这些模型主要通过分析两个主要特征来区分癌症相关克隆型:氨基酸富集和CDR3区域内残基的特定序列顺序。例如,肿瘤浸润淋巴细胞受体表现出更高的疏水残基使用率,这被认为是免疫原性的关键理化标志;较长的CDR3序列在癌症患者中频繁富集,可能反映了与肿瘤抗原相互作用所需的独特环状结构;肿瘤浸润序列中组氨酸富集被推测是癌细胞酸中毒改变组氨酸构象的选择压力结果。此外,caTCR还以优先的V和J基因富集为特征,即TCR偏倚现象。针对共享肿瘤抗原NY-ESO-1的T细胞群体常表现出TRBV12-3和TRBJ2-1基因优势配对TRAV17和TRAJ31,而对Melan-A抗原的应答则一致富集TRBV27、TRBJ2-1、TRAV12和TRAJ34。这些模型利用V(D)J重组和选择的非随机性来提高预测准确性。以BertTCR为例,BERT组件捕获嵌入层中的序列顺序和上下文信息,随后卷积神经网络(Convolutional Neural Network,CNN)利用这些特征进行最终预测。尽管不同模型可能采用不同的特征提取器或架构,但它们的共同目标是学习能够捕获TCR组库中生物学相关模式的序列表征。

3. caTCR预测方法概述

大多数方法遵循相似的工作流程:首先提取TCR中的CDR3序列(通过TCR-seq直接获得或通过TRUST4等组库重建工具从RNA-seq间接获得),经过质量过滤(如去除非生产性TCR),应用TCR聚类或冗余减少策略以富集可能代表克隆扩增T细胞的序列,然后将序列编码为适合神经网络架构的数值表示进行训练,最终输出表示癌症或非癌症关联的概率分数。该综述共纳入十二种方法,可分为两类:基于氨基酸特征的方法和基于嵌入特征的方法。

3.1. 氨基酸特征化

DeepCAT是该领域的开创性方法,假设caTCR可能包含独特的生化特征。其对癌症和对照队列采用不同的预处理流程:癌症样本使用TRUST算法从TCGA的bulk RNA-seq数据中重建TCR序列,健康样本则使用iSMART算法聚类公开TCR-seq数据集。DeepCAT对AAindex数据库中的544种生化氨基酸描述符应用主成分分析,生成20×20编码矩阵,将每个TCR转换为二维图像,通过CNN进行训练。由于CNN仅允许固定输入大小,DeepCAT分别针对12-16个氨基酸长度的CDR3训练了多个模型。
DeepLION/DeepLION2针对DeepCAT的两个问题进行了改进:固定长度卷积核无法跨多个长度使用基序,以及忽略了同一免疫组库中TCR间的序列相关性。DeepLION利用不同大小(2-8mer)的卷积核处理不同长度的氨基酸k-mer,并采用多实例学习(Multiple Instance Learning,MIL)在预测过程中对组库中每个TCR重新分配适当权重。DeepLION2进一步引入多实例对比学习以防止模型从非caTCR中学习噪声模式,并引入稀疏自注意力以洞察组库中的序列关系。
MINN-SA在MIL上下文中引入稀疏注意力机制,能够过滤每个bag中的非信息性实例以提高模型可解释性。其使用基于Atchley因子的TESSA编码TCR,并在训练中利用残差连接改善模型学习性能。
iCanTCR结合TCR的生物物理化学性质(AAIndex)和基于k-mer基序丰度的统计特征。除二分类caTCR预测器外,还引入多分类器以判断具体癌症类型。模型包含CNN和长短期记忆网络(Long Short-Term Memory,LSTM)等多种特征提取器。由于对照样本与癌症样本比例严重失衡,使用CD-HIT进行聚类以获得非冗余的健康CDR3序列。
DeepCaTCR引入具有不同大小卷积核的一维CNN,以及结合自注意力的双向LSTM(Bidirectional LSTM,BiLSTM)网络,用于提取多种长度的基序。与DeepCAT不同,其采用零填充确保序列长度统一,并使用一维CNN而非二维CNN,以避免零填充序列经二维CNN处理导致的数据长度分布改变和性能下降。
AutoTFCNNY引入结合Transformer和CNN的多实例深度神经网络,同时学习TCR的局部和全局特征。其利用编码器的多头注意力建模TCR关系,在关注重要TCR的同时不忽略其他TCR。

3.2. 嵌入作为特征

AttenCaIdX采用基于Transformer的架构解决DeepCAT固定长度输入的问题,并依赖嵌入层编码TCR的序列和位置信息。自注意力机制同时考虑局部和全局模式,增强学习鲁棒性和预测性能。
BertTCR首次将蛋白质嵌入空间用于caTCR分类,应用预训练的ProteinBERT模型将CDR3编码为738维表示,并使用CNN进行分类。序列在输入CNN前进行零填充以确保长度统一,集成学习通过多个多层线性分类器聚合预测结果。
MICA将TCR信息编码为50维词向量,并采用并行CNN层提取特征。模型分为实例评分和bag分类两个模块,bag分类模块结合全连接层和自注意力模块进行预测。MICA在肺癌和甲状腺癌数据集上训练和测试。
PCTE(Parallel Convolutional and Transformer Encoder)使用并行CNN和Transformer编码器进行caTCR分类,采用516维词向量。模型包含三个特征提取器:由两个连续CNN层组成的主要特征提取器、由两个并行Transformer编码器组成的时间序列特征提取器,以及由两个并行CNN层组成的先进特征提取器。
MDPR是截至2025年12月最新发表的方法,利用TCR的空间特性。其使用ESMFold生成的1280维词向量,并将原子三维坐标与原子one-hot编码结合,氨基酸被映射为主原子序列,每个原子的one-hot编码由其x、y、z坐标加权后拼接并零填充形成固定长度矩阵。网络包含空间特征提取模块、序列特征提取模块和联合训练模块。

4. caTCR方法的比较基准测试

各方法均进行了内部基准测试并报告了接近或达到最先进的性能,AUC值通常达到0.95-0.99。然而,后续在不同设置下的重新实现或评估经常产生明显更低或更可变的结果,表明性能估计对模型架构、数据预处理、训练-测试划分和评估协议的选择高度敏感。该领域目前缺乏大规模、社区公认的参考数据集。研究人员对六个提供公开预训练模型的工具进行了小规模探索性基准测试,使用这些模型应用于各工具均未见过的癌症数据集和内部健康对照数据,未进行重新训练、微调或阈值优化。结果显示,大多数模型在外部评估数据集上的性能低于原始报告值,AUC值一般在0.4至0.7之间。DeepCAT达到0.8的AUC,iCanTCR达到1.0的AUC,而DeepCaTCR和BertTCR-THCA的AUC低于0.5。值得注意的是,ROC AUC和F1分数捕获了性能的不同方面:AUC是阈值无关的排序指标,而F1分数取决于特定决策阈值和类别分布。例如,iCanTCR虽然AUC为1.0(表示完全排序分离),但在默认阈值0.5下仅1/10的癌症样本被正确识别,F1分数仅为0.2,说明原始评分量表和默认阈值无法直接迁移到外部队列。

5. caTCR预测的局限性与挑战

癌症关联只能在样本或组库层面进行分配,因为癌症患者中并非每个TCR序列都是肿瘤反应性或特异性的。所有方法本质上将样本视为"bags"、TCR序列视为实例,通过聚合获得样本层面预测。当这些分数事后聚合时,所得数值不再对应固定的概率量,应主要在同一方法处理的其他样本的相对关系中解释。数据不平衡和采样偏差构成额外挑战:组库中仅小部分TCR预期与癌症相关,而癌症相关TCR的ground truth目前缺乏(与CMV、EBV等病毒感染的TCR疾病关联可通过VDJdb等资源获得不同)。数据泄漏是另一重要问题——同一供体的TCR同时出现在训练和验证/测试集中会因验证偏差导致性能估计膨胀,因为来自单一供体的TCR并非独立同分布,受克隆扩增和共享HLA/MHC限制的影响。此外,癌症样本相对于健康对照代表性不足,构建平衡的训练环境面临挑战。聚类方法(如iCanTCR使用的CD-HIT)虽可缓解类别不平衡,但增加了建模流程的复杂性,其影响尚不明确。生物学解释方面,预测的癌症相关TCR特征可能反映与恶性肿瘤相关的更广泛的免疫扰动,而非直接的肿瘤抗原识别,需要正交实验验证以建立真正的肿瘤特异性。

6. 未来研究与结论

持续集成最先进的深度学习架构是推进caTCR预测研究的关键方向。AlphaFold及Boltz-1、Boltz-2等蛋白质结构预测模型的进展为将空间和结构信息纳入caTCR预测工作流程开辟了新可能性,PCTE是首个利用CDR3区域空间特征的caTCR预测方法。特征表示本身仍是活跃研究领域,未来工作可能聚焦于优化生物学信息嵌入和保留有意义免疫学模式的低维表示。然而,caTCR检测模型向常规临床实践的转化仍然有限。基准测试表明,尽管多个模型在外部评估中保留了判别能力,但性能变异性、阈值依赖行为和校准局限性仍然显著。临床应用中,模型效用不仅取决于整体判别能力,还取决于经过验证的诊断性能特征,包括敏感性、特异性、假阳性和假阴性率以及误分类的临床后果。未来临床应用需要在多样化队列中进行严格的外部验证、队列特异性校准、标准化基准测试方案,以及仔细评估具有临床意义的决策阈值。值得注意的是,FDA批准的clonoSeq?等检测已用于血液恶性肿瘤的微小残留病检测,表明TCR测序可在广泛临床验证支持下纳入受监管的临床工作流程,但这不应被解读为对基于AI的癌症分类方法的验证。总体而言,该领域在方法学上仍不成熟,有限的外部验证、异构的基准测试实践、潜在的数据泄漏和模型输出校准问题继续限制临床转化,需要持续的方法学发展和标准化评估框架来确定这些方法能否最终实现稳健的临床效用。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号