《Nature Biotechnology》:A blinded, prospective benchmark of in silico antibody discovery anchored to experimental affinity and developability
编辑推荐:
实验验证的前瞻性盲法基准测试对于区分计算抗体设计中的持久进步与炒作是必要的。在此,受蛋白质结构预测关键评估(CASP)启发的AIntibody挑战,测试了来自29个组织的511个人工智能(AI)设计或预测的抗体,在三个任务上:基于第一阶段测序输出的计算机模拟亲
实验验证的前瞻性盲法基准测试对于区分计算抗体设计中的持久进步与炒作是必要的。在此,受蛋白质结构预测关键评估(CASP)启发的AIntibody挑战,测试了来自29个组织的511个人工智能(AI)设计或预测的抗体,在三个任务上:基于第一阶段测序输出的计算机模拟亲和力成熟、在选择输出的重链互补决定区3(HCDR3)簇内的亲和力排名,以及未包含在选择输出中的蛋白质的CDR设计。通过多种实验测定验证,几个研究小组产生了亲和力<100 pM的可开发抗体。然而,这些成功是例外,并未跨任务迁移。亲和力成熟的抗体被有效建模。除一个模型外,从聚类的HCDR3数据集预测高亲和力克隆比随机克隆挑选更差。对于大多数提交的方法,库外设计高度可变,许多未能优于标准选择。AIntibody挑战表明,AI可以在明确的、基于生物学的领域中优化抗体,此外还突出了关键差距,包括亲和力预测和库启发的抗体设计以及跨任务泛化。
**论文解读:基于实验验证的AIntibody挑战——计算机抗体发现的前瞻性基准测试**
**研究背景与问题**
在计算生物学中,基准测试是区分可持续进步与缺乏独立实验验证的主张的关键。蛋白质结构预测领域的CASP(Critical Assessment of Structure Prediction)挑战为AlphaFold等突破性进展提供了验证平台,推动了该领域的迭代优化。然而,抗体设计领域长期缺乏类似的前瞻性、盲法、实验锚定的基准测试。大多数性能评估依赖回顾性分析,缺乏额外实验验证,限制了方法的客观比较和真正前沿的识别。随着计算机抗体设计方法(尤其是AI方法)的数量激增,亟需建立统一的实验验证标准,以评估算法在实际抗体发现流程中的真实能力。为此,研究人员发起了AIntibody挑战,旨在通过实验测定的亲和力与可开发性,对参与者提交的抗体序列进行盲法评价,为领域提供现实检验。
**研究内容与结论**
AIntibody挑战借鉴CASP理念,但聚焦于抗体发现的多参数优化(亲和力、动力学、可开发性)。研究人员使用SARS-CoV-2 RBD(受体结合域)作为靶标,提供了深度测序数据集(包括亲和力信息),设置了三个任务:任务1(计算机模拟亲和力成熟):基于第一阶段酵母展示筛选输出的CDR亚库测序数据,在不修改HCDR3和框架区的前提下,设计高亲和力可开发抗体;任务2(簇内亲和力排名):从三个HCDR3簇(27F、28F、47F)的测序数据中,预测最高亲和力可开发抗体;任务3(库外CDR设计):利用完整测序数据集和部分亲和力数据,设计未出现在数据集中的高亲和力可开发抗体。29个组织提交了511个抗体序列,通过统一的高通量表面等离子体共振(HT-SPR)和动力学排除实验(KinExA)测量亲和力,并通过五个可开发性实验(AC-SINS、BVP、HIC、Tm、Tagg)进行评估。
**主要技术方法**
抗体表达与纯化:将VH/VL编码序列克隆至人IgG1载体,转染HEK293F细胞,经蛋白A亲和层析纯化。可开发性评估:采用热稳定性(Tm、Tagg)、疏水性(HIC-HPLC)、多反应性(BVP ELISA)、自相互作用(AC-SINS)五测定法,依据临床阶段抗体参考值设定评分阈值(0=通过,1=可疑,2=失败),总分≤3视为可开发。结合动力学:HT-SPR(Carterra LSA-XT)测定结合与解离速率,KinExA 4000验证平衡解离常数(KD)。计算方面,参与者方法分为四类:统计/启发式基线、经典机器学习(ML)、基于预训练蛋白语言模型(PLM)或注意力机制、结构感知方法(如AlphaFold)。样本队列来源:SARS-CoV-2 RBD(氨基酸319-591,来自La Jolla Immunology研究所)。
**研究结果**
**Challenge 1: 计算机模拟亲和力成熟**
通过HT-SPR和KinExA测量所有提交抗体的亲和力,Aureka的胜出设计达到95 pM亲和力(较亲本抗体提高2000倍),与实验最佳抗体(113 pM)统计上无差异。但仅约13%的AI设计实现≥20倍亲和力提升,且组织间差异显著。ProBioGen的共识序列方法(非AI)排名第三(540 pM),表明统计方法即可获得优异结果。86.1%的提交通过可开发性阈值。
**Challenge 2: 三个HCDR3簇内亲和力排名**
在27F、28F、47F簇中,AI预测的亲和力改善率(9.8-13.8%)低于随机挑选克隆的39%改善率,仅WashU(D.H.F.实验组)的预测改善率(50%)超过随机基线。除一个模型外,所有AI方法均不如随机挑选。获胜者来自UCSD/Scripps(27F簇,9.2 pM)、Xencor和WashU(28F簇,105-106 pM)、WashU(47F簇,50 pM)。HCDR3簇对可开发性影响显著,28F簇可开发性差。
**Challenge 3: 库外CDR优化/设计**
Xencor的2.9 pM设计获胜,但该抗体在HIC柱上无法洗脱,亲和力虽高但可开发性受限;次优可开发抗体(8.69 pM)与实验最佳(9.2 pM)统计上无差异。30.4%的提交为非结合物,46.4%未通过可开发性。多数组织提交的亲和力范围极宽,仅少数组织在100倍亲和力范围内。
**计算方法分类分析**
不同任务的最优方法类不同:任务1由PLM+结构方法(Aureka)获胜;任务2无单一方法类主导;任务3由PLM方法(Xencor)获胜。统计基线在任务1中优于多数AI。各组织跨任务表现不一致,支持“按任务匹配方法”的策略。
**总结与讨论**
AIntibody挑战表明,在提供深度、高质量数据时,最佳AI算法(而非所有)可在亲和力成熟中提供真实价值(减少实验时间2-3周),但在簇内排名和库外设计中仍存在显著差距。大部分AI方法在预测高亲和力结合物时不如随机挑选,且跨任务泛化能力不足。挑战的评分系统允许高亲和力抵消单一生物物理缺陷,暴露了需要改进的“关键通过/失败”标准。此外,参与者缺乏某些知名团队,反映了对盲法流程和公开方法的顾虑。研究结论翻译如下:使用AI扩展针对感兴趣靶标的抗体范围的价值取决于这些额外抗体的特性。如果AI设计的抗体可以改善实验获得的抗体的亲和力,那么AI已经在抗体发现过程中有用。同样,如果AI可以设计可开发版本的不可开发抗体或设计结合实验抗体组中未代表的表位的抗体,这将增加AI在抗体发现流程中的使用。这里描述的结果表明,当提供深度、靶向、高质量的数据时,最好的AI算法(但不是其他)已经在亲和力成熟中提供了真正的价值,并在某些HCDR3(WashU)的命中扩展中,通过识别已识别HCDR3簇中的可能高亲和力结合物和设计针对数据靶标的库外抗体。算法是否总是需要如此深度的数据集(包括亲和力)用于每个感兴趣靶标,还是能够使用此类数据集训练可迁移到数据稀疏情况的模型,从而从优化过渡到真正发现,仍有待观察,这将是2026年下一届AIntibody挑战的主题。