生命学院王童课题组应邀发表大语言模型用于蛋白质适应度预测述评文章

【字体: 时间:2026年07月22日 来源:清华园生命学院

编辑推荐:

  蛋白质适应度用于量化单个氨基酸突变对蛋白质功能改变与表型修饰的诱导程度,是探究生物学机制、开展理性蛋白质设计以及酶工程改造的重要基础。尽管深度突变扫描是蛋白质适应度精准检测的标准实验方法,但其高耗时、高劳动力成本以及对特定实验检测体系依赖的特点阻碍了其在高通量评估中的应用。为解决这一问题,蛋白质语言模型已逐渐发展成为预测蛋白质适应度的重要计算方案。然而,蛋白质语言模型为何能够预测适应度、为何模...

  

蛋白质适应度用于量化单个氨基酸突变对蛋白质功能改变与表型修饰的诱导程度,是探究生物学机制、开展理性蛋白质设计以及酶工程改造的重要基础。尽管深度突变扫描是蛋白质适应度精准检测的标准实验方法,但其高耗时、高劳动力成本以及对特定实验检测体系依赖的特点阻碍了其在高通量评估中的应用。为解决这一问题,蛋白质语言模型已逐渐发展成为预测蛋白质适应度的重要计算方案。然而,蛋白质语言模型为何能够预测适应度、为何模型越大并不总能带来更优的性能,以及在何种条件下可以使用大模型进行预测,长期以来仍有待解析。

2026年7月13日,清华大学生命学院王童课题组应邀在国际权威学术期刊《自然-计算科学》(Nature Computational Science)发表了题为“基于语言模型的蛋白质适应度预测”(Protein fitness prediction with language models)的述评观点文章。该文章系统评述了蛋白质大语言模型在蛋白质适应度预测任务中最新研究进展,指出“大模型不等于高性能”,并展望了该领域的模型设计方向,为后续的实践应用提供了重要指导准则。

图1 利用蛋白质语言模型进行蛋白质适应度预测。a, 大型蛋白质语言模型中的过度自信陷阱。b, 适应度预测性能与预测序列似然之间的钟形曲线关系。c, 蛋白质适应度预测的标准化操作流程。

基于无监督训练的蛋白质语言模型的适应度预测通常使用序列似然进行衡量。通过计算突变体序列与野生型序列之间的对数似然比,最先进的无监督蛋白质语言模型,例如ESM-2,在适应度预测上能够超越传统的监督学习模型。然而,由于大型模型对野生型氨基酸给出了极高的预测似然,进而导致其他替换突变体被赋予了极低的概率值,最终引发了大模型对野生型预测的过度自信陷阱。这说明了盲目扩大蛋白质语言模型的参数规模并不一定能提升蛋白质适应度预测的表现。

文章进一步指出,针对多种蛋白质家族训练的通用大语言模型,其适应度预测性能与预测的野生型序列似然之间呈现出独特的“钟形曲线”关系。对该领域最新研究的分析发现,蛋白质大语言模型的预测性能高度依赖于从同源序列中捕获进化信息的准确度。因此,对于蛋白质适用度预测,在应用通用大语言模型之前,必须进行一项前置的比对检查,评估其预测的序列似然是否与特定蛋白质家族的专一模型得到的进化模式是否吻合,而非盲目的直接使用。基于以上分析,下一代蛋白质语言模型在训练过程中,应当显式地将进化模式和同源序列信息纳入考量。这一指导准则同时也为DNA/RNA语言模型的发展及其在分子设计与酶工程中的应用提供了重要指引。

更重要的是,尽管现有的蛋白质语言模型具备高效编码蛋白质序列的能力,但它们依然缺乏对构象动力学、别构调节以及局部结构扰动等重要因素的有效表征。与此同时,由于蛋白质适应度依赖于其所处的微环境,如何对温度、pH值、溶剂与离子、配体及辅因子等复杂环境变量进行精确建模,同样是该领域面临的重要挑战。通过将各种环境条件下高精度分子动力学模拟(例如AI2BMD)所得的动态结构信息有机融合,构建“序列-结构-动力学”统一整合的多模态蛋白质基础模型将成为未来重要的研究方向,为在可变微环境条件与多样化的蛋白质序列上下文中,动态预测蛋白质适应度铺平道路。

清华大学生命科学学院王童助理教授为本篇述评文章的唯一作者及通讯作者。

论文链接:https://doi.org/10.1038/s43588-026-01011-y

相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热搜:

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号