综述:在基础模型时代用于图级表示学习的图变换器:分类、泛化能力、可靠性及基准测试
《Neurocomputing》:Graph Transformers for Graph-Level Representation Learning in the Foundation Model Era: Taxonomy, Generalization, Trustworthiness, and Benchmarks
【字体:
大
中
小
】
时间:2026年09月03日
来源:Neurocomputing 6.7
编辑推荐:
摘要
近年来,图神经网络(Graph Neural Networks,GNNs)通过捕捉图中的结构依赖关系和节点级特征,显著推进了图级表示学习的发展。然而,传统的基于GNN的模型在可扩展性和捕捉大型图中长距离依赖关系方面往往存在困难。为了解决这些问题,图变换器(Graph Tra
摘要
近年来,图神经网络(Graph Neural Networks,GNNs)通过捕捉图中的结构依赖关系和节点级特征,显著推进了图级表示学习的发展。然而,传统的基于GNN的模型在可扩展性和捕捉大型图中长距离依赖关系方面往往存在困难。为了解决这些问题,图变换器(Graph Transformers)作为一种强大的替代方案应运而生。图变换器利用自注意力机制(self-attention mechanisms),能够有效地捕捉图数据中的全局关系和长距离依赖关系,为图级任务提供了一种灵活且可扩展的方法。鉴于图基础模型(graph foundation models)、图泛化(graph generalization)和可信图学习(trustworthy graph learning)的最新进展,本调查进一步探讨了图级图变换器作为一个具体研究领域,可以在其中系统地研究模型的可迁移性(transferability)、鲁棒性(robustness)、可扩展性(scalability)和可靠性(reliability)。本调查全面回顾了图变换器的最新发展,详细介绍了它们的架构、关键进展,并与传统GNN模型进行了比较。为了更清晰地组织内容,我们引入了一个两级分类体系。第一级根据架构设计对现有方法进行分类,包括纯图变换器(pure Graph Transformers)、混合GNN-Transformer架构(hybrid GNN–Transformer architectures)和新兴范式(emerging paradigms)。第二级从能力角度分析模型,包括图分词(graph tokenization)、拓扑注入(topology injection)、注意力范围和可扩展性(attention scope and scalability)、学习范式(learning paradigm)以及以可信性为导向的评估(trustworthiness-oriented evaluation)。我们探讨了这些模型在生物信息学(bioinformatics)、社交网络分析(social network analysis)和计算化学(computational chemistry)等领域的应用。此外,我们还讨论了模型复杂性(model complexity)、可解释性(interpretability)和可扩展性(scalability)当前面临的挑战,并提出了改进和优化图变换器的未来方向。最后,我们在各种基准数据集上评估了不同图变换器模型的性能,突出了它们的优势和劣势。我们没有将基准性能简单地视为单一的排行榜,而是进一步讨论了以能力为中心的评估标准,包括分布内预测(in-distribution prediction)、长距离依赖关系建模(long-range dependency modeling)、可扩展性(scalability)、分布外泛化(out-of-distribution generalization)、基础模型迁移(foundation-model transfer)和可信部署(trustworthy deployment)。这项工作旨在为希望利用图变换器进行实际图级学习任务的研究人员和实践者提供坚实的基础。
引言
在互联系统时代,关系数据(relational data)的爆炸性增长使得图成为描述社会网络[1]、[2]、分子网络[3]、[4]、[5]、交通网络[6]、[7]以及通信网络[7]、[8]、[9]、[10]中复杂关系最有效的数据结构之一。这些图结构化数据集既包含了丰富的节点属性,也包含了复杂的拓扑关系,使得传统欧几里得模型无法捕捉的潜在模式和语义依赖关系得以发现。图表示学习(graph representation learning)旨在将图结构映射到低维嵌入(low-dimensional embeddings)中,因此成为下游任务(如节点分类(node classification)、链接预测(link prediction)和图级分类(graph-level classification)[11]、[12]、[13]、[14]、[15]的基础技术。在各种方法中,图神经网络(GNNs)由于能够执行局部消息传递(local message passing)并捕捉相邻节点之间的结构依赖关系而取得了显著的成功。尽管效果显著,但传统GNN在模拟复杂图结构中的长距离依赖关系和全局交互(global interactions)方面存在固有的局限性。具体来说,邻域聚合机制(neighborhood aggregation mechanism)将信息传播限制在局部区域,导致过平滑(over-smoothing)和接受域有限(receptive field limited)的问题。此外,基于消息传递的GNN的表达能力已被理论证明受到Weisfeiler–Lehman(WL)图同构测试(Weisfeiler–Lehman graph isomorphism test)[12]的限制,这限制了它们区分具有相似局部结构的非同构图的能力。为了克服这些局限性,研究人员越来越多地将注意力转向Transformer架构[16],由于Transformer通过自注意力机制强大地模拟全局依赖关系,在自然语言处理(natural language processing)和计算机视觉(computer vision)领域取得了显著成功。受此启发,图变换器将基于注意力的机制集成到图表示学习中,实现了对全局节点交互(global node interactions)的直接建模,并突破了局部连接性限制[17]、[18]、[19]。
与传统的GNN[11]、[12]、[20]、[21]不同,图变换器可以通过同时考虑结构和特征依赖关系来学习整个图的层次结构和语义表示。它们在平衡局部拓扑建模与全局上下文推理方面的能力使它们在图级任务(如分子属性预测(molecular property prediction)、场景理解(scene understanding)和图分类(graph classification)中特别有效。虽然已经提出了许多图变换器模型,例如Graph-BERT[22]、Graphormer[23]、GraphGPS[19]、结构感知Transformer(Structure-Aware Transformer,SAT)[24]、边缘增强图变换器(Edge-augmented Graph Transformer,EGT)[25]、谱注意力网络(Spectral Attention Network,SAN)[26]、Tokenized Graph Transformer(TokenGT)[28]、Graphormer-URPE[29]、Graphormer-GD[30]、图归纳偏差Transformer(Graph Inductive bias Transformer,GRIT)[31]、基于扩散的Transformer(Diffusion-based Transformers,DIFFormer)[32]、简化图变换器(Simplified Graph Transformers,SGFormer)[34]、Graph ViT[35]、DeGTA[36]、三元组图变换器(Triplet Graph Transformer,TGT)[37]、GraphsGPT[38]、HopFormer[39]等。这些模型基于不同的架构设计、归纳偏差(inductive biases)和学习范式(learning paradigms)开发。然而,现有研究通常以碎片化的方式呈现,从架构原理(architecture principles)、编码策略(encoding strategies)和图级表示学习的学習目标(learning objectives)的角度对图变换器方法进行统一和系统化的组织仍然有限。尽管一些最近的调查(如Yuan等人[40]、Müller等人[41]、Min等人[42]、Chen等人[43]和Shehzad等人[44])提供了图变换器的概述,但它们存在明显的局限性。尽管图级表示学习可能看起来比图基础模型(graph foundation models)、GNN泛化(GNN generalization)和可信图学习(trustworthy graph learning)等广泛主题更为具体,但它仍然是评估和部署这些方向的核心领域。许多高影响力的图学习场景,包括分子属性预测(molecular property prediction)、材料发现(material discovery)、蛋白质功能分析(protein function analysis)、代码理解(code understanding)、恶意软件检测(malware detection)、财务风险评估(financial risk assessment)和图级社会分析(graph-level social analysis),最终都需要可靠的图级预测。此外,最近的图基础模型通常通过图级迁移(graph-level transfer)、少样本预测(few-shot prediction)、分子或生物属性预测(molecular or biological property prediction)和图生成任务(graph generation tasks)来评估。同样,分布外泛化(OOD)和可信图学习(trustworthy graph learning)也经常在图级别出现,例如在支架变化(scaffold shifts)、大小变化(size shifts)、领域变化(domain shifts)或需要识别与任务相关的功能子结构(task-relevant functional substructures)的情况下。因此,图级图变换器提供了一个具体且及时的视角,用于分析基于Transformer的图模型如何支持可迁移性(transferability)、结构泛化(structural generalization)、可扩展性(scalability)和可靠的决策制定(reliable decision-making)。大多数先前的调查专注于特定的架构组件或任务领域,并没有系统地涵盖跨不同领域的理论基础和实际应用。此外,它们往往缺乏对模型表达能力(model expressiveness)、可扩展性(scalability)和计算复杂性(computational complexity)的比较分析,而这些对于实际选择合适的方法至关重要。
为了填补这些空白,我们的调查提供了一个统一的图级视角,明确地将图变换器与图基础模型、分布外图泛化和可信图学习的最新进展联系起来。我们不是将图级表示学习视为一个孤立的任务设置,而是用它作为一个实践视角,来研究架构选择(architecture choices)、结构编码(structural encodings)、预训练目标(pretraining objectives)和评估协议(evaluation protocols)如何影响模型的可迁移性(transferability)、鲁棒性(robustness)、可解释性(interpretability)和可扩展性(scalability)。具体来说,我们将现有的图变换器架构分为纯变换器(pure transformers)、混合GNN-Transformer模型(hybrid GNN–Transformer models)和其他新兴范式(emerging paradigms),突出了它们的结构编码策略(structural encoding strategies)、归纳偏差(inductive biases)、计算权衡(computational trade-offs)和代表性应用(representative applications)。表1总结了先前调查的局限性,并将其与我们工作的贡献进行了对比,使读者能够清楚地了解本综述提供的独特范围(unique scope)、多领域覆盖(multi-domain coverage)和实际见解(practical insights)。通过整合理论基础(theoretical foundations)、架构设计(architecture design)、基准数据集(benchmark datasets)和跨领域应用(cross-domain applications),我们的调查提供了比现有综述更系统化和可操作的资源。本文的其余部分组织如下:
第2节介绍了图变换器的理论基础,包括图神经网络中的消息传递范式(message-passing paradigm)、标准Transformer中的自注意力机制(self-attention mechanism),以及通过拓扑感知注意力(topology-aware attention)和池化组件(pooling components)在图结构化设置中的统一。第3节从架构角度回顾了图变换器模型的最新进展,将代表性方法分为纯图变换器(pure Graph Transformers)、混合GNN-Transformer架构和其他新兴范式,并进一步讨论了每个类别中的结构编码策略(structural encoding strategies)和归纳偏差(inductive biases)。第4节介绍了图级变换器研究中的代表性数据集和基准测试。第5节概述了常见的计算框架(common computational frameworks)。第6节探讨了它们在生物信息学(bioinformatics)、化学(chemistry)和社会计算(social computing)等领域的应用。第7节讨论了该领域面临的挑战和未解决的问题。第8节提供了性能比较分析,第9节总结了未来的研究方向。
本文的主要贡献如下:
- 我们引入了一个两级分类体系来描述图级图变换器。第一级根据架构设计将现有模型分为纯图变换器(pure Graph Transformers)、混合GNN-Transformer架构和新兴范式。第二级提供了以能力为导向的视角,根据分词粒度(tokenization granularity)、拓扑注入机制(topology injection mechanism)、注意力范围和可扩展性(attention scope and scalability)、学习范式(learning paradigm)以及以可信性为导向的评估(trustworthiness-oriented evaluation)对模型进行了组织。
- 我们将图级图变换器重新定位在三个活跃的研究方向中:图基础模型(graph foundation models)、分布外图泛化(out-of-distribution graph generalization)和可信图学习(trustworthy graph learning)。这一视角明确了为什么图级表示学习在当前的图学习领域仍然具有实际重要性。
- 我们提供了更新的文献组织方式,涵盖了结构和位置编码(structural and positional encodings)、可扩展的注意力机制(scalable attention mechanisms)、图预训练(graph pretraining)、图语言对齐(graph-language alignment)、生成图建模(generative graph modeling)以及新兴的基础模型导向图学习范式(emerging foundation-model-oriented graph learning paradigms)。
- 我们不仅从预测性能(predictive performance)的角度,还从可扩展性(scalability)、长距离依赖关系建模(long-range dependency modeling)、分布外鲁棒性(OOD robustness)、可迁移性(transferability)和可信部署(trustworthy deployment)的角度,总结了代表性数据集和基准协议。
图神经网络(Graph Neural Networks)
本小节介绍了图神经网络的理论基础,包括基本符号(basic notations)、消息传递原理(message-passing principle)、图池化(graph pooling)和关键架构组件(key architectural components)[45]、[46]、[47]。
图表示为??= (??,??),其中??= {??1,…,????}是节点集,??= {??1,…,????}是边集。连接结构可以通过邻接矩阵?? ∈???×??来编码,其中?????? ≠0表示节点????和????之间存在边,或者通过边列表表示[45]、[47]来表示。
前沿(Frontiers)
Transformer架构的出现重塑了多个领域的表示学习,促进了将自注意力机制扩展到图结构化数据(graph-structured data)的努力。与传统基于消息传递的图神经网络相比,图变换器能够实现所有节点之间的直接互动,提供了一种原理性的方法来模拟长距离依赖关系和全局结构模式。这些属性对于图级表示尤为重要。
数据集(Datasets)
在我们的实验中,我们涵盖了一系列多样化的基准测试,包括来自视觉(vision-derived graphs)、分子属性预测(molecular property prediction)、生物信息学(bioinformatics)、网络安全(cybersecurity)和代码图(code graphs)的测试。这些选择旨在在不同图大小、结构模式和任务类型下评估模型,并遵循广泛采用和标准化的基准测试协议(benchmarking protocols)。许多这些数据集来自成熟的基准测试套件,包括TUDatasets[64]、Benchmarking GNNs[65]、Long...
框架(Frameworks)
图学习框架(graph learning frameworks)为处理图结构化数据并在图上实现深度学习模型提供了专门的工具和平台。通过提供统一的图数据抽象(graph data abstractions)、高效的稀疏运算符(efficient sparse operators)、邻域采样管道(neighborhood sampling pipelines)和模块化神经组件(moduleular neural components),这些框架显著降低了构建图神经网络和图变换器的工程开销。此外,许多框架集成了图池化和读出工具(graph pooling and readout utilities),使得...
应用(Applications)
图变换器已应用于多个领域,包括化学(chemistry)、社交网络(social networks)、交通(traffic)、金融(finance)和视觉(vision),因为它们能够模拟复杂关系并捕捉长距离依赖关系。为了更清楚地了解图建模范式,表2比较了传统方法、GNN和基于图变换器的方法在机制(mechanisms)、计算特性(computational characteristics)、优势( strengths)、局限性(limitations)和代表性应用(representative applications)方面的差异。
挑战与未来方向(Challenges and Future Directions)
图变换器在图级表示学习方面取得了显著成功,在分子属性预测(molecular property prediction)、材料科学(materials science)和社交网络分析(social network analysis)任务上表现出最先进的性能。在最近的图学习研究中,三个问题变得尤为重要:如何构建图基础模型(how to build graph foundation models)、如何在分布变化(distribution shift)下提高泛化能力(how to improve generalization),以及如何使图模型变得可信(how to make graph models trustworthy)。因此,本节讨论了来自...
基准评估与比较分析(Benchmark Evaluation and Comparative Analysis)
除了在标准基准测试上报告预测性能外,图级图变换器还应该通过以能力为中心的协议进行评估。这是必要的,因为不同的模型可能在不同的方面表现优异。一些模型在分布内准确率(in-distribution accuracy)方面表现 competitive,一些模型在长距离依赖关系建模(long-range dependency modeling)方面更胜一筹,而其他模型可能更适合大规模图(large-scale graphs)、迁移学习(transfer learning)或可信部署(trustworthy deployment)。因此,基准比较不应仅仅关注...
结论(Conclusion)
图变换器作为一种吸引人的图级表示学习范式(graph-level representation learning)应运而生,它解决了基于消息传递的GNN在模拟长距离依赖关系和全局结构模式方面的固有局限性。通过引入基于注意力的全局交互机制(attention-based global interaction mechanisms),这些模型将图学习扩展到了局部聚合之外,使图在不同图领域中能够进行更灵活的结构推理。在这项调查中,我们回顾了代表性的图变换器模型...
作者贡献声明(Authorship Contribution Statement)
Di-Jun Gong:调查(Investigation)、数据整理(Data curation)、概念化(Conceptualization)。Meng Xing:验证(Validation)、资源管理(Resources)、方法论(Methodology)。Qin-Hu Zhang:撰写原始草稿(Writing – original draft)、方法论(Methodology)、概念化(Conceptualization)。Chi Ma:撰写原始草稿(Writing – original draft)、数据整理(Data curation)。李志鹏:撰写(审稿与编辑)、撰写(初稿)、形式分析、概念构建。黄德双:撰写(审稿与编辑)、资金筹集、概念构建。王丽辉:撰写(审稿与编辑)、资源调配。
**利益冲突声明**
作者声明不存在任何可能影响本文研究结果的已知财务利益冲突或个人关系。
**致谢**
本研究部分得到了国家重点研发计划(科技部)2030项目“重大专项”(项目编号2021ZD0200403)的支持,同时也获得了国家自然科学基金(项目编号62333018、62372255、U22A2039、62073231、62372318)的资助,以及宁波市人民政府青年科技创新领军人才计划(项目编号2023QL008)和宁波市2022年重点技术创新计划(项目编号2022Z080)的支持。此外,该项目还得到了宁波市重点研发计划(数字孪生领域)的资助。
李志鹏于2023年在中国上海同济大学获得计算机科学与技术博士学位。2023年9月至2025年8月期间,他在中国科学技术大学担任博士后研究员。目前,他既是宁波市数字孪生研究所的副研究员,也是东方理工学院的成员。他已在包括《IEEE网络科学与工程汇刊》(IEEE Transactions on Network Science and Engineering)在内的多家知名期刊上发表超过20篇学术论文。
**作者名单**
李志鹏(Li Zhi-Peng) | 马奇(Chi Ma) | 张秦胡(Qin-Hu Zhang) | 冯萌(Meng Xing) | 公迪军(Di-Jun Gong) | 王丽辉(Li-Hui Wang) | 黄德双(De-Shuang Huang)
**单位信息**
宁波市数字孪生研究所 | 东方理工学院
地址:中国浙江省宁波市童心路568号,邮编315201
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号