技术摘要:基于结构交互图的神经消息传递用于全归纳式图神经网络
1. 问题陈述
图基础模型(Graph Foundation Models, GFMs)的发展面临着一个核心障碍:输入异构性。与自然语言不同(自然语言拥有共享的 Token 词表,使模型能够编码任何文本),图数据以具有不同维度、坐标语义和标签集的独特节点特征空间形式呈现。因此,在一个图上训练的模型通常无法“阅读”另一个图。
现有方法解决了部分挑战,但未能实现统一:
- 节点分类 GFM: 像 GraphAny 这样的方法可以处理任意特征和标签空间,但仅针对节点分类设计,缺乏处理链路预测或关系推理的机制。
- 知识图谱基础模型 (KGFMs): 像 ULTRA 这样的模型通过在离散关系类型上构建“关系图”来实现零样本迁移。然而,这种方法本质上是离散的;它预设了一个有限的关系词表,且缺乏处理连续节点或边特征的机制。
核心挑战在于设计一个**全归纳式(fully-inductive)**的图模型,使其能够同时在三个维度上进行泛化:未见的图结构、未见的特征空间(任意维度和语义)以及未见的标签空间。
2. 方法论:Sigil 框架
作者提出了 Sigil(用于归纳学习的结构交互图),该框架将任何属性图映射到一个统一的、固定维度的表示空间。其核心创新是结构交互图(Structural Interaction Graph, SIG)。
2.1 构建结构交互图 (SIG)
给定输入图 G=(V,E),其节点特征为 X∈Rn×d,Sigil 将图从“节点域”提升到**“特征维度域”**。
- 多阶传播: 特征通过增加的邻域阶数 k(从 $0到K)进行传播,使用非参数化传播方式:X^{(k)} = A^k X$。
- 交互算子: 对于每个阶数 k,应用交互算子 g(例如减法或元素级乘法)作用于相邻节点的特征,以创建边特征。
- 角色聚合: 这些边特征被聚合回节点,并按角色(对于有向图分为头/尾)进行分离,从而创建汇总矩阵 Xˉh(k) 和 Xˉt(k)。这些矩阵刻画了特征值如何在局部邻域中实例化。
- Gram 矩阵构建: 通过计算这些汇总向量的内积来捕捉特征维度之间的对齐关系,得到 Gram 矩阵:Aˉ(k)=(Xˉ(k))⊤Xˉ(k)。
- SIG: 生成的矩阵 Aˉ(k) 构成了结构交互图 Gstruct。在此图中:
- 节点是输入的特征维度 [d]。
- 边是加权且有类型的,编码了特征在不同连接阶数下的对齐方式。
- 对于有向图,构建过程会产生每阶四个切片(头-头、尾-尾、头-尾、尾-头),以捕捉方向性交互。
2.2 通过关系消息传递学习表示
一旦构建了 SIG,关系消息传递网络 (RMPNN) 便在其上运行:
- 嵌入: RMPNN 将每个特征维度 f∈[d] 嵌入到一个固定大小的隐藏空间 dh 中。
- 变换: 学习到的特征嵌入 Θ(T)∈Rd×dh 被用于将任何图的原始节点特征转换为统一表示:H=XΘ(T)。
- 归纳特性: 由于 RMPNN 的参数仅作用于固定的隐藏宽度 dh,而从不作用于输入维度 d,因此单个训练好的 Sigil 模型可以处理具有任意特征维度的图。
2.3 下游任务
- 链路预测: 统一的节点表示被输入到具有表现力的链路预测 GNN(如 NBFNet)中,以进行零样本推理。
- 节点分类: 统一的表示作为下游解码器(如轻量级 MLP 或闭式解析解)的输入,用于预测标签。
3. 核心贡献与理论属性
3.1 对 KGFMs 的严格泛化
论文证明了 Sigil 是现有知识图谱基础模型(如 ULTRA)的严格泛化。
- 定理 1: 当输入特征是离散关系的独热编码(one-hot indicators)时,SIG 构建过程能精确还原 KGFMs 所使用的关系图。
- 扩展: 与 KGFMs 不同,Sigil 接受连续特征。在这种情况下,Gram 矩阵变为连续的特征对齐矩阵,而非整数共现计数。此外,Sigil 的多阶传播编码了特征之间的高阶交互,而 KGFMs(受限于单跳基元)则无法捕捉这些交互。
3.2 对称性与等变性
Sigil 满足全归纳泛化所需的对称性:
- 节点置换等变性: 输出的节点表示对于输入节点的置换具有等变性。
- 特征置换不变性: 统一表示对于输入特征维度的顺序或身份具有不变性。这使得模型能够读取从未见过的特征空间的图。
- 标签置换等变性: 当与等变解码器配合使用时,模型遵循标签置换。
4. 实验结果
作者在三个回归中评估了 Sigil,使用在 Cora 数据集(用于链路预测和节点分类)或混合知识图谱(用于 KG 推理)上预训练的单个模型。
4.1 链路预测(连续特征)
在 11 个基准测试(7 个属性图,4 个非属性图)上进行了评估。
- 属性图: Sigil-lp 是每个数据集上最强的全归纳方法,优于 UniLP 和 TFMLinker 等基线模型。值得注意的是,它在 CiteSeer 和 AmazonPhotos 等数据集上显著优于 UniLP,证明了通过 SIG 利用特征空间比直接丢弃特征更为优越。
- 非属性图: Sigil-lp 保持了竞争力,在全归纳方法中排名第二,并表现出高度的稳定性。
- 效率: Sigil-lp 在几分钟内即可完成推理,而像 UniLP 这样的上下文学习(in-context)基线方法则需要超过 24 小时的计算预算。
4.2 知识图谱推理
在 ULTRA 基准测试(涉及未见实体和关系的归纳设置)上进行了评估。
- 复现: Sigil(0)(阶数为 0 的 SIG)在预训练图上精确匹配了 ULTRA 的 MRR 等指标,实现了极小的误差复现。
- 表达力: 高阶 SIG(Sigil(1), Sigil(2))的表现因数据集而异,这表明虽然高阶交互增加了表达力,但它们并不在所有任务中都能带来统一的性能提升。
4.3 节点分类
在 26 个具有不同特征维度和类别数的基准测试上进行了评估。
- 性能: Sigil-nc 具有竞争力,在 26 个数据集中的 10 个中排名第一或第二。虽然它略逊于针对特定任务优化的专门模型(如 RGVT 和 TAG),但它优于 GraphAny 和 TS-MEAN。
- 分析: 作者将性能差距归因于“统一的代价”:将任意特征空间压缩到固定维度 dh 会导致原始坐标对解码器而言变得不可及,从而需要更多的监督。然而,结果证实了在 SIG 上进行学习是节点分类基础模型的有效途径。
5. 重要性与主张
论文声称 Sigil 统一了此前几个独立的图基础模型设计领域:
- 统一性: 它弥合了节点分类 GFM(处理任意特征)与 KGFM(处理关系推理)之间的鸿沟,提供了一种单一的机制。
- 可迁移性: 它证明了单个在单一图上训练的模型,可以对具有完全不同特征空间和结构的图提供强大的零样本性能。
- 泛化性: 通过将关系图形式化为结构交互图的一个离散实例,这项工作为将关系推理扩展到连续输入空间提供了理论基础。
作者总结道,迁移性、关系推理和边级任务可以源于同一个机制(SIG 构建和消息传递),而不是需要为不同类型的图设计不同的方案。未来的工作建议研究如何改进在 SIG 上进行学习的架构,并研究其表达能力。