想象一下,你正试图通过一个朋友网络,在拥挤的城市中发送一条秘密消息。在标准图神经网络(GNN)——即用于理解社交媒体、电网或分子等网络的人工智能工具——的世界里,这条消息通常像热量在金属棒中扩散一样传播。
如果你在金属棒的一端放下一块烧热的石头,热量会缓慢扩散开来,随着传播逐渐减弱并变得稀释。当它到达另一端时,最初的“热度”已经消失;整根棒子只是温温的。在人工智能术语中,这被称为扩散。它非常适合平滑处理,但如果你需要确切知道链条最初发生了什么,尤其是当链条非常长时,它就糟糕透顶了。这就是为什么标准人工智能往往难以应对“长程”问题,例如预测电网是否能保持稳定,或理解分子的某个特定部分如何影响整体。
本文作者克里斯蒂安·诺克(Christian Nauck)及其同事提出了一种发送消息的新方法。他们不使用热量,而是使用波,就像光脉冲在光纤电缆中传播一样。
新构想:“波”网络
研究人员构建了一种新型人工智能层,称为狄拉克–比安科尼图神经网络(DBGNN)。他们的灵感来源于物理学中一个著名的方程(狄拉克方程),该方程描述了电子等粒子的运动方式。
用简单的话来说,两者的区别如下:
- 旧方法(MPNNs): 想象一群人传递一张纸条。每个人阅读纸条,加入一点自己的观点,然后传递下去。经过几轮传递后,原始纸条被改变得面目全非、混杂不清,没人知道它最初是什么样子。信息变得“过度平滑”。
- 新方法(DBGNN): 想象一股能量波在人群中移动。波在传播过程中保持其形状和速度。它不会被稀释;到达另一端时,看起来几乎与开始时一模一样。
工作原理:“边”的诀窍
在大多数人工智能网络中,“边”(节点之间的连接)只是被动的桥梁。它们帮助节点相互交谈,但桥梁本身没有记忆或个性。
DBGNN 改变了规则。它将节点(人)和边(桥梁)视为平等的伙伴。两者都拥有随时间演变的自身“特征”。
- 作者创建了一个数学系统,其中节点和边以有节奏的振荡模式不断更新彼此。
- 这产生了一种相干波,能够深入网络传播而不失其形状。
实验:证明波的有效性
团队在两个截然不同的现实世界挑战中测试了这种新的“波”网络:
- 电网: 想象一个拥有数百个发电站的庞大电网。如果一个发电站出现问题,即使发电站相距甚远,也可能影响整个电网。标准人工智能需要许多层才能解决这个问题,但到那时,信号已经过于模糊。然而,DBGNN 能够更准确地预测这些电网的稳定性,即使是在小电网上进行训练,并在巨大电网上进行测试。它使信号在整个网络中始终保持清晰。
- 肽(分子): 肽是短氨基酸链,在人体内充当微小机器。要理解它们如何工作,你需要看到链的一部分如何与远离它的部分相互作用。DBGNN 在预测这些分子的性质方面优于标准方法,且仅使用了其他顶级模型所需四分之一计算机内存(参数)。
关键要点
该论文声称,通过借用波的物理学(特别是狄拉克方程),并将连接(边)视为积极参与者而非仅仅是被动链接,他们创造了一种不会遭受“过度平滑”的人工智能。
信息不再像热量那样消散,而是像激光束一样传播。这使得人工智能能够比以往任何方法更有效地理解数据中复杂的长距离关系——无论是流经城市的电力,还是药物分子中原子的键合。
技术摘要:狄拉克–比安科尼图神经网络
问题陈述
图神经网络(GNN),特别是消息传递神经网络(MPNN),被广泛用于图结构数据,但在处理长程依赖方面面临重大局限。传统的 MPNN 通常受基于图拉普拉斯算子的动力系统启发,类似于热方程。这种表述导致了扩散式传播,即特征在图上逐渐平均化。随着层数的增加,这会导致过平滑,使得节点表示变得无法区分,从而阻碍网络捕捉复杂的长程依赖。
这一局限在电网稳定性分析和肽属性预测等领域尤为关键,因为:
- 长程相互作用在物理上是固有的(例如,电网的稳定性模式取决于拓扑设置,而与局部节点特征无关)。
- 边和节点特征往往具有同等重要性,但标准 MPNN 仅将边视为节点更新的耦合,未能动态传播边特征。
- 现有基准测试表明,深层 MPNN(例如超过 13 层)表现困难,而浅层网络(2-3 层)通常足以应对较简单的数据集,这表明针对复杂长程任务存在根本性的架构不匹配。
方法论
作者提出了狄拉克–比安科尼图神经网络(DBGNNs),这是一种基于网络上拓扑狄拉克方程的新颖架构,由 Bianconi(2021)近期引入。与基于拉普拉斯算子的热方程不同,狄拉克方程支持相干波包传播,允许信号在传播过程中不失形状或扩散,从而能够长距离传输。
核心数学表述
该方法将拓扑狄拉克方程推广到离散且可学习的设定中。
- 狄拉克算子:作者利用一个算子同时映射节点特征(x)和边特征(e)。该算子使用关联矩阵 B(将边映射到节点)及其共轭转置 B† 定义。
∂DB(xe)=(0(bB)†bB0)(xe)
- 广义线性狄拉克–比安科尼方程:作者使用欧拉方案离散化拓扑狄拉克方程(包括质量项 β),以定义层更新规则。这将节点和边视为耦合系统,两者均随时间步(层)演化:
xi(t+1)=xi(t)+Wnej∈Ni∑eij(t)+Wβnxi(t)
eij(t+1)=eij(t)+Wen(xi(t)−xj(t))−Wβeeij(t)
其中,Wne,Wen 是耦合矩阵,Wβ 是质量矩阵。通过约束这些权重(例如,使其反对称),系统可以表现出振荡行为,而非扩散衰减。
架构设计
- DB 1-步层:对广义线性方程进行单次应用,随后进行 Dropout 和非线性激活。
- DB T-步层:连续应用多个 1-步层并共享权重,允许信息在单个逻辑层内传播 T 跳。
- DBGNN:一个由堆叠 K 个 T-步层构成的完整网络,层间穿插跳跃连接以混合输入特征与处理后的特征。这使得网络能够深入探测图结构,同时保留初始条件。
主要贡献
- 扩散极限分析:作者通过可视化信号轨迹证明,传统 MPNN 以扩散方式(类似热)传播特征,导致异质性迅速丧失,而所提出的架构支持相干传播。
- 新颖层定义:他们推广了 Bianconi 的拓扑狄拉克方程,定义了狄拉克–比安科尼 T-步(DBTS)层,该层显式地同时传播节点和边特征。
- 长程传播机制:在合成网格上的实验分析表明,线性 DB 方程的类波动动力学是深层信号传播的主要驱动力,而非边非线性。该架构防止狄利克雷能量衰减至零,避免了 GCN 中出现的均衡化现象。
- 实证验证:作者在两个具有挑战性的基准测试上验证了该架构:
- 电网稳定性:预测不同规模(20 节点和 100 节点)电网的动态稳定性。
- 肽属性:从以长程依赖著称的 Peptides-struct 数据集中预测分子属性。
实验结果
- 电网稳定性(Nauck 等人,2023):
- DBGNN 在所有任务上均取得了最高的 R2 分数,包括分布外泛化(在 20 节点网格上训练,在 100 节点网格上测试)。
- 其表现显著优于 ArmaNet、GCNNet 和 TAGNet 等基准模型。
- 该模型使用了 48 个总步数(4 层 × 12 步),未出现过平滑现象,前向传播过程中高狄利克雷能量的保持证实了这一点。
- 肽属性预测(Dwivedi 等人,2023):
- 在 Peptides-struct 数据集上,DBGNN 优于所有传统 MPNN(GCN、GINE、GatedGCN 等)以及 GCNII 等竞争模型。
- 值得注意的是,DBGNN 仅使用了约 25% 的参数(12.7 万对比基线的约 50 万)就实现了这一结果。
- 虽然它未能超越利用位置编码的基于 Transformer 的模型(SANs),但它证明了消息传递架构可以在不使用位置编码的情况下有效处理长程依赖。
意义与主张
本文主张,DBGNN 代表了 GNN 设计的根本性转变,即从扩散式(基于拉普拉斯)转向类波动(基于狄拉克)动力学。
- 内在非过平滑性:该架构本质上具有抗过平滑性,因为底层的狄拉克算子拥有正负特征值,可防止均衡化,这与负半定拉普拉斯算子不同。
- 拓扑的平等对待:通过沿节点特征一起传播边特征,DBGNN 更适合那些边拓扑与节点属性同样关键的任务(例如电网)。
- 效率:能够以更少的参数在长距离上传播信号,表明与深层 MPNN 或重型 Transformer 架构相比,这是一种捕捉全局图结构的高效机制。
作者总结道,这种方法为构建依赖边特征和长程传播的更复杂图数据集铺平了道路,为物理学和化学领域的科学探索提供了新机遇。他们指出,虽然当前形式是有效的,但进一步的修改(例如与长程 GCN 技术结合)仍是未来研究的开放领域。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。