Billion-Scale Graph Foundation Models
本文介绍了 GraphBFF,这是一个端到端框架,其可扩展的 Transformer 架构使得在异构图上成功训练十亿参数基础模型成为可能,并展现出可预测的神经缩放规律,以及在多种下游任务中相较于现有基线模型的卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一座庞大而混乱的图书馆,其中每一本书都通过成千上万种不同类型的绳子与其他所有书相连。有些绳子是红色的,有些是蓝色的,有些由绳索制成,而另一些则由丝绸制成。有些书附有厚厚的笔记堆,而另一些则几乎没有。这就是图在数据世界中的模样:一张巨大的连接网(例如社交网络、金融交易或供应链)。
很长一段时间以来,计算机非常擅长阅读文本(如书籍)或查看图片(如画作),因为这些事物具有非常整洁、可预测的结构。但试图教会计算机理解这种混乱、巨大的连接网却极其困难。
本文介绍了GraphBFF,这是一种构建图基础模型的新“配方”。可以将此模型想象为一位超级聪明的图书管理员,他阅读了这座庞大图书馆中的每一本书,并学会了所有绳子是如何将它们连接起来的。
以下是他们如何实现这一点的简化概念分解:
1. 问题:一刀切行不通
以往尝试让计算机理解这些网络的作法,就像试图把方形的钉子硬塞进圆形的孔里。
- “文本”方法: 有些人试图将网络转化为长长的单词列表。但这就像试图通过按顺序列出街道名称来描述一座三维城市;你丢失了地图。
- “图像”方法: 另一些人试图将网络视为网格(如照片)。但网络是混乱且不规则的,并非整齐的网格。
作者们意识到,要处理拥有十亿个节点的网络,你需要一个能够理解不同连接意味着不同事物的模型。“朋友”连接与“交易”连接是不同的。
2. 解决方案:GraphBFF Transformer
他们发明的核心是一种名为GraphBFF Transformer的新大脑架构。它采用巧妙的两部分策略来“聆听”网络:
- 部分 A:“专家”耳朵(类型条件注意力): 这部分仔细聆听特定类型的连接。如果你正在查看“朋友”连接,它只关注其他“朋友”连接。这就像拥有一位翻译,只有在法语对话中才说法语。这确保它不会被其他连接类型的噪音所混淆。
- 部分 B:“通才”耳朵(类型无关注意力): 这部分聆听所有附近的连接,无论连接类型如何。这就像一种“房间里都有谁?”的普遍感知。这有助于模型看到大局,而不仅仅局限于某一种细节。
通过结合这两只耳朵,模型兼得两者之长:它既理解具体细节,又了解整体环境。
3. 挑战:“交通堵塞”
在拥有十亿个节点的图上进行训练,就像试图用仅有一个厨房的餐厅喂饱十亿人。如果你试图同时为所有人上菜,厨房会爆炸(内存过载)。如果你随机上菜,厨师会感到困惑,因为他们不断在端汤和端牛排之间切换。
作者们发明了两种新的上菜策略:
- KL 批处理(智能菜单): 他们不是随机抓取餐桌,而是根据顾客点的菜(节点类型)将顾客分组,以确保每张餐桌都能获得均衡的食物搭配。这防止厨师被过多的“牛排”订单同时压垮。
- 轮询批处理(公平队列): 他们确保厨师按顺序为每种类型的顾客服务。如果只有 5 份“稀有菜肴”订单,却有 1,000 份“常见菜肴”订单,他们会确保稀有菜肴也得到关注,这样厨师就不会忘记如何烹饪它们。
4. 结果:“超级图书管理员”
他们在现实世界的十亿级规模图(如大型企业集团网络)上测试了该系统。他们在十亿条数据上训练了该模型,然后要求它解决 10 个它从未见过的谜题。
- 测试: 他们给模型一个“冻结”的大脑(它无法学习新事物),只要求它利用已有的知识来解决新问题(例如预测两个人是否是朋友,或某笔交易是否可疑)。
- 结果: GraphBFF 模型彻底击败了竞争对手。它在这些特定任务上大幅超越了所有专用模型(最高提升了 31 个百分点)。
- “少样本”魔法: 即使他们只给模型 1 或 2 个新任务的示例(例如给它看一张猫的图片,让它找出猫),它仍然表现得非常出色。这就像给图书管理员看一本新书,然后要求他们在整个图书馆中找到相似的书,而他们完美地做到了这一点。
5. “缩放定律”发现
该论文还发现了这些模型的经验法则,类似于我们对语言模型的了解:你必须让大脑和图书馆一起成长。
- 如果你让大脑变大,却不给它更多的书去读,它就不会变得更聪明。
- 如果你给它更多的书,但大脑保持很小,它就会不堪重负并停止学习。
- 要获得最佳结果,你必须同时扩大模型规模和数据规模。
总结
简而言之,作者们构建了一个通用图大脑,它能够阅读、理解并从庞大、混乱的现实世界网络中学习。他们解决了如何在不使计算机崩溃的情况下为这个大脑“喂食”的技术问题,并证明了这个大脑如此聪明,以至于能够解决它从未见过的新问题,其表现往往优于那些花费数年时间为单一特定问题构建模型的专家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。