GraphLand: Evaluating Graph Machine Learning Models on Diverse Industrial Data
本文介绍了 GraphLand,这是一个包含 14 个多样化工业图数据集的综合基准,旨在通过揭示当前图基础模型的表现不如结合图特征的梯度提升决策树,来解决现有评估范围狭窄的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何理解世界。长期以来,我们测试这个机器人的唯一方法,是给它展示一种非常特定类型的社区图片:一个图书馆,那里的人只与阅读完全相同书籍的其他人交谈。我们将此称为“引文网络”。
这篇论文的作者 Gleb Bazhenov、Oleg Platonov 和 Liudmila Prokhorenkova 表示:“等一下!现实世界不仅仅是一个图书馆。”
他们认为,尽管我们拥有理解连接的优秀工具(称为图神经网络,或 GNN),但我们一直在一个非常狭小、人工的沙盒中测试它们。为了解决这个问题,他们建造了一个名为GraphLand的新游乐场。
以下是他们所做的工作及其发现的一个简单分解:
1. 问题:“图书馆”偏差
大多数用于图的 AI 模型都是在类似学术论文引用其他论文的数据上进行训练和测试的。这是对世界非常狭隘的视角。
- 现实情况: 在现实世界中,图无处不在。它们是社交网络(谁与谁是朋友)、道路地图(哪些街道相互连接)以及购物网络(人们一起购买哪些商品)。
- 问题所在: 这些现实世界的图很混乱。它们具有不同的规模、不同类型的信息(如数字和类别,而不仅仅是文本),并且随时间变化。旧的“图书馆”测试并未检查这些机器人是否能处理这种混乱。
2. 解决方案:GraphLand(新游乐场)
该团队创建了GraphLand,这是一个包含 14 个不同“世界”(数据集)的集合,取自真实的工业应用。
- 里面有什么?
- 互联网: 网站地图,用于识别欺诈或猜测网站内容。
- 艺术家: 艺术创作者的社交网络,用于预测谁创作露骨内容或他们的受欢迎程度。
- 城市: 道路地图用于预测交通速度,以及评论系统用于识别虚假评论。
- 购物: 商品共同购买的网络,用于预测价格或类别。
- 多样性: 其中一些图非常巨大(数百万个节点),有些则很小。有些是“同配”的(物以类聚),有些则是“异配”的(异性相吸)。它们拥有丰富的数据,包括数字、类别和文本。
3. 实验:对机器人进行测试
研究人员选取了现有的最佳 AI 模型,并在 GraphLand 中让它们接受三种不同类型的挑战:
- “随机”测试: 随机打乱数据(就像从帽子里抽签)。
- “时间旅行”测试: 使用旧数据训练,用新数据测试(就像在 2020 年学习驾驶,然后在 2024 年参加考试)。这模拟了现实世界的变化。
- “归纳”测试: 在一张城市地图上训练,然后要求机器人导航一个它从未见过的新城市区域。
4. 令人惊讶的结果
以下是他们运行测试时发生的情况:
- “老派”冠军: 他们测试了一种经典的非 AI 方法,称为GBDT(梯度提升决策树)。将其想象为一个非常聪明、经验丰富的人类,他查看事实列表并做出决定。
- 转折: 当他们给这个人类一张包含一些基本图信息的“小抄”(例如“你的邻居是谁?”)时,它变得异常强大。在许多情况下,它击败了花哨的 AI 模型,特别是在预测数字(如交通速度或价格)方面。
- AI 模型(GNNs): 花哨的图神经网络表现良好,但并不完美。
- 注意力是关键: 能够“关注”特定邻居的模型(就像侦探专注于最可疑的人)比那些一视同仁对待所有人的模型表现更好。
- 时间问题: 当数据随时间变化时(“时间旅行”测试),几乎所有模型都 struggled。它们感到困惑,因为它们所学到的世界与它们被测试的世界不同。
- “基础模型”的失败: 最近,关于“图基础模型”的炒作很多——这些是训练有素的超级机器人,可以瞬间适应任何新图。
- 现实检验: 在这些真实的工业数据集上,这些超级机器人表现糟糕。它们无法处理数字和类别的混合,并且未能击败更简单、更经典的方法。
5. 结论
该论文的结论是:
- 现实世界数据很混乱: 我们需要停止仅在干净、学术数据上测试 AI。
- 简单有时更好: 在工业环境中,带有少量图信息的智能决策树可以击败庞大的神经网络。
- 时间很重要: AI 需要更好地处理随时间的变化,否则它在部署到现实世界时会失败。
- 基础模型尚未准备好: “一刀切”的超级机器人还不足以胜任多样化、现实世界的任务。
简而言之,GraphLand是一个新的、更严格的健身房,供 AI 模型在此训练,确保当它们最终被派往现实世界工作(如识别欺诈或管理交通)时,真正做好了准备。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。