Towards Foundation Models for Relational Databases with Language Models and Graph Neural Networks
本文提出了一种轻量级混合架构,该架构结合了用于行内语义的微调 BART 编码器与基于 GraphSAGE 的图神经网络以处理关系上下文,证明该方法显著提升了关系数据库任务的性能,并为结构化数据的基础模型提供了一条资源高效的路径。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座巨大的图书馆,其中每一本书都是一张数据库表。在传统图书馆中,如果你想查找关于一位未完成比赛的车手的具体故事,图书管理员(计算机)必须手动从“车手”书架、“比赛”书架和“结果”书架上取书,复制相关页面,并将它们粘贴成一份巨大而杂乱的文档。这个过程缓慢、容易出错,且常常丢失书籍之间微妙的联系。
本文提出了一种利用“混合大脑”阅读这些图书馆的新方法,该大脑结合了两种强大的工具:一位语言专家和一位社交网络侦探。
问题:图书馆的扁平化
目前,要在这些数据库上使用深度学习(AI),我们通常会将其“扁平化”。我们将所有独立的表打碎并合并成一张巨大的扁平电子表格。
- 类比:想象将一个三维拼图拆解,然后把所有碎片粘在一块平 cardboard 上。你虽然能看到颜色,却失去了告诉你碎片如何实际拼接的三维结构。这破坏了“关系上下文”——即车手与特定比赛相关联,而该比赛又与特定车队相关联这一事实。
解决方案:混合大脑
作者构建了一个由两部分协同工作的系统:
1. 语言专家(BART)
首先,他们使用预训练语言模型(BART)来读取数据库的行。
- 它的作用:这就像一位非常聪明的读者,查看数据库的一行数据(例如:“车手:爱丽丝,车队:红色,日期:周一”),并理解该特定句子的含义。它知道“爱丽丝”是名字,“周一”是时间。
- 局限性:这位专家擅长在孤立状态下理解单行数据,但它不知道爱丽丝也与那个周一发生的特定比赛相关联。这就像一位只读过某一章情节却未读完整本书的读者。
2. 社交网络侦探(图神经网络)
接着,他们使用图神经网络(GNN),具体版本为 GraphSAGE。
- 它的作用:这就像一位侦探,查看“连接”(主键和外键)。它看到“车手”行与“比赛”行相连,而“比赛”行又与“车队”行相连。
- 神奇之处:它将来自语言专家的“理解”沿着这些连接传递。它告诉侦探:“嘿,这位车手与一个通常在周一获胜的车队相关联。”侦探随后利用这种新的关系上下文更新车手的档案。
测试方法
他们在RelBench基准的一个特定挑战上测试了这个“混合大脑”:预测一级方程式(F1)车手在下个月是否会未能完成比赛(DNF)。
- 设置:他们在 6 个不同的数据库(如亚马逊、事件日志等)上训练了语言专家,然后利用侦探来学习连接。
- 结果:当他们在从未见过的新数据库(F1 赛车数据)上进行测试时:
- 混合大脑得分:67.40(分数越高越好)。
- “人类专家”得分:69.80(数据科学家手动构建特征)。
- “旧 AI"得分:68.86(LightGBM,一种标准的机器学习工具)。
- “超级 AI"得分:82.63(KumoRFM,一种庞大且昂贵的商业模型)。
这意味着什么
论文声称,这种轻量级的混合方法是一个重大进步。
- 弥合差距:它的表现几乎与最佳手动方法和标准 AI 工具相当,但无需人工手动将表格拼接在一起。
- 证明连接的重要性:当他们关闭“侦探”(GNN)而仅使用“语言专家”时,得分暴跌至 43.90。这证明理解数据点之间的关系与理解数据本身同样重要。
- 高效:与需要巨大算力的庞大商业模型不同,这种方法采用了一种“轻量级”架构,更加易于获取。
陷阱(局限性)
作者诚实地指出了他们仍需努力的地方:
- 规模:与驱动 ChatGPT 等事物的“基础模型”相比,他们训练的数据量相对较小。
- 两步流程:他们先训练语言专家,然后训练侦探。他们尚未找到如何同时训练它们以更好地协同学习的方法。
- 尚不完美:虽然他们已接近“人类专家”水平,但仍比庞大且专有的商业模型落后约 15 分。
结论
这篇论文表明,我们无需在“理解文字”(语言模型)和“理解连接”(图网络)之间做出选择。通过将它们结合,我们可以创建一个能更自然地读取关系数据库的系统,推动我们迈向这样一个未来:AI 能够理解复杂的多表数据,而无需人类先将其扁平化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。