← 最新论文
🤖 AI

Towards Foundation Models for Relational Databases with Language Models and Graph Neural Networks

本文提出了一种轻量级混合架构,该架构结合了用于行内语义的微调 BART 编码器与基于 GraphSAGE 的图神经网络以处理关系上下文,证明该方法显著提升了关系数据库任务的性能,并为结构化数据的基础模型提供了一条资源高效的路径。

原作者: Jingcheng Wu, Ratan Bahadur Thapa, Mojtaba Nayyeri, Lucas Etteldorf, Max Finkenbeiner, Fabian Leeske, Steffen Staab

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingcheng Wu, Ratan Bahadur Thapa, Mojtaba Nayyeri, Lucas Etteldorf, Max Finkenbeiner, Fabian Leeske, Steffen Staab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座巨大的图书馆,其中每一本书都是一张数据库表。在传统图书馆中,如果你想查找关于一位未完成比赛的车手的具体故事,图书管理员(计算机)必须手动从“车手”书架、“比赛”书架和“结果”书架上取书,复制相关页面,并将它们粘贴成一份巨大而杂乱的文档。这个过程缓慢、容易出错,且常常丢失书籍之间微妙的联系。

本文提出了一种利用“混合大脑”阅读这些图书馆的新方法,该大脑结合了两种强大的工具:一位语言专家和一位社交网络侦探

问题:图书馆的扁平化

目前,要在这些数据库上使用深度学习(AI),我们通常会将其“扁平化”。我们将所有独立的表打碎并合并成一张巨大的扁平电子表格。

  • 类比:想象将一个三维拼图拆解,然后把所有碎片粘在一块平 cardboard 上。你虽然能看到颜色,却失去了告诉你碎片如何实际拼接的三维结构。这破坏了“关系上下文”——即车手与特定比赛相关联,而该比赛又与特定车队相关联这一事实。

解决方案:混合大脑

作者构建了一个由两部分协同工作的系统:

1. 语言专家(BART)
首先,他们使用预训练语言模型(BART)来读取数据库的行。

  • 它的作用:这就像一位非常聪明的读者,查看数据库的一行数据(例如:“车手:爱丽丝,车队:红色,日期:周一”),并理解该特定句子的含义。它知道“爱丽丝”是名字,“周一”是时间。
  • 局限性:这位专家擅长在孤立状态下理解单行数据,但它不知道爱丽丝也与那个周一发生的特定比赛相关联。这就像一位只读过某一章情节却未读完整本书的读者。

2. 社交网络侦探(图神经网络)
接着,他们使用图神经网络(GNN),具体版本为 GraphSAGE。

  • 它的作用:这就像一位侦探,查看“连接”(主键和外键)。它看到“车手”行与“比赛”行相连,而“比赛”行又与“车队”行相连。
  • 神奇之处:它将来自语言专家的“理解”沿着这些连接传递。它告诉侦探:“嘿,这位车手与一个通常在周一获胜的车队相关联。”侦探随后利用这种新的关系上下文更新车手的档案。

测试方法

他们在RelBench基准的一个特定挑战上测试了这个“混合大脑”:预测一级方程式(F1)车手在下个月是否会未能完成比赛(DNF)。

  • 设置:他们在 6 个不同的数据库(如亚马逊、事件日志等)上训练了语言专家,然后利用侦探来学习连接。
  • 结果:当他们在从未见过的数据库(F1 赛车数据)上进行测试时:
    • 混合大脑得分:67.40(分数越高越好)。
    • “人类专家”得分:69.80(数据科学家手动构建特征)。
    • “旧 AI"得分:68.86(LightGBM,一种标准的机器学习工具)。
    • “超级 AI"得分:82.63(KumoRFM,一种庞大且昂贵的商业模型)。

这意味着什么

论文声称,这种轻量级的混合方法是一个重大进步。

  • 弥合差距:它的表现几乎与最佳手动方法和标准 AI 工具相当,但无需人工手动将表格拼接在一起。
  • 证明连接的重要性:当他们关闭“侦探”(GNN)而仅使用“语言专家”时,得分暴跌至 43.90。这证明理解数据点之间的关系与理解数据本身同样重要。
  • 高效:与需要巨大算力的庞大商业模型不同,这种方法采用了一种“轻量级”架构,更加易于获取。

陷阱(局限性)

作者诚实地指出了他们仍需努力的地方:

  • 规模:与驱动 ChatGPT 等事物的“基础模型”相比,他们训练的数据量相对较小。
  • 两步流程:他们先训练语言专家,然后训练侦探。他们尚未找到如何同时训练它们以更好地协同学习的方法。
  • 尚不完美:虽然他们已接近“人类专家”水平,但仍比庞大且专有的商业模型落后约 15 分。

结论

这篇论文表明,我们无需在“理解文字”(语言模型)和“理解连接”(图网络)之间做出选择。通过将它们结合,我们可以创建一个能更自然地读取关系数据库的系统,推动我们迈向这样一个未来:AI 能够理解复杂的多表数据,而无需人类先将其扁平化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →