← 最新论文
🤖 AI

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

本文介绍了 PLuRel,这是一个用于合成多样化多表关系数据库的轻量级框架,它首次证明了通过扩展合成数据可以为关系基础模型带来可预测的性能提升和强大的泛化能力。

原作者: Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何理解复杂且相互关联的商业数据世界。在现实世界中,公司将他们的秘密存储在庞大的“关系型数据库”中——可以把它们想象成巨大的多房间图书馆,每一本书(表)都通过特定的线索(比如通过客户 ID 将姓名与其订单历史联系起来)与其他书相连。为了让机器人真正擅长阅读这些图书馆,我们需要向它展示数百万个不同的示例。但问题在于,真实的商业数据是私密的。它们被锁在隐私法和商业机密的围墙之后,我们无法直接交给我们的机器人。

这就是“合成数据”概念的用武之地。这就像是从零开始构建一个完美的、虚假的图书馆副本,利用数学方法来推测书籍及其连接线索应该呈现的样子,而无需亲眼见到任何真实的数据。科学家们一直在尝试生成单张表(例如简单的姓名列表)的数据,但要构建一个让连接关系也显得合理的“多房间”虚拟图书馆,难度极大。如果机器人是在一个连接破碎或逻辑怪异的虚假图书馆中学习,它将来将无法解决现实中的问题。这篇论文正是针对这个难题:我们如何建立一个工厂,能够源源不断地生产出无穷无尽、多样化且连接完美的虚假数据库,从而让我们的 AI 在接触真实数据之前,就能先学会游戏的规则?


PLUREL 工厂:为 AI 构建虚假世界

认识一下 PLUREL,它是一个集建筑大师与创意作家于一身的新型框架。它的任务是从底层开始构建合成关系型数据库,为 AI 模型创造可以练习的“虚假世界”。PLUREL 背后的研究人员想要探索是否能为这些 AI 模型解锁一种秘密力量:即仅仅通过看到更多更多样化的示例就能变得更聪明,这一概念被称为“缩放法则”(Scaling Laws)。

把训练 AI 比作教青少年开车。如果你只让他们在一个空旷的停车场里练习(单个小型数据库),他们可能会精通那个特定的场地,但一旦进入繁忙的城市街道(现实世界数据库),就会发生碰撞。PLUREL 通过生成数千个不同的“驾驶课程”解决了这个问题——有些是狭窄街道,有些是环岛,有些交通拥堵,有些则雾气弥漫。每一个课程都是一个独特的数据库,拥有自己的一套表(如“用户”、“商品”和“交易”)以及它们之间复杂的连接网络。

PLUREL 如何构建这些虚假世界

PLUREL 不仅仅是复制粘贴现有数据;它通过三个创意步骤从头开始构建一切:

  1. 蓝图(模式/Schema): 首先,它绘制出一张图书馆的地图。它决定有多少个房间(表)以及它们如何连接。它使用“有向图”(一种带有箭头的地图)来决定哪个房间通向哪个房间。例如,它可能会决定“用户”房间连接到“订单”房间,但不会直接连接到“运输”房间。
  2. 线索(连通性/Connectivity): 接着,它编织起将房间系在一起的线索。在真实的数据库中,一个特定的订单属于特定的用户。PLUREL 使用一种巧妙的“二分图”(一种匹配两组对象的方法)来决定哪个用户获得哪些订单。它并非随机选择,而是使用一种“层级化”模式(类似于家谱),以确保连接感自然。例如,一个“VIP”用户可能会获得更多订单,或者来自特定地区的订单会聚集在一起。
  3. 内容(特征/Features): 最后,它用数据填满房间。它使用“结构化因果模型”(可以理解为逻辑引擎)来决定单元格中填充什么。如果用户购买了一件冬装,系统就会知道“日期”应当在冬季,且“价格”可能会更高。它甚至加入了“时间模式”,意味着数据会随着时间的变化而变化,就像现实生活一样(例如,销售额在黑色星期五期间激增)。

重大发现:多样性 = 更聪明的 AI

论文中最令人兴奋的部分是,当研究人员将一个名为关系 Transformer (Relational Transformer, RT) 的模型在 PLURELY 生成的数据库上进行训练时发生了什么。

研究人员测试了两件事:

  1. 规模(Size): 模型看到了多少数据?(总体的 Token 数,或数据的“词量”)。
  2. 多样性(Diversity): 模型看到了多少个不同的虚假数据库?(即“世界”的数量)。

他们发现了一个美丽且可预测的模式:训练数据越多样,模型的表现就越好。

想象一下你在学习一门语言。如果你读了同一本书的一万页,你会完美背诵这本书,但你不知道如何与陌生人交流。但如果你读了分布在一千本不同书籍中的一万页内容(涵盖不同的类型、作者和风格),你就会学会语言的规则。PLUREL 表明,当 AI 看到更多独特的数据库(增加多样性)时,它在处理真实数据时的预测能力会呈现出平滑且可预测的曲线提升。这是一种“幂律”(Power Law),意味着改进遵循稳定的数学规则,而非随机波动。

它在现实生活中有效吗?

最终的测试是:“这种虚假训练能否帮助解决现实问题?”

研究人员将这个在数十亿个 PLUREL 生成的 Token 上进行过训练的 AI,拿去在少量真实数据(来自基准测试 RelBench)上进行快速的“进阶学校”式微调。结果令人印象深刻:

  • 混合方法胜出: 一个在 PLUREL 虚假数据上学习并随后在真实数据上进行微调的 AI,其表现明显优于仅在真实数据上学习的 AI。
  • 收益情况: 平均而言,这种“合成 + 真实”的方法在分类任务(如预测用户是否流失)中将准确率提高了 1.2%,在回归任务(如预测销售数字)中提高了 3.0%
  • 高光时刻: 在某些特定任务上,提升非常巨大——在预测用户参与度方面提升了高达 7.4%,在预测客户终身价值方面提升了 5.2%

然而,论文谨慎地指出,合成数据本身并不是万灵药。如果他们尝试仅使用虚假数据而不接触任何真实数据,模型会表现挣扎。虚假数据擅长学习通用规则,但真实数据对于使模型与现实世界的特定特性保持一致是必不可少的。

这意味着什么

PLUREL 表明,我们不需要等待公司分享其私密数据来构建更好的 AI。相反,我们可以使用合成数据构建自己的“训练健身房”。通过生成数千个多样化、符合数学逻辑的虚假数据库,我们可以教会 AI 模型数据是如何连接的基本规则。这使得模型具备了泛化能力——这意味着它们可以将从虚假世界中学到的知识成功应用到混乱的现实世界中。

论文总结道,这是一个充满前景的新路径。这不仅仅是关于创造更多数据,更是关于创造更好、更多样化的数据。通过释放提升训练数据多样性的能力,PLUREL 有助于我们构建准备好应对未来复杂、互联数据挑战的关系型基础模型,同时确保现实世界的隐私安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →