← 最新论文
💬 NLP

BEAVER: An Enterprise Benchmark for Text-to-SQL

本文介绍了 BEAVER,这是首个源自私有企业数据仓库的文本到 SQL 基准测试,涵盖 19 个领域的 9,128 个真实世界查询,该基准揭示了最先进模型存在的显著性能差距,并提出了一种细粒度评估框架,以诊断领域知识和高级函数使用等复杂挑战。

原作者: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一座巨大而凌乱的图书馆,其中的书籍并非按书名或作者排列,而是按照只有图书管理员才知道的秘密代码进行组织。书架上标注着诸如"FCLT_ROOMS"这样的神秘符号,而非“教室”,书籍则散落在成千上万个不同的房间中。

现在,想象你想问图书管理员:“请展示艺术楼中面积超过 400 平方英尺的排名前 10 的课程。”在普通图书馆里,你只需这样提问,他们就能找到答案。但在这座秘密图书馆中,图书管理员(即人工智能)必须:

  1. 猜测需要查看哪 5 个不同的房间。
  2. 弄清楚"Stata 大楼”实际上是指"32 号房间”的代码。
  3. 将看似毫无关联的书籍联系起来。
  4. 进行复杂的计算以对课程进行排名。

这正是BEAVER试图解决的问题。

问题所在:“过于整洁”的图书馆

多年来,科学家们一直在训练人工智能将人类问题转化为数据库命令(称为文本到 SQL)。他们使用“练习图书馆”(如 Spider 或 BIRD 等公开基准测试)来测试这些人工智能。这些练习图书馆就像玩具套装:书架整齐,标签清晰,问题简单。

在这些玩具套装中,人工智能表现得像天才,80% 以上的答案都正确。但本文作者指出:“这就像在光滑的赛道上测试赛车,就假设它能开过泥泞的沼泽。”真实的企业数据库就是那片泥泞的沼泽:庞大、混乱、充满秘密代码,而且人们提出的问题极其复杂。

解决方案:BEAVER(沼泽模拟器)

该团队创建了BEAVER,这是首个利用来自私人企业数据库的真实、混乱数据对人工智能进行的“试驾”。

  • 数据:他们从三家不同的公司(一所大学、一个研究实验室和一个住房设施)收集了 9,128 个真实的问题和答案。
  • 规模:这些不是玩具套装。平均每个数据库包含超过 100 张表(书架)和近 900 列(数据行)。问题篇幅较长,需要深入思考。
  • 扩展:由于隐私规则导致无法获取足够多的真实数据,他们构建了一个“模板机器”。他们提取了真实问题的结构(例如“找出前 10 名……"),并将其与不同的公司细节相结合,从而生成了数千个新的、逼真的练习问题。

五个隐藏步骤(子任务)

该论文认为,得出正确答案并非仅仅是一大步跨越。这就像烘焙蛋糕;如果某一步出错,整个蛋糕就会失败。他们将人工智能的工作分解为五个具体步骤,以观察其在哪里失败:

  1. 找到正确的房间(多表检索):我需要查看哪 5 个书架?
  2. 连接线索(连接键检测):当“房间”书架和“课程”书架没有匹配的标签时,我该如何将它们关联起来?
  3. 解码标签(列映射):"Stata 大楼”是指 X 列还是 Y 列?
  4. 知晓秘密(领域知识):即使问题中没有写明,我也知道"Stata 大楼”实际上对应“建筑键 32"。
  5. 拆解问题(查询分解):这个问题太难,无法一次性完成。我需要先解决 A 部分,再解决 B 部分,然后将它们结合起来。

结果:现实检验

当他们在 BEAVER 上测试可用的最先进人工智能(包括 OpenAI 及其他公司的最新模型)时,结果令人震惊。

  • 得分:最佳人工智能的正确答案率并非 80%,而仅为10.8%
  • “小抄”测试:研究人员随后给人工智能提供了一份“小抄”(即那 5 个隐藏步骤的正确答案)。即使有了小抄,人工智能的得分也仅上升至30.1%

这意味着什么?
这意味着人工智能在两个主要方面存在失败:

  1. 基础能力:它甚至无法找到正确的书架或连接正确的线索(即那 5 个子任务)。
  2. 数学逻辑:即使它知道该做什么,它在构建最终答案所需的复杂数学和逻辑(例如使用高级函数或正确组织数据)方面仍显得力不从心。

结论

该论文得出结论,我们不能仅仅继续在整洁的玩具数据库上训练人工智能。要构建能够在真实企业中实际工作的人工智能,我们必须停止假装数据是整洁的。BEAVER 是一项新的、更严格的测试,它迫使人工智能开发者在工具能够被现实世界信任之前,先解决这些具体的、混乱的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →