EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge
本文介绍了 EntSQL,这是一个包含五个业务领域、共计 1,066 个示例的新型中英双语基准测试,旨在评估在长上下文企业知识背景下进行 Text-to-SQL 生成所面临的挑战,由于需要专有的业务理解,目前的模型在这些场景下难以实现高准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明、博学多才的图书管理员(AI),她既精通人类语言,也精通“数据库语言”(SQL)。通常情况下,如果你问这位管理员:“上个月我们卖了多少本书?”她可以查看图书馆的卡片目录(数据库架构),然后写下一份完美的便条给管理员助理,让其去获取答案。
但在现实世界的各种大公司中,情况并非如此简单。公司里有一本外人不知道的“秘密规则手册”。也许“上个月”实际上指的是“截至六月的财政季度”;或者“热门产品”不包括目前正在清仓处理的商品。如果这位图书管理员没有这本秘密规则手册,她就会进行猜测,而她的便条也会出错。
走进“EntSQL”:针对“秘密规则手册”的测试
这篇论文介绍了一种名为 EntSQL 的新测试。你可以把它看作是对 AI 图书管理员的一次期末考试——它不仅仅是考查它们是否能阅读卡片目录,而是给它们一本厚达 50 页的私人公司手册,并要求它们根据手册内容编写查询语句。
以下是该论文研究结果的拆解,使用了简单的类比:
1. 问题所在:“缺失的手册”
现有的 AI 图书管理员测试(如 Spider 或 BIRD)就像是给它们一个通用的图书馆目录。如果目录清晰,它们很擅长找书。但在真实的商业环境中,如果没有“员工手册”(私人业务规则),这个“目录”(数据库)就是毫无用处的。
- 类比: 想象你问 AI:“我们在‘项目 X’上花了多少钱?”数据库里只有一个名为
cost的列。它并不知道“项目 X”其实是“市场部”的代号,或者它只计算特定日期之后的成本。没有这份私人手册,AI 就像是在盲目飞行。
2. 测试方法:EntSQL
研究人员利用来自五个不同公司部门(财务、司库、人力资源、业务管理和党建)的真实(但已匿名)数据构建了这个测试。
- 设置: 他们给 AI 一个问题、一个数据库结构以及一份包含公司特定规则的长篇且杂乱无章的文件。
- 难度: 问题非常棘手。它们要求 AI 阅读一份长文档,找到关于“财政年度”或“奖金计算”的具体规则,然后将该规则与数据库结合起来,编写出复杂的计算机指令。
- 规模: 该测试拥有 1,000 多个问题。其“标准答案”(正确的指令)非常长且复杂,就像一段 400 字左右的代码段。
3. 结果:AI 仍在苦苦挣扎
研究人员在这次考试中测试了世界上最聪明的 AI 模型(如 Claude、GPT-4 等)。
- 得分: 当面对长文档时,即使是最优秀的 AI 也仅能答对约 16% 的题目。
- 类比: 这就像给一位天才学生一本 500 页的教科书,然后让他们解决一个数学题。他们懂得数学,但他们找不到书中适用于这个特定问题的那个具体规则。他们在文本中迷失了方向。
- “证据”提示: 当研究人员给 AI 提供一份“高亮版”书籍(即只提供那 2 到 3 句关键信息)时,得分上升到了约 21%。这证明了 AI 并不是不擅长数学,而是不擅长“大海捞针”。
4. 失败原因
研究人员分析了 AI 出错的原因。通常并不是因为 AI 忘记了如何编写代码。
- 主要错误 (54%): AI 遗漏了“过滤器”。这就像是要求寻找“红色的车”,而 AI 却带回了“所有的车”或“蓝色的车”。它无法正确地将文档中的特定规则应用到数据中。
- 范围错误 (14%): AI 找错了时间段或部门。这就像是在计算“2023年”的预算,而问题问的是“2024年”。
5. 人类差距
研究人员还请一位人类专家参加了同样的测试。
- 差距: 当获得高亮笔记时,人类专家的正确率约为 84%。而 AI 仅为 20%。
- 启示: 人类利用公司手册进行操作的能力与当前 AI 的能力之间存在巨大的鸿沟。AI 在理解特定业务的“潜规则”方面仍然表现得很差。
总结
EntSQL 是一个新的基准测试,它在说:“不要仅仅测试 AI 是否能读取数据库。要测试它是否能阅读一份公司的秘密规则手册并将其应用其中。”
论文结论指出,虽然 AI 在编写代码方面正在进步,但它目前在将代码落实到支撑真实业务的、混乱且私密的“长上下文知识”方面表现极差。这提醒我们,为了让 AI 真正能在办公室里发挥作用,它需要变得更擅长阅读那些“细则条款”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。