Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
本文介绍了 Spider 2.0-AIFunc,这是一个包含跨 125 个真实世界数据库的 465 个已验证实例的新基准,旨在评估大语言模型在 Snowflake 平台上生成 AI 原生 SQL 查询的能力,研究揭示了尽管顶尖的专有模型达到了 67-70% 的准确率,但目前针对传统文本转 SQL 任务优化的智能体框架并不能有效地迁移到这一新兴场景中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、高科技的图书馆(云数据库),人们在其中存储从客户评论到销售记录的一切信息。多年来,向这个图书馆提问需要使用一种非常严格、机械化的语言,叫做 SQL。这就像是在餐厅点餐时,只能通过一套由数字和符号组成的编码来进行交流。
最近,图书馆的所有者(如 Snowflake)增加了一个新功能:AI 函数(AI Functions)。你可以把它们想象成直接内置在订餐系统中的“智能助手”。现在,你不再只是询问“所有的红苹果”,而是可以要求系统“阅读这些苹果的评论,并告诉我人们是开心还是愤怒”,或者“寻找与这条评论相似的评论”。这使得数据库变成了一个 AI 原生(AI-Native) 系统,让你可以在单句指令中将标准的数据库命令与基于语言的智能思维结合起来。
问题所在:旧地图不再适用
研究人员注意到,虽然这些新的“智能助手”功能强大,但用于训练和测试计算机大脑(AI 模型)的测试方法已经过时了。旧的测试只检查计算机是否能说那种严格的机械化语言。它们并没有检查计算机是否能够使用这些新的“智能助手”。这就像是在测试一名司机时,只在一条笔直、空旷的路上进行测试,而忽视了现实世界中充满了交通、行人和施工区域。
解决方案:Spider 2.0-AIFunc
为了解决这个问题,团队创建了一个更严格的驾驶测试,名为 Spider 2.0-AIFunc。
- 转化过程: 他们将 513 个现有的“驾驶测试”(关于数据的提问)进行了重写。他们强制要求这些问题必须调用新的“智能助手”。
- 旧问题: “显示所有负面评论。”(需要人类先阅读评论)。
- 新问题: “显示所有 AI 助手判定为负面情绪的评论。”(由 AI 在数据库内部完成阅读)。
- 建设团队: 他们使用了一组 AI Agent(数字员工)来重写这些问题。这些 Agent 扮演着编辑和机械师的角色:
- 他们检查指令是否清晰(例如:“你所谓的‘负面’具体指什么?”)。
- 他们确保“智能助手”拥有执行任务所需的所有正确工具(参数)。
- 他们反复运行测试,以确保答案是稳定的,不会仅仅因为 AI 助手“状态不佳”就发生变化。
- 最终考试: 最终结果是一个包含 465 个经过验证的问题、涵盖 125 个不同数据库 的基准测试。它涵盖了六种类型的“智能助手”任务,例如按情感对评论进行排序、寻找相似文本或从一段文字中提取特定细节。
测试结果:谁通过了考试?
研究人员让 10 个不同的 AI 模型(即“驾驶员”)参加了这场新考试,以观察它们编写这些复杂的、由 AI 驱动的查询的能力如何。
- 顶尖驾驶员(闭源模型): 大型闭源模型(如 Claude Opus 和 Gemini)表现最好。它们的正确率约为 67% 到 70%。它们擅长判断该使用哪种“智能助手”,以及如何向其提出正确的问题。
- 开源驾驶员: 最优秀的开源模型(如 Kimi K2.5)得分约为 58%。它们表现尚可,但也犯了不少错误。
- 差距所在: 开源模型表现挣扎的主要原因并不是它们无法编写基础代码,而是它们在“智能”部分遇到了困难:
- 误解规则: 选错了表或列。
- 指令不佳: 忘记告诉 AI 助手具体要寻找什么(例如,在分类任务中没有列出所有可能的类别)。
- 逻辑错误: 搞混了操作顺序(例如,在调用 AI 之前而不是之后进行数据过滤)。
令人惊讶的发现:少即是多
研究人员还测试了使用复杂的“Agent 框架”(即帮助 AI 规划步骤的精细工具包)是否会有所帮助。
- 发现: 令人惊讶的是,最复杂的工具包并没有带来多少帮助。事实上,一个极简的设置——仅包含一个查看数据库的工具和一个运行查询的工具——其表现与那些花哨的框架一样好,甚至更好。
- 隐喻: 这就像是给一位名厨一把小巧简单的菜刀,而不是一把巨大的、复杂的瑞士军刀。对于这种特定的烹饪方式(AI 原生 SQL),这位名厨并不需要额外的各种小工具;他只需要知道如何使用这把菜刀即可。那些为传统数据任务设计的复杂框架,反而成了累赘或未能提供额外价值。
总结
本论文介绍了一种新的、更真实的测试方法,用于检测 AI 模型是否能够使用现代的“AI 驱动型”数据库功能。研究发现,虽然顶尖的 AI 模型正在变得日益熟练,但顶尖模型与开源模型之间仍存在差距。成功的关键不在于使用更复杂的规划工具,而在于将 AI 函数的基础指令和参数设置得完全正确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。