FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents
FlexSQL 引入了一个文本转 SQL 智能体,该智能体通过采用一种灵活的设计原则,在推理过程中支持动态模式探索、数据检查以及多样化的执行计划,并贯穿两层修复机制,从而在 Spider2-Snow 基准测试中超越了更强大的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图解开一个谜团,但你的“案发现场”并非犯罪现场,而是一座拥有数百万本书籍、文件和数据点的庞大且混乱的图书馆。你的老板给你一个模糊的线索:“找出所有在 2014 年初提交的材料科学专利,并统计它们引用了多少篇旧专利。”
大多数试图解决此类问题的现有计算机程序表现得像僵硬的机器人。它们在开始时只获得一次图书馆地图。它们根据该地图挑选几个书架,写下一份指令清单(查询),然后尝试执行。如果它们卡住或答案错误,它们只能修正指令中的小拼写错误。它们无法回头说:“等等,我完全挑错了书架,”或者“我没意识到‘材料科学’被隐藏在像'MS-01'这样的代码下。”它们被困在最初的错误中。
FlexSQL 是一种新型侦探代理,表现得更像好奇的人类探索者。它不僵硬,而是灵活。以下是它的工作原理,使用简单的类比:
1. “灵活探索者”(灵活交互)
FlexSQL 不像机器人那样只看一次地图就锁定路径,而是被允许在思考过程中在图书馆里漫游。
- 旧方式:机器人查看地图,猜测“材料科学”在“科学”区,然后开始编写清单。
- FlexSQL 的方式:代理说:“我不确定‘材料科学’在哪里。让我走到‘技术’区,向箱子里窥探一下,并阅读标签。”
- 它使用特殊工具来浏览书架(模式),阅读箱子的实际内容(数据值),并运行小型测试搜索以验证其猜测是否合理。如果它意识到自己走错了过道,它可以立即转身前往正确的过道。它不会被困死胡同。
2. “头脑风暴团队”(多样化规划)
线索“每篇专利引用的早期专利”很棘手。它是指仅国内专利?也包括国外专利?还是待审申请?
- 旧方式:机器人选择一种解释(例如“仅国内”)并坚持到底。如果它是错的,整个答案就是错的。
- FlexSQL 的方式:它像一个进行头脑风暴的侦探团队。它同时生成多种不同的理论(计划)。
- 计划 A:仅统计国内引用。
- 计划 B:统计国内和国外引用。
- 计划 C:统计所有内容,包括待审申请。
它运行所有这些理论,然后让“多数投票”决定哪个答案最可能是正确的。这样,即使一个理论错了,团队仍可能得到正确答案。
3. “双语翻译员”(灵活执行)
有时,任务太复杂,无法写成单一的直线指令(SQL)。它可能需要循环、"if-then"决策,或者在数据库语言中难以编写的逐步计算。
- 旧方式:机器人试图将所有内容强行塞进一个僵硬的 SQL 句子中,这往往使其过于复杂且容易出错。
- FlexSQL 的方式:它是双语的。它可以用SQL(数据库使用的语言)或Python(一种灵活的编程语言)编写指令。
- 如果任务是一个简单的列表,它使用 SQL。
- 如果任务需要复杂的循环或逐步计算,它先编写 Python 脚本,因为这样思考更容易。
- 一旦 Python 脚本完美运行,它将最终结果翻译回 SQL,以便数据库理解。这就像先在笔记本上写下复杂的食谱,然后将其翻译成正式的厨房订单。
4. “重做”按钮(回溯)
如果 FlexSQL 制定了一个计划,然后意识到:“哦不,我完全误解了问题,”它不会只是尝试修复代码。它会按下回溯按钮。它会一直回到起点,重新检查图书馆书架,改变整个策略,并开始一个新计划。这防止了它浪费时间去修复一个破碎的基础。
结果
该论文在一个名为Spider2的非常困难的基准测试上测试了这种“灵活侦探”,该基准模拟了大规模的真实企业数据库。
- 得分:使用名为
gpt-oss-120b的模型,FlexSQL 得分为65.4%。 - 对比:这一得分高于其他使用更大、更强大模型(如
DeepSeek-R1或gpt-o3)的顶级系统。 - 结论:通过保持灵活——在图书馆漫游、头脑风暴多种理论、使用两种语言以及在需要时按下“撤销”——FlexSQL 比“僵硬机器人”更好地解决了问题,即使它的“大脑”更小。
简而言之,FlexSQL 证明,在大数据的复杂世界中,灵活性胜过僵化性。成为一个能够探索、适应和改变主意的代理,比顽固地遵循单一、预先写好的地图要好得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。