← 最新论文
🤖 AI

SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback

SIRIUS-SQL 是一种新颖的 Text-to-SQL 框架,它通过用于多样化生成的难度平滑强化学习训练策略、用于针对性错误修复的执行落地生命周期,以及用于置信度门控的混合选择器,解决了现有多候选系统的局限性,从而提升了在复杂模式下的准确性,并在 BIRD 和 SPIDER 基准测试上实现了最先进的性能。

原作者: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图给一个机器人厨师(AI)下达一个非常具体且复杂的指令,让它根据一本极其庞大且杂乱的食谱(数据库)来烹饪一道菜(编写一条 SQL 查询)。

如果你只要求机器人做一次,它往往会出错,因为食谱很混乱,食材名称很奇怪,或者指令很模糊。

旧方法:“群众投票”问题
最近,其他系统尝试通过让机器人做 16 次而不是 1 次来解决这个问题(即多数投票法)。

SIRIUS-SQL 的作者指出,这种“群众投票”的方法存在三个大问题:

  1. 回声壁效应: 如果你让同一个机器人做 16 次,它会不断重复同样的 16 个错误。这就像让同一个人猜 16 次密码;他们很可能会一遍又一遍地猜出同一个错误的答案。
  2. “一刀切”的修复方式: 当一道菜做得不对时,旧系统只会说:“噢,它坏了,再试一次,”而不会观察它是如何出错的。是锅烧焦了?是忘了放盐?还是用了错误的锅?这些都需要不同的修复方法,但旧系统将它们一概而论。
  3. 错误的赢家: 有时,正确的菜肴其实就在 16 道菜的堆里,但群众投票选出了错误的那个,因为他们关注的点不对(比如关注的是味道而非食材清单)。

SIRIUS-SQL 的解决方案:大师级主厨与全才
SIRIUS-SQL 通过三部分的策略解决了这些问题:

1. “专家”与“全才”(解决回声壁效应)

他们不是让一个机器人做 16 次,而是使用了两位不同的厨师:

  • 专家 (SIRIUS-32B): 这是一个专门针对烹饪(SQL)训练的机器人。它通过一种特殊的“奖励机制”(强化学习)进行训练,只有当菜肴真正成功时,它才会获得奖励。它学会了制作正确菜肴的许多不同版本,而不是仅仅重复同一个错误。
  • 全才: 这是一个超级聪明的全能型机器人(类似于著名的 AI 模型),擅长理解复杂的语言和古怪的指令。
  • 结果: 通过将专家的深度知识与全才的广泛理解相结合,他们得到了更丰富的尝试版本。这就像是一位寿司大师和一位极具创意的法国大厨共同协作;你们更有机会做出完美的食谱。

2. “分诊护士”系统(解决“一刀切”问题)

当一道菜做得不对时,SIRIUS-SQL 不仅仅是说“再试一次”。它像医院里的分诊护士一样,诊断出具体出了什么问题:

  • 运行时错误(锅烧焦了): 机器人尝试使用了一个不存在的工具。系统会立即修复语法。
  • 超时(炉灶太慢了): 食谱太复杂,耗时太长。系统会在不改变味道的前提下,重写食谱以提高效率。
  • 空结果(锅里是空的): 机器人完美地遵循了食谱,但结果却是空的,因为它寻找了错误的食材。系统会尝试特定的“结构化”修复,以找到正确的食材。

只有在经过这些特定的修复之后,机器人才能再次尝试。这节省了时间,并防止系统在不可能实现的修复上浪费精力。

3. “智能评委”(解决“错误的赢家”问题)

最后,当需要从一堆菜肴中挑选出最好的那道时,系统使用了一个两步投票过程:

  • 第一步:味觉测试: 它观察实际的结果。如果 10 道菜的味道是一样的,它们就会获得高分。
  • 第二步:决胜局: 如果有两组菜肴的味道得分相同,系统不会仅仅靠猜测。它会查看食谱的“蓝图”(结构)。它会问:“是否有多位不同的厨师(专家和全才)独立地提出了相同的蓝图?”如果是,那么这个蓝图很可能才是真正的赢家。

结果
通过使用这个“专家 + 全才”团队、“分诊护士”修复系统以及“智能评委”,SIRIUS-SQL 成为了该领域的佼佼者。

  • BIRD 测试(一个处理真实世界杂乱数据的困难测试)中,它的准确率达到了 75.88%,超越了之前的最优系统。
  • SPIDER 测试(一个标准测试)中,它的准确率达到了 91.20%

简而言之,SIRIUS-SQL 不再依赖单个机器人盲目猜测 16 次。相反,它使用了一个由不同专家组成的团队,通过诊断特定错误来进行精准修复,并使用一套智能的多步投票系统来找到唯一的正确答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →