← Nieuwste papers
🤖 AI

SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback

SIRIUS-SQL is een nieuw Text-to-SQL-framework dat de nauwkeurigheid op complexe schema's verbetert door de beperkingen van bestaande multi-candidate systemen aan te pakken via een difficulty-smoothing RL-trainingsstrategie voor diverse generatie, een execution-grounded levenscyclus voor gerichte foutreparatie, en een confidence-gated hybride selector, waarmee het state-of-the-art prestaties bereikt op de BIRD- en SPIDER-benchmarks.

Oorspronkelijke auteurs: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer specifieke, complexe instructie probele te geven aan een robotkok (de AI) om een maaltijd te bereiden (een SQL-query te schrijven) op basis van een enorm, rommelig receptenboek (de database).

Als je de robot vraagt om het gerecht slechts één keer te bereiden, maakt hij vaak fouten omdat het receptenboek verwarrend is, de ingrediënten vreemd benoemd zijn of de instructies vaag zijn.

De Oude Manier: Het "Crowd Vote"-probleem
Onlangs probeerden andere systemen dit op te lossen door de robot te vragen het gerecht 16 keer te bereiden in plaats van één keer. Vervolgens keken ze naar deze 16 gerechten en kozen ze het gerecht waar de meeste mensen het over eens waren (meerderheidsstemming).

De auteurs van dit paper, SIRIUS-SQL, zeggen dat deze "crowd vote"-aanpak drie grote problemen heeft:

  1. De Echoput: Als je dezelfde robot 16 keer vraat om te koken, blijft hij dezelfde 16 fouten maken. Het is alsoer je één persoon vraagt om 16 keer een wachtwoord te raden; diegene zal waarschijnlijk steeds weer hetzelfde foute wachtwoord raden.
  2. De "One-Size-Fits-All"-oplossing: Wanneer een gerecht mislukt, zeggen de oude systemen alleen maar: "O, het is mislukt, probeer het opnieuw," zonder te kijken naar hoe het misging. Is de pan aangebrand? Is het zout vergeten? Is de verkeerde pan gebruikt? Al deze zaken vereisen verschillende oplossingen, maar het oude systeem behandelt ze allemaal hetzelfde.
  3. De Verkeerde Winnaar: Soms staat het juiste gerecht daadwerkelijk op de tafel tussen de 16 gerechten, maar stemt de menigte voor de verkeerde omdat ze naar de verkeerde dingen kijken (zoals de smaak versus de ingrediëntenlijst).

De SIRIUS-SQL Oplossing: Een Meesterkok en een Generalist
SIRIUS-SQL lost deze problemen op met een drieledige strategie:

1. De "Specialist" en de "Generalist" (Het oplossen van de Echoput)

In plaats van één robot 16 keer te vragen te koken, gebruiken ze twee verschillende chefs:

  • De Specialist (SIRIUS-32B): Dit is een robot die specifiek is getraind op koken (SQL). Deze is getraind met een speciaal "beloningssysteem" (Reinforcement Learning), waarbij de robot alleen een traktatie krijgt als het gerecht daadwerkelijk werkt. Hierdoor leert de robot veel verschillende versies van het juiste gerecht te maken, in plaats van steeds dezelfde fout te maken.
  • De Generalist: Dit is een superintelligente, veelzijdige robot (zoals een beroemd AI-model) die goed is in het begrijpen van lastige taal en vreemde instructies.
  • Het Resultaat: Door de diepe kennis van de Specialist te combineren met het brede begrip van de Generalist, krijgen ze een veel grotere variëteit aan pogingen. Het is alsof je een meester-sushichef en een creatieve Franse chef samen laatwerken; je hebt dan een grotere kans dat een van hen het recept perfect raakt.

2. Het "Triageverpleegkundige"-systeem (Het oplossen van de One-Size-Fits-All)

Wanneer een gerecht mislukt, zegt SIRIUS-SQL niet simpelweg "probeer het opnieuw." Het gedraagt zich als een triageverpleegkundige in een ziekenhuis en diagnosticeert precies wat er misging:

  • Runtime Error (De pan is aangebrand): De robot probeerde een hulpmiddel te gebruiken dat niet bestaat. Het systeem herstelt direct de syntaxis.
  • Timeout (Het fornuis is te traag): Het recept is te ingewikkeld en duurt te lang. Het systeem herschrijft het recept om het efficiënter te maken zonder de smaak te veranderen.
  • Empty Result (De pan is leeg): De robot volgde het recept perfect op, maar het resultaat is leeg omdat er naar het verkeerde ingrediënt werd gezocht. Het systeem probeert specifieke "structurele" verbeteringen om het juiste ingrediënt te vinden.

Pas nadat de robot deze specifieke reparaties heeft geprobeerd, krijgt hij de kans om het opnieuw te proberen. Dit bespaart tijd en voorkomt dat het systeem moeite verspilt aan onmogelijke oplossingen.

3. De "Slimme Rechter" (Het oplossen van de Verkeerde Winnaar)

Ten slotte, wanneer het tijd is om het beste gerecht uit de stapel te kiezen, gebruikt het systeem een tweestaps-stemproces:

  • Stap 1: De Proeverij: Het kijkt naar de werkelijke resultaten. Als 10 gerechten hetzelfde smaken, krijgen ze een hoge score.
  • Stap 2: De Beslissende Factor: Als twee groepen gerechten dezelfde smaakscore hebben, gokt het systeem niet zomaar. Het kijkt naar het blauwdruk (de structuur) van de recepten. Het stelt de vraag: "Hebben meerdere verschillende chefs (de Specialist en de Generalist) onafhankelijk van elkaar dezelfde blauwdruk bedacht?" Zo ja, dan is die blauwdruk waarschijnlijk de echte winnaar.

De Resultaten
Door dit team van "Specialist + Generalist", het "Triageverpleegkundige" reparatiesysteem en de "Slimme Rechter" te gebruiken, is SIRIX-SQL de beste in zijn vak geworden.

  • Op de BIRD-test (een moeilijke test met echte, rommelige data) behaalde het een nauwkeurigheid van 75,88%, waarmee het het vorige beste systeem versloeg.
  • Op de SPIDER-test (een standaardtest) behaalde het een nauwkeurigheid van 91,20%.

Kortom, SIRIUS-SQL vertrouwt niet langer op één robot die 16 keer gokt. In plaats daarvan zet het een team van verschillende experts in, diagnosticeert specifieke fouten om ze goed te herstellen, en gebruikt een slim, meerstaps stemproces om het ene ware antwoord te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →