← Nieuwste papers
🤖 AI

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

Dit artikel stelt een nieuw raamwerk voor voor LLM-gebaseerde Text-to-SQL-generatie dat een pijplijn voor single-agent zelfverfijning met ensemblevoting (SSEV) combineert met een multi-agent collaboratief systeem (ReCAPAgent-SQL) om concurrerende uitvoeringsnauwkeurigheid te bereiken op benchmarks zoals Spider en BIRD, terwijl tegelijkertijd de complexiteiten van real-world enterprise-databases effectief worden aangepakt zonder steun op ground-truth-gegevens.

Oorspronkelijke auteurs: Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een vraag wilt stellen aan een enorme bibliotheek van informatie (een database), maar de bibliothecarissen spreken alleen een zeer strenge, robotachtige taal genaamd SQL. Jij spreekt natuurlijk Engels. Het doel van dit onderzoek is het bouwen van een vertaler die jouw Engelse vragen kan omzetten in perfecte SQL-opdrachten, zodat de bibliotheek je kan antwoorden.

De auteurs van dit artikel, Yu-Jie Yang en collega's, namen het probleem aan dat deze vertalers vaak in de war raken, fouten maken of de indeling van de bibliotheek niet begrijpen. Ze bouwden twee hoofdsystemen om dit op te lossen: een "Team van Experts"-benadering en een "Gespecialiseerd Agententeam"-benadering.

Hier is hoe ze het deden, met behulp van eenvoudige analogieën:

1. Het Probleem: De "One-Size-Fits-All"-Vertaler Faalt

Stel je voor dat je vraagt aan één persoon om een complex juridisch document in een andere taal te vertalen. Ze kunnen een nuance missen, een naam verkeerd schrijven of de verkeerde grammatica gebruiken. In de wereld van databases gebeurt dit wanneer een enkel AI-model probeert de SQL-code te raden. Vaak raakt het verdwaald in het "schema" (de kaart van de bibliotheek) of begrijpt het je vraag verkeerd.

2. De Eerste Oplossing: Het "Team van Experts" (SSEV-pijplijn)

De auteurs creëerden een systeem genaamd SSEV (Single-Agent Self-Refinement with Ensemble Voting). Denk hierbij niet aan één vertaler, maar aan een panel van vijf verschillende experts die rond een tafel zitten.

  • De Ontwerpfase (PreSQL): Het panel schrijft hun eerste schattingen voor het antwoord op.
  • De Kaartcontrole (Schema Linking): Ze beseffen dat ze naar een enorme kaart van de bibliotheek kijken. In plaats van de hele kaart te proberen te lezen, gebruiken ze hun eerste schattingen om alleen de relevante gangen en planken te markeren. Dit snijdt het ruis uit.
  • De Tweede Conceptversie (PostSQL): Met de kaart ingeperkt, schrijven ze een schonere, meer gefocuste tweede versie.
  • De "Zelfcorrectie"-lus: Als een concept een typefout heeft of niet werkt wanneer ze het proberen uit te voeren, gooien ze het niet zomaar weg. Ze kijken naar het foutbericht, herstellen het en proberen het opnieuw. Het is als een schrijver die zijn eigen werk bewerkt tot het zinvol is.
  • Het Stemmingssysteem (WMA): Dit is het geheim. In plaats van gewoon een stemming te houden waarbij iedereen één gelijke punt krijgt, gebruiken ze een Gewogen Meerderheidsalgoritme.
    • Stel je een spelshow voor waarbij de juryleden verschillende niveaus van vertrouwen hebben. Als "Jurylid A" tien keer op rij gelijk heeft gehad, telt hun stem meer. Als "Jurylid B" blijft fouten maken, telt hun stem minder.
    • Het systeem werkt deze "vertrouwensscores" voortdurend bij op basis van wie in het verleden het juiste antwoord gaf. Na verloop van tijd leert het systeem vooral te luisteren naar de slimste expert in de kamer.

Het Resultaat: Bij standaardtests (zoals Spider 1.0 en BIRD) kreeg deze "Team van Experts"-benadering ongeveer 86% van de tijd het juiste antwoord, wat veel beter is dan welke enkele expert dan ook die alleen werkt.

3. De Tweede Oplossing: Het "Gespecialiseerd Agententeam" (ReCAPAgent-SQL)

Voor nog moeilijkere problemen (zoals de nieuwe Spider 2.0-dataset, die rommelige, realistische zakelijke databases nabootst), is een simpel panel niet genoeg. De auteurs bouwden ReCAPAgent-SQL, wat vergelijkbaar is met het inhuren van een gespecialiseerd taskforce waarbij elk lid een specifieke taak heeft.

  • De Planner: Breekt je grote vraag op in kleine, logische stappen (zoals een projectmanager).
  • De Opvraager: Gaat op zoek naar extra handleidingen of documentatie als het team een specifieke regel niet kent (zoals een onderzoeker).
  • De Criticus: Beoordeelt het werk en zegt: "Wacht, die logica is niet logisch," of "Je hebt een stap overgeslagen."
  • De Schema-linker: Handelt specifiek de kaart van de bibliotheek af en zorgt ervoor dat ze naar de juiste tabellen en kolommen kijken.
  • De Zelfverbeteraar: Als de code stuk gaat, repareert deze agent het.
  • De Validator: De uiteindelijke kwaliteitscontroleur die controleert: "Lost dit antwoord daadwerkelijk het probleem van de gebruiker op?"

Deze agenten communiceren met elkaar in een lus. Ze plannen, handelen, krijgen kritiek, herstellen de fout en proberen het opnieuw totdat het goed is.

Het Resultaat: Toen ze dit testten op de moeilijkste, meest realistische vragen (Spider 2.0-lite), namen ze een basissysteem dat slechts 6% van de antwoorden goed had en verhoogden dit naar 31%. Dat is een enorme sprong in een vakgebied waar vooruitgang meestal wordt gemeten in kleine fracties.

4. Waarom Dit Belangrijk Is

Het artikel beweert dat door zelfcorrectie (je eigen fouten herstellen), slimme stemming (luisteren naar de beste experts) en gespecialiseerde agenten (een team met specifieke rollen) te combineren, we systemen kunnen bouwen die complexe, realistische data-vragen veel beter aankunnen dan voorheen.

Ze gokten niet zomaar; ze testten deze methoden op standaard benchmarks en bewezen dat:

  1. Gewogen Stemming beter werkt dan eenvoudige meerderheidsstemming omdat het zich aanpast aan wie de taak daadwerkelijk goed uitvoert.
  2. Zelfverbetering helpt fouten op te lossen die ontstaan wanneer de database zegt: "Nee, die opdracht is verkeerd."
  3. Multi-Agent Systemen noodzakelijk zijn voor de rommelige, ingewikkelde databases die in echte bedrijven worden aangetroffen.

Kortom, ze bouwden een slimmere, veerkrachtigere vertaler die leert van zijn fouten en luistert naar zijn beste experts, waardoor het voor gewone mensen veel gemakkelijker wordt om complexe vragen te stellen aan enorme databases.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →