← Nieuwste papers
🤖 AI

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

Het artikel introduceert ACTS-SQL, een trainingsvrij, boomgestructureerd framework dat gebruikmaakt van agentic planning, backtracking en executiegebaseerde verificatie om de nauwkeurigheid van SQL-correctie aanzienlijk te verbeteren in zowel benchmarkevaluaties als reële industriële implementaties.

Oorspronkelijke auteurs: Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

Gepubliceerd 2026-08-18
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne wereld wordt enorme hoeveelheden informatie opgeslagen in digitale magazijnen die databases worden genoemd. Om deze magazijnen een vraag te stellen, gebruiken mensen een specifieke taal die bekend staat als SQL, die fungeert als de primaire interface voor het ophalen van gestructureerde gegevens. Hoewel het correct schrijven van deze taal een diep begrip vereist van complexe relaties en logica, maken zelfs ervaren mensen fouten die leiden tot verkeerde antwoorden. Recentelijk zijn krachtige computersystemen, bekend als large language models, geleerd om deze queries automatisch te schrijven, met de belofte om data toegankelijk te maken voor iedereen. Deze modellen produceren echter vaak queries die er correct uitzien maar niet het ware antwoord op de vraag van de gebruiker geven, of ze bevatten subtiele fouten die ervoor zorgen dat de computer crasht of misleidende resultaten teruggeeft. Het oplossen van deze fouten is moeilijk omdat een kleine verandering in één deel van een query de betekenis van de hele aanvraag volledig kan veranderen.

Een team onderzoekers van Renmin University of China en ByteDance heeft een nieuwe manier ontwikkeld om deze computersystemen hun eigen fouten te laten herstellen. In plaats van te proberen een foutieve query in een enkele, rechte lijn te corrigeren, behandelt hun systeem, genaamd ACTS-SQL, het proces als een vertakkend pad waarbij de computer tegelijkertijd meerdere mogelijkheden kan verkennen. Als de computer een verkeerde afslag neemt, kan hij een stap terug doen en een andere route proberen in plaats van vast te komen te zitten op een gebrekkige aanname. Deze aanpak is getest op standaard benchmarks en in een echt industrieel systeem, waar het de nauwkeurigheid van de gegenereerde vragen aanzienlijk verbeterde. De onderzoekers ontdekten dat door het systeem toe te staan te pauzeren, zijn werk te controleren en zijn keuzes te heroverwegen, het problemen kon oplossen die voorheen onmogelijk waren voor eerdere methoden, wat de technologie veel betrouwbaarder maakt voor dagelijks gebruik.

Het kernprobleem dat de onderzoekers aanpakten, is dat huidige computersystemen vaak gevangen raken in een lus van fouten. Wanneer een model een foutieve query genereert, proberen oudere correctiemethoden de fout meestal stap voor stap te herstellen via een enkele lijn van redenering. Als het model een fout maakt in een vroeg stadium, zoals het verkeerd begrijpen van wat een gebruiker met een specifiek woord bedoelde, bouwt elke daaropvolgende correctie voort op die initiële fout. Dit is als het navigeren door een doolhof waarbij je alleen vooruit beweegt; als je aan het begin een verkeerde afslag neemt, blijf je dieper in de doodlopende weg lopen, ervan overtuigd dat je op het juiste pad bent, totdat je zonder opties komt te zitten. De onderzoekers observeerden dat deze lineaire methoden fragiel zijn omdat ze niet gemakkelijk terug kunnen gaan om hun eerste keuze te heroverwegen. Zodra de computer zich vastlegt op een specifieke interpretatie van een verzoek van een gebruiker, verandert hij zelden van mening, zelfs niet wanneer de resultaten bewijzen dat het fout is.

Om dit op te lossen, ontwierp het team een systeem dat het correctieproces organiseert in een boomstructuur. Stel je een beslisboom voor waarbij de computer bovenaan begint en wanneer een tool een nieuw besluitpunt introduceert — zoals wanneer de 'Detect Ambiguities'-tool specifieke ambigue zinnen in het verzoek van de gebruiker identificeert — splitst hij zich in verschillende takken, die elk een verschillende mogelijke betekenis vertegenwoordigen. Eén tak zou kunnen aannemen dat de gebruer alle verkopen voor een jaar wil zien, terwijl een andere aanneemt dat ze de verkopen voor een specifieke maand willen zien. Het systeem test vervolgens elke tak onafhankelijk. Als een tak leidt tot een resultaat dat niet overeenkomt met wat de gebruiker waarschijnlijk bedoelde, kan het systeem die tak afsnijden en terugkeren naar de splitsing om een ander pad te proberen. Dit vermogen om terug te keren (backtracken) en alternatieven te verkennen, voorkomt dat de computer vast komt te zitten op één enkel, incorrect idee.

Het systeem werkt door een centrale "hersenen" te gebruiken die een plan maakt voor hoe de query te corrigeren. Dit plan is geen eenvoudige lijst met stappen, maar een kaart van potentiële acties. De computer gebruikt speciale tools om deze kaart te navigeren. De ene tool helpt het systeem om ambigue woorden in de vraag van de gebruiker op te sporen en verschillende manieren te genereren om ze te begrijpen. Een andere tool stelt de computer in staat om kleine delen van de query tegen de werkelijke database te draaien om te zien welke data er terugkomt, wat fungeert als een snelle test om te zien of een idee werkt. Als de computer een syntaxfout vindt, wat een fout is in de grammatica van de query, gebruikt een gespecialiseerde tool om de query in kleinere stukjes op te delen om precies te vinden waar de grammatica fout ging, zonder de hele query vanaf nul te hoeven herschrijven.

De onderzoekers testten hun systeem op een benchmark genaamd BIRD-Critic, die veel voorbeelden bevat van moeilijke SQL-queries met diverse soorten fouten. Ze vergeleken hun methode met verschillende andere benaderingen, waaronder krachtige modellen die specifiek zijn getraind om SQL te corrigeren en andere systemen die probeerden fouten te herstellen met een lineaire, stapsgewijze methode. De resultaten lieten zien dat hun boomgestructureerde aanpak aanzienlijk nauwkeuriger was. Op de benchmark verbeterde het nieuwe systeem het succespercentage met 9,42 procentpunten vergeleken met de vorige beste methode. Deze verbetering hield stand bij verschillende soorten database-talen, wat suggereert dat de methode robuust is en niet afhankelijk is van een specifieke stijl van query-schrijven.

Om te bewijzen dat het systeem in de echte wereld werkt, hebben de onderzoekers het ingezet in een productieomgeving bij ByteDance, specifelijk binnen een loganalyse-service genaamd Torch Log Service. In deze setting werd het systeem gebruikt om queries te corrigeren die door een sterk taalmodel werden gegenereerd voordat ze naar gebruikers werden verzonden. De resultaten waren opmerkelijk: de nauwkeurigheid van de queries die daadwerkelijk succesvol werden uitgevoerd, sprong van 36,77% naar 53,61%. Dit betekent dat het systeem in een scenario met complexe, aangepaste data in staat was om een meerderheid van de mislukte pogingen in succesvolle pogingen te veranderen. De onderzoekers merkten op dat deze verbetering plaatsvond zonder dat het onderliggende computermodel op nieuwe data opnieuw getraind hoefde te worden, wat de oplossing praktisch en gemakkelijk te integreren maakt in bestaande systemen.

De studie benadrukte ook het belang van het vermogen om terug te keren (backtracken). In een gedetailleerde casestudy lieten de onderzoekers zien hoe een lineaire methode zou falen bij het corrigeren van een query over "maandelijkse verkopen", omdat het vast kwam te zitten op het idee dat de gebruiker jaarlijkse verkopen bedoelde. Hoe vaak de lineaire system ook probeerde de query aan te passen, het kon niet ontsnappen aan die initiële foutieve aanname. In contrast hiermee herkende het boomgestructureerde systeem de ambiguïteit, probeerde het idee van de jaarlijkse verkopen, zag dat dit faalde, en schakelde vervolgens direct over naar een tak die de aanvraag correct interpreteerde als maandelijkse data. Dit vermogen om van richting te veranderen op basis van bewijs was de sleutel tot het succes.

Hoewel het nieuwe systeem effectiever is, duurt het iets langer om te draaien omdat het meerdere paden verkent en meer tests uitvoert. De onderzoekers maten de tijd die nodig was om een query te corrigeren en vonden dat het enkele minuten toevoegde aan het proces, wat een redelijke afweging is voor de aanzienlijke winst in nauwkeurigheid. Ze ontdekten ook dat het systeem goed werkte met verschillende soorten computermodellen, niet alleen het model dat ze voor hun tests gebruikten, wat aangeeft dat de aanpak flexibel is en breed toegepast kan worden.

Het werk laat zien dat voor complexe taken zoals het schrijven van database-queries, een gestructureerde, op een plan gebaseerde aanpak superieur is aan een eenvoudige, lineaire aanpak. Door de computer het vermogen te geven om te pauzeren, meerdere opties te overwegen en een stap terug te doen wanneer hij een fout maakt, wordt het systeem veel betrouwbaarder. Deze bevinding suggereert dat toekomstige verbeteringen in kunstmatige intelligentie voor data-analyse waarschijnlijk minder zullen rusten op het slimmer maken van de modellen in isolatie, en meer op het geven van betere tools en processen aan de modellen om hun eigen werk te controleren. De onderzoekers hebben hun code en data beschikbaar gesteld, zodat anderen voort kunnen bouwen op deze methode om de interactie tussen computers en menselijke data verder te verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →