SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data
De SemPlan-benchmark evalueert vier architecturale benaderingen voor het vertalen van natuurlijke taalvragen naar uitvoerbare enterprise data-operaties, waarbij wordt onthuld dat hoewel gestructureerde semantische planning (A3) de hoogste antwoordcorrectheid oplevert, geen enkele architectuur universeel alle metrieken optimaliseert, aangezien elke architectuur duidelijke afwegingen vertoont tussen nauwkeurigheid, beleidsovereenstemming, kosten en stabiliteit.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een specifieke vraag wilt stellen aan een superintelligente robot-bibliothecaris, maar je kent het geheime codesysteem van de bibliotheek niet. Je zegt gewoon: "Ik wil het boek over draken van de rode plank." De robot moet uitzoeken wat je precies bedoelt, controleren of je wel toestemming hebt om die plank te bekijken, en dan het boek vinden. Dit is de wereld van Natural Language Interfaces to Enterprise Data. Het is de wetenschap van het laten praten van gewone mensen met complexe databases via normale zinnen in plaats van computercode.
Lange tijd hebben wetenschappers zich zorgen gemaakt dat deze robots misschien de syntax wel goed krijgen (een geldige computercode schrijven), maar de betekenis fout hebben (het verkeerde boek vinden), of dat ze de regels overtreden door je dingen te laten zien die je niet mag aanraken. De grote vraag is: Hoe bouwen we de beste "hersenen" voor deze robot? Moeten we de robot direct de computercode laten schrijven? Moelten we de robot een specifieke set hulpmiddelen geven om te gebruiken? Of moeten we hem dwingen om eerst een gedetailleerd plan te schrijven voordat hij iets doet? Dit paper, genaamd SemPlan, is een gigantisch experiment om uit te zoeken welke van deze "hersendesigns" eigenlijk het beste werkt wanneer de inzet hoog is en de data ingewikkeld is.
De Grote Robot-Hersenen-Battle
De onderzoekers zetten een massale, gecontroleerde battle royale op in een fictief maar zeer realistisch "Northstar Commerce"-universum. Ze creëerden 1.800 verschillende vragen in zowel het Engels als het Braziliaans-Portugees, variërend van eenvoudige verzoeken zoals "Hoeveel geld hebben we verdiend?" tot lastige, meerdelige puzzels die proberen de robot te misleiden. Ze testten vervolgens vier verschillende robotarchitecturen (laten we ze Team A, B, C en D noemen) met gebruik van exact hetzelfde superintelligente model (een specifieke versie van een AI genaamd gpt-5.6-luna) om ervoor te zorgen dat de vergelijking eerlijk was.
Zo speelden de vier teams het spel:
- Team A (De Directe Schrijver): Deze robot hoort je vraag en probeert onmiddellijk de computercode (SQL) te schrijven om het antwoord te krijgen. Het is alsof je een student vraagt een wiskundeprobleem op een whiteboard op te lossen zonder de tussenstappen te laten zien.
- Team B (De Tool Gebruiker): Deze robot schrijft geen code. In plaats daarvan heeft hij een gereedschapskist. Hij moet de juiste tools kiezen (zoals "getallen optellen" of "sorteren op datum") en deze in de juiste volgorde aanklikken. Het is als een chef die alleen met vooraf bereide ingrediënten en specifieke keukenapparaten kan werken.
- Team C (De Planner): Deze robot schrijft geen code of kiest geen tools. In plaats daarvan schrijft hij een strikt, gestructureerd semantisch verzoek—een zeer specifiek, georganiseerd plan dat precies aangeeft welke data nodig is. Een apart, saai maar perfect computerprogramma neemt dit plan vervolgens en zet het om in code. Het is alsof een student een perfecte outline schrijft, en een ander persoon de uiteindelijke essay schrijft op basis van die outline.
- Team D (De Verduidelijker): Dit is de oudere broer van Team C. Hij schrijft ook een plan, maar als de vraag verwarrend is, mag hij om verduidelijking vragen of onthouden wat er eerder in het gesprek is gezegd. Het is als een detective die terug kan gaan en kan vragen: "Wacht, bedoelde je de rode draak of de blauwe?"
De Resultaten: Geen Perfecte Winnaars
Na het draaien van in totaal 4.800 tests (1.200 vragen voor elk van de vier teams), waren de resultaten verrassend. De belangrijkste conclusie? Er is niet één "beste" robot. Het is een afweging, zoals het kiezen tussen een sportwagen, een vrachtwagen en een zuinige sedan. Je kunt niet de snelheid van de sportwagen, de laadkracht van de vrachtwagen én het brandstofverbruik van de sedan in één voertuig hebben.
Dit is wat de data liet zien:
1. De Race om Accuratesse
Als je gewoon het juiste antwoord wilt, was Team C (De Planner) de winnaar, maar het was geen overtuigende overwinning.
- Team C kreeg het juiste antwoord 25,67% van de tijd.
- Team D (De Verduidelijker) kwam op de tweede plaats met 24,25%.
- Team B (Tool Gebruiker) zat op 22,58%.
- Team A (Directe Schrijver) was laatst met 22,25%.
Hoewel Team C statistisch gezien beter was dan de anderen, merkt het paper op dat het juiste antwoord krijgen in slechts ongeveer 1 op de 4 gevallen nog steeds vrij laag is. Zelfs het "beste" ontwerp had moeite met de complexiteit van de vragen.
2. De Race om Veiligheid en Regels
Hier wisselden de teams van plek.
Team A (De Directe Schrijver) was de veiligste. Het volgde de regels (het beleid) het beste (43,67%) en was het minst geneigd om iets gevaarlijks of ongeldigs te doen (**3
Team D (De Verduidelijker) was de meest beleefde (weigerde slechts 0,17% van de keren) maar de riskantste. Het had de hoogste score op onveilige of ongeldige acties (64,08%). Het probeerde zo graag behulpzaam te zijn, dat het soms de regels overtrad.
3. Kosten en Stabiliteit
- Team D was het goedkoopst om te draaien, met een gemiddelde kostenpost van slechts $0,000469 per vraag.
- Team C was het meest stabiel. Wanneer ze dezelfde vraag drie keer stelden, gaf Team C in 98,67% van de gevallen hetzelfde correcte antwoord. Team B was het minst stabiel en herhaalde het antwoord slechts in 92,00% van de gevallen correct.
4. De "Taal" Verrassing
De onderzoekers merkten ook op dat elk team slechter presteerde wanneer de vragen in het Braziliaans-Portugees waren vergeleken met het Engels. Bijvoorbeeld: Team C haalde 31,00% goed in het Engels, maar slechts 20,33% in het Portugees. Dit suggereert dat zelfs met het beste ontwerp, taalverschillen nog steeds grote problemen veroorzaken.
Wat dit betekent voor de toekomst
Het paper sluit expliciet de gedachte uit dat "meer structuur altijd beter is". Je zou denken dat het dwingen van de robot om een gedetailleerd plan te schrijven (Team C) of om verduidelijking te vragen (Team D) alles zou oplossen. De data zegt nee. Het toevoegen van structuur veranderde hoe de robots faalden, maar het loste het feit niet magisch op dat ze nog steeds het grootste deel van de tijd het verkeerde antwoord gaven.
- Team A is veilig, maar geeft vaak te snel op.
- Team B is oké, maar inconsistent.
- Team C is het meest accuraat en stabiel, maar niet perfect.
- Team D is goedkoop en beleefd, maar gevaarlijk en minder accuraat.
De auteur concludeert dat we niet alleen naar de "winnaar" moeten kijken met de hoogste accuratesse-score. In plaats daarvan moeten we het hele plaatje bekijken: Geven we meer om veiligheid (Team A)? Geven we meer om het juiste antwoord (Team C)? Of geven we meer om het besparen van geld (Team D)?
De studie suggereert dat we, voor nu, zelfs met de slimste AI-ontwerpen nog steeds worstelen met het perfect begrijpen van complexe zakelijke vragen. De weg vooruit is niet alleen het bouwen van een "betere" robot; het is het begrijpen van de specifieke afwegingen van elk ontwerp en het kiezen van het juiste instrument voor de specifieke taak. Zoals het paper stelt: dit is nog geen "opgelost probleem"; het is een kaart die ons de valkuilen laat zien, zodat we in de toekomst betere systemen kunnen bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.