← Nieuwste papers
💬 NLP

BEAVER: An Enterprise Benchmark for Text-to-SQL

Het artikel introduceert BEAVER, de eerste tekst-naar-SQL-benchmark afgeleid van privé-ondernemingsdatawarehouses met 9.128 real-world queries over 19 domeinen, die een aanzienlijke prestatiekloof voor state-of-the-art-modellen blootlegt en een fijnmazig evaluatiekader voorstelt om complexe uitdagingen zoals domeinkennis en het gebruik van geavanceerde functies te diagnosticeren.

Oorspronkelijke auteurs: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

Gepubliceerd 2026-05-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, rommelige bibliotheek voor waar de boeken niet zijn georganiseerd op titel of auteur, maar volgens een geheim code alleen bekend bij de bibliothecarissen. De planken zijn gelabeld met cryptische symbolen zoals "FCLT_ROOMS" in plaats van "Klasslokalen", en de boeken zijn verspreid over duizenden verschillende kamers.

Stel je nu voor dat je een bibliothecaris vraagt: "Toon me de top 10 lessen in het Kunstgebouw die plaatsvinden in ruimtes groter dan 400 vierkante voet." In een normale bibliotheek zou je dat gewoon zeggen, en ze zouden het vinden. Maar in deze geheime bibliotheek moet de bibliothecaris (een AI) het volgende doen:

  1. Raden welke 5 verschillende kamers ze moeten bekijken.
  2. Uitzoeken dat "Stata-gebouw" eigenlijk code is voor "Kamer 32".
  3. De connecties leggen tussen boeken die totaal niet met elkaar lijken te verband houden.
  4. Complexe wiskunde uitvoeren om de lessen te rangschikken.

Dit is het probleem dat BEAVER probeert op te lossen.

Het Probleem: De "Te Schone" Bibliotheek

Jarenlang hebben wetenschappers AI getraind om menselijke vragen om te zetten in databaseopdrachten (zogenaamde Text-to-SQL). Ze testten deze AI's met "oefenbibliotheken" (publieke benchmarks zoals Spider of BIRD). Deze oefenbibliotheken zijn als speelgoedsets: de planken zijn netjes, de labels zijn duidelijk en de vragen zijn eenvoudig.

In deze speelgoedsets zijn de AI's genieën, met meer dan 80% van de antwoorden correct. Maar de auteurs van dit paper zeggen: "Dat is alsof je een raceauto test op een gladde baan en er vanuit gaat dat hij door een modderig moeras kan rijden." Echte bedrijfsdatabases zijn het modderige moeras: enorm, rommelig, vol met geheim codes, en de vragen die mensen stellen zijn ongelooflijk complex.

De Oplossing: BEAVER (De Moeras Simulator)

Het team heeft BEAVER ontwikkeld, de eerste "proefrit" voor AI's met echte, rommelige data uit privébedrijfsdatabases.

  • De Data: Ze verzamelden 9.128 echte vragen en antwoorden van drie verschillende bedrijven (een universiteit, een onderzoekslaboratorium en een huisvestingsfaciliteit).
  • De Schaal: Dit zijn geen speelgoedsets. De gemiddelde database heeft meer dan 100 tabellen (planken) en bijna 900 kolommen (rijen data). De vragen zijn lang en vereisen diep nadenken.
  • De Uitbreiding: Omdat ze door privacyregels niet genoeg echte data konden krijgen, bouwden ze een "sjabloonmachine". Ze namen de structuur van echte vragen (zoals "Vind de top 10...") en mengden die met verschillende bedrijfsdetails om duizenden nieuwe, realistische oefenvragen te creëren.

De Vijf Verborgen Stappen (Subtaken)

Het paper betoogt dat het juiste eindantwoord niet één grote sprong is. Het is als een cake bakken; als je één stap verpest, mislukt de hele cake. Ze hebben de taak van de AI opgesplitst in vijf specifieke stappen om te zien waar hij faalt:

  1. De Juiste Kamers Vinden (Multi-table retrieval): Welke 5 planken moet ik bekijken?
  2. De Connecties Leggen (Join key detection): Hoe koppel ik de "Kamer"-plank aan de "Les"-plank als ze geen overeenkomstige labels hebben?
  3. De Labels Decoderen (Column mapping): Betekent "Stata-gebouw" kolom X of kolom Y?
  4. De Geheimen Kennen (Domain knowledge): Ik weet dat "Stata-gebouw" eigenlijk "Sleutel 32 Gebouw" is, zelfs al staat dat feit niet in de vraag geschreven.
  5. Het Opbreken (Query decomposition): Deze vraag is te moeilijk om in één keer te doen. Ik moet eerst deel A oplossen, dan deel B, en ze daarna combineren.

De Resultaten: Een Realiteitscheck

Toen ze de slimste beschikbare AI's (inclusief de nieuwste modellen van OpenAI en anderen) testten op BEAVER, waren de resultaten schokkend.

  • De Score: In plaats van 80%, kreeg de beste AI slechts 10,8% van de antwoorden correct.
  • De "Spiekbrief"-test: De onderzoekers gaven de AI vervolgens een "spiekbrief" (de juiste antwoorden voor die 5 verborgen stappen). Zelfs met de spiekbrief steeg de score van de AI slechts naar 30,1%.

Wat betekent dit?
Dit betekent dat de AI faalt op twee hoofdgebieden:

  1. De Basis: Hij kan zelfs niet de juiste planken vinden of de juiste connecties leggen (de 5 subtaken).
  2. De Wiskunde: Zelfs als hij weet wat hij moet doen, heeft hij moeite met de complexe wiskunde en logica die nodig is om het eindantwoord te bouwen (zoals het gebruik van geavanceerde functies of het correct organiseren van de data).

De Conclusie

Het paper concludeert dat we niet doorgaan met het trainen van AI's op nette, speelgoeddatabases. Om AI te bouwen die daadwerkelijk in echte bedrijven kan werken, moeten we stoppen met doen alsof de data schoon is. BEAVER is een nieuwe, moeilijkere test die AI-ontwikkelaars dwingt deze specifieke, rommelige problemen op te lossen voordat hun tools in de echte wereld kunnen worden vertrouwd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →