EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge
Dit artikel introduceert EntSQL, een nieuwe Chinees-Engelse benchmark bestaande uit 1.066 voorbeelden over vijf zakelijke domeinen, ontworpen om de uitdagingen van het gronding van Text-to-SQL-generatie in langetermijncontext van bedrijfsgegevens te evalueren, waarbij huidige modellen moeite hebben om een hoge nauwkeurigheid te bereiken vanwege de noodzaak voor specifieke zakelijke kennis.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, goed onderlegde bibliothecaris hebt (een AI) die weet hoe hij menselijke taal spreekt en hoe hij "database-taal" (SQL) spreekt. Normaal gesproken, als je deze bibliothecaris vraagt: "Hoeveel boeken hebben we vorige maand verkocht?", kan hij de catalogus van de bibliotheek (het databaseschema) bekijken en een perfecte notitie schrijven aan de assistent van de bibliothecaris om het antwoord op te halen.
Maar in de echte wereld van grote bedrijven is het niet zo simpel. Het bedrijf heeft een geheim regelboek dat niemand buiten het gebouw kent. Misschien betekent "vorige maand" eigenlijk "het fiscale kwartaal eindigend in juni", of sluiten "top producten" artikelen uit die momenteel in de uitverkoop zijn. Als de bibliothecaris dit geheime regelboek niet heeft, zal hij gokken, en zal zijn notitie fout zijn.
Ontmoet "EntSQL": De Test voor het Geheime Regelboek
Dit artikel introduceert een nieuwe test genaamd EntSQL. Zie dit als een eindexamen voor AI-bibliothecarissen, maar in plaats van hen alleen te vragen de catalogus van de bibliotheek te lezen, geeft het examen hen een enorme, 50 pagina tellende private bedrijfs-handbook en vraagt hen een query te schrijven op basis daarvan.
Hier is de uitsplitsing van wat het artikel heeft gevonden, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Ontbrekende Handleiding"
Bestaande tests voor deze AI-bibliothecarissen (zoals Spider of BIRD) zijn alsof je ze een generieke bibliotheekcatalogus geeft. Ze zijn goed in het vinden van boeken als de catalogus duidelijk is. Maar in een echt bedrijf is de "catalogus" (de database) nutteloos zonder het "personeelshandboek" (de private bedrijfsregels).
- De Analogie: Stel je voor dat je een AI vraagt: "Hoeveel hebben we uitgegeven aan 'Project X'?" De database heeft alleen een kolom genaamd
cost. Het weet niet dat "Project X" eigenlijk een codenaam is voor "Marketing", of dat het alleen kosten telt na een specifieke datum. Zonder het private handboek vliegt de AI blind.
2. De Test: EntSQL
De onderzoekers hebben een test gebouwd met gebruik van echte (maar geanonimiseerde) gegevens van vijf verschillende bedrijfsafdelingen: Financiën, Treasury, HR, Business Management en Party Building.
- De Opzet: Ze gaven de AI een vraag, de databasestructuur en een lang, rommelig document met de specifieke regels van het bedrijf.
- De Moeilijkheidsgraad: De vragen waren lastig. Ze vereisten dat de AI een lang document las, de specifieke regel over "fiscale jaren" of "bonusberekeningen" vond, en dat vervolgens combineerde met de database om een complexe computinstructie te schrijven.
- De Schaal: De test bevatte meer dan 1.000 vragen. De "gouden standaard" antwoorden (de correcte instructies) waren erg lang en complex, zoals een code-alinea van 400 woorden.
3. De Resultaten: De AI Heeft Nog Steeds Moeite
De onderzoekers testten de slimste AI-modellen ter wereld (zoals Claude, GPT-4 en anderen) op dit examen.
- De Score: Zelfs de beste AI kreeg slechts ongeveer 16% van de antwoorden goed wanneer ze de lange documenten kregen.
- De Analogie: Het is alsof je een briljante student een tekstboek van 500 pagina's geeft en hem vraagt een wiskundeprobleem op te lossen. Hij weet hoe hij wiskunde moet doen, maar hij kan de specifieke regel in het boek niet vinden die van toepassing is op dit specifieke probleem. Hij raakt verdwaald in de tekst.
- De "Bewijs" Hint: Wanneer de onderzoekers de AI een gehighlighte versie van het boek gaven (slechts de 2 of 3 zinnen die er toe deden), steeg de score naar ongeveer 21%. Dit bewijst dat de AI niet slecht is in wiskunde; het is gewoon slecht in het vinden van de naald in de hooiberg.
4. Waar Ze Faalden
De onderzoekers keken naar waarom de AI fouten maakte. Het was meestal niet omdat de AI vergat hoe hij de code moest schrijven.
- De Hoofdfout (54%): De AI miste de "filter". Het was alsof je vroeg om "rode auto's" en de AI kwam terug met "alle auto's" of "blauwe auto's". Het kon de specifieke regels uit het document niet correct toepassen op de data.
- De Scope-fout (14%): De AI keek naar de verkeerde periode of de verkeerde afdeling. Het was alsof het budget voor "2023" berekende terwijl de vraag over "2024" ging.
5. De Menselijke Kloof
De onderzoekers vroegen ook aan een menselijke expert om dezelfde test te maken.
- De Kloof: De menselijke expert kreeg ongeveer 84% goed wanneer hij de gehighlighte aantekeningen kreeg. De AI kreeg 20%.
- De Conclusie: Er is een enorme kloof tussen wat een mens kan met een bedrijfs-handboek en wat de huidige AI kan doen. De AI is nog steeds erg slecht in het begrijpen van de "ongeschreven regels" van een specifiek bedrijf.
Samenvatting
EntSQL is een nieuwe benchmark die zegt: "Stop met alleen te testen of AI een database kan lezen. Test of het een geheim regelboek van een bedrijf kan lezen en dit kan toepassen."
Het artikel concludeert dat hoewel AI beter wordt in het schrijven van code, het momenteel erg slecht is in het funderen van die code in de rommelige, private, contextrijke kennis waar echte bedrijven op vertrouwen. Het is een herinnering dat voor AI om echt te kunnen helpen op kantoor, het veel beter moet worden in het lezen van de kleine lettertjes.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.