Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
Dit artikel introduceert Spider 2.0-AIFunc, een nieuwe benchmark van 465 geverifieerde instanties verspreid over 125 real-world databases, ontworpen om het vermogen van grote taalmodellen om AI-native SQL-queries te genereren op het Snowflake-platform te evalueren, waarbij wordt onthuld dat hoewel top propriëtaire modellen een nauwkeurigheid van 67-70% bereiken, huidige agent-frameworks die geoptimaliseerd zijn voor traditionele text-to-SQL-taken niet effectief overdraagbaar zijn naar deze opkomende setting.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, hoogtechnologische bibliotheek hebt (een clouddatabase) waar mensen alles opslaan, van klantbeoordelingen tot verkoopcijfers. Jarenlang vereiste het stellen van vragen over deze bibliotheek een zeer strikte, robotische taal genaamd SQL. Het was alsof je een complex gerecht in een restaurant probeerde te bestellen door alleen in een code van cijfers en symbolen te spreken.
Onlangs hebben de eigenaren van de bibliotheek (zoals Snowflake) een nieuwe functie toegevoegd: AI-functies. Denk aan deze als "slimme assistenten" die direct in het bestelsysteem zijn ingebouwd. Nu kun je, in plaats van alleen te vragen om "alle rode appels", het systeem vragen om "de beoordelingen van deze appels te lezen en mij te vertellen of mensen blij of boos zijn", of "zoeken naar beoordelingen die lijken op deze". Dit verandert de database in een AI-native systeem, waarbij je standaard datacommando's kunt combineren met slim, taalgebaseerd denken in één enkele zin.
Het Probleem: De Oude Kaart Werkt Niet Meer
De onderzoekers merkten op dat hoewel deze nieuwe "slimme assistenten" krachtig zijn, de tests die werden gebruikt om computerbreinen (AI-modellen) te trainen en te controleren, verouderd waren. De oude tests controleerden alleen of de computer de strikte, robotische taal kon spreken. Ze controleerden niet of de computer de nieuwe "slimme assistenten" kon gebruiken. Het was alsojd een bestuurder testte op een rechte, lege weg, terwijl de echte wereld nu verkeer, voetgangers en wegwerkzaamheden heeft.
De Oplossing: Spider 2.0-AIFunc
Om dit op te lossen, creëerde het team een nieuwe, moeilijkere rijtest genaamd Spider 2.0-AIFunc.
- De Transformatie: Ze namen 513 bestaande "rijtests" (vragen over data) en schreven deze opnieuw. Ze dwongen de vragen om de nieuwe "slimme assistenten" te vereisen.
- Oude Vraag: "Toon alle negatieve beoordelingen." (Vereist dat een mens ze eerst leest).
- Nieuwe Vraag: "Toon alle beoordelingen waar de AI-assistent zegt dat het sentiment negatief is." (De AI doet het lezen binnen de database).
- De Bouwploeg: Ze gebruikten een team van AI-agenten (digitale werkers) om deze vragen te herschrijven. Deze agenten fungeerden als redacteuren en monteurs:
- Ze controleerden of de instructies duidelijk waren (bijv. "Wat bedoel je precies met 'negatief'?").
- Ze zorgden ervoor dat de "slimme assistent" over alle juiste instrumenten (parameters) beschikte om de klus te klaren.
- Ze draalden de tests herhaaldelijk om er zeker van te zijn dat de antwoorden stabiel waren en niet veranderden alleen omdat de AI-assistent een slechte dag had.
- Het Eindexamen: Het resultaat is een benchmark van 465 geverifieerde vragen verspreid over 125 verschillende databases. Het dekt zes soorten "slimme assistent"-taken, zoals het sorteren van beoordelingen op emotie, het vinden van vergelijkbare tekst, of het extraheren van specifieke details uit een paragraaf.
De Resultaten: Wie Is Er Geslaagd?
De onderzoekers lieten 10 verschillende AI-modellen (de "bestuurders") dit nieuwe examen afleggen om te zien hoe goed ze deze complexe, AI-gestuurde queries konden schrijven.
- De Topbestuurders (Proprietary Modellen): De grote, gesloten modellen (zoals Claude Opus en Gemini) presteerden het best. Ze kregen ongeveer 67% tot 70% van de antwoorden goed. Ze waren goed in het uitzoeken welke "slimme assistent" te gebruiken en hoe de juiste vraag aan deze assistent gesteld moest worden.
- De Open-Source Bestuurders: De beste open-source modellen (zoals Kimi K2.5) scoorden rond de 58%. Ze waren redelijk, maar maakten meer fouten.
- De Kloof: De belangrijkste reden dat de open-source modellen moeite hadden, was niet dat ze de basiscode niet konden schrijven. Ze struikelden over de "slimme" onderdelen:
- Misverstanden over de regels: Het kiezen van de verkeerde tabel of kolom.
- Slechte instructies: Vergeten de AI-assistent precies te vertellen waar hij naar moet zoeken (bijv. niet alle mogbare categorieën vermelden voor een classificatietaak).
- Logische fouten: Het door elkaar halen van de volgorde van bewerkingen (bijv. data filteren na het vragen aan de AI in plaats van ervóór).
De Verrassende Ontdekking: Minder is Meer
De onderzoekers testten ook of het gebruik van complexe "agent frameworks" (uitgebreide toolkits die de AI helpen bij het plannen van zijn stappen) hielp.
- De Bevinding: Verrassend genoeg hielpen de meest complexe toolkits niet veel. Sterker nog, een minimale opstelling — slechts een simpele tool om naar de database te kijken en een tool om de query uit te voeren — presteerde net zo goed als, of zelfs beter dan, de fancy frameworks.
- De Metafoor: Het is alsof je een meesterkok een klein, simpel mes geeft in plaats van een enorme, ingewikkelde Zwitserse zakmes. Voor dit specifieke soort koken (AI-Native SQL) had de meesterkok de extra gadgets niet nodig; hij moest alleen weten hoe hij het mes moest gebruiken. De complexe frameworks die ontworpen zijn voor de ouderwetse data-taken, stonden in de weg of voegden geen waarde toe voor deze nieuwe, slimme taken.
Samenvatting
Dit paper introduceert een nieuwe, realistische test voor AI-modellen die controleert of ze moderne "AI-gestuurde" databasefuncties kunnen gebruiken. Het toonde aan dat hoewel de beste AI-modellen goed worden, er nog steeds een kloof bestaat tussen de topmodellen en de open-source modellen. De sleutel tot succes is niet het gebruik van complexere planningsinstrumenten, maar het exact goed krijgen van de basisinstructies en parameters voor de AI-functies.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.