PRACTIQ: A Practical Conversational Text-to-SQL dataset with Ambiguous and Unanswerable Queries
Dit artikel introduceert PRACTIQ, een nieuwe conversationele text-to-SQL dataset met ambigue en onbeantwoordbare queries geïnspireerd door interacties uit de echte wereld, en toont via op LLM gebaseerde baselines aan dat huidige state-of-the-art systemen moeite hebben met het effectief afhandelen van deze praktische uitdagingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een bibliothecaris probeert te vragen naar een specifiek boek. In de perfecte wereld van de meeste computerwetenschappelijke tests loop je naar voren en zeg je: "Ik wil het boek van Auteur X gepubliceerd in 1990," en de bibliothecaris overhandigt je direct het juiste boek.
Maar in de echte wereld is het rommeliger. Je zegt misschien: "Ik wil het boek van Auteur X," maar de bibliotheek heeft drie boeken van die auteur en je hebt niet gespecificeerd welke. Of je vraagt naar een boek dat helemaal niet in hun collectie voorkomt. Als de bibliothecaris gewoon gokt of zegt "Dat kan ik niet doen" zonder uit te leggen waarom, raak je gefrustreerd.
Dit artikel, PRACTIQ, gaat over het leren van computers (specifiek AI-systemen die menselijke vragen omzetten in database-queries) hoe ze met deze rommelige, echte situaties om moeten gaan.
Hier is een uitsplitsing van wat ze hebben gedaan, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Te Perfecte" Bibliothecaris
De meeste bestaande AI-trainingsdata zijn als een bibliotheek waar elk verzoek perfect is. De gebruiker stelt een heldere vraag en het antwoord bestaat.
- De Realiteit: Echte gebruikers stellen verwarrende vragen (Ambigu) of vragen naar zaken die niet bestaan (Onbeantwoordbaar).
- De Kloof: Huidige AI-systemen zijn geweldig in de "perfecte" vragen, maar crashen of geven onzinnige antwoorden wanneer ze geconfronteerd worden met verwarring of ontbrekende gegevens. Ze zijn niet getraind om te zeggen: "Wacht even, bedoel je dit boek of dat boek?" of "Sorry, we hebben dat boek niet."
2. De Oplossing: Een "Rommelige" Bibliotheek Bouwen (PRACTIQ)
De auteurs creëerden een nieuwe dataset genaamd PRACTIQ. Zie dit als een trainingshandleiding voor een nieuwe bibliothecaris die vol staat met moeilijke, verwarrende en onmogelijke verzoeken.
Ze identificeerden 8 specifieke soorten problemen:
- 4 Soorten Verwarring (Ambigu):
- Voorbeeld: Je vraagt naar "de leeftijd" van een bezoeker. De database heeft "Leeftijd bij binnenkomst" en "Huidige leeftijd". Welke bedoel je?
- Voorbeeld: Je vraagt naar "jonge" mensen. Betekent dat onder de 18? Onder de 21? De definitie is vaag.
- 4 Soorten Onmogelijkheid (Onbeantwoordbaar):
- Voorbeeld: Je vraagt naar de "bijnaam" van een winnaar, maar de database heeft alleen hun juridische namen. De informatie is er simpelweg niet.
- Voorbeeld: Je vraagt om twee datalijsten met elkaar te verbinden die geen link hebben (zoals het proberen samen te voegen van een lijst met studenten met een lijst met bibliotheekboeken wanneer er geen gedeelde ID is).
3. Hoe ze de Data hebben Gemaakt: De "Reverse Engineering" Truc
In plaats van alleen maar nepvragen te schrijven, gebruikten ze een slim drie-stappenproces om realistische gesprekken op te bouwen:
- Fase 1: De Database Breken: Ze namen een normale, schone database en maakten deze opzettelijk "kapot" of maakten het verwarrend. Ze verwijderden bijvoorbeeld een kolom of voegden twee kolommen toe die op elkaar lijken maar iets anders betekenen.
- Fase 2: Het Gespreksscript: Ze vroegen een AI om een script te schrijven waarbij:
- De Gebruiker een verwarrende vraag stelt.
- De Assistent (de AI) de verwarring opmerkt en vraagt: "Bedoel je X of Y?"
- De Gebruiker verduidelijkt: "Oh, ik bedoelde X."
- De Assistent het juiste antwoord geeft en dit in begrijpelijke taal uitlegt.
- Speciale Twist: Soms, in plaats van om verduidelijking te vragen, is de assistent slim genoeg om beide antwoorden tegelijk te geven om extra behulpzaam te zijn.
- Fase 3: Polijsten: Ze gebruikten opnieuw AI om het gesprek natuurlijk te laten klinken, alsof twee mensen met elkaar praten, in plaats van een robot die een script voorleest.
4. De Test: Kan de AI de Chaos Aan?
De auteurs testten de slimste AI-modellen van dit moment (zoals Claude 3.5 en Llama 3) met deze nieuwe "rommelige" dataset.
De Resultaten:
- De AI heeft nog steeds moeite. Zelfs de beste modellen kregen ongeveer 70-77% van de antwoorden goed bij de verwarrende vragen.
- De "Perfect" vs. "Real" Kloof: Deze modellen zijn geweldig in de schone, perfecte vragen (ze scoren ongeveer 79% goed), maar hun prestaties dalen aanzienlijk wanneer de vraag ambigu is of de data ontbreekt.
- De Les: Huidige AI is als een student die het tekstboek uitwendig kent, maar zakt voor een onverwachte toets wanneer de leraar een lastige vraag stelt. Ze hebben meer training nodig in hoe ze met verwarring en ontbrekende informatie om moeten gaan.
Samenvatting
Het artikel introduceert PRACTIQ, een nieuwe dataset die ontworpen is om AI te leren hoe het met real-world verwarring moet omgaan. Het laat zien dat hoewel AI steeds beter wordt in het omzetten van vragen naar database-opdrachten, het nog steeds moet leren hoe het beleefd om verduidelijking vraagt wanneer een vraag vaag is, of moet toegeven wanneer een antwoord niet bestaat, in plaats van gewoon te gokken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.