Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks
Deze studie introduceert de UzHistQA-dataset en demonstreert dat hoewel retrieval-augmented generation hallucinaties bij het beantwoorden van vragen over de Oezbeekse geschiedenis aanzienlijk vermindert, het afdwingen van citatie- en onthoudingsmechanismen noodzakelijk is om gefabriceerde antwoorden volledig te elimineren, wat de noodzaak benadrukt om de kwaliteit van retrieval en de getrouwheid van generatie apart te evalueren in talen met beperkte middelen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het moderne klaslokaal wenden leerlingen zich steeds vaker tot kunstmatige intelligentie om moeilijke concepten uit te leggen, hoofdstukken samen te vatten of zich voor te bereiden op toetsen. Deze digitale assistenten zijn gebouwd op grote taalmodellen, systemen die getraind zijn op enorme hoeveelheden tekst en die vloeiende, zelfverzekerde en vaak overtuigende antwoorden kunnen genereren. Er ontstaat echter een specifiek risico wanneer een leerling een vraag stelt waar hij het antwoord nog niet op weet: hij mist de kennis om het antwoord te verifiëren. Als het systeem een feit verzint, blijft de fout onopgemerkt en leert de leerling iets onjuists. Om dit op te lossen, hebben onderzoekers een methode ontwikkeld die retrieval-augmented generation wordt genoemd. In plaats van uitsluitend te vertrouwen op het interne geheugen van het model, doorzoekt het systeem eerst een specifiek, betrouwbaar document — zoals een geschiedenisboek voor de middelbare school — om de relevante passage te vinden voordat het antwoord geeft. Dit houdt de reactie geworteld in de realiteit, maar het garandeert geen perfectie. Het systeem kan nog steeds falen in het vinden van de juiste passage, of het kan de juiste passage vinden en deze vervolgens negeren, of het kan de gevonden informatie verkeerd interpreteren.
Deze onzekerheid is bijzonder acuut in het Oeigoez met miljoenen sprekers, maar beschouwd wordt als een "low-resource" taal in de wereld van kunstmatige intelligentie. In tegenstelling tot het Engels, dat domineert in de data die gebruikt worden om deze modellen te trainen, zijn er minder digitale teksten beschikbaar voor het Oeigoez. Bovendien is het Oeigoez een agglutinerende taal, wat betekent dat een enkel stamwoord kan worden aangepast met vele verschillende uitgangen om een enorme variëteit aan oppervlaktevormen te creëren. Een leerling die vraat naar "onafhankelijkheid" kan een woordvorm gebruiken die er totaal anders uitziet dan de vorm die in het tekstboek wordt gebruikt, waardoor het zoeksysteem het antwoord volledig kan missen. Tot nu toe was er geen standaardmethode om te testen hoe goed deze systemen werken voor de Oeigoezische geschiedenis of om te meten hoe vaak ze dingen verzinnen.
Een recente studie door onafhankelijk onderzoeker Ruzimboy Kholmurotov pakt dit gat aan door een specifieke testset genaamd UzHistQA op te bouwen, gebaseerd op een officieel geschiedenisboek voor de tiende klas dat de jaren 1917 tot 1991 behandelt. De onderzoeker analyseerde het tekstboek en vond een aanzienlijke taalkundige hindernis: van bijna 31.000 woorden in het boek verscheen meer dan de helft van de unieke woordvormen slechts één keer. Deze extreme variëteit betekent dat een eenvoudige zoekopdracht naar exacte woordovereenkomsten waarschijnlijk zal falen. Om te testen hoe dit overwonnen kan worden, creëerde de studie 56 vragen, inclusief enkele die het tekstboek simpelweg niet kon beantwoorden, om te zien of het systeem zijn onwetendheid zou toegeven of een antwoord zou verzinnen. De onderzoeker vergeleek vervolgens vier verschillende manieren om het systeem te laten draaien: één die uitsluitend vertrouwde op zijn interne geheugen, één die het tekstboek doorzocht met een standaard semantische zoekopdracht, één die dat combineerde met een trefwoordzoekopdracht, en een laatste versie die strikt werd geïnstrueerd om zijn bron te citeren en te weigeren te antwoorden als de bewijslast ontbrak.
De resultaten waren schokkend. Wanneer het systeem alleen vertrouwde op zijn interne geheugen zonder het tekstboek te raadplegen, maakte het in 91 procent van de gevallen ongefundeerde of verzonnen claims. Het fabriceerde vol zelfvertrouwen data, namen en lijsten voor vragen die niet in het tekstboek voorkwamen. Wanneer het systeem werd gedwongen eerst het tekstboek te raadplegen, daalde het percentage van deze ongefundeerde claims drastisch naar slechts 9 procent. Dit bevestigde dat het funderen van de antwoorden in de werkelijke tekst essentieel is voor betrouwbaarheid. De studie onthulde echter ook een verrassende complicatie. De versie die de meest geavanceerde zoekmethode gebruikte, die semantisch begrip combineerde met trefwoordmatching, vond de juiste passages vaker dan de eenvoudigere zoekopdracht. Toch produceerde dit geavanceerde systeem, ondanks het vinden van betere bewijslast, meer ongefundeerde claims dan de eenvoudigere versie. Het lijkt erop dat wanneer het systeem een grotere, diversere set passages ophaalde, de extra informatie het model in verwarring bracht, wat leidde tot onjuiste gevolgtrekkingen of berekeningen, zelfs wanneer de feiten gewoon aanwezig waren.
De meest effectieve configuratie voor veiligheid was de versie die strikte regels afdwong: het systeem moest voor elke claim de specifieke pagina citeren en kreeg de instructie om "Ik weet het niet" te zeggen als het tekstboek het antwoord niet bevatte. Deze aanpak elimineerde alle gefabriceerde antwoorden voor vragen die het tekstboek niet kon beantwoorden. Het nadeel was dat het systeem 14 procent van de vragen weigerde te beantwoorden die het wel had kunnen beantwoorden, soms zelfs wanneer het antwoord in de opgehaalde tekst aanwezig was. De onderzoeker concludeert dat deze weigering voor een educatieve setting een noodzakelijke functie is. Een leerling die een "Ik weet het niet" ontvangt, kan een leraar om hulp vragen, maar een leerling die een zelfverzekerd, gefabriceerd antwoord krijgt, leert iets onjuists en heeft geen manier om te weten dat het fout is. De studie stelt vast dat hoewel retrieval-augmented generation deze systemen levensvatbaar maakt voor het Oeigoezische onderwijs, het zorgvuldige vormgeving vereist om te voorkomen dat het systeem hallucineert, en het benadrukt dat het vinden van de juiste informatie en het schrijven van een correct antwoord twee aparte uitdagingen zijn die onafhankelijk van elkaar gemeten moeten worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.