Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
Dit artikel behandelt het probleem van LLM-hallucinaties door een robuuste evaluatiebenchmark voor te stellen die rekening houdt met pretrainingdata en door een nieuwe methode te introduceren om de eerlijkheid van het model te vergroten via de retrieval van die pretrainingdata.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een briljante maar overmoedige student voor genaamd "LLM" die miljarden boeken heeft gelezen tijdens zijn training. Deze student is geweldig in het beantwoorden van vragen, maar heeft een grote tekortkoming: hij weet niet wat hij niet weet. Wanneer hem een vraag wordt gesteld over een onderwerp dat hij nog nooit heeft gezien, verzint hij in plaats daarvan zelfverzekerd een verhaal. In de wereld van AI wordt dit een hallucinatie genoemd.
Het paper dat je deelde stelt dat we, om AI betrouwbaar te maken, de AI moeten leren het verschil te begrijpen tussen "Ik weet dit" en "Ik weet dit niet". Hier is een uiteenzetting van hun oplossing, gebruikmakend van eenvoudige analogieën.
Het Probleem: De "Black Box" Blinde Vlek
Meestal, wanneer onderzoekers proberen te testen of een AI eerlijk is, behandelen ze de AI als een black box (zwarte doos). Ze stellen vragen en kijken wat de AI zegt, maar ze weten niet precies welke boeken de AI heeft gelezen om zijn feiten te leren.
- De Tekortkoming: Als de AI een vraag fout beantwoordt, gaan onderzoekers ervan uit dat de AI het antwoord "niet weet". Maar misschien heeft de AI het antwoord wel gelezen in zijn trainingsboeken; hij is het alleen vergeten of raakte in de war.
- Het Resultaat: Eerdere tests waren oneerlijk omdat ze niet konden onderscheiden of de AI loog (hallucineerde) of gewoon een slechte dag had (vergat).
De Oplossing: De "Open Boek" Benadering
De auteurs gebruikten een speciaal, open-source AI-model genaamd Pythia. Het grote voordeel? Wij hebben de volledige bibliotheek met boeken die deze AI heeft gelezen.
- De Analogie: Stel je voor dat je de student een specifieke lijst geeft van elk boek dat hij heeft bestudeerd. Nu, wanneer je een vraag stelt, kun je daadwerkelijk de bibliotheek controleren om te zien: "Heeft deze student het antwoord op deze vraag gelezen?"
- De Nieuwe Benchmark: Ze creëerden een nieuwe test (genaamd TIP-TRIVIAQA) waarbij we precies weten welke vragen de AI zou moeten weten (omdat het antwoord in zijn trainingsboeken staat) en welke hij niet zou moeten weten (omdat het antwoord nergens in zijn boeken voorkomt). Dit creëert een gelijk speelveld om eerlijkheid te meten.
De Methode: Het "Librarian" Systeem (RETAIN)
Om de eerlijkheid van de AI te verbeteren, zeiden de auteurs niet simpelweg dat de AI "eerlijk moet zijn". Ze bouwden een drieslagig systeem genaamd RETAIN dat fungeert als een slimme bibliothecaris:
De Retriever (De Zoeker):
Wanneer je een vraag stelt, gaat deze agent direct naar de "bibliotheek" van de AI (de pretraining data) om naar het antwoord te zoeken. Het is alsoals een bibliothecaris die boeken uit de kast pakt om te zien of het antwoord erin staat.De Answerability Classifier (De Poortwachter):
Deze agent kijkt naar de boeken die de zoeker heeft gevonden. Hij vraagt: "Bevat dit boek daadwerkelijk het antwoord?"- Als Ja: Dan geeft hij het boek door aan de volgende agent.
- Als Nee: Dan stopt het proces en zegt hij tegen de AI: "We hebben het antwoord niet in onze bibliotheek. Zeg 'ik weet het niet'."
De Responder (De Spreker):
Dit is de AI die daadwerkelijk met jou praat. Hij spreekt alleen als de Poortwachter groen licht geeft en een relevant boek ter hand heeft. Als de Poortwachter "Nee" zegt, zegt de Responder simpelweg: "Ik weet het niet."
Waarom Dit Werkt
Het paper vond dat deze methode veel beter is dan eerdere trucjes.
- Oude Manier: De AI simpelweg vertellen "Als je het niet zeker weet, zeg dan 'ik weet het niet'" werkte niet goed. De AI probeerde nog steeds te gokken.
- RETAIN Manier: Door eerst het bronmateriaal fysiek op te halen, krijgt de AI een "reality check". De AI kan zien: "Oh, het antwoord staat niet in mijn boeken," waardoor hij eerlijk toegeeft dat hij het niet weet.
- Bonus: Wanneer het antwoord wel in de boeken staat, geeft de AI een veel nauwkeuriger antwoord omdat hij op dat moment het bronmateriaal leest, in plaats van alleen te vertrouwen op zijn geheugen.
De Resultaten
Toen ze dit nieuwe systeem testten:
- Was het veel beter in het zeggen van "ik weet het niet" wanneer het antwoord niet in de trainingsdata zat.
- Was het veel beter in het correct beantwoorden van vragen wanneer het antwoord wel in de data zat.
- Presteerde het beter dan alle andere methoden die ze testten, wat bewees dat de AI toegang geven tot zijn eigen "broncode" (de boeken die hij las) de sleutel is om hem eerlijk te maken.
Kortom: Het paper laat zien dat om te voorkomen dat AI dingen verzint, je de AI niet alleen niet moet vertellen dat hij eerlijk moet zijn. In plaats daarvan moet je hem een hulpmiddel geven om eerst zijn eigen bibliotheek te controleren. Als het antwoord daar niet staat, moet hij eerlijk genoeg zijn om te zeggen: "Ik heb dat niet gelezen."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.