A Unified Definition of Hallucination: It's The World Model, Stupid!
Dit artikel stelt een verenigde definitie van hallucinatie voor als een onnauwkeurige interne wereldmodellering die waarneembaar is voor de gebruiker, waarbij wordt betoogd dat dit kader eerdere definities omvat, evaluatiestandaarden verheldert door referentiewerelden te specificeren, en hallucinaties onderscheidt van andere fouttypen om betere benchmarking- en mitigatiestrategieën te faciliteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een spelletje "Telefoontje" speelt met een zeer slimme, maar lichtelijk verwarde robot. Je geeft de robot een verhaal, een plaatje of een reeks regels, en vraagt de robot om te vertellen wat er is gebeurd. Soms vertelt de robot je iets dat zelfverzekerd en vloeiend klinkt, maar dat volledig verzonnen is. In de techwereld noemen we dit een hallucinatie.
Maar hier is het probleem: iedereen discussieert over wat precies als een hallucinatie telt.
- Als een robot een nieuwsartikel samenvat en een feit fout krijgt, is het dan een hallucinatie?
- Als een robot een trivia-vraag uit zijn geheugen beantwoordt en het fout heeft, is het dan een hallucinatie?
- Als een robot probeert op een knop op een website te klikken die niet bestaat, is het dan een hallucinatie?
Sommige onderzoekers zeggen "ja" tegen alle drie. Anderen zeggen "nee, dat is gewoon een foutje". Deze verwarring maakt het moeilijk om het probleem op te lossen.
Dit artikel betoogt dat we moeten stoppen met discussiëren over de definitie en moeten beginnen met kijken naar de grondoorzaak. De auteurs stellen een simpel, verenigd idee voor: Hallucinatie is simpelweg een kapot "Wereldmodel".
Het Kernidee: De Interne Kaart van de Robot
Denk aan de robot als een ontdekkingsreiziger die een stad probeert te navigeren. Hiervoor heeft de robot een kaart nodig (een Wereldmodel).
- De Referentiewereld: Dit is de echte kaart. Het is de grondwaarheid. Het kan het nieuwsartikel zijn dat je hem gaf, de werkelijke regels van schaken, de echte database van een bedrijf, of de live code van een website.
- De Blik van de Robot: Dit is wat de robot daadwerkelijk mag zien. Miss�of de robot ziet het hele artikel, of hij ziet slechts een klein fragment.
- De Conflictregel: Dit is de scheidsrechter. Als het geheugen van de robot zegt "De lucht is groen" maar het artikel zegt "De lucht is blauw", wie wint er dan? Meestal wint het artikel (de Referentiewereld).
De Definitie van het Papier:
Een hallucinatie vindt alleen plaats wanneer de output van de robot in strijd is met de Referentiewereld op basis van de Conflictregel.
Als de robot zegt: "De lucht is groen," en de Referentiewereld (het artikel) zegt "De lucht is blauw," dan heeft de robot een kapotte kaart. Hij hallucineert.
Waarom dit alles verenigt
De auteurs laten zien dat al de verschillende soorten "hallucinaties" waar mensen over praten, eigenlijk hetzelfde zijn wat in verschillende kamers gebeurt:
- Samenvatting: De "Referentiewereld" is het brondocument. Als de samenvatting in strijd is met het document, is de kaart van de robot van dat document fout.
- Trivia (Open QA): De "Referentiewereld" zijn de feitelijke feiten van het universum (bijv. wie de Nobelprijs won). Als de robot fout gokt op basis van zijn training, is zijn interne kaart van de werkelijkheid fout.
- Web Browsen (Agents): De "Referentiewereld" is de werkelijke websitecode (de DOM). Als de robot zegt "Ik heb op de Submit-knop geklikt" maar de code laat zien dat er geen dergelijke knop bestaat, hallucineert de robot een object dat er niet is.
Het "Domme" Deel: Het is de Kaart, Niet de Robot
De titel luidt: "It's The World Model, Stupid!" Dit is een verwijzing naar een beroemde politieke slogan. De auteurs zeggen: Stop met de robot de schuld te geven van het "verward" zijn. Het probleem is dat zijn interne kaart van de wereld onnauwkeurig is.
Soms liegt de robot niet echt; hij kijkt gewoon naar de verkeerde kaart.
- Planningsfout: De robot weet dat de kaart klopt, maar kiest een slecht pad. (Geen hallucinatie).
- Hallucinatie: De robot denkt dat de kaart zegt "Brug hier," maar de kaart zegt eigenlijk "Afgrond." (Dit is een hallucinatie).
Hoe het op te lossen (Volgens het Papier)
Het papier suggereert dat we moeten stoppen met het bouwen van een "perfecte robot" en moeten beginnen met het bouwen van betere testomgevingen.
Ze stellen voor om synthetische werelden (zoals videogames of schaken) te gebruiken om robots te testen.
- De Schaken-analogie: Stel je een schaakspel voor waarbij de regels 100% duidelijk zijn en de stelling van het bord 100% bekend is. We kunnen de robot vragen: "Kan de witte paard naar dit veld springen?"
- Als de robot "Ja" zegt maar de regels zeggen "Nee," dan weten we exact dat zijn interne kaart van het schaakbord kapot is.
- Omdat de "Referentiewereld" (de schaakregels) perfect wordt gedefinieerd door een computer, hebben we geen mensen nodig om te raden of de robot liegt. De computer weet het direct.
Waarom dit Belangrijk is
Door een eens te worden over deze definitie, kunnen onderzoekers eindelijk:
- Appels met appels vergelijken: We kunnen zien of een nieuwe techniek daadwerkelijk hallucinaties vermindert of dat het alleen de spelregels heeft veranderd.
- Weten wat te repareren: Als een robot hallucineert omdat hij niet het hele document kan zien, repareren we de "Blik" (View). Als hij hallucineert omdat hij het document negeert ten gunste van zijn geheugen, repareren we de "Conflictregel".
- Grotere tests bouwen: We kunnen duizenden testsituaties creëren (zoals miljoenen schaakpuzzels) waarbij we het antwoord 100% van de tijd weten, zonder dat we mensen nodig hebben om alles te beoordelen.
Kortom: Het papier zegt: "Stop met discussiëren over wat een hallucinatie is. Het is simpelweg wanneer het verhaal van de robot niet overeenkomt met de werkelijkheid die we hebben afgesproken om tegen te testen. Laten we betere kaarten en betere tests bouwen zodat we de kapotte kompas van de robot kunnen repareren."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.