← Nieuwste papers
💬 NLP

Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models

Dit artikel onderzoekt de correlatie tussen kennisconflicten en hallucinaties in Large Language Models door interne representaties over verschillende lagen te analyseren, waarbij wordt vastgesteld dat hoewel de twee fenomenen conceptueel aan elkaar gerelateerd zijn, hallucinatiepatronen niet volledig verklaard kunnen worden door kennisconflictrepresentaties, wat daarmee de waarde van fijnmazige interpreteerbaarheidstools voor het begrijpen van LLM-gedrag benadrukt.

Oorspronkelijke auteurs: Lucrezia Laraspata, Giovanna Castellano, Gennaro Vessio

Gepubliceerd 2026-06-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lucrezia Laraspata, Giovanna Castellano, Gennaro Vessio

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je Large Language Models (LLM's) voor als ongelooflijk goed geïnformeerde bibliothecarissen die een enorme bibliotheek aan boeken uit hun hoofd hebben geleerd. Maar er is een addertje onder het gras: ze kunnen hun planken niet bijwerken. Als een boek in hun bibliotheek verouderd is of als ze een nieuw briefje krijgen dat spreekt met wat ze hebben onthouden, kunnen ze in de war raken.

Dit paper onderzoekt twee specifieke manieren waarop deze verwarring fout kan gaan:

  1. De "Hallucinatie": De bibliothecaris verzint vol vertrouwen een feit of geeft een antwoord dat echt klinkt, maar eigenlijk onjuist is.
  2. De "Kennisconflict": De bibliothecaris krijgt een briefje (context) waarin staat: "De lucht is groen," maar hun geheugen zegt: "De lucht is blauw." Ze moeten beslissen welke ze moeten vertrouwen.

De Grote Vraag

De onderzoekers wilden weten: Zijn deze twee problemen hetzelfde?

Ze vermoedden dat wanneer een bibliothecaris "hallucineert", dit komt doordat ze intern vechten tegen een "kennisconflict". Met andere woorden, ze dachten dat het brein van de bibliothecaris gonst van de verwarring (conflict) vlak voordat hij een leugen verzint (hallucinatie). Als dit waar zou zijn, zouden we een eenvoudig alarmsysteem kunnen bouwen: als we de "verwarrings-buzz" detecteren, weten we dat er een leugen aankomt.

Hoe Ze Het Testten

Om dit te testen, gedroegen de onderzoekers zich als "hersenscanners" (een techniek genaamd probing). Ze veranderden de bibliothecarissen niet; ze keken alleen even in hun hoofd tijdens verschillende stadia van het denken (de verborgen lagen, de aandachtslagen en de logische lagen) om te zien of ze de signalen van verwarring of liegen konden opmerken.

Ze gebruikten twee verschillende "bibliothecarissen" (AI-modellen):

  • LLaMA-3-8B: Ze probeerden te zien of de "verwarringssignalen" van deze bibliothecaris konden voorspellen wanneer hij zou liegen.
  • Falcon-7B: Ze probeerden te zien of de "liegensignalen" van deze bibliothecaris konden voorspellen wanneer hij in de war was.

Wat Ze Vonden

De resultaten waren een beetje verrassend. Het is alsof je een rookmelder controleert en ontdekt dat het alarm voor "brand" niet afgaat als iemand toast verbrandt, en het alarm voor "verbrande toast" niet afgaat wanneer er een brand uitbreekt.

  • Verwarring \neq Liegen: Wanneer ze naar de "verwarringssignalen" binnen het model keken, konden ze deze niet gebruiken om te voorspellen wanneer het model zou hallucineren. De interne patronen van verward zijn waren anders dan de patronen van dingen verzinnen.
  • Liegen \neq Verwarring: Omgekeerd hielpen de signalen die gewoonlijk aangeven dat het model liegt, hen niet om te ontdekken wanneer het model te maken had met een kennisconflict.

De Conclusie: Zelfs al voelt het alsof hallucinaties worden veroorzaakt door kennisconflicten, het paper laat zien dat deze binnen het model twee verschillende processen zijn. Je kunt de verwarringspatronen niet gebruiken om de hallucinaties te vinden. Ze zijn verschillende fenomenen.

Eén Goed Nieuws

Hoewel ze niet de link vonden waar ze naar op zoek waren, ontdekten ze wel dat hun "hersenscanner" (de probing-tool) zeer consistent werkt. De tool werkt net zo goed in het Engels als in het Italiaans, Spaans, Chinees en vele andere talen. Dit betekent dat de tool zelf betrouwbaar is, zelfs als de specifieke theorie over de link tussen conflict en hallucinatie niet bewezen kon worden.

In het Kort

De onderzoekers hoopten een enkele "rookmelder" te vinden die zowel de verwarring als het liegen in AI-modellen kon vangen. Ze ontdekten dat het brein van de AI deze twee problemen op verschillende manieren afhandelt. Hoewel ze in de echte wereld aan elkaar gerelateerd zijn, zien ze er in de computercode niet hetzelfde uit. Dit vertelt ons dat we complexere instrumenten nodig hebben om de fouten van AI te begrijpen en te herstellen, in plaats van alleen maar naar één simpele oorzaak te zoeken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →