← Nieuwste papers
💬 NLP

Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering

Dit artikel introduceert FalseCite, een dataset om hallucinaties in LLM's te benchmarken, en onthult via analyse van interne staten dat de verborgen vectorrepresentaties van deze modellen een kenmerkende hoornvormige structuur vertonen.

Oorspronkelijke auteurs: Nathan Mao, Varun Kaushik, Shreya Shivkumar, Parham Sharafoleslami, Kevin Zhu, Sunishchal Dev

Gepubliceerd 2026-02-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nathan Mao, Varun Kaushik, Shreya Shivkumar, Parham Sharafoleslami, Kevin Zhu, Sunishchal Dev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat overdreven fantasierijke robot hebt die alles over de wereld weet. Deze robot is zo goed in het praten dat hij soms dingen zegt die klinken als waarheid, maar eigenlijk helemaal niet kloppen. In de tech-wereld noemen ze dit "hallucineren". Het is alsof de robot droomt terwijl hij wakker is en die dromen als feiten verkoopt.

Dit is een groot probleem, vooral als je die robot gebruikt voor belangrijke dingen zoals medische adviezen of juridische zaken.

De auteurs van dit paper hebben een slimme manier bedacht om dit probleem te bestuderen. Hier is hun verhaal, vertaald naar een eenvoudig verhaal met een paar creatieve vergelijkingen:

1. De "Valse Referentie" Test (De FalseCite)

De onderzoekers wilden weten: Wat gebeurt er als we die robot een leugen vertellen, maar die leugen verpakken in een nep-verwijzing naar een "betrouwbare" bron?

Stel je voor dat je tegen iemand zegt: "De maan is gemaakt van kaas." Die persoon denkt misschien: "Nee, dat is onzin."
Maar als je zegt: "Volgens een nieuw onderzoek van de NASA is de maan gemaakt van kaas," dan twijfelt die persoon misschien meer.

De onderzoekers hebben een enorme database gemaakt genaamd FalseCite. Dit is een verzameling van 82.000 leugens. Ze hebben deze leugens op twee manieren getest:

  1. Alleen de leugen.
  2. De leugen + een nep-verwijzing (bijv. "Zoals Harvard Medical School zegt...").

Het resultaat: De robot werd veel sneller "gek" als er een nep-verwijzing bij zat. Het was alsof de nep-verwijzing een groene licht gaf aan de robot om zijn fantasie de vrije loop te laten. Zelfs slimme robots (zoals GPT-4o-mini) lieten zich hierdoor verleiden, vooral als de nep-verwijzing er heel geloofwaardig uitzag.

2. De Twee Soorten "Dromen"

Ze ontdekten dat de robot op twee manieren hallucineerde:

  • De "Gevolgde Leugen": De robot blijft vasthouden aan de nep-verwijzing, zelfs als de rest van wat hij zegt onzin is. Hij denkt: "Als de bron het zegt, moet het waar zijn."
  • De "Zelfgemaakte Leugen": De robot begint zelf een verhaal te bedenken en gebruikt vervolgens zijn eigen verzonnen zinnen om dat verhaal te bewijzen. Het is een kringloop van leugens.

3. Het Kijken in het Brein (Interne Analyse)

Dit is het meest fascinerende deel. De onderzoekers wilden niet alleen kijken naar wat de robot zei, maar ook naar hoe zijn brein (de interne staten) eruitzag terwijl hij droomde.

Ze hebben de "gedachten" van de robot (de wiskundige vectoren in zijn lagen) opgepikt en op een grafiek gezet.

  • De Vergelijking: Stel je voor dat je de gedachten van de robot tekent als een lijn op papier. Of de robot nu de waarheid spreekt of liegt, die lijn volgt een heel specifiek patroon: het lijkt op een hoorn (zoals die van een eenhoorn of een stier).
  • Wat betekent dit? Het betekent dat het brein van de robot een vaste "route" volgt, ongeacht of hij liegt of niet. Maar door deze route in kaart te brengen, hopen ze in de toekomst te kunnen zien wanneer de robot de hoorn begint te buigen naar "leugen-land", zodat we hem kunnen stoppen voordat hij iets verkeerds zegt.

4. De Conclusie

Kort samengevat:

  • Het probleem: Robots liegen, vooral als je ze nep-bronnen geeft.
  • De oplossing: Ze hebben een testtool (FalseCite) gemaakt om dit te meten.
  • De ontdekking: Ze hebben gezien hoe het "brein" van de robot eruitziet tijdens het liegen (die hoorn-vorm).

Dit onderzoek is als een detective die niet alleen kijkt naar de dader, maar ook naar de vingerafdrukken in het stof. Door te begrijpen hoe en waarom robots hallucineren, kunnen we in de toekomst betere robots bouwen die betrouwbaarder zijn, vooral in gebieden waar fouten maken levensgevaarlijk kan zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →