← Nieuwste papers
💻 computer science

Forecasting the Onset of Hallucination: Causal, Token-Level, Black-Box Survival Analysis During Generation

Dit artikel introduceert een causaal, op token gebaseerd survivalanalyse-framework dat er succesvol in slaagt om het ontstaan van hallucinaties in grote taalmodellen te voorspellen voordat ze optreden, waarbij een AUROC van 0,777 wordt bereikt door tekst-nieuwheidsdrift te detecteren en waarschuwingen te geven ongeveer 11 tokens eerder dan traditionele post-hoc detectoren.

Oorspronkelijke auteurs: Igor Itkin

Gepubliceerd 2026-07-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Igor Itkin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een goochelaar kijkt die een verhaal vertelt. Meestal, wanneer de goochelaar begint te liegen—feiten verzinnen die niet in het script staan—noemen we dat een "hallucinatie".

Lama een tijdje was de enige manier om de goochelaar te betrappen het wachten tot hij daadwerkelijk de leugen uitsprak, een vinger naar hem wijzen en zeggen: "Hé, stop! Dat is nep!" Maar tegen die tijd heeft het publiek de leugen al gehoord. Het is alsof je probeert een vallende vaas te vangen nadat deze de grond heeft geraakt; je kunt de rommel opruimen, maar je kunt de vaas niet on-breken.

Dit artikel stelt een gedurfde vraag: Kunnen we de leugen voorspellen voordat de goochelaar zelfs zijn mond opent om hem te spreken?

De Kristallen Bol versus de Rookmelder

De auteurs bouwden een "kristallen bol" (een voorspellingsinstrument) die het verhaal van de AI observeert terwijl het woord voor woord wordt geschreven. Ze vergeleken dit met een "rookmelder" (de oude manier van simpelweg wachten tot de leugen plaatsvindt).

Hier is de goocheltruc die ze ontdekten: De AI schakelt niet zomaar van "waarheid" naar "leugen". In plaats daarvan begint de AI langzaam af te dwalen van de waarheid, zoals een boot die van koers afwijkt voordat hij de rotsen raakt.

  • De Oude Manier (De Detector): Dit hulpmiddel wacht tot de AI begint te verzinnen. In hun tests gaf het alarm pas 15 tokens (ongeveer 15 woorden) nadat de leugen was begonnen. Het is snel, maar het is altijd te laat.
  • De Nieuwe Manier (De Voorspeller): Dit hulpmiddel observeert de "drift" van de AI. Het merkte op dat voordat de AI begint te liegen, de tekst vreemd nieuw en losgekoppeld raakt van de oorspronkelijke bron. Omdat het deze drift ziet, kan het het alarm laten afgaan 11 tokens voordat de leugen daadwerkelijk plaatsvindt.

Dat is een enorme zaak. Het betekent dat het systeem je kan waarschuwen terwijl de tekst nog steeds waar is, waardoor je de kans krijgt om de AI te stoppen voordat hij iets onjuists zegt.

Hoe Ziet de Kristallen Bol de Drift?

Je zou denken dat de AI vlak voordat hij liegt nerveus of verward begint te worden. Je zou verwachten dat het hulpmiddel kijkt naar het "verrassingsniveau" van de AI (hoe geschokt de AI is door zijn eigen woorden).

Maar de auteurs sluiten dat uit. De auteurs ontdekten dat de AI niet verrast is voordat hij liegt. In plaats daarvan komt het waarschuwingssignaal van tekstuele nieuwheid (novelty).

Denk aan een zanger die de teksten perfect kent. Wanneer hij begint af te dwalen naar een vals lied, wordt hij niet plotseling nerveus; hij begint simpelweg noten te zingen die steeds meer verschillen van de originele bladmuziek. Het hulpmiddel meet hoe "nieuw" en "uit de context" de woorden worden vergeleken met de oorspronkelijke bron. Wanneer de woorden te "vers" en te ver verwijderd raken van het oorspronkelijke verhaal, weet het hulpmiddel dat er een leugen aankomt.

Wat het Hulpmiddel Niet Kan (De Realiteitscheck)

De auteurs zijn zeer voorzichtig om hun uitvinding niet te overhypen. Hier is wat ze expliciet zeggen dat dit hulpmiddel niet is:

  • Het is geen universele vertaler: Als je dit hulpmiddel traint op lange, gedetailleerde artikelen (zoals een Wikipedia-samenvatting) en het vervolgens probeert te gebruiken voor korte, snelle vragen (zoals een trivia-spel), faalt het volledig. Sterker nog, het presteert slechter dan willekeurig gokken! De "drift" ziet er anders uit afhankelijk van het type tekst. Het hulpmiddel werkt alleen als je het specifiek traint op het soort tekst dat het observeert.
  • Het is geen magische oplossing om leugens te stoppen: De auteurs voerden een simulatie uit waarbij ze de AI simpelweg vertelden om "op te houden met praten" op het moment dat het alarm afging. Ze ontdekten dat de oude "rookmelder" (die wacht op de leugen) eigenlijk beter was in het besparen van woorden. Waarom? Omdat het nieuwe hulpmiddel de AI soms te vroeg stopt, waardoor goede, ware zinnen worden afgekapt, simpelweg omdat ze een beetje "drifty" aanvoelden. De voorlooptijd is alleen nuttig als je een manier hebt om de zin te corrigeren (zoals het herschrijven ervan) in plaats van alleen de hele tekst te verwijderen.
  • Het leest niet de geest van de AI: Het hulpmiddel heeft geen toegang nodig tot de interne hersencode van de AI. Het kijkt alleen naar de woorden die eruit komen, wat het een "black-box" hulpmiddel maakt dat met elke AI werkt.

De Cijfers Achter de Magie

De auteurs hebben dit getest op een enorme dataset genaamd RAGTruth. Hier is hoe goed het werkte:

  • Wanneer het een leugen binnen de volgende 3 woorden voorspelde, was het hulpmiddel in 77,7% van de gevallen correct (een score van 0,777).
  • Zelfs wanneer het naar slechts één specifief document keek waarin de AI wel liegt, kon het hulpmiddel de komende leugen in 68,7% van de gevallen spotten, wat bewijst dat het niet alleen gokte welke documenten slecht waren, maar daadwerkelijk het moment beet dat de leugen begon te ontstaan.
  • Het hulpmiddel waarschuwde succesvol 11 tokens vóór de leugen, terwijl de oude detector 15 tokens na de leugen wachtte.

De Kern van het Verhaal

Dit artikel bewijst dat we een hallucinatie zien aankomen, maar alleen als we letten op de "drift" in de tekst, en niet op de verwarring van de AI. Het is als het opmerken van een auto die lichtjes uitwijkt in zijn rijstrook voordat hij een ongeluk krijgt, in plaats van wachten tot het ongeluk gebeurt.

Echter, dit is nog geen opgelost probleem. Het hulpmiddel is zeer specifiek voor het type tekst waarop het is getraind, en het simpelweg stoppen van de AI wanneer het waarschuwt, is niet altijd de beste oplossing. Maar voor het eerst hebben we een manier om de leugen te zien aankomen terwijl het verhaal nog waar is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →