← Nieuwste papers
💬 NLP

HALT: Hallucination Assessment via Log-probs as Time series

Het artikel introduceert HALT, een lichtgewicht en efficiënte hallucinatiedetector die token log-waarschijnlijkheden als tijdreeksen analyseert om superieure prestaties en snelheid te bereiken vergeleken met bestaande methoden, naast HUB, een uitgebreide benchmark die tien diverse capaciteiten verenigt voor het evalueren van hallucinatiedetectie over grote taalmodellen heen.

Oorspronkelijke auteurs: Ahmad Shapiro, Karan Taneja, Ashok Goel

Gepubliceerd 2026-02-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ahmad Shapiro, Karan Taneja, Ashok Goel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je luistert naar een verhalenverteller die een verhaal vertelt. Soms spreekt hij met absolute zelfverzekerdheid, zijn stem stabiel en helder. Andere keren kan hij stotteren, aarzelen, of kan zijn stem wankelen vlak voordat hij een detail verzint dat niet waar is.

Al een tijdje proberen onderzoekers die proberen LLM's (Large Language Models) te betrappen op liegen (of "hallucineren"), twee hoofdaanpakken te gebruiken:

  1. De "White-Box"-aanpak: De verhalenverteller vragen om zijn geheime aantekeningen en hersengolven te laten zien. Dit is geweldig als je de verhalenverteller bezit, maar onmogelijk als je slechts een publieke API gebruikt (zoals een chatbot).
  2. De "Black-Box"-aanpak: De verhalenverteller vragen om het verhaal te herhalen of een tweede verhalenverteller te vragen om hem te controleren. Dit is traag, duur, en soms liegt de tweede verhalenverteller ook.

HALT (Hallucination Assessment via Log-probs as Time series) is een nieuwe, slimme detective die noch de geheime aantekeningen, noch een tweede verhalenverteller nodig heeft. Het luistert alleen naar het ritme van de zelfverzekerdheid van de verhalenverteller.

Het Kernidee: Luisteren naar de "Hartslag" van Zelfverzekerdheid

Wanneer een AI tekst genereert, kiest hij niet zomaar een woord; hij berekent hoe waarschijnlijk elk mogelijk volgend woord is. Deze berekeningen worden log-probabilities genoemd. Denk aan deze als de interne "zelfverzekerdheidsmeter" van de AI voor elk woord dat hij uitspreekt.

De auteurs van dit artikel realiseerden zich dat deze zelfverzekerdheidsmeters niet zomaar daar liggen; ze bewegen als een tijdreeks (een hartslag of een aandelenmarktgrafiek).

  • Wanneer een AI de waarheid spreekt, volgt zijn zelfverzekerdheidsmeter meestal een vloeiend, stabiel ritme.
  • Wanneer de AI begint te hallucineren (iets te verzinnen), wordt dat ritme vreemd. Het kan pieken, plotseling dalen, of op een specifieke manier wiebelen, zelfs als de AI heel zelfverzekerd klinkt.

HALT is een klein, lichtgewicht computerprogramma (een "GRU"-model) dat getraind is om dit zelfverzekerdheidsritme te observeren. Het leest niet de woorden die de AI zegt; het kijkt alleen naar de grafiek van de zelfverzekerdheid van de AI terwijl hij spreekt.

De Gereedschapskist van de Detective: HALT

HALT is als een gespecialiseerde stethoscoop. Het kijkt naar de top 20 meest waarschijnlijke woorden die de AI overwegt bij elke stap. Het meet:

  • Hoe wankel de keuze is: Is de AI verdeeld tussen twee woorden? (Hoge onzekerheid).
  • Hoe plotseling de verandering is: Sprong de AI plotseling van 99% zeker naar 50% zeker?
  • Het patroon in de tijd: Ziet de zelfverzekerdheidscurve eruit als een vloeiende heuvel of een grillige bergketen?

Door deze "zelfverzekerdheids-hartslag" in zijn brein te voeren, leert HALT de specifieke "aritmie" te herkennen die optreedt wanneer een AI begint te liegen.

Het Nieuwe Stadion: HUB

Om te testen of HALT echt werkt, hebben de auteurs een enorme nieuwe testomgeving gebouwd genaamd HUB (Hallucination detection Unified Benchmark).

Stel je voor dat eerdere tests leken op het spelen in slechts een kleine, stille bibliotheek (gericht op alleen eenvoudige feiten of chat). HUB is een gigantisch, chaotisch stadion met 10 verschillende sporten:

  • Redeneringsporten: Wiskunde, codering, logische puzzels en algoritmen.
  • Algemene Sporten: Chatten, het samenvatten van nieuws en het beantwoorden van trivia.

De auteurs realiseerden zich dat "hallucinatie" niet alleen gaat over het verzinnen van feiten (zoals zeggen dat de maan van kaas is gemaakt). Het gaat ook over logische hallucinaties — waarbij de AI de feiten wel goed krijgt, maar de wiskundige of logische stappen om daar te komen verpest. HUB test al deze aspecten.

De Resultaten: Klein maar Krachtig

Het artikel vergelijkt HALT met andere detectoren:

  • Lettuce: Een zeer grote, zware detector (als een enorme tank) die de werkelijke tekst leest.
  • White-box methoden: Detectoren die toegang nodig hebben tot de interne hersenen van de AI (wat je niet kunt bij de meeste commerciële AI's).

De Verrassing: HALT is 30 keer kleiner dan de zware tank (Lettuce) en 60 keer sneller. Toch wint het vaker!

  • Het verslaat de zware tank in 7 van de 10 sporten.
  • Het werkt net zo goed als de gigantische tank, maar heeft de tekst of de hersenen van de AI niet nodig om te lezen. Het luistert alleen naar het ritme van de zelfverzekerdheid.

Belangrijke Beperkingen (Wat het artikel zegt)

  • Het is Model-Specifiek: HALT is als een coach die de hartslag van één specifieke speler perfect kent. Als je HALT traint op een AI genaamd "Llama", wordt het een expert in het opsporen van leugens in Llama. Als je diezelfde HALT probeert te gebruiken op een andere AI genaamd "Qwen", raakt het in de war. De "hartslagpatronen" verschillen per model.
  • Het heeft toegang nodig tot de "Zelfverzekerdheidsgetallen": Je hebt de hersenen van de AI niet nodig, maar je hebt wel de API nodig die je de top 20 zelfverzekerheidsgetallen voor elk woord geeft. Als een API deze getallen volledig verbergt, kan HALT niet werken.
  • Het Detecteert, het Herstelt Niet: HALT is een rookmelder. Het vertelt je wanneer de AI aan het hallucineren is, maar het vertelt je niet waarom of hoe je het verhaal moet repareren.

Samenvattende Analogie

Beschouw een AI als een goochelaar die een truc uitvoert.

  • Oude detectoren probeerden onder de hoed van de goochelaar te kijken (White-box) of het publiek te vragen of de truc echt was (Black-box tekstanalyse).
  • HALT kijkt gewoon naar de handen van de goochelaar. Het weet dat wanneer een goochelaar een nep konijn uit een hoed gaat trekken, de handbewegingen licht schokkerig en onvoorspelbaar worden, zelfs als hij zelfverzekerd glimlacht. HALT is getraind om dat specifieke "schokkerige hand"-patroon in de zelfverzekerheidscijfers van de AI te herkennen, waardoor het de leugen direct kan betrappen zonder de truc te hoeven zien of iemand anders te hoeven vragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →