← Nieuwste papers
💬 NLP

Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models

Dit artikel introduceert SinkProbe, een state-of-the-art methode voor hallucinatiedetectie die gebruikmaakt van attention sinks — tokens die een onevenredige hoeveelheid aandacht accumuleren — als interne signalen die een verschuiving aangeven van op input gebaseerde naar op voorkennis gebaseerde berekening, terwijl het ook onthult dat effectieve detectie afhankelijk is van sinks met grote waarde-vectornormen en eerdere benaderingen wiskundig verenigt met dit mechanisme.

Oorspronkelijke auteurs: Jakub Binkowski, Kamil Adamczewski, Tomasz Kajdanowicz

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jakub Binkowski, Kamil Adamczewski, Tomasz Kajdanowicz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal leest dat geschreven is door een zeer zelfverzekerde, ongelooflijk snelle robot. Deze robot heeft bijna elk boek ooit geschreven gelezen en kan vragen beantwoorden over alles, van de oude geschiedenis tot kwantumfysica. Maar soms, wanneer de robot vastloopt of het antwoord niet weet, zegt hij niet: "Ik weet het niet." In plaats daarvan blijft hij praten met een vloeiende, heldere stem, waarbij hij feiten verzint die perfect klinken maar volledig verzonnen zijn. In de wereld van de informatica wordt dit een "hallucinatie" genoemd. Dit is een groot probleem, want als we deze robots vertrouwen voor belangrijke taken zoals medisch advies of juridische beslissingen, kunnen hun zelfverzekerde leugens echte problemen veroorzaken.

Om te begrijpen hoe we deze leugens kunnen betrappen, moeten we eerst in het brein van de robot kijken. Moderne robots zoals deze gebruiken een systeem genaamd een "Transformer", die werkt door aandacht te besteden aan verschillende delen van een zin om te bepalen wat er volgt. Denk aan een groep detectives (genaamd "attention heads") die naar een plaats delict kijken (de zin). Meestal richten zij zich op de belangrijkste aanwijzingen. Echter, onderzoekers ontdekten onlangs iets vreemds: soms raken deze detectives geobsedeerd door een paar specifieke, saaie aanwijzingen—zoals het allereerste woord van de zin of een lege ruimte—waardoor ze de rest van het bewijs negeren. Ze noemen deze obsessies "attention sinks". Het is alsofd de detectives zo intens naar een stofje staren dat ze het eigenlijke moordwapen missen.

Dit artikel, getiteld "Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models", stelt een simpele maar briljante vraag: Kunnen we deze vreemde "attention sinks" gebruiken om de robot te betrappen op liegen? De auteurs, Jakub Binkowski en zijn team, stellen een nieuwe methode voor genaamd SinkProbe. Ze suggereren dat wanneer een robot begint te hallucineren, zijn interne aandachtsysteem "verstopt" of "instort" op deze onbelangrijke tokens, waardoor de verbinding met de echte feiten verloren gaat. Door te meten hoeveel aandacht de robot aan deze "sinks" besteedt, kunnen ze voorspellen of de robot op het punt staat dingen te verzinnen.

Het Nieuwe Gereedschap van de Detective: SinkProbe

De auteurs gokten niet alleen; ze bouwden een hulpmiddel om dit idee te testen. Ze bekeken de attention maps van verschillende populaire large language models (LLM's) zoals Llama en Mistral terwijl deze vragen beantwoordden op diverse lastige datasets, inclusief wiskundeproblemen en algemene kennisquizzen.

Zo werkt hun methode, gebruikmakend van een eenvoudige analogie: Stel je voor dat het brein van de robot een drukke snelweg is met veel rijstroken (lagen) en veel auto's (tokens). Normaal gesproken verspreiden de auto's zich en kijken ze naar verschillende delen van de weg. Maar wanneer de robot op het punt staat te hallucineren, loopt de verkeersdrukte vast. Een paar specifieke auto's (de "sinks") raken vastgelopen in een enorme verkeersopstopping, en bijna alle andere auto's op de snelweg beginnen naar hen te staren in plaats van naar de weg voor hen uit.

De auteurs ontwikkelden een score genaamd de Sink Score om precies te meten hoeveel verkeer er vastloopt bij deze specifieke punten. Ze ontdekten dat wanneer een robot liegt, deze sink scores pieken. Maar er is een twist: niet alle verkeersopstoppingen zijn gelijk. De auteurs ontdekten dat de "sinks" die er echt toe doen om leugens te betrappen, niet alleen de sinks zijn die veel aandacht krijgen, maar ook die een zware last dragen (een grote "value vector"). Het is alsof je een verkeersopstopping vindt waar de vastgelopen auto's ook nog eens zware kratten vervoeren; dat is wanneer je weet dat er serieus iets mis is met de informatiestroom.

Wat Ze Vonden (en Wat Ze Niet Vonden)

De resultaten waren zeer veelbelovend. Wanneer ze een eenvoudig computerprogramma (een logistische regressie classifier) trainden om naar deze sink scores te kijken, werd het erg goed in het opsporen van hallucinaties. Sterker nog, op de meeste tests die ze uitvoerden, presteerde hun nieuwe methode, SinkProbe, beter dan andere bestaande methoden die probeerden leugens te detecteren door naar aandachtspatronen op verschillende manieren te kijken.

Bijvoorbeeld, op een dataset genaamd GSM8K (die wiskundeproblemen bevat), behaalde SinkProbe een score van 0,845, waarmee het de vorige beste methode versloeg die een score van 0,835 behaalde. Op TruthfulQA, een dataset ontworpen om modellen te misleiden tot liegen, scoorde SinkProbe 0,785, en kwam opnieuw als winnaar uit de bus. De auteurs merkten op dat deze methode goed werkt bij verschillende groottes van modellen, van kleinere modellen met 3 miljard parameters tot grotere modellen met 12 miljard parameters.

De paper is echter voorzichtig om niet te beweren dat ze het probleem van hallucinaties hebben "opgelost". Ze geven expliciet aan dat hun methode toegang vereist tot de interne attention weights van het model, wat betekent dat het alleen werkt op open-source modellen waarbij je de bedrading van het brein kunt zien, en niet op gesloten, geheime modellen. Ze verduidelijken ook dat hoewel ze een sterke verbinding vonden tussen attention sinks en hallucinaties, ze niet hebben bewezen dat de sinks de leugens veroorzaken. Het is als zien dat de motor van een auto oververhit raakt wanneer deze crasht; de hitte is een duidelijk signaal van problemen, maar de hitte zelf is misschien niet de reden dat de auto crashte.

Waarom Dit Belangrijk Is

De schoonheid van dit werk is dat het verschillende ideeën verenigt. De auteurs toonden aan dat andere methoden die mensen hebben geprobeerd—zoals het kijken naar de "vorm" van de attention graph of het vergelijken van hoeveel aandacht er wordt besteed aan de vraag versus het antwoord—eigenlijk gewoon verschillende manieren zijn om naar hetzelfde "sink"-fenomeen te kijken. Het is alsof je beseft dat drie verschillende mensen allemaal proberen een olifant te beschrijven door aan zijn poot, zijn oor en zijn staart te voelen; ze voelen allemaal hetzelfde dier, maar vanuit verschillende hoeken.

Door te focussen op deze "attention sinks", bieden de auteurs een simpelere, directere manier om naar de interne gedachten van de robot te luisteren. Ze ontdekten dat de "leugens" van de robot vaak worden gesignaleerd door een specifiek soort interne verkeersopstopping waarbij het brein stopt met het verwerken van nieuwe informatie en begint met het recyclen van oude, onbelangrijke signalen. Hoewel dit de neiging van de robot om te liegen niet oplost, geeft het ons een zeer effectief alarmsysteem om te weten wanneer de robot begint af te dwalen in fantasie.

Kortom, de paper suggereert dat als je wilt weten of een superintelligent AI de waarheid spreekt, je niet alleen moet luisteren naar wat het zegt. Je moet ook kijken waar het naar kijkt. Als het te intens naar de verkeerde dingen staart, is het waarschijnlijk dingen aan het verzinnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →