← Nieuwste papers
💬 NLP

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

Deze paper introduceert HETA, een nieuw attribuutframework dat speciaal is ontworpen voor decoder-only taalmodellen door Hessian-gebaseerde gevoeligheid, semantische transitievectoren en KL-divergentie te combineren om de interpretatie van autoregeneratieve generaties nauwkeuriger en menselijker te maken dan bestaande methoden.

Oorspronkelijke auteurs: Vishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Sumit Kumar Jha

Gepubliceerd 2026-04-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Sumit Kumar Jha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

HETA: De "Super-Detective" voor Taalmodellen

Stel je voor dat een groot taalmodel (zoals de AI die je nu gebruikt) een enorme, donkere fabriek is. Als de AI een zin schrijft, is het alsof er een productielijn draait. Maar als je vraagt: "Waarom koos de AI precies dit woord?", kijken de meeste huidige methoden alleen naar de schaduwen op de muur. Ze zeggen: "Ah, deze lamp brandde toen het woord werd gekozen!" Maar dat zegt nog niets over wat er echt in de machine gebeurt.

Deze paper introduceert HETA (Hessian-Enhanced Token Attribution). Dit is een nieuwe, slimme manier om te kijken hoe een AI denkt, speciaal voor modellen die zinnen woord voor woord opbouwen (zoals wij spreken).

Hier is hoe HETA werkt, uitgelegd met drie simpele metaforen:

1. De "Causale Stroom" (De Rivier van Betekenis)

Stel je voor dat de zin die de AI schrijft een rivier is. Elk woord is een druppel water.

  • Oude methoden kijken alleen naar waar de stroom naar toe kijkt (de aandacht). Maar soms kijkt de stroom naar een rots, terwijl het water eigenlijk ergens anders naartoe stroomt.
  • HETA volgt de stroomlijn. Het kijkt niet alleen naar waar de AI naar kijkt, maar naar welke druppels water daadwerkelijk de volgende druppel hebben aangestoten. Het zorgt ervoor dat we alleen kijken naar woorden die een echte, causale link hebben met het woord dat nu wordt gekozen. Het is alsof je een bootje volgt dat precies de route vaart die het water heeft genomen, in plaats van alleen naar de wind te kijken.

2. De "Krulkracht" (De Hessian)

Stel je voor dat je op een trampoline springt.

  • Oude methoden kijken alleen naar hoe steil de helling is op het moment dat je springt (de eerste graad). Maar als je precies op een plat vlak landt (een vlakke plek in de helling), zeggen ze: "Geen helling, dus geen kracht!" Terwijl je er wel degelijk een enorme duw nodig hebt om daar vandaan te komen.
  • HETA kijkt naar de kromming (de Hessian). Het voelt niet alleen de helling, maar ook hoe de trampoline buigt. Als een woord op een "plat" punt staat, maar een kleine verandering toch een groot effect heeft, ziet HETA dat. Het begrijpt dat de wereld van AI niet altijd rechtlijnig is; soms is de kracht verborgen in de bocht.

3. De "Verdwijntruc" (De KL-divergentie)

Stel je voor dat je een puzzel oplost.

  • Oude methoden proberen te raden welke stukjes belangrijk zijn door ze een beetje te verplaatsen.
  • HETA doet een verdwijntruc. Het neemt een woord weg (maskert het) en kijkt: "Hoeveel is de puzzel nu veranderd?" Als je het woord "hond" weghaalt en de zin wordt ineens onbegrijpelijk, dan was dat woord cruciaal. Als je "de" weghaalt en de zin blijft hetzelfde, was het niet zo belangrijk. HETA meet precies hoeveel informatie er verloren gaat als een woord wegvalt.

Waarom is dit zo cool?

De auteurs hebben een nieuwe speelset (een dataset) gemaakt om deze methoden te testen. Ze hebben een zin gemaakt met twee delen:

  1. Een leuk verhaal over een winterstorm (afleidingsmanoeuvre).
  2. Een feitelijke zin over fotosynthese (het echte antwoord).

Als je de AI vraagt: "Waar gebeurt fotosynthese?", moeten de oude methoden vaak verward raken door het winterverhaal. Ze zeggen: "Oh, het woord 'winter' is belangrijk!"
HETA daarentegen zegt: "Nee, kijk naar het tweede deel! Het woord 'bladeren' is de enige echte sleutel."

De Conclusie in één zin

HETA is als een super-detective die niet alleen kijkt naar wie in de kamer was (aandacht), maar ook voelt hoe de vloer trilt (kromming) en wat er gebeurt als je een persoon uit de kamer haalt (informatie). Hierdoor begrijpen we eindelijk écht waarom een AI het antwoord geeft dat hij geeft, en niet alleen wat hij doet.

Dit maakt AI veiliger, betrouwbaarder en minder een "zwarte doos".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →