← Nieuwste papers
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

Dit artikel introduceert IG-Lens, een nieuwe methode die exacte, additieve waarschijnlijkheidsattributie over transformerlagen bereikt door telescopische Integrated Gradients langs een enkel pad toe te passen, waardoor de beperkingen van niet-lineariteit en bias van bestaande op logits gebaseerde of niet-additieve readout-tools worden overwonnen terwijl volledigheid zonder discretiefout wordt gewaarborgd.

Oorspronkelijke auteurs: Duc Anh Nguyen

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Duc Anh Nguyen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groot taalmodel (zoals degene die deze chat aanstuurt) voor als een fabriek met meerdere verdiepingen, waar een ruw idee onderaan binnenkomt en een afgewerkt product (het voorspelde woord) bovenaan uitkomt.

Lange tijd hebben onderzoekers geprobeerd een simpele vraag te beantwoorden: "Op precies welke verdieping van deze fabriek wordt de beslissing om 'Hanoi' te zeggen eigenlijk genomen?"

Bestaande tools hebben geprobeerd deze vraag te beantwoorden, maar ze waren als slechte boekhouders:

  • Sommige tools kijken naar elke verdieping en raden hoe "zelfverzekerd" de fabriek is, maar hun gissingen tellen niet op tot 100%. Het is alsof je zegt dat Verdieping 1 voor 40% zeker is, Verdieping 2 voor 60% en Verdieping 3 voor 80% — een totaal van 180%, wat geen zin maakt.
  • Andere tools kijken naar de ruwe getallen (logits) voordat ze worden omgezet in percentages. Maar het omzetten van ruwe getallen naar kansen is als het bakken van een taart; je kunt de bloem en de eieren niet apart optellen en verwachten dat je het gewicht van de afgebakken taart krijgt. Het "bakken" (de wiskunde die softmax wordt genoemd) verandert alles.
  • Een derde groep tools probeert de hoeveelheid werk op elke verdieping te meten, maar zij meten elke verdieping ten opzichte van een ander startpunt, waardoor hun getallen niet bij elkaar optellen om het totale werk te verklaren.

Maak kennis met IG-Lens: De Perfecte Boekhouder

Het artikel introduceert IG-Lens, een nieuwe methode die fungeert als een perfecte boekhouder voor deze fabriek. Het lost het probleem op door een "telescopische" truc te gebruiken (denk aan een uitschuifbare telescoop die kan uit- en inklappen).

Zo werkt het in eenvoudige termen:

1. De "Eénmalige Snapshot"-regel
In plaats van het woord door de hele fabriek te laten reizen en het bij elke draai te laten mengen met andere woorden, maakt IG-Lens een "snapshot" (een momentopname) van de staat van het woord op specifieke verdiepingen. Vervolgens stelt het de vraag: "Als we de staat van Verdieping 10 zouden nemen en deze door alleen de laatste 'afwerkingsmachine' (het deel dat ruwe data in een waarschijnlijkheid verandert) zouden halen, wat zou dan het resultaat zijn?"

2. De Telescopische Som
IG-Lens breekt de reis op in segmenten (bijv. Verdieping 10 naar 11, 11 naar 12, enz.).

  • Het berekent de waarschijnlijkheid van het woord op Verdieping 10.
  • Het berekent de waarschijnlijkheid op Verdieping 11.
  • Het verschil tussen hen is de exacte hoeveelheid werk die op dat specifieke segment is verricht.
  • Omdat het de verandering op elke stap meet, tellen wanneer je alle veranderingen van beneden naar boven bij elkaar op, ze perfect gelijk aan de totale verandering van begin tot eind. Er is geen ontbrekende wiskunde, geen "bakfout" en geen afrondingsprobleem.

3. De "Voorspellingsbewuste" Filter
De meeste methoden kijken naar hoeveel de getallen schommelen (gradiënten) om belangrijkheid te raden. Maar soms schommelen getallen veel zonder dat de uiteindelijke beslissing daadwerkelijk verandert.
IG-Lens is slimmer. Het geeft een verdieping alleen krediet voor werk als de werkelijke waarschijnlijkheid van het woord veranderde. Als de getallen schommelen maar de voorspelling hetzelfde blijft, negeert IG-Lens deze schommeling. Het is als een manager die werknemers alleen betaalt voor de dagen dat ze daadwerkelijk een taak hebben voltooid, en niet alleen voor de dagen dat ze druk bezig waren met het rondbewegen van dozen.

Waarom dit ertoe doet (volgens het artikel)

  • Het is Exact: In tegenstelling tot eerdere tools die je een benadering geven, garandeert IG-Lens dat als je de bijdragen van elke laag bij elkaar optelt, je exact de uiteindelijke waarschijnlijkheid krijgt. Het is wiskundig perfect (tot aan de grenzen van computerberekeningen).
  • Het vindt de "Onset": Het kan je vertellen op de exacte laag waar het model het woord "besloot". Bijvoorbeeld: het kan laten zien dat voor het woord "capital" de beslissing grotendeels werd genomen door laag 12, maar dat voor "Hanoi" de beslissing veel later plaatsvond, rond laag 15 of 16.
  • Het is Eerlijk over de Limieten: Het artikel geeft toe dat er een afweging is. Omdat IG-Lens naar de "snapshot" van een woord op een specifieke laag kijkt, telt het het werk niet mee dat een laag mogelijk later doet terwijl het woord naar de top van de fabriek reist. Het meet: "Hoeveel heeft deze laag bijgedragen aan het uiteindelijke antwoord, gegeven waar we begonnen?" in plaats van: "Wat was het totale effect van deze laag op het hele systeem?"

De Kern van het Verhaal

IG-Lens is een nieuwe manier om in AI-modellen te kijken die eindelijk de vraag beantwoordt: "Wanneer heeft het model de beslissing genomen?" met een wiskundig perfect "ontvangstbewijs" dat optelt tot 100%. Het raadt niet; het berekent de exacte verandering in waarschijnlijkheid laag voor laag, waarbij de ruis wordt weggefilterd om je precies te laten zien waar de beslissing plaatsvond.

De auteurs zijn van plan dit te testen door het model te "breken" op de lagen die IG-Lens identificeert, om te zien of het model daar inderdaad stopt met correct functioneren, wat zou bewijzen dat de methode de echte beslissingspunten vindt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →