← Nieuwste papers
🤖 machine learning

Dual Path Attribution: Efficient Attribution for SwiGLU-Transformers through Layer-Wise Target Propagation

Dit paper introduceert Dual Path Attribution (DPA), een efficiënt en betrouwbaar framework dat de informatieflow in SwiGLU-Transformers analyseert via een doelgerichte propagatie met lineaire complexiteit, waardoor state-of-the-art interpretatie mogelijk wordt zonder de hoge kosten van bestaande methoden.

Oorspronkelijke auteurs: Lasse Marten Jantsch, Dong-Jae Koh, Seonghyeon Lee, Young-Kyoon Suh

Gepubliceerd 2026-03-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lasse Marten Jantsch, Dong-Jae Koh, Seonghyeon Lee, Young-Kyoon Suh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een groot taalmodel (zoals een slimme chatbot) een gigantisch, complex fabrieksgebouw is. Binnenin werken duizenden kleine werknemers (de neuronen) en afdelingen (de lagen) samen om een antwoord te genereren.

Het probleem is: we weten niet precies wie wat doet. Als de robot een fout maakt of een grappige grap vertelt, kunnen we niet makkelijk zeggen: "Ah, dat was de werknemer in de derde verdieping die de sleutel had," of "Dat kwam door het woord 'hond' in de eerste zin."

Tot nu toe waren de methodes om dit te achterhalen ofwel te traag (alsof je elke werknemer één voor één moet testen) ofwel onnauwkeurig (alsof je gissen doet).

Deze paper introduceert een nieuwe methode genaamd Dual Path Attribution (DPA). Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het oude probleem: De "Stop-en-Vraag" methode

Stel je voor dat je wilt weten welke werknemer in de fabriek het belangrijkst is voor het eindproduct. De oude manier was:

  • "Oké, we gaan werknemer #456 even stoppen en kijken wat er gebeurt."
  • "Oké, nu werknemer #457..."
  • "Nu werknemer #458..."

Dit kost enorm veel tijd. Als je duizenden werknemers hebt, duurt het eeuwen om iedereen te testen. Dit is wat de huidige methodes doen: ze zijn eerlijk, maar veel te traag.

2. De nieuwe oplossing: DPA (De "Terugwaartse Stroom")

DPA is slimmer. In plaats van naar voren te werken en iedereen te testen, doet DPA het omgekeerde. Het is alsof je een stroom van energie van het eindresultaat terug naar de bron stuurt.

Stel je voor dat het eindantwoord een doelwit is (bijvoorbeeld een pijl die op een bord schiet).

  • Stap 1: Je schiet de pijl (het antwoord) en kijkt waar hij landt.
  • Stap 2: Je stuurt een "terugwaartse golf" van die pijl door de fabriek. Deze golf zegt: "Jullie hebben allemaal geholpen om deze pijl hier te krijgen. Wie heeft er het meest bijgedragen?"

Deze golf beweegt zich door de fabriek en verdeelt de "verdienste" (of de schuld) eerlijk over alle werknemers en afdelingen. Het mooie is: je hoeft dit slechts één keer te doen, in plaats van duizenden keren.

3. De twee paden: De "Inhoud" en de "Regisseur"

De auteurs ontdekten dat de fabriek (het model) twee soorten werknemers heeft die samenwerken. Ze noemen dit de Dual Path (Twee Paden):

  1. Het Inhouds-pad (Content Pathway): Dit zijn de werknemers die de feitelijke informatie dragen. Stel je voor dat ze zware dozen met kennis dragen. Als je een vraag stelt over "Hoe maak je pannenkoeken?", dragen deze werknemers de recepten.
  2. Het Regie-pad (Control Pathway): Dit zijn de managers die beslissen wie wat doet. Ze zeggen: "Neem die doos met pannenkoekenrecepten en geef hem aan de kok," of "Negeer die doos met auto-onderdelen."

De meeste oude methodes keken alleen naar de dozen (de inhoud) of keken naar de managers (de aandacht) alsof ze onafhankelijk waren. DPA kijkt naar beide paden tegelijk. Het begrijpt dat de managers (de regie) bepalen welke informatie (de inhoud) erdoor komt.

4. Waarom is dit zo geweldig?

  • Snelheid: Omdat DPA terugwaarts werkt in één enkele ronde, is het ontzettend snel. Het is alsof je in plaats van elke werknemer één voor één te testen, gewoon de hele fabriek in één keer "terugspoelt" om te zien wie er hard heeft gewerkt.
  • Eerlijkheid: Het is heel nauwkeurig. Het kan precies vertellen welk woord in de zin het belangrijkst was, of welke specifieke "neuron" (werker) in het model de beslissing nam.
  • Geen gissen: Het heeft geen "tegenstrijdige voorbeelden" nodig (zoals het testen van wat er gebeurt als je het woord "hond" vervangt door "kat"). Het berekent het direct.

Samenvatting in één zin

DPA is als een slimme detective die niet elke verdachte één voor één hoeft te ondervragen, maar die in één keer de "sporen" van het eindresultaat terugvolgt door de fabriek, zodat hij precies weet wie de sleutelrol speelde, en dat allemaal in een flits.

Dit helpt ons om te begrijpen waarom AI's doen wat ze doen, wat essentieel is om ze veiliger en betrouwbaarder te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →