← Nieuwste papers
🤖 machine learning

Feed-Forward Steering in Transformer Residual Dynamics

Dit artikel breidt de uitsluitend op aandacht gebaseerde dynamische theorieën van Transformers uit door feed-forward netwerken te modelleren als lokale sturende velden, waarbij wordt aangetoond dat hun tangentiële componenten essentieel zijn voor residuele beweging en modelprestaties, terwijl commutatordefecten worden geïdentificeerd als een belangrijke metriek voor het bepalen van de haalbaarheid van het paralleliseren van aandacht- en FFN-blokken.

Oorspronkelijke auteurs: Timur Mudarisov, Mikhail Burtsev, Radu State

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Timur Mudarisov, Mikhail Burtsev, Radu State

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je kijkt naar een enorm, onzichtbaar dansfeest in een computerbrein. Dit is geen feest met muziek en flitsende lichten, maar met woorden en getallen. In de wereld van kunstmatige intelligentie, specifits de "Transformers" die chatbots en zoekmachines aandrijven, is er een constante stroom van informatie die een "residual stream" wordt genoemd. Denk aan deze stroom als een rivier die kleine bootjes (tokens) vervoert die woorden vertegenwoordigen. Voor een lange tijd geloofden wetenschappers dat het enige dat deze bootjes stuurde een mechanisme was dat "Attention" (aandacht) wordt genoemd. Je kunt Attention zien als een enorme, onzichtbare magneet die bootjes naar elkaar toe trekt als ze over vergelijkbare dingen praten. Als een bootje "koning" zegt, trekt de magneet het misschien dichter naar een bootje dat "koningin" zegt. Deze trekkracht wordt "aggregatie" genoemd, en dit is waarom woorden die bij elkaar horen, in dezelfde richting beginnen te klonteren.

Echter, er is nog een ander deel van de dansvloer: het Feed-Forward Network, of FFN. Als Attention de magneet is die bootjes naar elkaar toe trekt, dan is de FFN als een lokale DJ of een persoonlijke coach die vlak naast elk bootje staat en het in een specifieke richting duwt op basis van wat dat specifieke bootje zegt. Jarenlang dachten onderzoekers dat de FFN slechts een bijrol speelde, misschien alleen de snelheid van de bootjes aanpas of het volume corrigeerde. Maar een nieuw artikel stelt een grote vraag: Is de FFN slechts een volumeknop, of is het daadwerkelijk het stuur dat bepaalt waar de bootjes heen gaan? Het begrijpen hiervan is belangrijk omdat als we precies weten hoe deze bootjes bewegen, we AI sneller, slimmer en gemakkelijker kunnen repareren wanneer het fouten maakt.

De Grote Ontdekking van het Papier: De DJ is de Kapitein

Dit artikel, getiteld "Feed-Forward Steering in Transformer Residual Dynamics", suggereert dat het oude beeld een cruciaal puzzelstukje miste. De auteurs stellen een nieuwe manier voor om naar de dansvloer te kijken: Attention is de "aggregatie" die iedereen naar een gedeelde groep trekt, maar de FFN is een "stuurveld" dat individuele bootjes actief in nieuwe richtingen duwt. Ze behandelen de beweging van deze woord-bootjes als een natuurkundig probleem, waarbij de bootjes deeltjes zijn die bewegen op een sfeer (zoals het oppervlak van een wereldbol).

De onderzoekers ontdekten dat de FFN de bootjes niet alleen naar voren of naar achteren duwt (wat alleen hun snelheid of grootte zou veranderen). In plaats daarvan is het belangrijkste deel van de taak van de FFN hen zijwaarts, of "tangentieel", duwen. Stel je een bootje voor op een wereldbol voor; het duwen naar de Noordpool verandert de grootte ten opzichte van het centrum, maar het zijwaarts duwen verandert de werkelijke richting op de kaart. Het papier laat zien dat deze zijwaartse duw is wat de betekenis en het pad van het woord daadwerkelijk verandert.

Wat Ze Deden en Wat Ze Vonden

Om dit te bewijzen, voerde het team een reeks experimenten uit op verschillende beroemde AI-modellen, waaronder GPT-2, Pythia, Mistral en Llama-3. Ze behandelden de AI als een wetenschappelijk laboratorium waar ze onderdelen aan of uit konden zetten of de manier waarop ze werkten konden veranderen.

Eerst controleerden ze of Attention alleen kon verklaren waar de bootjes heen gingen. Ze vonden een enorme "angular-alignment deficit" (hoekmatig uitlijningstekort). In gewone mensentaal: als ze alleen de Attention-magneet zouden laten werken, zouden de bootjes in de verkeerde richting wijzen vergeleken met waar de echte AI de bootjes naartoe stuurde. Dit tekort werd groter in grotere, nieuwere modellen, van ongeveer 0,41 in GPT-2 naar 0,63 in Llama-3-8B. Dit suggereert dat zonder de sturing van de FFN, de AI de weg kwijt zou zijn.

Vervolgens voerden ze een "operatie" uit op de FFN. Ze splitsen de duw van de FFN in twee delen: het "radiale" deel (naar voren/achteren duwen) en het "tangentiële" deel (zijwaarts duwen).

  • Wanneer ze alleen het radiale deel behielden, stortte de prestatie van de AI volledig in, net alsof ze de FFN volledig hadden verwijderd.
  • Wanneer ze alleen het tangentiële deel behielden, bleef de AI bijna perfect werken, met slechts een minimale daling in kwaliteit.

Dit was het bewijs. Het bewees dat de belangrijkste taak van de FFF het sturen van de richting van de woorden is, en niet alleen het aanpassen van hun grootte.

Ze keken ook naar wat er gebeurt als de Attention-magneet te hard trekt en probeert alle bootjes in één kleine klomp te proppen (een probleem dat "rank collapse" wordt genoemd). Ze ontdekten dat de FFF fungeert als een tegenkracht. Terwijl Attention probeert de bootjes bij elkaar te drukken, duwt de FFF ze juist uit elkaar, waardoor de groep divers blijft en ze niet allemaal hetzelfde woord worden. Het is als een DJ die merkt dat iedereen naar het midden kruipt en dan een beat begint te spelen die mensen weer doet verspreiden.

Een Praktische Truc: Het Dansfeest Versnellen

Het meest opwindende deel van het artikel is een praktische truc die ze ontdekten. In een standaard AI worden de bootjes eerst getrokken door de Attention-magneet, en daarna geeft de FFN-coach ze een duwtje. Dit gebeurt één na het ander (sequentieel). De onderzoekers vroegen zich af: "Wat als we de magneet en de coach tegelijkertijd (in parallel) laten werken?"

Normaal gesproken kun je dit niet doen omdat de coach eerst moet zien waar de magneet het bootje naartoe heeft getrokken. Maar het team mat een "defect score" om te zien hoeveel de volgorde uitmaakte voor elke laag van de AI. Ze ontdekten dat voor sommige lagen de volgorde niet veel uitmaakte. Door deze "low-defect" lagen te identificeren, konden ze de Attention- en FFN-onderdelen tegelijkertijd laten draaien.

  • In GPT-2-large slaagden ze erin het proces met ongeveer 1,24 keer te versnellen met bijna geen kwaliteitsverlies (slechts +0,02 verlies).
  • In Mistral behaalden ze een versnelling van 1,10 keer met een minimaal verlies van +0,009.

Echter, als ze dit probeerden te doen op lagen waar de volgorde wel uitmaakte (high-defect lagen), stortte de prestatie van de AI in. Dit suggereert dat hoewel we de hele AI niet direct in parallel kunnen laten draaien, we specifieke delen ervan kunnen versnellen door precies te weten hoe de sturing werkt.

Wat Dit Betekent

Het artikel beweert niet dat het alles over AI heeft opgelost, maar het verandert de manier waarop we de motor zien. Het suggereert dat de FFN niet alleen een helper is; het is een directioneel stuurveld dat de geometrie van de gedachten van de AI vormgeeft. Het voorkomt dat de AI vastloopt in één enkele richting en stelt de AI in staat om complexe ideeën te navigeren. Door te begrijpen dat de FFF het "stuur" is en niet alleen het "gaspedaal", kunnen onderzoekers mogelijk snellere, efficiëntere AI-modellen bouwen die niet de weg kwijtraken. De bevindingen zijn gebaseerd op zorgvuldige metingen en simulaties over meerdere modellen, wat suggereert dat dit "aggregatie-sturing" beeld een robuuste manier is om te begrijpen hoe deze digitale breinen bewegen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →