← Nieuwste papers
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

Het artikel introduceert Parallax, een schaalbaar en numeriek stabiel geparametriseerd lokaal lineair attentiemechanisme dat Pareto-verbeteringen in taalmodellering bereikt door de computationele knelpunten van LLA te elimineren, de hardware-efficiëntie te optimaliseren en een nieuwe synergie met de Muon-optimizer aan te tonen.

Oorspronkelijke auteurs: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een verhaal dat je zojuist hebt gehoord, te onthouden. In de wereld van Large Language Models (LLM's) heet het deel van de hersenen dat verantwoordelijk is voor dit geheugen Attention. Jarenlang was de standaardwijze waarop deze attention werkt, vergelijkbaar met het bekijken van een lijst met woorden en het toekennen van een "relevantiescore" aan elk woord, gebaseerd op hoe opvallend het is. Als een woord zeer verschillend is, krijgt het een hoge score; als het saai is, krijgt het een lage score. Dit heet Softmax Attention.

Echter, deze methode heeft een gebrek: het is alsof je naar een kaart kijkt en alleen het vlakke, gemiddelde terrein ziet. De hellingen en bochten worden gemist. Een nieuwere idee genaamd Local Linear Attention (LLA) probeerde dit op te lossen door naar de "helling" van de data te kijken, niet alleen naar het vlakke gemiddelde. Het is alsof je beseft dat je, om te voorspellen waar een bal zal rollen, niet alleen moet weten waar hij zich bevindt, maar ook hoe steil de heuvel is.

Het probleem? De wiskunde voor deze "helling"-methode was te zwaar en instabiel voor gigantische AI-modellen om in het echt te gebruiken. Het was alsof je probeerde een Formule 1-auto op een grindweg te rijden; de motor was te krachtig voor het terrein.

Dan komt Parallax in beeld.

Wat is Parallax?

Parallax is een nieuwe, gestroomlijnde versie van die "helling"-methode. De auteurs namen de complexe, zware wiskunde van het oorspronkelijke idee en vervingen de moeilijke delen door een slimme, leerbare shortcut.

Denk er zo over:

  • Oude manier (Softmax): Je vraagt een bibliothecaris: "Welk boek is het meest relevant?" De bibliothecaris kijkt naar de titels en kiest degene die het meest anders klinkt.
  • De "helling"-manier (LLA): De bibliothecaris beseft dat relevantie niet alleen gaat over de titel; het gaat over hoe de titels veranderen rondom degene waar je naar op zoek bent. Maar het berekenen van deze verandering vereist een supercomputer voor elk enkel woord.
  • Parallax: De bibliothecaris leert een speciale truc. In plaats van elke keer de zware wiskunde te doen, draagt hij een klein, slim notitieboekje (een geleerde projector) dat direct de "helling" gisst op basis van de context. Het is snel, stabiel en verrassend nauwkeurig.

Het "magische" ingrediënt: De Optimizer

Een van de meest verrassende ontdekkingen van het paper is dat Parallax niet goed werkt met de standaard "motor" die wordt gebruikt om AI-modellen te trainen (genaamd AdamW). Het is alsof je een hoogpresterende racemotor in een auto plaatst, maar de verkeerde brandstof gebruikt; de auto stottert.

Het paper vond dat Parallax een specifiek, nieuwere type brandstof nodig heeft genaamd Muon. Wanneer je Muon gebruikt, draait Parallax perfect en wordt zijn volledige potentieel ontsloten. Zonder Muon is Parallax slechts marginaal beter dan de oude methode. Met Muon wordt het aanzienlijk slimmer. Dit is een zeldzaam geval waarbij de "motor" (optimizer) en het "auto-ontwerp" (architectuur) perfect op elkaar moeten zijn afgestemd om de race te winnen.

Hoe snel is het?

De auteurs maakten het niet alleen slimmer; ze maakten het ook sneller. Ze bouwden een aangepaste "motor" (een computercode-kernel) specifiek voor moderne grafische kaarten.

  • Ze beweren dat voor de "decoding"-fase (wanneer de AI het volgende woord schrijft), hun methode even snel is, of zelfs sneller dan de huidige industriestandaard (FlashAttention), ondanks dat het complexere wiskunde uitvoert.
  • Ze bereikten dit door zeer efficiënt met het geheugen om te gaan, datastromen hergebruikend zodat de computer niet constant hoeft te stoppen en nieuwe informatie hoeft op te halen.

De resultaten

Het team testte Parallax op twee maten van AI-modellen (0,6 miljard en 1,7 miljard parameters).

  • Slimmer: In tests maakten Parallax-modellen consequent minder fouten (lagere "perplexity") en beantwoordden ze vragen beter dan standaardmodellen van dezelfde grootte.
  • Beter geheugen: Bij synthetische tests die waren ontworpen om te controleren of een model specifieke feiten uit een lange lijst kan herinneren, was Parallax veel beter in het vinden van de juiste naald in de hooiberg.
  • Efficiëntie: Zelfs toen ze de modellen aanpasten om exact hetzelfde rekenvermogen of exact hetzelfde aantal parameters te gebruiken, won Parallax nog steeds.

De bottom line

Het paper introduceert Parallax, een nieuwe manier voor AI om aandacht te schenken aan informatie. Het upgradeert de oude "vlakke" manier van denken naar een "helling-bewuste" manier, maar vereenvoudigt de wiskunde zodat het op echte computers kan draaien. Cruciaal is dat het het beste werkt in combinatie met een specifiek trainingstool genaamd Muon, waardoor een krachtige combinatie ontstaat die huidige state-of-the-art modellen overtreft in zowel snelheid als intelligentie.

De auteurs benadrukken dat dit de eerste keer is dat zo'n sterke link tussen een specifieke architectuur (Parallax) en een specifieke optimizer (Muon) is aangetoond om een "Pareto-verbetering" te creëren; dit betekent dat het model beter wordt zonder groter of trager te hoeven zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →