← Nieuwste papers
🤖 machine learning

Kaczmarz Linear Attention

Het artikel introduceert Kaczmarz Lineaire Aandacht (KLA), een gemodificeerde Gated DeltaNet die de empirisch geleerde updatecoëfficiënt vervangt door een theoretisch afgeleide, op de norm van de sleutel genormaliseerde Kaczmarz-stapgrootte, wat resulteert in superieure perplexiteit, stabiliteit bij lange contexten en decoderingsefficiëntie zonder de architectuur of de vorm van de toestand van het model te wijzigen.

Oorspronkelijke auteurs: Jiaxuan Zou, Ruifeng Ren, Yong Liu

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiaxuan Zou, Ruifeng Ren, Yong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren een zeer lang boek te lezen. De robot moet zich herinneren wat het eerder las om de huidige zin te begrijpen.

Het Probleem: De "Kwadratische" Bottleneck
Traditionele AI-modellen (Transformers) werken als een student die, voor elk nieuw woord dat hij leest, door het hele boek moet terugbladeren om elk vorig woord te controleren en te zien hoe ze met elkaar verbonden zijn. Als het boek kort is, is dit geen probleem. Maar als het boek 100.000 pagina's lang is, moet de student voor elk enkel woord een enorme hoeveelheid werk verrichten. Dit wordt zo traag en duur dat het praktisch onmogelijk is om dit op te schalen.

De Oplossing: De "Recurrence State"
Nieuwere modellen proberen dit op te lossen door te werken als een student met een klein, vast formaat notitieboekje. In plaats van terug te bladeren naar het hele boek, werken ze hun notitieboekje bij naarmate ze lezen. Ze schrijven de belangrijkste stukjes op, vergeten de rest en blijven doorgaan. Dit is snel (lineaire tijd), maar het is moeilijk goed te krijgen: Wat moeten ze opschrijven? Hoeveel moeten ze wissen? En hoe moeten ze de notitie bijwerken als ze weer hetzelfde onderwerp tegenkomen?

De Eerdere Poging: Gated DeltaNet (GDN)
Een populair model, genaamd Gated DeltaNet (GDN), gebruikt een "notitieboekje"-benadering. Wanneer het een nieuw stukje informatie ziet, berekent het het verschil tussen wat het denkt te weten en wat het echt ziet, en schrijft dat verschil dan in het notitieboekje.

Echter, GDN heeft een gebrek: het gebruikt een "geleerde gok" (een getal dat het tijdens het trainen uitrekent) om te beslissen hoe groot de verandering moet zijn. Het is alsof een student raadt: "Hmm, ik denk dat ik dit moet opschrijven met een stift van maat 5." Soms gebruiken ze een stift die te groot is (de pagina wordt besmeurd), en soms te klein (de tekst is vaag en gaat verloren). Deze gok is gewoon een gewoonte die het model heeft geleerd, geen wiskundige regel.

Het Nieuwe Idee: Kaczmarz Linear Attention (KLA)
De auteurs van dit artikel, Jiaxuan Zou en collega's, vroegen zich af: "Kunnen we stoppen met gokken en wiskunde gebruiken om precies te beslissen hoe groot de verandering moet zijn?"

Ze keken naar een oude wiskundige methode genaamd de Kaczmarz-projectie.

  • De Analogie: Stel je voor dat je een lijn op een stuk papier probeert te tekenen die door een specifiek punt gaat. Je hebt een liniaal (je huidige staat). Als je liniaal het punt niet raakt, moet je hem een duwtje geven.
  • Het Inzicht: De Kaczmarz-methode zegt dat de beste manier om de liniaal een duwtje te geven is om te meten hoe "sterk" of "luid" het punt is. Als het punt erg luid is (een sterk signaal), heb je slechts een klein duwtje nodig om het te raken. Als het punt stil is (een zwak signaal), heb je een groot duwtje nodig.

In de taal van het artikel kijken ze naar de "Key" (het signaal) en meten ze de sterkte ervan (de "norm"). Ze berekenen vervolgens een precieze stapgrootte:

Stapgrootte = (Leerfactor) / (Sterkte van het Signaal)

Dit is de Kaczmarz-coëfficiënt.

Wat Veranderde Er?
De auteurs bouwden geen nieuwe robot of een nieuw notitieboekje. Ze veranderden de hardware niet. Ze vervingen simpelweg het "gokkende" getal in het GDN-model door dit precieze, wiskundig afgeleide getal.

  • Oude Manier: "Ik zal dit opschrijven met een stiftdikte van 0,5 omdat mijn trainingsdata mij dat vertelde."
  • Nieuwe Manier (KLA): "Ik zal dit opschrijven met een stiftdikte van 0,5 gedeeld door hoe luid dit signaal is."

De Resultaten
Omdat deze nieuwe regel wiskundig perfect is voor de specifieke taak van het bijwerken van het geheugen, presteert het model beter:

  1. Slimmer: Het voorspelt het volgende woord in een zin nauwkeuriger (lagere "perplexity") dan de vorige beste modellen.
  2. Langere Geheugen: Het kan veel langere contexten (tot 65.000 woorden) verwerken zonder verward te raken of dingen te vergeten, terwijl het oude model begon te worstelen.
  3. Beter in Taken: In tests waarbij het model een specifieke "naald" moest vinden in een enorme "hooiberg" van tekst, haalde KLA 100% correct, terwijl anderen het misten.
  4. Even Snel: Omdat ze alleen de wiskundige formule voor de update veranderden en niet de structuur van het notitieboekje, draait het model even snel als het oude. Sterker nog, het decodeert (tekst genereert) 2,1 keer sneller bij lange lengtes.

Samenvattend
Het artikel introduceert KLA, een model dat dezelfde snelle, efficiënte structuur behoudt als zijn voorganger, maar een "gokkende" update-regel vervangt door een precieze, wiskundig afgeleide. Het is alsof je een auto neemt die al goed rijdt en de gokwerk van de bestuurder vervangt door een perfect GPS-navigatiesysteem. De auto is hetzelfde, maar hij komt nauwkeuriger en efficiënter op de bestemming aan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →