← Nieuwste papers
🤖 machine learning

On Subquadratic Architectures: From Applications to Principles

Dit artikel evalueert toonaangevende subkwadratische architecturen (xLSTM, Mamba-2 en Gated DeltaNet) over code- en tijdreeks-taken heen, waarbij wordt aangetoond dat xLSTM superieure prestaties levert doordat het gating-schema een flexibelere en stabielere geheugencorrectie en staat-tracking mogelijk maakt.

Oorspronkelijke auteurs: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Gepubliceerd 2026-06-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente assistent probeert te bouwen die een enorm boek kan lezen, complexe computercode kan schrijven of het weer voor volgende week kan voorspellen. Jarenlang was de industriestandaard een specifiek type motor genaamd een Transformer. Het is ongelooflijk krachtig, maar heeft een groot gebrek: naarmate de hoeveelheid informatie (de "sequentie") groeit, wordt de motor exponentieel zwaarder en trager. Het is alsof je probeert een rugzak te dragen waarbij elke nieuwe boekt die je toevoegt de tas twee keer zo zwaar maakt als de vorige.

Om dit op te lossen, hebben wetenschappers Subkwadratische Architecturen uitgevonden. Dit zijn nieuwe motordesigns die bedoeld zijn om lichter en sneller te zijn, waarbij ze slechts lineair groeien met de hoeveelheid informatie. Maar welke nieuwe motor is eigenlijk de beste?

Dit artikel zet drie van de topkandidaten in een race: xLSTM, Mamba-2 en Gated DeltaNet. Ze testten deze op drie zeer moeilijke taken:

  1. Code schrijven: Een taak vol strikte regels en lange ketens van logica.
  2. Leren van een leraar: Een grote, slimme AI nemen en een kleinere, snellere AI leren om die vaardigheden te kopiëren.
  3. Tijdreeksvoorspelling: Het voorspellen van zaken zoals aandelenkoersen of het weer, waarbij het verleden de toekomst op complexe wijze beïnvloedt.

De uitslag van de race

Over de hele linie won xLSTM. Het was de meest consistente en nauwkeurige motor, vooral wanneer de taken complex waren en een lang geheugen voor gebeurtenissen vereisten. Mamba-2 en Gated DeltaNet waren goed, maar ze struikelden vaker over de moeilijkste onderdelen van de klus.

Waarom won xLSTM? (De "geheugen"-analogie)

Om dit te begrijpen, keken de auteurs onder de motorkap. Ze realiseerden zich dat al deze motoren werken door een "toestand" of een "geheugen" bij te houden van wat ze tot nu toe hebben gezien. Ze vergeleken hoe elke motor deze twee cruciale geheugenskills afhandelt:

  1. Accumulatie (De "Teller"): Het vermogen om een lopend totaal bij te houden of dingen te tellen over een lange periode (zoals tellen hoe vaak een specifiek woord voorkomt in een document van 100 pagina's).
  2. Toestandstracking (De "Tracker"): Het vermogen om specifieke, geordende details te onthouden en ze correct bij te werken zonder de draad kwijt te raken (zoals onthouden dat "als A gebeurt, dan B moet gebeuren, tenzij C eerder is gebeurd").

Hier is hoe de drie motoren deze skills afhandelen:

  • Mamba-2 is als een strikte bibliothecaris met een gebonden hand. Het heeft een regel die zegt: "Als ik iets vergeet, moet ik ook stoppen met nieuwe dingen schrijven." Omdat de "vergeet"- en "schrijf"-schakelaars aan elkaar gekoppeld zijn, heeft het moeite om het geheugen flexibel bij te werken. Het is goed in sommige dingen, maar het raakt vaak de telling kwijt of raakt in de war wanneer het verhaal te lang wordt.
  • Gated DeltaNet is als een whiteboard met een gum. Het is erg goed in het vervangen van oude informatie door nieuwe informatie. Als er een nieuw feit binnenkomt, veegt het het oude van het bord. Dit is geweldig voor retrieval (het vinden van het nieuwste feit), maar verschrikkelijk voor het tellen. Als je moet onthouden dat "A + B + C = 10", en het bord blijft de oude getallen wegvegen om plaats te maken voor nieuwe, verlies je het totaal.
  • xLSTM is als een slim notitieboek met een markeerstift en een rekenmachine. Het scheidt het geheugen in twee delen:
    • Eén deel werkt als een rekenmachine die een lopend totaal kan bijhouden (Accumulatie) zonder iets uit te wissen.
    • Het andere deel werkt als een notitieboek dat specifieke toestanden kan bijhouden en ze flexibel kan bijwerken (State Tracking).
    • Cruciaal is dat xLSTM een speciale "poort" heeft die werkt als een zachte gum. In plaats van alleen een pagina schoon te vegen (zoals DeltaNet) of niet te kunnen wissen (zoals Mamba), kan het oude informatie verzwakken als nieuwe informatie belangrijker is, of oude informatie behouden als het nog steeds relevant is. Deze flexibiliteit stelt het in staat om zowel perfect te tellen als te tracken tegelijk.

Het bewijs: De "Lange String"-test

Om deze theorie te bewijzen, voerden de auteurs een eenvoudige test uit met verzonnen taken:

  • De Teltest: Vraag de AI om items in een lijst te tellen die veel langer is dan waarvoor hij getraind is.
  • De Trackingtest: Vraag de AI om een specifiek patroon van "oneven" en "even" wisselingen te onthouden over een lange sequentie.

De resultaten:

  • Mamba-2 faalde bijna onmiddellijk. Naarmate de lijst langer werd, vergat het alles.
  • Gated DeltaNet kon een beetje tellen, maar raakte in de war door de trackingtaken. Zelfs wanneer het werd aangepast om beter te tracken, bleef het worstelen met tellen over zeer lange afstanden.
  • xLSTM was de enige die beide kon. Het kon perfect tellen over lange afstanden én complexe patronen tracken zonder de draad kwijt te raken.

De kernboodschap

Het artikel concludeert dat xLSTM momenteel de superieure keuze is voor complexe taken omdat het het beste van twee werelden combineert: het vermogen om een lopend totaal bij te houden (accumulatie) en het vermogen om specifieke, veranderende details bij te houden (state tracking), zonder te moeten kiezen tussen de twee. Hoewel de andere motoren goed zijn in het een of het ander, stelt het flexibele "geheugencorrectie"-mechanisme van xLSTM het in staat om de rommelige, langetermijnafhankelijkheden te verwerken die voorkomen in echte code en data.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →