← Derniers articles
🤖 machine learning

On Subquadratic Architectures: From Applications to Principles

Cet article évalue les principales architectures sous-quadratiques (xLSTM, Mamba-2 et Gated DeltaNet) à travers des tâches de code et de séries temporelles, démontrant que xLSTM atteint une performance supérieure grâce à son schéma de porte permettant une correction de la mémoire et un suivi d'état plus flexibles et stables.

Auteurs originaux : Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Publié 2026-06-11
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de construire un assistant super intelligent capable de lire un livre massif, d'écrire du code informatique complexe ou de prédire la météo pour la semaine prochaine. Pendant des années, la norme de l'industrie a été un type spécifique de moteur appelé Transformer. Il est incroyablement puissant, mais il possède un défaut majeur : à mesure que la quantité d'informations (la « séquence ») augmente, le moteur devient exponentiellement plus lourd et plus lent. C'est comme essayer de porter un sac à dos où chaque nouveau livre que vous ajoutez rend le sac deux fois plus lourd que le précédent.

Pour corriger cela, les scientifiques ont inventé les Architectures Subquadratiques. Ce sont de nouveaux designs de moteurs destinés à être plus légers et plus rapides, dont la croissance est seulement linéaire avec la quantité d'informations. Mais quel nouveau moteur est réellement le meilleur ?

Ce document met trois des meilleurs prétendants en compétition. Ils les ont testés sur trois tâches très difficiles :

  1. Écrire du code : Une tâche pleine de règles strictes et de longues chaînes de logique.
  2. Apprendre d'un enseignant : Prendre une IA immense et intelligente et apprendre à une plus petite et plus rapide à copier ses compétences.
  3. Prédire des séries temporelles : Prévoir des choses comme les cours de la bourse ou la météo, où le passé influence le futur de manière complexe.

Les résultats de la course

Sur toute la ligne, xLSTM a gagné. Il a été le moteur le plus constant et le plus précis, surtout lorsque les tâches étaient complexes et nécessitaient de se souvenir de longues chaînes d'événements. Mamba-2 et Gated DeltaNet étaient bons, mais ils ont trébuché plus souvent sur les parties les plus difficiles du travail.

Pourquoi xLSTM a-t-il gagné ? (L'analogie de la « Mémoire »)

Pour comprendre pourquoi, les auteurs ont regardé sous le capot. Ils ont réalisé que tous ces moteurs fonctionnent en maintenant un « état » ou une « mémoire » de ce qu'ils ont vu jusqu'à présent. Ils ont comparé la façon dont chaque moteur gère deux compétences de mémoire critiques :

  1. L'Accumulation (le « Compteur ») : La capacité de tenir un total courant ou de compter des choses sur une longue période (comme compter combien de fois un mot spécifique apparaît dans un document de 100 pages).
  2. Le Suivi d'État (le « Traceur ») : La capacité de se souvenir de détails spécifiques et ordonnés et de les mettre à jour correctement sans perdre le fil (comme se souvenir que « si A arrive, alors B doit arriver, à moins que C ne soit arrivé d'abord »).

Voici comment les trois moteurs gèrent ces compétences :

  • Mamba-2 est comme un bibliothécaire strict à la main liée. Il a une règle qui dit : « Si j'oublie quelque chose, je dois aussi arrêter d'écrire de nouvelles choses. » Parce que ses commutateurs « oublier » et « écrire » sont liés, il a du mal à mettre à jour sa mémoire de manière flexible. Il est bon pour certaines choses, mais il perd souvent le compte ou s'embrouille quand l'histoire devient trop longue.
  • Gated DeltaNet est comme un tableau blanc avec une brosse à effacer. Il est très bon pour remplacer les anciennes informations par de nouvelles. Si une nouvelle information arrive, il efface l'ancienne du tableau. C'est excellent pour la récupération (trouver le dernier fait), mais terrible pour le comptage. Si vous devez vous souvenir que « A + B + C = 10 », et que le tableau continue d'effacer les anciens chiffres pour faire de la place aux nouveaux, vous perdez le total.
  • xLSTM est comme un carnet intelligent avec un surligneur et une calculatrice. Il sépare sa mémoire en deux parties :
    • Une partie agit comme une calculatrice qui peut tenir un total courant (Accumulation) sans rien effacer.
    • L'autre partie agit comme un carnet qui peut suivre des états spécifiques et les mettre à jour de manière flexible (Suivi d'État).
    • Crucialement, xLSTM possède une « porte » spéciale qui agit comme une gomme douce. Au lieu de simplement nettoyer une page entière (comme DeltaNet) ou d'être incapable d'effacer (comme Mamba), il peut atténuer les anciennes informations si de nouvelles informations sont plus importantes, ou conserver les anciennes informations si elles sont toujours pertinentes. Cette flexibilité lui permet de faire parfaitement le comptage et le suivi en même la fois.

La preuve : Le test de la « Longue Chaîne »

Pour prouver cette théorie, les auteurs ont mené un test simple avec des tâches fictives :

  • Le test de comptage : Demander à l'IA de compter des éléments dans une liste qui est beaucoup plus longue que celle pour laquelle elle a été entraînée.
  • Le test de suivi : Demander à l'IA de se souvenir d'un motif spécifique de commutations « impairs » et « pairs » sur une longue séquence.

Les résultats :

  • Mamba-2 a échoué presque immédiatement. À mesure que la liste devenait plus longue, il oubliait tout.
  • Gated DeltaNet pouvait compter un peu, mais il se mélangeait les pinceaux dans les tâches de suivi. Même lorsqu'il était ajusté pour être meilleur en suivi, il peinait toujours à compter sur de très longues distances.
  • xLSTM était le seul capable de faire les deux. Il pouvait compter parfaitement sur de longues distances et suivre des motifs complexes sans perdre le fil.

L'essentiel

Le document conclut que xLSTM est actuellement le choix supérieur pour les tâches complexes car il combine le meilleur des deux mondes : la capacité de tenir un total courant (accumulation) et la capacité de suivre des détails spécifiques et changeants (suivi d'état) sans les forcer à choisir entre les deux. Bien que les autres moteurs soient bons pour l'un ou l'autre, le mécanisme de « correction de mémoire » flexible de xLSTM lui permet de gérer les dépendances complexes et à long terme présentes dans le code et les données du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →