← Derniers articles
💬 NLP

Mechanistic evaluation of Transformers and state space models

Cet article emploie des interventions causales pour révéler que, bien que les Transformers et les SSM puissent atteindre une précision similaire sur les tâches de rappel associatif, ils reposent sur des mécanismes fondamentalement différents — plus précisément, les modèles Transformer et Based utilisent l'induction en contexte alors que la plupart des SSM reposent sur des calculs d'état à couche unique, Mamba parvenant de manière unique à l'induction grâce à de courtes convolutions plutôt que par son composant SSM central.

Auteurs originaux : Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

Publié 2026-02-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment jouer à un jeu de mémoire. Le jeu est simple : vous montrez au robot une liste de paires, comme « Pomme = Rouge », « Banane = Jaune » et « Raisin = Violet ». Ensuite, vous demandez : « Quelle est la couleur de la Banane ? ». Le robot doit regarder en arrière dans la liste, trouver « Banane » et se souvenir qu'elle est liée à « Jaune ».

Dans le monde de l'IA, cela s'appelle le Rappel Associatif (Associative Recall). Le document que vous avez partagé est une analyse approfondie de la manière dont différents types de cerveaux d'IA (architectures) résolvent ce jeu. Les chercheurs ne se sont pas contentés de regarder qui obtenait le score le plus élevé ; ils ont passé les robots sous un microscope pour voir exactement ce qui se passait à l'intérieur de leurs « têtes » pendant qu'ils jouaient.

Voici l'histoire de leurs découvertes, décomposée en concepts simples.

Les deux principaux rivaux

Le document compare deux principaux types d'architectures d'IA :

  1. Les Transformers : Les champions actuels de l'IA (comme ceux qui alimentent la plupart des chatbots). Ils utilisent un mécanisme appelé « Attention », qui est comme un projecteur capable de scanner instantanément toute la liste de paires pour trouver la réponse.
  2. Les Modèles d'Espace d'États (SSM) : Les nouveaux challengers, plus rapides et plus efficaces (comme Mamba et DeltaNet). Ils sont conçus pour être plus légers et plus rapides que les Transformers, mais on soupçonnait qu'ils étaient moins performants pour les tâches de mémoire.

La grande découverte : Ce n'est pas seulement une question de score

Habituellement, si une IA obtient 99 % à un test, nous supposons qu'elle a appris la leçon. Mais ce document soutient que obtenir la bonne réponse ne signifie pas que vous avez appris de la bonne manière.

Les chercheurs ont utilisé une technique de « chirurgie » spéciale appelée Intervention Causale. Imaginez que vous avez un robot qui résout parfaitement le jeu de mémoire. Ensuite, vous remplacez secrètement le mot « Banane » par « Voiture » dans la mémoire du robot après qu'il a lu la liste, mais avant qu'il ne donne la réponse.

  • Si le robot dit soudainement « Jaune est la couleur d'une Voiture », cela signifie qu'il a réellement mémorisé le lien (Induction).
  • S'il se trompe ou échoue, cela signifie qu'il n'a pas réellement stocké le lien de manière flexible ; il regardait simplement ses environs immédiats.

Ce qu'ils ont trouvé

1. La différence entre « Induction » et « Récupération Directe »

  • Les Transformers et les modèles « Based » : Ces modèles ont appris à jouer au jeu de la manière « intelligente ». Ils ont créé une carte mentale où ils stockent la connexion entre l'élément et sa valeur (par exemple, « Banane » est collée à « Jaune ») au fur et à mesure de la lecture de la liste. Lorsqu'on pose une question, ils consultent cette carte stockée. Les chercheurs appellent cela l'Induction.
  • La plupart des SSM (comme H3 et Hyena) : Ces modèles ont échoué au jeu. Ils n'ont pas réussi à comprendre comment stocker les liens.
  • Mamba et DeltaNet : Ces modèles ont obtenu des scores élevés, mais ils ont triché ! Ils n'ont pas construit de carte mentale. Au lieu de cela, ils ont utilisé un « raccourci ». Quand la question « Banane ? » arrive, ils regardent immédiatement le jeton juste avant eux ou utilisent un truc très spécifique et rigide pour saisir la réponse. Ils n'ont pas appris la règle générale d'« association » ; ils ont juste appris à saisir la réponse à un endroit précis.

2. L'arme secrète : La « Convolution courte »

Les chercheurs ont découvert que les modèles qui ont réussi (Mamba et Based) possédaient une arme secrète : un outil de mémoire à court terme appelé convolution courte.

  • Analogie : Imaginez lire un livre. Une « convolution longue » revient à lire tout le chapitre pour comprendre une phrase. Une « convolution courte » revient à jeter un coup d'œil rapide sur le mot que vous venez de lire et sur celui qui le précède.
  • La découverte : Mamba utilise ce « coup d'œil » (convolution courte) pour lier « Banque » à « Jaune » pendant qu'il lit. Sans cet outil spécifique (convolution courte), Mamba oublie complètement comment jouer au jeu. Il s'avère que Mamba n'utilise pas son « cerveau » principal (la partie SSM) pour faire le travail de mémoire ; il utilise cet outil de « coup d'œil » pour faire le gros du travail.

3. Le rebondissement : Le jeu de l'« Arbre » (ATR)

Pour voir si ces découvertes étaient dues au hasard dans ce jeu simple, les chercheurs ont inventé une version plus difficile appelée Associative Treecall (ATR).

  • Le changement : Dans le jeu simple, « Banane » et « Jaune » étaient toujours l'un à côté de l'autre. Dans le jeu de l'« Arbre », ils pouvaient être éloignés, séparés par d'autres mots, comme un arbre généalogique. « Jean avait un chien. Le chien a poursuivi un chat. Le chat a vu un oiseau. Qu'est-ce que Jean avait ? »
  • Le résultat :
    • Les Transformers et Based : Utilisaient toujours leur carte d'« Induction ». Ils géraient facilement la distance.
    • Mamba (avec le raccourci) : Utilisait toujours son outil de « coup d'œil » et réussissait bien.
    • Mamba (sans le raccourci) : Voici la surprise ! Lorsque les chercheurs ont retiré l'outil de « convolution courte » de Mamba, Mamba a échoué au jeu simple mais a réussi au jeu difficile de l'« Arbre ».
    • Pourquoi ? Sans le raccourci, Mamba a été forcé d'apprendre la carte d'« Induction » (de la même manière que les Transformers) pour résoudre le problème plus difficile. Cela a prouvé que Mamba est capable d'apprendre de la manière intelligente, mais qu'il ne le fait que lorsqu'il y est absolument obligé.

La conclusion

Le document conclut que la précision est un menteur.

Deux modèles d'IA peuvent obtenir le même score à un test, mais l'un peut être un génie qui comprend les règles (Induction), tandis que l'autre peut être un tricheur qui a simplement mémorisé le corrigé pour ce test spécifique (Récupération Directe).

  • Les Transformers sont comme des bibliothécaires qui organisent les livres sur des étagères pour pouvoir trouver n'importe quelle connexion plus tard.
  • Mamba (dans sa forme standard) est comme une personne qui ne se souvient que de la dernière chose qu'elle a vue, à moins d'utiliser un « post-it » spécifique (convolution courte) pour l'aider.
  • La leçon : Pour vraiment comprendre l'IA, nous ne pouvons pas nous contenter de regarder les scores aux tests. Nous devons regarder sous le capot pour voir comment la machine réfléchit. Cette « évaluation mécaniste » est le nouvel outil que les auteurs proposent pour nous empêcher d'être trompés par des scores élevés qui cachent une compréhension fragile.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →