← Derniers articles
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

Ce papier démontre que, bien que les circuits de modèles de langage identifiés soient hautement cohérents et nécessaires à l'exécution de la tâche, ils manquent de spécificité de tâche en raison d'un chevauchement substantiel entre les tâches, remettant ainsi en cause l'utilité du cadre pour l'intervention ciblée et la compréhension.

Auteurs originaux : Michael Li, Nishant Subramani

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Michael Li, Nishant Subramani

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez une usine massive et complexe (un modèle de langage de grande taille) capable de résoudre toutes sortes de problèmes, du calcul mathématique à la blague. Depuis longtemps, les scientifiques tentent de déterminer exactement quelles machines à l'intérieur de cette usine sont responsables de quelles tâches. Ils appellent ces groupes spécifiques de machines des « circuits ».

Ce document pose deux questions simples à propos de ces circuits :

  1. Cohérence : Si l'usine effectue la même tâche (comme additionner des nombres) dix fois, utilise-t-elle exactement les mêmes machines à chaque fois ?
  2. Spécificité : Si l'usine effectue une tâche mathématique, utilise-t-elle des différentes machines que lorsqu'elle effectue une tâche d'histoire ?

Voici ce que les chercheurs ont découvert, en utilisant des analogies simples :

1. Le test de « Cohérence » : Oui, elles sont fiables.

Les chercheurs ont vérifié si l'usine utilise les mêmes outils pour la même tâche.

  • La découverte : Oui ! Si l'usine est invitée à additionner des nombres, elle utilise de manière fiable un ensemble spécifique de machines (principalement les « couches MLP », qui sont comme les établis lourds de l'usine) pour presque chaque problème mathématique.
  • L'analogie : C'est comme un chef préparant un gâteau spécifique. Chaque fois qu'il prépare ce gâteau, il utilise le même mixeur et le même four. Il ne change pas pour un blender ou un grille-pain en cours de route. Les chercheurs ont découvert que s'ils « débranchaient » ces machines spécifiques, l'usine arrêtait presque complètement de fonctionner sur cette tâche. Cela prouve que ces machines effectuent réellement le travail et ne font pas simplement semblant d'être occupées.

2. Le test de « Spécificité » : Non, elles ne sont pas uniques.

C'est la partie surprenante. Les chercheurs s'attendaient à ce que les machines utilisées pour les « Mathématiques » soient totalement différentes de celles utilisées pour l'« Histoire » ou la « Logique ».

  • La découverte : Ils avaient tort. Les machines utilisées pour les mathématiques sont presque exactement les mêmes que celles utilisées pour l'histoire, la logique et même la compréhension de lecture.
  • L'analogie : Imaginez que vous avez une boîte à outils. Vous pensiez que la « Boîte Math » ne contenait que des outils de mathématiques (règles, calculatrices) et que la « Boîte Histoire » ne contenait que des outils d'histoire (cartes, livres). Mais en les ouvrant, vous avez découvert que les deux boîtes contenaient les mêmes 90 % d'outils.
    • Si vous retirez les « outils mathématiques » de la boîte à outils, l'usine ne peut plus faire de mathématiques.
    • Mais si vous retirez ces mêmes outils, l'usine ne peut plus faire d'histoire ni de logique non plus.
    • Il s'avère que l'usine repose sur une immense « infrastructure » partagée (les établis/couches MLP) pour faire tout. Ces outils sont le fondement de toutes les tâches, pas seulement d'une seule.

3. Les « Pépites cachées » : Un tout petit peu d'unicité.

Y a-t-il une quelconque différence entre les tâches ?

  • La découverte : Oui, mais c'est très petit. À l'intérieur du grand tas d'outils partagés, il existe un tout petit ensemble spécialisé d'outils (environ 10 à 30 % du total) qui est unique à la tâche spécifique.
  • L'analogie : Pour revenir à la boîte à outils : bien que 90 % des outils soient partagés, la « Boîte Math » contient une toute petite calculatrice spéciale que la « Boîte Histoire » n'a pas. Si vous retirez uniquement cette calculatrice, les mathématiques échouent, mais l'histoire fonctionne toujours. Cependant, comme les 90 % partagés sont si vastes et importants, retirer toute la « Boîte Math » brise tout, donnant l'impression que les outils mathématiques étaient la seule chose qui comptait.

La vue d'ensemble

Le document conclut que lorsque nous examinons les modèles de langage au niveau des « têtes d'attention » et des « couches MLP » (les grandes parties visibles de l'usine), nous voyons principalement l'infrastructure générale du bâtiment, et non les plans spécifiques pour chaque tâche.

  • Ce que cela signifie pour la compréhension : Nous pouvons facilement trouver les « établis » que le modèle utilise, mais nous ne pouvons pas facilement dire quel établi est uniquement pour les mathématiques et quel établi est uniquement pour l'histoire, car ils sont tous utilisés pour les deux.
  • La mise en garde : Les chercheurs suggèrent que pour trouver les véritables « outils spécialisés » uniques (les 10 % minuscules), nous devrons peut-être regarder de plus près, peut-être au niveau des vis ou des fils individuels (neurones ou caractéristiques) plutôt que de l'ensemble de l'établi.

En bref : Le modèle est cohérent (il utilise les mêmes outils pour la même tâche), mais il n'est pas spécifique (il utilise les mêmes outils pour chaque tâche). Les « circuits » que nous trouvons sont principalement le fondement partagé du modèle, et non les instructions uniques pour une tâche donnée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →