A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Cet article propose les représentations par produit tensoriel (TPR) comme un cadre unificateur qui démontre mathématiquement et empiriquement comment diverses méthodes d'interprétabilité des modèles de langage, telles que le sondage linéaire et les auto-encodeurs creux, peuvent être dérivées d'une structure unique de liaisons entre remplisseurs et rôles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde calme et bourdonnant de l'intelligence artificielle, les chercheurs tentent de comprendre comment les programmes informatiques massifs, connus sous le nom de modèles de langage, réfléchissent réellement. Ces systèmes peuvent écrire de la poésie, résoudre des problèmes mathématiques et tenir des conversations, mais à l'intérieur de leurs cerveaux numériques, l'information est stockée sous forme de longues listes de nombres. Pendant des années, les scientifiques ont utilisé divers outils pour jeter un coup d'œil dans ces boîtes noires, découvrant que les modèles semblent organiser l'information de manières étonnamment ordonnées. Certains outils montrent que les modèles peuvent résoudre des énigmes en ajoutant et en soustrayant ces listes de nombres, tandis que d'autres révèlent que des parties spécifiques du modèle s'illuminent lorsqu'elles rencontrent un mot ou une idée particulière. Pourtant, ces découvertes sont restées isolées, comme des indices séparés trouvés dans différentes pièces d'une maison obscure. La grande question était de savoir s'il existe une structure unique et sous-jacente qui explique tous ces comportements différents, ou si les modèles ne sont qu'un mélange chaotique de tours de passe-passe sans rapport.
Une équipe de chercheurs de l'Université de Yale a proposé une réponse unificatrice à cette énigme. Ils suggèrent que ces modèles de langage complexes sont construits sur un principe architectural spécifique appelé Représentations de Produits Tensoriels. En termes simples, cela signifie que ces modèles stockent l'information en liant étroitement deux éléments : le contenu d'une idée (comme un mot spécifique) et son rôle dans une phrase (comme le fait d'être le sujet ou l'objet). Imaginez un système de classement où chaque information est stockée non seulement par ce qu'elle est, mais aussi par l'endroit exact où elle appartient dans une structure. Les chercheurs ont découvert que cette manière simple et structurée d'organiser les données peut expliquer un large éventail de découvertes auparavant sans lien entre elles. Elle rend compte de la raison pour laquelle les modèles peuvent effectuer des analogies mathématiques, pourquoi des tests simples peuvent révéler des concepts cachés, et pourquoi le changement d'une seule partie de l'état interne d'un modèle peut modifier son comportement de manière prévisible.
Pour tester cette idée, l'équipe ne s'est pas contentée de la théorie ; elle a construit un nouvel outil pour servir de traducteur. Ils ont créé un système qui prend la structure connue d'une phrase — identifiant le sujet, le verbe et l'objet — et la convertit en les motifs numériques spécifiques utilisés par les modèles. Ils ont ensuite comparé cette version traduite aux fonctions internes réelles de plusieurs modèles informatiques différents, allant de réseaux petits et simples aux systèmes de langage massifs et de pointe. Les résultats étaient d'une cohérence frappante. Dans des tests impliquant des séquences de nombres et des phrases anglaques structurées, la traduction structurelle des chercheurs correspondait aux états internes des modèles avec une précision extrêmement élevée. Pour les modèles plus simples, la correspondance était presque parfaite, capturant presque toute la variation de la manière dont les modèles traitaient l'information. Même pour les modèles de langage les plus grands et les plus complexes, la traduction capturait la vaste majorité de l'information, suggérant que ces systèmes géants, malgré leur taille, reposent sur cette même méthode fondamentale de liaison du contenu à la position.
La force de cette découverte réside dans la façon dont elle relie différentes méthodes d'investigation. Les chercheurs ont montré que la logique mathématique derrière leur traduction structurelle pouvait être utilisée pour recréer les résultats de quatre techniques majeures d'interprétabilité utilisées aujourd'hui par les scientifiques. Premièrement, ils ont expliqué pourquoi les modèles de langage peuvent effectuer des « analogies additives », un phénomène où la soustraction d'un concept d'un autre et l'ajout d'un troisième produit un quatrième concept lié. Leur travail a démontré que cela se produit parce que les modèles calculent essentiellement la différence entre des couplages spécifiques de contenu et de rôle. Deuxièmement, ils ont montré comment les « sondes linéaires », qui sont des tests simples utilisés pour détecter si un modèle connaît un certain fait, sont en réalité un moyen de délier le rôle du contenu pour récupérer l'idée originale. Troisièmement, ils ont expliqué comment les « auto-encodeurs clairsemés », qui décomposent des signaux complexes en parties plus simples, identifient en fait ces mêmes liaisons de contenu et de rôle. Enfin, ils ont démontré que le « patch d'activation », une technique consistant à échanger des parties du cerveau d'un modèle pour voir comment cela modifie le comportement, fonctionne parce qu'ils échangent directement ces liaisons structurelles spécifiques.
Dans une série d'expériences, l'équipe a prouvé qu'elle pouvait utiliser sa traduction structurelle pour construire ces quatre outils de test à partir de zéro, sans avoir besoin de les entraîner sur les modèles au préalable. Lorsqu'ils ont utilisé ces outils construits pour analyser les modèles, ils ont performé aussi bien que les outils standard, lourdement entraînés, utilisés par le domaine. Par exemple, lorsqu'ils ont utilisé leur méthode pour prédire quel mot apparaîtrait ensuite dans une phrase, ou pour identifier le sujet d'une phrase, la précision était presque identique aux meilleures méthodes existantes. Dans un test spécifique impliquant un grand modèle de langage, la différence entre leur prédiction structurelle et la méthode standard était si petite qu'elle était presque invisible, avec un score de corrélation proche de un. Cela suggère que les comportements complexes et appris de ces modèles ne sont pas mystérieux ou accidentels, mais sont les conséquences directes de cette règle structurelle sous-jacente.
Les chercheurs ont également exploré la robustesse de cette structure face à de nouvelles situations. Ils ont entraîné leur traducteur structurel sur un ensemble de phrases, puis l'ont testé sur des phrases contenant des mots et des rôles qu'ils n'avaient jamais vus auparavant. Le traducteur a réussi à généraliser, reconstruisant avec précision l'état interne du modèle pour ces nouvelles combinaisons. Cela indique que les modèles ne font pas que mémoriser des exemples spécifiques, mais utilisent un système flexible pour combiner de nouveaux contenus avec des rôles connus. L'étude n'a pas prétendu résoudre tous les mystères de l'intelligence artificielle, ni suggéré que tous les modèles sont identiques. Cependant, elle a fourni des preuves solides qu'un cadre unique et cohérent peut expliquer comment ces systèmes représentent le monde. En montnant que diverses méthodes d'interprétabilité pointent toutes vers la même réalité structurelle, ce travail rapproche le domaine d'une compréhension unifiée du fonctionnement des réseaux neuronaux, transformant une collection d'observations isolées en une image unique et cohérente de l'esprit de la machine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.