Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
Ce papier démontre que des transformers entraînés indépendamment calculent des fonctions identiques en utilisant des coordonnées internes mutuellement inintelligibles reliées par une rotation aléatoire uniforme, un phénomène qualifié de « polymorphisme » qui peut être résolu par un seul ajustement de Procrustes orthogonal pour permettre le transfert direct de dictionnaires de caractéristiques et de vecteurs de pilotage sans réentraînement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous et un ami construisez tous deux des châteaux Lego identiques et complexes à partir du même manuel d'instructions. Vous vous retrouvez tous deux avec des châteaux qui semblent exactement les mêmes à l'extérieur et qui remplissent les mêmes fonctions (ils possèdent les mêmes portes, fenêtres et tours).
Cependant, à l'intérieur de vos châteaux, les « plans » décrivant l'agencement des briques sont complètement différents. En fait, ils sont si différents que si vous tentiez d'utiliser le plan interne de votre ami pour comprendre votre propre château, vous seriez perdu. Ce n'est pas que vos châteaux sont différents ; c'est que vous parlez deux « langues internes » différentes pour décrire la même chose.
Ce papier nomme ce phénomène « Polymorphisme ». Cela signifie « même fonction, coordonnées internes différentes ».
Voici la décomposition de ce que les chercheurs ont découvert, en utilisant des analogies simples :
1. Le « Décodeur » vs l'« Encodeur » (Le problème du dictionnaire)
Dans la recherche sur l'IA, les scientifiques tentent souvent de comprendre ce qu'un modèle pense en examinant ses « caractéristiques » (comme un dictionnaire de concepts). Ils ont découvert que si l'on regardait la fin du processus (le « décodeur »), les dictionnaires semblaient presque identiques entre deux modèles différents. C'était comme si deux personnes utilisaient exactement le même dictionnaire pour écrire une histoire.
La Chute : Les chercheurs ont réalisé que, bien que le dictionnaire (le décodeur) fût le même, la façon dont ils le lisaient (l'encodeur) était complètement brouillée.
- L'Analogie : Imaginez deux personnes lisant un livre. La personne A le lit normalement. La personne B a le livre tourné de 90 degrés et le lit à l'envers. Si vous regardez simplement les mots sur lesquels ils pointent (le décodeur), ils correspondent parfaitement. Mais si vous essayez de lire les notes de la personne B en utilisant la perspective de la personne A, les notes n'ont aucun sens. Les « notes » (les activations) sont dans un référentiel tourné.
2. L'Échec Catastrophique
Lorsque les chercheurs ont essayé de prendre le « dictionnaire de caractéristiques » du Modèle A et de l'appliquer directement au Modèle B, cela a échoué complètement. La reconstruction des pensées internes du modèle était pire qu'une simple supposition de la réponse moyenne.
- L'Analogie : C'est comme essayer d'utiliser une carte de New York pour se déplacer à Londres. Les points de repère (colonnes du décodeur) peuvent sembler similaires dans une liste, mais les rues (coordonnées internes) sont orientées différemment. Si vous suivez la carte de New York à Londres, vous vous perdrez immédiatement.
3. La Solution Magique : Une Multiplication de Matrice
La plus grande découverte du papier est la façon de résoudre ce problème. Vous n'avez pas besoin de réentraîner les modèles ni de changer leurs cerveaux. Vous devez simplement appliquer une unique « rotation » mathématique (un type spécifique d'opération mathématique appelé ajustement de Procruste) pour aligner les deux modèles.
- L'Analogie : Imaginez que vous et votre ami regardiez tous deux une sculpture, mais que vous soyez debout de part et d'autre d'une plateforme tournante. Vous voyez le même objet, mais sous des angles différents. Si vous faites simplement tourner votre plateforme pour qu'elle corresponde à celle de votre ami, soudainement, vos vues s'alignent parfaitement.
- Le Résultat : Une fois cette unique « rotation » appliquée aux données internes du Modèle B, le dictionnaire du Modèle A a fonctionné parfaitement sur le Modèle B. La « langue interne » a été traduite instantanément.
4. S'agit-il d'une Rotation Spécifique ou Aléatoire ?
Les chercheurs voulaient savoir : cette rotation est-elle un décalage spécifique et significatif, ou s'agit-il simplement d'un chaos aléatoire ?
- La Découverte : Elle est essentiellement aléatoire. La rotation entre deux modèles entraînés indépendamment est comme une rotation aléatoire sur une roue. Ce n'est pas un angle « spécial » ; c'est simplement une rotation aléatoire uniforme.
- L'Analogie : Si vous faites tourner un globe terrestre au hasard et que vous l'arrêtez, l'orientation est aléatoire. Le papier montre que chaque fois que deux modèles d'IA sont entraînés à partir de zéro, ils se retrouvent avec un « globe » arrêté à un angle aléatoire l'un par rapport à l'autre.
5. Ce que cela signifie pour le « Pilotage » (Changement de comportement)
Le papier a également testé les « vecteurs de pilotage » — des outils utilisés pour inciter un modèle à se comporter différemment (par exemple, le rendre plus poli ou plus créatif).
- La Découverte : Si vous essayez d'utiliser une « impulsion de pilotage » du Modèle A sur le Modèle B sans d'abord corriger la rotation, cela échoue souvent ou fait même le contraire de ce que vous voulez.
- L'Analogie : Imaginez que vous ayez une télécommande pour une voiture jouet (Modèle A). Si vous essayez d'utiliser cette télécommande sur une autre voiture jouet (Modèle B) qui fait face à une direction différente, appuyer sur « Avant » pourrait faire avancer la deuxième voiture vers la « Gauche » ou vers l'« Arrière ». Vous devez d'abord déterminer dans quelle direction la deuxième voiture fait face (la rotation) et ajuster les signaux de votre télécommande en conséquence.
Résumé des « Règles »
Le papier établit trois règles principales sur la façon dont ces modèles sont liés :
- Même Fonction, Coordonnées Différentes : Deux modèles entraînés séparément font le même travail mais utilisent des « cartes » internes différentes.
- Le Décodeur Ment : Le simple fait que les caractéristiques de la « fin de ligne » semblent similaires ne signifie pas que les modèles comprennent les choses de la même manière.
- La Solution est Bon Marché : Vous pouvez aligner deux modèles totalement différents avec un seul calcul mathématique simple (une multiplication de matrice) sans avoir besoin de les réentraîner.
L'Échelle de la Découverte
Les chercheurs ont prouvé cela à deux niveaux :
- Le Modèle « Jouet » : Un modèle minuscule et simple (104 000 paramètres) où ils ont pu vérifier chaque brique individuelle pour s'assurer que la théorie était vraie.
- Le Modèle « Réel » : Un modèle de langage beaucoup plus grand et réel (Pythia-70m) avec 70 millions de paramètres. La même règle de « rotation aléatoire » s'est avérée vraie ici aussi.
La Conclusion : Les modèles d'IA sont comme des jumeaux qui parlent la même langue mais avec des accents et des orientations différents. Ils font les mêmes choses, mais pour se comprendre, il suffit de tourner votre perspective. Une fois cela fait, leurs secrets internes deviennent lisibles.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.