Automated Interpretability and Feature Discovery in Language Models with Agents
Cet article présente un cadre multi-agents autonome qui automatise l'interprétabilité mécaniste en affinant itérativement des hypothèses et en découvrant des caractéristiques internes dans les grands modèles de langage, démontrant une performance supérieure aux méthodes en un seul coup pour produire des explications plus précises, falsifiables et auditable.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez une machine géante, incroyablement complexe (un grand modèle de langage), capable d'écrire des histoires, de répondre à des questions et de résoudre des problèmes. À l'intérieur de cette machine, des milliards de petits interrupteurs et engrenages (neurones et caractéristiques) travaillent ensemble. Le problème est que nous ne disposons pas de manuel. Nous pouvons observer la machine en action, mais nous ne savons pas exactement ce que fait chaque engrenage individuel.
Pendant longtemps, les chercheurs ont tenté de résoudre ce mystère en examinant un engrenage, en devinant sa fonction et en notant une étiquette telle que « cet engrenage sert aux mathématiques ». Mais souvent, cette hypothèse était erronée, trop vague, ou s'effondrait dès qu'on essayait un exemple légèrement différent. C'était comme essayer de deviner la fonction d'une pièce de voiture en la regardant une seule fois.
Ce papier présente un nouveau système appelé InterpAgent. Au lieu qu'un humain fasse une seule hypothèse, InterpAgent fonctionne comme une équipe de détectives robots collaborant pour résoudre le mystère de la fonction réelle des engrenages de la machine.
Voici comment ils procèdent, en utilisant des analogies simples :
Les Deux Équipes de Détectives
Le système utilise deux agents robots spécialisés qui communiquent entre eux :
Le « Détecteur de Caractéristiques » (L'Éclaireur) :
Imaginez que vous voulez trouver tous les engrenages responsables de la « langue espagnole ». L'Éclaireur ne sait pas quel engrenage il s'agit. Il se rend donc dans « l'espace d'activation » de la machine (une carte montrant comment les engrenages s'illuminent) pour y chercher des motifs. Il utilise une carte statistique (comme un GPS) pour repérer des groupes d'engrenages qui s'illuminent simultanément lorsque des mots espagnols sont utilisés. Il ne se contente pas de deviner ; il utilise les mathématiques pour identifier les engrenages qui séparent de manière fiable les requêtes en espagnol de celles en anglais.- L'Analogie : C'est comme un détective scrutant une foule pour trouver la seule personne portant un chapeau rouge, qui n'apparaît que lors de fêtes françaises.
Le « Explorateur de Caractéristiques » (L'Interrogateur) :
Une fois que l'Éclaireur a identifié un engrenage candidat, l'Interrogateur prend le relais. Sa tâche ne consiste pas seulement à nommer l'engrenage ; il doit tester sous contrainte cette étiquette.- L'Ancienne Méthode : Un humain pourrait dire : « Cet engrenage sert à la 'technologie'. »
- La Méthode InterpAgent : L'Interrogateur répond : « D'accord, vous pensez que c'est pour la 'technologie' ? Testons cela. » Il génère 12 exemples qui devraient activer l'engrenage (comme « réparer un ordinateur ») et 12 exemples qui ne devraient pas (comme « cuisiner des pâtes »). Il les fait passer dans la machine.
- La Surprise : Si l'engrenage s'illumine pour « cuisiner des pâtes », l'Interrogateur sait que l'étiquette « technologie » est fausse. Il reformule alors l'hypothèse : « Peut-être sert-il à 'réparer des choses' ? » Il répète ce processus, génère de nouveaux tests, vérifie les résultats et affine l'étiquette jusqu'à trouver une description qui résiste à la pression.
La « Boucle » de Découverte
Le papier souligne qu'il ne s'agit pas d'un événement ponctuel. C'est une boucle.
- Étape 1 : L'Éclaireur repère un engrenage potentiel.
- Étape 2 : L'Interrogateur émet une hypothèse sur sa fonction.
- Étape 3 : L'Interrogateur tente de briser sa propre hypothèse en trouvant des contre-exemples (des choses qui devraient activer l'engrenage mais ne le font pas, ou des choses qui ne devraient pas mais le font).
- Étape 4 : L'Interrogateur met à jour son hypothèse en fonction de cet échec.
- Étape 5 : Répéter jusqu'à ce que l'hypothèse soit solide.
C'est comme un scientifique répétant une expérience encore et encore. Si votre théorie est « Ce bouton allume les lumières », mais que vous appuyez dessus et que la radio s'allume, vous ne dites pas simplement « oups ». Vous modifiez votre théorie en « Ce bouton contrôle l'alimentation », et vous la testez à nouveau.
Ce Qu'ils Ont Découvert
Les auteurs ont testé ce système sur la famille de modèles Gemma-2 (un type d'IA). Voici ce qui s'est produit :
- Meilleures Étiquettes : L'équipe de robots était bien plus performante pour étiqueter les caractéristiques que l'ancienne méthode « en un seul coup ». L'ancienne méthode donnait souvent des réponses vagues comme « connaissances ». L'équipe de robots a trouvé des réponses spécifiques et précises, telles que « formulations françaises informelles dans des contextes de dépannage technique ».
- Découverte de l'Inconnu : Le système n'a pas seulement expliqué des engrenages que les chercheurs connaissaient déjà. L'Éclaireur a découvert de nouveaux engrenages que les humains n'avaient pas remarqués, comme des neurones spécifiques qui ne s'activent que pour du « contenu nuisible » (comme des explosifs) ou des motifs de codage particuliers.
- Vérification de Sécurité : Dans une étude de cas, ils ont trouvé un engrenage lié au refus de demandes dangereuses. Ils ont pu « orienter » la machine en désactivant cet engrenage, et la machine a cessé de refuser la demande. Cela a prouvé que l'engrenage était bien la cause du comportement de sécurité, et non un simple spectateur de celui-ci.
- Polysemanticité : Parfois, les robots ont découvert qu'un seul engrenage effectuait deux tâches très différentes simultanément (comme un engrenage gérant à la fois les « équations mathématiques » et les « termes médicaux »). Le système est assez intelligent pour dire : « Cet engrenage est confus ; il fait deux emplois », plutôt que de forcer une étiquette unique et erronée.
La Conclusion
Le papier affirme qu'en traitant l'interprétation de l'IA comme une expérience itérative (deviner, tester, échouer, corriger) plutôt que comme une étiquette statique (regarder, deviner, noter), nous obtenons des explications beaucoup plus précises et fiables.
Le système produit une « trace écrite » de chaque hypothèse, chaque test et chaque échec, rendant le processus transparent. Il démontre que si vous laissez un agent IA agir comme un scientifique rigoureux — tentant constamment de prouver ses propres idées fausses — vous obtenez une image beaucoup plus claire du fonctionnement réel du cerveau de la machine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.