Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?
Cet article introduit AgenticInterpBench et le cadre HyVE pour démontrer que les agents de modèles de langage peuvent générer efficacement des explications au niveau des composants et des tâches pour les circuits neuronaux identifiés grâce à une boucle itérative d'hypothèse-validation, bien que leur fiabilité soit actuellement limitée par des défis lors de la phase de validation.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une machine massive et complexe (comme un immense modèle de langage) capable d'écrire des histoires, de résoudre des problèmes mathématiques ou de répondre à des questions. Des scientifiques ont découvert comment trouver les « engrenages et leviers » spécifiques à l'intérieur de cette machine qui lui permettent d'accomplir une tâche précise. C'est ce qu'on appelle la localisation de circuit.
Cependant, trouver les engrenages ne suffit pas ; nous ne savons toujours pas exactement ce que fait chaque engrenage ni comment ils fonctionnent ensemble. Habituellement, un expert humain doit passer des heures à fixer la machine, à deviner la fonction d'une pièce, à tester son hypothèse, puis à recommencer. C'est lent, ennuyeux et difficile à mettre à l'échelle.
Cette publication pose la question suivante : Pouvons-nous embaucher un robot détective (un Agent de Modèle de Langage) pour faire ce travail d'enquête à notre place ?
Voici la décomposition de leur expérience, en utilisant des analogies simples :
1. Le Problème : Le mystère de la « Boîte Noire »
Considérez le modèle de langage comme un coffre-fort géant et verrouillé. Des scientifiques ont déjà utilisé des outils spéciaux pour trouver les goupilles spécifiques (le « circuit ») qui ouvrent le coffre. Mais ils ne savent pas ce que fait chaque goupille.
- L'ancienne méthode : Un détective humain essaie de deviner : « Peut-être que cette goupille actionne la serrure ? ». Il teste. Si cela échoue, il devine à nouveau. Cela prend beaucoup de temps.
- La nouvelle idée : Pouvons-nous confier la tâche à un détective IA capable de réfléchir, d'écrire du code pour tester ses propres théories et de corriger ses erreurs ?
2. Le Terrain d'Entraînement : Un coffre-fort « Jouet »
Pour tester si leur détective IA fonctionne, les chercheurs n'ont pas pu utiliser un vrai coffre-fort complexe (un modèle de langage du monde réel) car ils n'auraient pas de « bonne réponse » pour vérifier le résultat.
Au lieu de cela, ils ont construit 84 « Coffres-forts Jouets » (AGENTICINTERPBENCH).
- Ce sont de petites machines artificielles construites de toutes pièces.
- Les chercheurs savent exactement comment elles fonctionnent car ils les ont construites à partir d'un ensemble simple d'instructions (comme une recette).
- Ils savent exactement ce que chaque engrenage est censé faire. Cela permet de noter le détective IA : « Avez-vous deviné correctement ? »
3. Le Détective : HYVE (La boucle « Hypothèse, Validation, Explication »)
Les chercheurs ont créé un agent IA nommé HYVE. HYVE ne se contente pas de deviner ; il suit une routine de détective stricte pour chaque engrenage de la machine :
- Observer : HYVE observe l'engrenage. « Hmm, quand l'entrée est 'x', cet engrenage s'allume en rouge vif. Quand c'est 'y', il reste éteint. »
- Émettre une hypothèse : HYVE fait une supposition. « Je parie que cet engrenage est un 'Détecteur de Lumière Rouge' qui ne s'active que pour 'x'. »
- Valider (Le Test) : C'est la partie la plus importante. HYVE écrit un programme informatique pour tester sa supposition. Il peut dire : « Voyons si l'on force cet engrenage à rester éteint même quand l'entrée est 'x' et si la machine tombe en panne. »
- Si la machine tombe en panne exactement comme prévu, la supposition est confirmée.
- Si la machine continue de fonctionner, la supposition est fausse. HYVE doit revenir à l'étape 2 et essayer une nouvelle hypothèse.
- Expliquer : Une fois tous les engrenages testés, HYVE rédige un résumé : « Cette machine est un 'Calculateur de Fractions' qui compte combien de 'x' apparaissent dans la phrase. »
4. Les Résultats : Le détective est bon, mais pas parfait
Les chercheurs ont testé HYVE en utilisant quatre « cerveaux » différents (différents modèles de langage de grande taille) pour voir lequel faisait le meilleur détective.
- Succès : Les agents IA étaient étonnamment bons ! Ils pouvaient identifier correctement ce que faisaient les engrenages environ 79 % du temps et décrire la tâche globale environ 83 % du temps.
- Le Goulot d'étranglement : L'IA était très douée pour formuler l'hypothèse initiale. Le problème survenait lors de la phase de test.
- Parfois, l'IA rédigeait un plan de test trop vague.
- Parfois, l'IA écrivait du code pour exécuter le test, mais le code contenait des bugs (comme un détective qui rédige un plan de test mais oublie d'apporter sa lampe de poche).
- Analogie : C'est comme un détective qui a une théorie brillante sur l'identité du tueur, mais lorsqu'il essaie de se rendre sur la scène de crime pour vérifier un alibi, il se perd ou se retrouve enfermé à l'extérieur du bâtiment.
Qui était le meilleur ?
- Claude-Sonnet était le meilleur pour exécuter réellement les tests sans planter (écriture de code sans bug).
- Gemini était le meilleur pour rédiger l'explication finale, facile à comprendre.
- GPT-5.4 était excellent pour planifier les tests, mais son code échouait souvent à s'exécuter.
5. Le Test en Conditions Réelles : Le cas d'étude « Llama »
Pour voir si cela fonctionnait en dehors de leurs « Coffres-forts Jouets », ils ont testé HYVE sur un véritable modèle de langage entraîné naturellement (Llama-3-8B) qui effectue des calculs mathématiques.
- Ils ont donné à l'IA un circuit trouvé par d'autres humains qui aide le modèle à additionner trois nombres.
- Résultat : Le détective IA a réussi à comprendre que certains engrenages étaient des « têtes de transfert » (déplaçant les nombres) et a correctement identifié que d'autres engrenages étaient simplement « redondants » (ils semblaient importants mais n'étaient pas réellement nécessaires).
- Cela a prouvé que la méthode fonctionne même sur des machines réelles et complexes, et pas seulement sur les modèles propres et artificiels.
L'essentiel
La publication conclut que les agents IA sont des outils prometteurs pour expliquer comment l'IA fonctionne. Ils peuvent effectuer le gros du travail de supposition et de test. Cependant, ils ne sont pas encore parfaits. Le principal obstacle est la fiabilité : l'IA doit devenir meilleure pour écrire le code qui teste réellement ses propres théories sans commettre d'erreurs.
Tant que l'IA ne sera pas plus performante dans la « réalisation de l'expérience » (la boucle de validation), les experts humains devront encore vérifier le travail. Mais c'est une étape majeure vers l'automatisation de la compréhension des cerveaux complexes de l'IA.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.