Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
Cet article étudie l'identifiabilité de l'interprétabilité mécaniste en démontrant, par des expériences sur des fonctions booléennes et de petits réseaux de neurones, que des explications uniques sont souvent impossibles à obtenir en raison d'une non-identifiabilité systématique, incitant ainsi à une réévaluation de la nécessité d'une unicité stricte pour la validité des explications de l'IA.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez un robot boîte noire très intelligent capable de résoudre un puzzle spécifique parfaitement. Vous voulez savoir comment il y parvient. Vous ne voulez pas seulement savoir que cela fonctionne ; vous voulez soulever le rideau pour voir les minuscules engrenages, leviers et interrupteurs à l'intérieur qui font opérer la magie. C'est l'objectif de l'interprétabilité mécaniste : tenter de faire de l'ingénierie inverse d'un réseau de neurones (le cerveau du robot) pour trouver une histoire simple et lisible par l'humain sur la façon dont il réfléchit.
Ce document pose une question très simple, mais profonde : Si nous regardons à l'intérieur de ce robot pour trouver l'histoire de son fonctionnement, trouverons-nous tous exactement la même histoire ? Ou bien, deux personnes différentes pourraient-elles observer le même robot, utiliser les mêmes règles d'investigation, et aboutir à deux histoires complètement différentes, bien qu'également valides ?
Les auteurs disent : Non, nous ne sommes pas garantis d'obtenir une histoire unique. En fait, il existe souvent des dizaines, des centaines ou même des milliers de "histoires" différentes qui correspondent parfaitement aux données.
Voici une décomposition de leurs conclusions en utilisant des analogies simples :
Les deux manières d'enquêter
Le document examine deux principales méthodes par lesquelles les chercheurs tentent de trouver ces histoires :
« Où-puis-Quoi » (L'approche du Détective) :
- L'idée : D'abord, vous essayez de trouver un petit groupe de neurones (un « circuit ») à l'intérieur du robot qui fait tout le gros du travail. Une fois que vous avez trouvé ce groupe, vous essayez de deviner quelle logique ils utilisent (par exemple : « Oh, ces trois neurones agissent comme une porte ET »).
- Le problème : Imaginez que vous avez une immense bibliothèque de livres. Vous voulez trouver les pages spécifiques qui racontent une histoire. Vous pourriez trouver un premier ensemble de pages qui raconte l'histoire parfaitement. Mais ensuite, vous trouvez un autre ensemble de pages, complètement différent du premier, qui raconte aussi l'histoire parfaitement. Le document a découvert que pour une tâche simple, il existait 85 groupes de neurones différents qui pouvaient tous accomplir la tâche parfaitement. Il n'y a pas un seul groupe d'engrenages « correct ».
« Quoi-puis-Où » (L'approche de l'Architecte) :
- L'idée : D'abord, vous devinez une histoire ou un algorithme simple (par exemple : « Le robot doit utiliser une porte OU »). Ensuite, vous scannez le cerveau du robot pour voir si vous pouvez trouver un endroit où cette histoire est mise en scène.
- Le problème : Imaginez que vous cherchez une mélodie spécifique jouée par un orchestre massif. Vous pourriez trouver la mélodie jouée par les violons. Mais vous réalisez ensuite que les violoncelles jouent la même mélodie exacte en même temps, et que les flûtes le font aussi. Le document a découvert qu'il y avait 159 endroits différents dans le cerveau du robot où cet algorithme était implémenté parfaitement.
L'expérience « XOR »
Pour prouver cela, les auteurs ont entraîné un minuscule robot simple pour résoudre un puzzle logique classique appelé XOR (qui est comme un interrupteur qui s'allume uniquement si l'un des deux boutons est pressé, mais pas les deux).
- Le résultat : Ils n'ont pas seulement trouvé une explication. Ils ont trouvé plus de 45 000 explications différentes (combinaisons de circuits et d'histoires) qui étaient toutes mathématiquement parfaites.
- L'analogie : C'est comme demander : « Comment la boulangère a-t-elle fait ce gâteau parfait ? »
- Explication A : « Elle a utilisé de la farine, du sucre et des œufs dans le Bol X. »
- Explication B : « Elle a utilisé de la farine, du sucre et des œufs dans le Bol Y. »
- Explication C : « Elle a utilisé un mélange différent d'ingrédients dans le Bol Z. »
- Toutes sont vraies. Le gâteau a le même goût, mais le « mécanisme » que vous pointez est différent à chaque fois.
Pourquoi est-ce important ?
En statistiques, nous avons un concept appelé identifiabilité. Cela signifie que si vous avez les données, il ne devrait y avoir qu'un seul ensemble de « vrais » nombres qui les ont créées. Ce document soutient que pour les explications de l'IA, l'identifiabilité est brisée.
- Le mythe de la « Vérité Unique » : Nous supposons souvent que si nous creusons assez profondément, nous trouverons l'unique vraie manière dont l'IA réfléchit. Ce document affirme que cette supposition est probablement fausse. L'IA peut réfléchir de plusieurs manières différentes simultanément, ou il peut y avoir plusieurs façons différentes de décrire sa pensée qui sont toutes également correctes.
- La conséquence : Si vous demandez à deux experts d'expliquer la même IA, ils pourraient vous donner deux réponses totalement différentes, et tous deux auraient raison selon les règles actuelles de la science.
La conclusion : Que devons-nous faire ?
Les auteurs ne disent pas « abandonnez ». Au lieu de cela, ils suggèrent que nous devons changer d'état d'esprit :
- Arrêtez de chercher « l'Histoire Unique » : Nous devrons peut-être accepter qu'il n'existe pas d'explication unique.
- Concentrez-vous sur l'Utilité : Peut-être que le fait que l'explication ne soit pas unique n'a pas d'importance. Peut-être qu'il compte seulement si l'explication nous aide à prédire ce que l'IA fera ensuite ou à la manipuler pour qu'elle fasse ce que nous voulons.
- Utilisez des vérifications multiples : Si nous avons vraiment besoin d'être sûrs, nous ne devrions pas nous fier à une seule méthode. Nous devrions utiliser de nombreux tests différents pour voir si une explication tient la route sous tous les angles.
En bref : Le document soutient que l'« empreinte digitale » de la pensée d'une IA n'est pas unique. Il existe de nombreuses clés différentes qui peuvent ouvrir la même serrure, et de nombreuses cartes différentes qui peuvent décrire le même territoire. Nous devons cesser d'attendre une carte unique et parfaite et commencer à accepter que la « vérité » du fonctionnement de l'IA pourrait être une collection de nombreuses histoires valides et imbriquées.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.