← Derniers articles
💬 NLP

Mechanistic Interpretability as Statistical Estimation: A Variance Analysis

Cet article soutient que l'interprétabilité mécaniste est fondamentalement un problème d'estimation statistique marqué par une variance intrinsèque élevée des scores de médiation causale, ce qui amène les pipelines de découverte de circuits à produire des résultats instables et fragiles qui nécessitent un passage vers une rigueur en matière de robustesse statistique et de rapport de stabilité.

Auteurs originaux : Maxime Méloux, François Portet, Maxime Peyrard

Publié 2026-06-01
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Maxime Méloux, François Portet, Maxime Peyrard

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vision globale : Essayer de cartographier une ville avec une boussole instable

Imaginez que vous essayiez de dessiner la carte d'une ville complexe (un réseau de neurones) pour comprendre comment elle va d'un point A à un point B (comment elle résout un problème). Les scientifiques du domaine de l'interprétabilité mécaniste sont comme des explorateurs urbains. Ils veulent trouver les « routes » et les « intersections » spécifiques (neurones et connexions) que la ville utilise pour prendre des décisions. Ils appellent ces itinéraires particuliers des « circuits ».

L'article soutient qu'actuellement, ces explorateurs utilisent une boussole qui tourne follement. Ils pensent trouver la seule véritable carte, mais en réalité, ils dessinent des cartes différentes à chaque fois qu'ils regardent, selon les minuscules changements aléatoires de la météo ou de la façon dont ils tiennent la boussole.

Le problème central : La « boussole qui tourne » (La variance)

Les chercheurs ont découvert que les outils utilisés pour trouver ces circuits sont fondamentalement instables. Ils ont décomposé le problème en trois couches d'instabilité :

1. Le signal brut est bruité (Variabilité intrinsèque)

L'analogie : Imaginez que vous essayiez de mesurer la force d'un courant de vent spécifique dans une tempête. Si vous mesurez à un instant précis, vous obtenez un chiffre. Si vous mesurez une seconde plus tard, le vent peut être légèrement plus fort ou plus faible à cause de turbulences aléatoires.
La thèse de l'article : L'« importance » d'une partie spécifique de l'IA n'est pas un nombre fixe comme le poids d'un rocher. C'est plutôt comme la vitesse du vent. Elle change radicalement selon l'entrée spécifique (la « tempête ») que vous observez. L'article montre que même si vous calculez cela parfaitement, le score d'une seule connexion fluctue tellement qu'il est difficile de dire s'il est réellement important ou s'il s'agit juste d'une rafale aléatoire.

2. Les outils ajoutent du bruit (Erreurs d'approximation)

L'analogie : Comme mesurer le vent parfaitement prend trop de temps, les explorateurs utilisent un capteur bon marché et rapide (des méthodes d'approximation comme l'EAP) pour deviner la vitesse du vent. Mais ce capteur bon marché est instable. Il ajoute son propre statique et ses propres erreurs par-dessus le vent déjà changeant.
La thèse de l'article : Les méthodes rapides que les scientifiques utilisent pour gagner du temps (comme l'Edge Attribution Patching) introduisent encore plus de bruit. Elles rendent souvent les scores plus instables qu'ils ne l'étaient déjà. Le « rapport signal sur bruit » est si faible que les outils ne font souvent que capter de la statique plutôt que le véritable signal.

3. La carte change à chaque étape (Instabilité de l'agrégation)

L'analogie : Pour dessiner la carte finale, les explorateurs prennent 100 mesures différentes et en font la moyenne. Mais parce que les mesures sont si fragiles, si vous changez la liste des 100 mesures ne serait-ce qu'un tout petit peu (comme en remplaçant une mesure par une autre), la carte finale change complètement. Un jour, la carte montre une autoroute ; le lendemain, elle montre un chemin de terre.
La thèse de l'article : Lorsque les scientifiques combinent ces scores instables pour construire un « circuit », le résultat est incroyablement fragile.

  • Changement de données : S'ils utilisent un ensemble d'exemples légèrement différent pour entraîner leur carte, ils trouvent un circuit totalement différent.
  • Changement de méthode : S'ils modifient un paramètre (comme changer la façon dont ils calculent la moyenne des nombres), ils trouvent un circuit différent.
  • Changement de perturbation : S'ils changent la façon dont ils « cassent » l'IA pour la tester (le contrefactuel), le circuit trouvé se déplace à nouveau.

L'effet « Saumon Mort »

L'article mentionne que les méthodes actuelles sont sujettes aux artefacts de type « saumon mort ».
L'analogie : En neurosciences, des chercheurs ont autrefois trouvé une « activité cérébrale » dans un saumon mort simplement parce qu'ils n'avaient pas corrigé le bruit statistique. L'article suggère que les chercheurs en IA pourraient faire la même chose : trouver des « circuits » qui semblent réels mais qui ne sont en fait que du bruit aléatoire qui s'est aligné par hasard.

Ce que les chercheurs ont découvert (Les preuves)

Ils ont mené des expériences sur différents modèles d'IA (comme GPT-2 et Llama) et diverses tâches (comme les mathématiques ou la grammaire).

  • Le résultat : Lorsqu'ils ont répété la même expérience 100 fois avec des données légèrement différentes, les « circuits » qu'ils ont trouvés ne se chevauchaient presque pas. Parfois, le chevauchement était inférieur à 10 %.
  • La conclusion : Il n'existe pas un seul « Vrai Circuit » qui attend d'être découvert. Au lieu de cela, il existe un nuage de circuits possibles, et les méthodes actuelles ne font que choisir un point aléatoire dans ce nuage et l'appeler la vérité.

La solution proposée : Arrêter de deviner, commencer à mesurer l'incertitude

Les auteurs ne disent pas d'abandonner l'interprétation de l'IA. Ils disent plutôt : « arrêtez de prétendre que nous en savons plus que nous n'en savons réellement ».

Le nouveau livre de règles :

  1. Signaler la variance : Ne montrez pas seulement une carte. Montrez 100 cartes et dites : « Voici la moyenne, et voici à quel point elles diffèrent. »
  2. Vérifier la stabilité : Avant de prétendre avoir trouvé un circuit, vérifiez s'il reste le même lorsque vous modifiez légèrement les données. Si le circuit disparaît avec un changement infime, il n'est pas fiable.
  3. Embrasser l'incertitude : Traitez ces découvertes comme des prévisions météorologiques (ex : « 70 % de chances de pluie ») plutôt que comme des faits absolus (ex : « Il va pleuvoir »).

Résumé

L'article soutient que l'interprétabilité mécaniste essaie actuellement de faire de la science sans admettre qu'elle traite de statistiques. C'est comme essayer de mesurer la hauteur d'une montagne tout en étant debout sur un trampoline. Les auteurs veulent que le domaine cesse de chercher un circuit unique et parfait « de vérité terrain » et commence à rapporter à quel point ses découvertes sont instables et variables. Ce n'est qu'en reconnaissant cette instabilité que nous pourrons faire confiance aux cartes que nous dessinons des esprits de l'IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →