← Derniers articles
💬 NLP

Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims

Cet article soutient que la recherche en interprétabilité mécanistique confond fréquemment les métriques de validation avec l'identification causale en omettant d'énoncer explicitement les hypothèses nécessaires, et il propose une nouvelle norme de divulgation exigeant que les auteurs exposent clairement leurs stratégies d'identification et la robustesse de leurs affirmations causales.

Auteurs originaux : Zezheng Lin, Fengming Liu

Publié 2026-05-11
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zezheng Lin, Fengming Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective essayant de comprendre pourquoi une machine complexe (une IA) fait ce qu'elle fait. Vous soupçonnez qu'un engrenage spécifique (un « circuit » ou une « fonctionnalité ») est la cause d'une action particulière. Vous retirez cet engrenage, et la machine cesse de fonctionner. Vous déclarez : « Aha ! Cet engrenage était la cause ! »

Ce papier soutient que dans le domaine de l'« interprétabilité mécaniste » de l'IA, les chercheurs font de telles déclarations beaucoup trop souvent sans suivre les règles de la preuve. Ils prétendent avoir trouvé la cause, mais ils n'expliquent pas pourquoi leur expérience prouve qu'il s'agit de la cause et non d'une simple coïncidence.

Voici la décomposition de l'argument du papier en utilisant des analogies simples :

1. Le Problème Central : La « Validation » n'est pas l'« Identification »

Le papier établit une distinction cruciale entre deux choses :

  • Validation (Le « Quoi ») : « J'ai retiré l'engrenage, et la machine s'est arrêtée. » C'est un fait. C'est un test réussi.
  • Identification (Le « Pourquoi ») : « Je sais pour un fait certain que seul cet engrenage a provoqué l'arrêt de la machine, et non un engrenage de secours caché ou un effet secondaire de mon retrait. »

L'Analogie :
Imaginez que vous êtes médecin. Vous donnez un comprimé à un patient, et sa fièvre diminue.

  • Validation : « La fièvre a diminué après le comprimé. » (C'est vrai).
  • Identification : « Le comprimé a provoqué la baisse de la fièvre. » (Cela nécessite des hypothèses).

Peut-être que la fièvre a diminué parce qu'il était l'heure de la journée où la fièvre retombe naturellement. Peut-être que le patient a bu de l'eau en même temps. Peut-être que le comprimé n'a pas fonctionné, mais que la fièvre était en train de passer de toute façon.

Dans la recherche sur l'IA, les articles disent souvent : « Nous avons modifié cette partie de l'IA, et le comportement a changé, donc cette partie est la cause. » Le papier soutient qu'ils sautent l'étape consistant à prouver qu'aucune autre explication n'aurait pu provoquer ce changement. Ils traitent la « baisse de la fièvre » (validation) comme une preuve du « fonctionnement du comprimé » (identification) sans vérifier si le patient avait un cycle de fièvre naturel.

2. Le Piège des « Hypothèses Cachées »

Chaque fois qu'un chercheur prétend avoir trouvé une cause, il se tient sur un ensemble d'hypothèses invisibles. Le papier indique que ces hypothèses sont actuellement cachées.

L'Analogie :
Imaginez un magicien qui prétend : « J'ai fait disparaître le lapin parce que j'ai agité ma baguette. »

  • L'Hypothèse Cachée : « Le lapin n'a pas sauté par la porte arrière. »
  • L'Hypothèse Cachée : « Le lapin n'était pas déjà parti avant que j'agite la baguette. »

Dans les articles sur l'IA, les « tours de magie » sont des choses comme :

  • Le Patching d'Activation : « Nous avons remplacé cette partie du cerveau de l'IA. Le comportement a changé. »
    • Hypothèse Cachée : « Nous n'avons pas accidentellement réveillé un système de secours endormi qui fait aussi ce travail. »
  • Les Auto-encodeurs Creux (SAE) : « Nous avons trouvé une « fonctionnalité » spécifique dans l'IA qui représente le concept de « l'honnêteté ». »
    • Hypothèse Cachée : « Cette fonctionnalité est un bloc de construction unique et autonome, et non simplement un mélange désordonné d'autres choses qui ressemble fort à « l'honnêteté ». »

Le papier examine 10 articles majeurs (et vérifie 30 autres) et constate que zéro d'entre eux possède une section dédiée où ils énumèrent ces hypothèses cachées. Ils montrent simplement le tour de magie (le résultat) et disent « Regardez, ça marche ! » sans admettre quelles règles ils supposent que l'univers suit.

3. L'Erreur de « Substitution »

Le papier qualifie l'habitude actuelle de « Substitution de Métrique de Validation ».

L'Analogie :
Imaginez un mécanicien de voiture qui dit : « J'ai réparé votre moteur parce que la voiture a démarré. »

  • L'Erreur : Le mécanicien substitue le résultat (la voiture a démarré) à la preuve (je sais exactement quelle pièce j'ai réparée et que rien d'autre n'aurait pu faire démarrer la voiture).
  • La Réalité : La voiture aurait pu démarrer parce que la batterie s'est rechargée toute seule, ou parce que le mécanicien a heurté la clé, ou parce que le moteur était en ordre depuis le début.

Dans les articles sur l'IA, les chercheurs rapportent des métriques comme la « fidélité » (l'explication correspond-elle au modèle ?) ou la « complétude » (avons-nous trouvé toutes les pièces ?). Le papier soutient que ce sont simplement des moments « la voiture a démarré ». Ils sont bons à avoir, mais ils ne constituent pas une preuve de causalité à moins d'énoncer les hypothèses qui en font une preuve.

4. La Solution Proposée : Le « Protocole de Divulgation »

L'auteur suggère que le domaine devrait emprunter une règle de l'Économétrie (l'étude des données économiques). En économie, si vous affirmez que « X cause Y », vous devez énoncer explicitement :

  1. Ce que vous affirmez : « Nous affirmons que X cause Y. »
  2. La Stratégie : « Nous utilisons la méthode Z pour le prouver. »
  3. Les Hypothèses : « Nous supposons que [Condition A] et [Condition B] sont vraies. »
  4. Le Test de Contrainte : « Si [Condition A] est fausse, notre conclusion s'effondre. Voici comment nous avons testé si elle est vraie. »

L'Analogie :
Au lieu de simplement dire « Le comprimé a fonctionné », le médecin doit rédiger un rapport :

  • « Nous affirmons que le comprimé a fait baisser la fièvre. »
  • « Nous supposons que le patient n'a pas pris d'autres médicaments. »
  • « Nous supposons que la fièvre ne touchait pas à sa fin naturellement. »
  • « Si le patient avait pris d'autres médicaments, notre conclusion serait fausse. Voici les données montrant qu'il ne l'a pas fait. »

5. Ce que l'Audit a Révélé

L'auteur a examiné 10 articles clés dans le domaine (couvrant différentes méthodes comme la découverte de circuits et les auto-encodeurs) puis en a vérifié 30 autres.

  • Résultat : 0 sur 30 articles possédaient une section dédiée listant leurs hypothèses d'identification.
  • Résultat : La plupart des articles (environ 19 à 26 sur 30, selon la rigueur de votre critère) utilisaient des « métriques de validation » (comme « l'IA s'est comportée comme prévu ») comme substitut pour prouver que leurs hypothèses étaient vraies.
  • Résultat : Même les articles les plus prudents, qui ont trouvé des erreurs dans le travail des autres, n'ont pas explicitement listé les hypothèses qu'ils utilisaient pour trouver ces erreurs.

Résumé

Le papier est un appel à l'honnêteté et à la clarté. Il ne dit pas que la recherche sur l'IA est fausse ; il dit que la recherche sur l'IA est incomplète.

Actuellement, les chercheurs disent : « Regardez, nous avons trouvé la cause ! »
Le papier dit : « S'il vous plaît, arrêtez-vous et dites-nous quelles règles vous supposez pour faire cette affirmation. Si vous ne nous dites pas les règles, nous ne savons pas si votre « cause » est réelle ou juste une chance. »

Il demande au domaine de passer de « Regardez à quel point notre tour de magie est cool » à « Voici exactement comment le tour fonctionne, et voici pourquoi nous savons que ce n'est pas un tour. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →