← Derniers articles
🤖 AI

Data-driven Circuit Discovery for Interpretability of Language Models

Ce papier critique les méthodes existantes de découverte de circuits fondées sur des hypothèses pour produire des circuits spécifiques à un jeu de données qui échouent à capturer la véritable diversité mécanistique des modèles de langage, et propose la Découverte de Circuits Pilotée par les Données (DCD), un nouveau cadre qui regroupe des exemples par similarité de traitement pour révéler plusieurs circuits distincts et haute fidélité pour une tâche unique.

Auteurs originaux : Daking Rai, Mor Geva, Ziyu Yao

Publié 2026-05-12
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Daking Rai, Mor Geva, Ziyu Yao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez un robot géant et ultra-intelligent (un Modèle de Langage) capable d'écrire des histoires, de faire des mathématiques et de résoudre des énigmes. Les scientifiques souhaitent comprendre comment ce robot pense. Ils appellent cela « l'interprétabilité mécaniste ».

La méthode traditionnelle que les scientifiques ont utilisée pour tenter de faire cela consiste à essayer de trouver le « moteur » d'une voiture en observant un seul trajet spécifique. Ils disent : « D'accord, le robot vient de conduire du Point A au Point B. Cartographions exactement quels engrenages se sont mis en mouvement pour que cela se produise. » Ils appellent ce chemin cartographié un Circuit.

Le Problème : Le Piège du « Taille Unique »
L'article soutient que l'ancienne méthode est flawed car elle repose sur deux mauvaises hypothèses :

  1. L'Hypothèse du Jeu de Données : Elle suppose que les exemples spécifiques utilisés par les scientifiques (comme une structure de phrase particulière) représentent toutes les façons dont le robot peut accomplir la tâche.
  2. L'Hypothèse du Moteur Unique : Elle suppose que le robot utilise un seul ensemble spécifique d'engrenages (circuit) pour résoudre la tâche, quelle que soit la manière dont la question est posée.

La Découverte : Le Robot Possède Plusieurs Moteurs
Les chercheurs ont testé cela en donnant au robot la même tâche mais avec de légères variations (comme changer les noms dans une histoire, ou écrire le problème mathématique en toutes lettres au lieu de chiffres).

Ils ont découvert que :

  • Lorsqu'ils cartographiaient le « moteur » du robot pour une histoire avec des noms comme « Jean et Marie », cela ressemblait complètement au moteur utilisé pour une histoire avec des noms comme « Personne X et Personne Y ».
  • Encore pire, s'ils mélangeaient deux tâches totalement différentes (comme « trouver l'objet » et « faire des mathématiques ») en un seul grand tas de données, l'ancienne méthode tentait toujours de forcer une seule carte dessus. Elle créait un circuit désordonné et confus, un mélange « Frankenstein » des deux tâches, plutôt que de réaliser que le robot basculait en réalité entre deux moteurs différents selon l'entrée.

La Solution : Découverte de Circuits Pilotée par les Données (DCD)
Pour résoudre ce problème, les auteurs proposent une nouvelle méthode appelée Découverte de Circuits Pilotée par les Données (DCD).

Imaginez cela ainsi :

  • Ancienne Méthode : Vous demandez à un groupe de personnes de résoudre une énigme. Vous examinez la solution de chacun et essayez de dessiner un seul plan directeur expliquant comment tout le monde l'a résolue. Si certaines personnes ont utilisé un marteau et d'autres un tournevis, votre plan devient un désordre confus mêlant les deux outils.
  • Nouvelle Méthode (DCD) : Vous examinez d'abord les personnes et les regroupez selon la manière dont elles résolvent le problème. Vous mettez tous les « utilisateurs de marteau » dans une pièce et tous les « utilisateurs de tournevis » dans une autre. Ensuite, vous dessinez un plan propre et distinct pour le groupe des marteaux et un autre plan propre et distinct pour le groupe des tournevis.

Comment Fonctionne la DCD (La Métaphore)

  1. Tri des Données : Au lieu de forcer le robot à utiliser un seul chemin, la DCD examine chaque exemple individuel que le robot traite. Elle se demande : « Est-ce que cet exemple fait tourner les engrenages internes du robot de manière similaire à cet autre exemple ? »
  2. Création de Groupes : Elle trie les exemples en « clusters » (groupes) basés sur la manière dont le robot les traite.
  3. Recherche de Circuits Spécifiques : Elle trouve ensuite une « carte moteur » spécifique et propre pour chaque groupe.

Les Résultats
Lorsqu'ils ont utilisé cette nouvelle méthode :

  • Ils ont découvert que le robot utilise en réalité plusieurs mécanismes distincts (moteurs) pour ce que les humains considèrent comme une seule tâche.
  • Les nouvelles cartes (circuits) étaient beaucoup plus précises (fidèles) et plus simples (plus clairsemées) que les anciennes cartes désordonnées.
  • Crucialement, l'organisation interne du robot ne se souciait pas des étiquettes humaines comme « Mathématiques » ou « Histoire ». Elle s'organisait selon la structure de l'entrée. La DCD respecte la logique interne du robot plutôt que de lui imposer des catégories humaines.

En Résumé
L'article dit : « Arrêtez d'essayer de trouver un moteur universel pour une tâche. Le robot est plus intelligent et plus flexible que cela. Il possède différents moteurs pour différentes situations. Notre nouvelle méthode, la DCD, laisse les données nous indiquer où se trouvent les limites, afin que nous puissions trouver le bon moteur pour le bon travail, plutôt que de forcer une seule carte de moteur confuse sur tout. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →