← Derniers articles
🤖 machine learning

Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

Cet article démontre que les grands modèles de langage entraînés à écrire des états intermédiaires dans un brouillon utilisent réellement ces états écrits comme des entrées causales pour les étapes de raisonnement ultérieures, plutôt que de simplement les générer pour la lisibilité humaine.

Auteurs originaux : Benjamin Shih, John Winnicki, Eric Darve

Publié 2026-06-30
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Benjamin Shih, John Winnicki, Eric Darve

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La grande question : Le modèle est-il en train de « parler » ou est-il réellement en train de « réfléchir » ?

Imaginez que vous regardez un étudiant passer un examen de mathématiques. L'étudiant écrit ses étapes sur une feuille de papier (le « brouillon »), puis écrit la réponse finale.

  • L'espoir : Nous espérons que l'étudiant utilise réellement ce papier pour faire ses calculs. Si vous pouviez changer magiquement un nombre qu'il a écrit, sa réponse finale devrait changer pour correspondre au nouveau calcul.
  • La crainte : Nous craignons que l'étudiant ne soit qu'en train de « faire semblant ». Il pourrait avoir déjà résolu le problème dans sa tête, et le papier n'est qu'une histoire qu'il vous raconte pour paraître intelligent. Si vous changiez le nombre sur le papier, sa réponse finale resterait la même parce qu'il n'a jamais réellement regardé le papier pour faire le travail.

Ce papier pose la question suivante : Lorsque les modèles d'IA écrivent les étapes de leur réflexion, utilisent-ils réellement ces étapes pour déterminer la partie suivante du problème, ou sont-ils simplement en train d'écrire une histoire ?

L'expérience : Le test de la « gomme magique »

Pour trouver la réponse, les chercheurs ont créé un jeu très spécifique et simple pour l'IA.

Le Jeu :
Imaginez un robot se déplaçant sur une grille minuscule de 2x2.

  1. Le robot commence à un endroit (ex: en haut à gauche).
  2. Il reçoit une commande de mouvement (ex : « inverser le premier bit »).
  3. Le robot écrit où il se trouve actuellement.
  4. Il reçoit une autre commande, écrit son nouvel emplacement, et ainsi de suite.

La partie délicate est que le robot possède un « bit de phase » caché (comme un interrupteur secret) qui change selon l'ordre des mouvements. Deux chemins différents peuvent aboutir au même emplacement visible, mais avec un réglage de l'interrupteur secret différent.

Le Test (La « Gomme Magique ») :
Les chercheurs ont laissé l'IA jouer au jeu et écrire ses étapes. Ensuite, ils ont effectué une opération « chirurgicale » :

  1. Ils ont gardé le texte écrit exactement le même. Le papier disait toujours : « Je suis à l'emplacement A avec l'interrupteur SUR ON ».
  2. Ils ont changé silencieusement l'état interne du cerveau de l'IA. Ils ont inversé le « interrupteur secret » dans la mémoire de l'IA pour le passer sur « OFF », même si le papier indiquait toujours « ON ».
  3. Ils ont demandé à l'IA d'effectuer le prochain mouvement.

La Question :

  • Si l'IA était juste en train d'écrire une histoire, elle ignorerait le changement interne. Elle verrait que le papier dit « Interrupteur ON », et calculera l'étape suivante en fonction de « Interrupteur ON ».
  • Si l'IA était réellement en train d'utiliser l'état, elle ressentirait le changement interne. Elle réaliserait : « Attendez, mon interrupteur interne est en fait sur OFF », et elle calculera l'étape suivante en fonction de « Interrupteur OFF », même si le papier indique le contraire.

Les Résultats : Qui a réussi le test ?

Les chercheurs ont testé trois types de modèles d'IA :

  1. Le Modèle Pré-entraîné : Un modèle qui a appris sur Internet mais qui n'a pas été enseigné ce jeu spécifique.
  2. Le Modèle « Réponse Finale » : Un modèle enseigné pour résoudre le jeu, mais qui n'écrit que le résultat final, pas les étapes.
  3. Le Modèle « État de Fonctionnement » (Running State) : Un modèle enseigné pour écrire chaque étape au fur et à mesure qu'il avance.

Les Constats :

  • Les « Conteurs d'histoires » (Modèles pré-entraînés et de réponse finale) : Lorsque les chercheurs ont secrètement inversé l'interrupteur interne, ces modèles n'en ont eu cure. Ils ont continué à prédire l'étape suivante en se basant sur ce qui était écrit sur le papier. Ils ignoraient leur propre réalité interne.
  • Les « Vrais Penseurs » (Modèles de type Running State) : Lorsque les chercheurs ont secrètement inversé l'interrupteur interne, ces modèles ont changé leur prédiction. Ils ont calculé l'étape suivante en fonction du nouvel interrupteur interne, ignorant le texte sur le papier.

Dans les modèles « Running State », le texte écrit n'était pas seulement un rapport ; il était devenu une variable de travail. Le modèle utilisait réellement ses propres notes pour faire les calculs.

L'analogie du « Pourquoi c'est important »

Pensez à un programme informatique.

  • Mauvaise surveillance : Un programme affiche « Je suis en train d'enregistrer le fichier » à l'écran, mais en arrière-plan, il est en train de supprimer le fichier. Si vous changez le texte à l'écran en « Je suis en train de supprimer », le programme s'en fiche car le texte n'est qu'un affichage.
  • Bonne surveillance : Un programme possède une variable réelle appelée statut_fichier. Si vous changez cette variable dans le code, le comportement du programme change immédiatement.

Ce papier proue qu'en apprenant à l'IA à écrire ses étapes intermédiaires (le « Running State »), nous pouvons transformer ces étapes en variables réelles que l'IA utilise réellement.

La preuve « Causale »

Les chercheurs ne se sont pas arrêtés là. Ils se sont assurés que l'IA ne se contentait pas de deviner ou de copier un exemple différent. Ils ont effectué des tests supplémentaires :

  • Le Test de « l'Échange de Mouvement » : Ils ont changé la commande (ex : « aller à gauche » au lieu de « aller à droite » tout en gardant l'état interne édité. L'IA a correctement modifié sa réponse en fonction de la nouvelle commande, prouvant qu'elle combinait l'état et la commande.
  • Le Test du « Copieur » : Ils ont essayé de piéger l'IA pour qu'elle copie une réponse future provenant d'un autre exemple. L'IA n'a pas copié ; elle a recalculé en fonction de la situation actuelle.

La Conclusion

Le papier conclut que pour que la sécurité et la surveillance de l'IA fonctionnent, nous ne devons pas simplement espérer que l'IA écrive ses pensées. Nous devons l'entraîner d'une manière spécifique pour que ces pensées écrites deviennent une partie réelle de son processus de calcul.

Lorsqu'on fait cela, le « brouillon » cesse d'être un compte rendu (un enregistrement de ce qui s'est passé) pour devenir un tableau de bord (un endroit où nous pouvons réellement intervenir et modifier la façon dont l'IA pense).

En bref : Le papier montre qu'avec le bon entraînement, les modèles d'IA peuvent apprendre à « lire ce qu'ils écrivent », transformant leur raisonnement écrit en une partie réelle et utilisable de leur cerveau.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →