← Derniers articles
💬 NLP

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

Cette étude révèle que les défaillances des grands modèles de langage dans des tâches symboliques élémentaires comme le comptage de caractères ne proviennent pas d'un manque de représentation, mais d'une interférence structurée où des circuits négatifs dans les dernières couches suppriment activement les informations correctes déjà encodées.

Auteurs originaux : Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

Publié 2026-04-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🍎 Le Paradoxe de la Pomme : Pourquoi les IA "intelligentes" échouent à compter des lettres

Imaginez que vous avez un ami très brillant, capable de rédiger des poèmes, de résoudre des équations complexes et de simuler des conversations humaines. C'est un Grand Modèle de Langage (LLM).

Pourtant, si vous lui demandez : "Combien de fois la lettre 'p' apparaît-elle dans le mot 'pomme' ?", il risque de vous répondre : "Je ne sais pas, peut-être 1 ?" ou "2 ?", alors que la réponse est 2.

C'est exactement ce que cette étude a découvert : ces modèles sont comme des génies qui perdent leur intelligence dès qu'il s'agit de tâches très simples, comme compter des lettres.

🕵️‍♂️ L'enquête : Le modèle sait-il la réponse ?

Les chercheurs se sont demandé : "Est-ce que le modèle ne sait tout simplement pas compter, ou est-ce qu'il sait la réponse mais oublie de la dire ?"

Pour le savoir, ils ont joué au détective à l'intérieur du cerveau du modèle (c'est ce qu'on appelle l'analyse mécanique). Ils ont utilisé des outils pour regarder ce qui se passe à chaque étape du calcul, comme si on regardait les pensées d'un humain se former.

La découverte choquante :
Le modèle sait la réponse !

  • Au début du processus (les premières couches du cerveau), le modèle a parfaitement compté les lettres. C'est comme si un enfant avait écrit "2" sur un petit papier et l'avait mis dans sa poche.
  • Mais à la fin, juste avant de parler, quelque chose de bizarre se produit. Le modèle regarde ce petit papier, puis il le froisse, le jette et dit une autre chose (souvent "1" ou une réponse au hasard).

🎭 L'analogie du Chef de Cuisine et du Garde du Corps

Pour mieux comprendre, imaginons un restaurant très sophistiqué :

  1. Le Chef (les premières couches) : C'est un chef d'élite. Il reçoit la commande "Comptez les 'p' dans 'pomme'". Il compte soigneusement, vérifie deux fois, et écrit sur un ticket : "2". Il est sûr de lui.
  2. Le Couloir (les couches intermédiaires) : Le ticket passe de main en main. Tout va bien.
  3. Le Garde du Corps (les dernières couches) : Juste avant que le plat ne sorte en cuisine, il passe par un garde du corps très strict (les dernières couches du modèle). Ce garde a une règle bizarre : "Je ne fais confiance à aucun chiffre. Je préfère toujours dire '1' car c'est plus sûr, ou je dis n'importe quoi pour ne pas prendre de risque."

Le Garde du Corps prend le ticket du Chef, le regarde, et le remplace par un nouveau ticket qui dit "1".
Le client (vous) reçoit donc la mauvaise réponse, même si le Chef avait la bonne.

🚫 Le problème n'est pas la taille, c'est le "Filtre"

Les chercheurs ont testé des modèles plus petits et des modèles géants (beaucoup plus intelligents). Résultat ? Ça ne change rien.
Même les plus gros modèles ont ce "Garde du Corps" qui bloque la bonne réponse.

C'est comme si on ajoutait un deuxième chef dans la cuisine, encore plus doué, mais que le Garde du Corps restait le même. Il continuera à bloquer la bonne réponse. Le problème n'est pas que le modèle manque de cerveau, c'est qu'il a appris à supprimer la bonne réponse au profit de réponses plus "faciles" ou plus fréquentes dans son entraînement.

💡 La leçon à retenir

Cette étude nous apprend deux choses importantes :

  1. L'intelligence n'est pas linéaire : Avoir un modèle énorme ne garantit pas qu'il sera bon à tout. Il peut être un génie en philosophie mais un idiot en arithmétique de base.
  2. Le "bruit" interne : Le vrai problème n'est pas que le modèle ne trouve pas la réponse, mais qu'il y a des mécanismes internes qui étouffent la vérité pour la remplacer par des habitudes.

En résumé : Ces IA ne sont pas "bêtes", elles sont juste distraites. Elles ont la réponse dans leur poche, mais elles ont appris à ne pas la sortir. Pour les rendre plus fiables, il faudra peut-être apprendre à ces modèles à faire confiance à leur propre "Chef" plutôt qu'à leur "Garde du Corps" trop prudent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →