← Derniers articles
💬 NLP

Understanding Verbatim Memorization in LLMs Through Circuit Discovery

Cet article emploie l'interprétabilité mécaniste et la découverte de circuits de transformateurs pour révéler que des sous-graphes neuronaux distincts sont responsables de l'initiation par rapport au maintien de la mémorisation verbatim dans les LLM, l'initiation étant dépendante du contexte tandis que les mécanismes de prévention se transfèrent de manière robuste à travers les domaines.

Auteurs originaux : Ilya Lasy, Peter Knees, Stefan Woltran

Publié 2026-02-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ilya Lasy, Peter Knees, Stefan Woltran

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un Grand Modèle de Langage (LLM) comme une bibliothèque massive et hyper-organisée où chaque livre jamais écrit est stocké. Parfois, lorsque vous posez une question au bibliothécaire, celui-ci ne se contente pas de résumer l'histoire ; il récite un paragraphe d'un livre mot pour mot. C'est ce qu'on appelle la mémorisation.

Le document que vous avez partagé est comme une équipe de détectives essayant de comprendre précisément comment le bibliothécaire décide de commencer à réciter ce livre et comment il continue ainsi. Au lieu de simplement deviner, ils ont utilisé un outil spécial appelé « découverte de circuits » pour cartographier les voies électriques spécifiques à l'intérieur du cerveau du bibliothécaire qui gèrent cette tâche.

Voici la décomposition de leurs découvertes en utilisant des analogies simples :

1. Les deux tâches différentes : L'« Interrupteur de démarrage » et le « Tapis roulant »

Les chercheurs ont réalisé que mémoriser une phrase n'est pas une seule grande action. C'est en fait deux étapes distinctes, comme allumer une machine puis la maintenir en marche.

  • L'« Interrupteur de démarrage » (Décision de mémorisation) : C'est le moment où le modèle examine votre consigne et décide : « Hé, je connais exactement cette phrase ! Recopions-la. »
  • Le « Tapis roulant » (Comparaison de branche) : Une fois que le modèle a commencé à copier, c'est le mécanisme qui le maintient sur le même chemin, mot après mot, sans être distrait.

2. Le travail de détective : Trouver les minuscules circuits

Pour trouver ces mécanismes, les chercheurs ont créé un jeu de « Cherchez l'erreur ». Ils ont donné au modèle deux consignes très similaires :

  • Consigne Propre : Une phrase qui est à une seule étape de déclencher une réponse mémorisée.
  • Consigne Corrompue : Une phrase qui ressemble à la première mais qui conduit le modèle vers une réponse totalement différente et non mémorisée.

En échangeant l'« activité cérébrale » (les activations) entre ces deux consignes, ils ont pu voir quels petits fils (circuits) étaient responsables de l'interrupteur. Ils ont découvert deux choses surprenantes :

  • L'« Interrupteur de démarrage » est un contrôleur maître : Le petit groupe de fils responsable de démarrer la mémorisation est assez puissant pour la maintenir en marche. Si vous manipulez l'« Interrupteur de démarrage », le modèle arrête complètement de mémoriser.
  • Le « Tapis roulant » est une rue à sens unique : Les fils responsables de maintenir le modèle sur son chemin mémorisé (une fois qu'il a commencé) ne peuvent pas démarrer le processus par eux-mêmes. Ils sont comme un tapis roulant qui ne fonctionne que si quelqu'un court déjà dessus ; ils ne peuvent pas démarrer le moteur.

3. Le « Bouton d'arrêt universel » vs le « Bouton de démarrage spécifique au contexte »

Les chercheurs ont testé si ces circuits fonctionnaient sur différents types de textes (comme du code, des e-mails ou des pages web), et pas seulement sur Wikipédia.

  • Le « Bouton d'arrêt universel » : Les circuits qui empêchent la mémorisation (arrêter le modèle de réciter) fonctionnaient partout. Que le texte concernât du code GitHub ou des e-mails d'Enron, les mêmes « freins » pouvaient être appliqués pour arrêter le modèle de réciter.
  • Le « Bouton de démarrage spécifique au contexte » : Les circuits qui causent la mémorisation étaient sélectifs. Ce qui déclenche la mémorisation d'une phrase dans un e-mail ne déclenche pas nécessairement la mémorisation d'une phrase dans un fichier de code. Le mécanisme de « démarrage » dépend fortement du type spécifique de texte.

4. La grande conclusion : Il est plus facile de briser le déclencheur que la mémoire

La conclusion la plus intéressante concerne la manière de contrôler ce comportement.

Les chercheurs ont découvert qu'il est beaucoup plus facile de briser l'« Interrupteur de démarrage » (empêcher le modèle de décider de mémoriser) qu'il ne l'est de forcer le modèle à mémoriser quelque chose de nouveau.

Ils comparent cela à une maison avec un système de sécurité :

  • Les informations stockées (les livres dans la bibliothèque) sont très difficiles à changer ou à effacer.
  • Cependant, le déclencheur (la clé qui déverrouille la porte de la bibliothèque) est fragile. Si vous manipulez la clé, la bibliothèque reste verrouillée, même si les livres sont toujours à l'intérieur.

En résumé : Le document suggère que si nous voulons empêcher l'IA de divulguer des informations privées ou des textes protégés par le droit d'auteur, nous ne devrions pas essayer de supprimer les mémoires (ce qui est difficile). Au lieu de cela, nous devrions nous concenter sur la recherche et la désactivation des « circuits de déclenchement » spécifiques qui décident quand commencer à réciter, car ce sont les points faibles qui fonctionnent à travers différents types de textes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →