← Derniers articles
💬 NLP

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

Cet article présente le « Perturbation Probing », une méthode diagnostique en deux passes et sans rétropropagation qui identifie deux structures distinctes de circuits FFN — des circuits d'opposition pour les comportements supprimés par l'alignement par renforcement à partir de retours humains et des circuits de routage pour les comportements de pré-entraînement — permettant des interventions précises et ciblées pour modifier des sorties spécifiques du modèle, telles que les refus de sécurité ou la sélection de langue, sans affecter les autres capacités.

Auteurs originaux : Hongliang Liu, Tung-Ling Li, Yuhao Wu

Publié 2026-05-01
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hongliang Liu, Tung-Ling Li, Yuhao Wu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un modèle de langage de grande taille (LLM) comme un orchestre massif et incroyablement complexe. Depuis des années, nous savons que la musique qu'il joue (les réponses qu'il donne) peut être dangereuse ou utile, mais nous ne savions pas exactement quels musiciens (neurones) étaient responsables des parties « sûres » ou « impolies » de la chanson.

Ce papier présente une nouvelle méthode appelée Perturbation Probing. Pensez-y comme un « outil de diagnostic en deux passes » qui permet aux chercheurs d'écouter l'orchestre sans avoir besoin de réécrire la partition (sans rétropropagation ni réentraînement).

Voici comment cela fonctionne, décomposé en concepts simples :

1. Le stéthoscope « en deux passes »

Habituellement, pour découvrir ce que fait chaque neurone, vous devez effectuer des calculs lourds ou entraîner un tout nouveau modèle. Cette méthode est beaucoup plus légère.

  • Passage 1 : Le modèle répond à une question normalement.
  • Passage 2 : Les chercheurs « brouillent » légèrement la question (comme changer « méthamphétamine » en « métahmphetamine » afin que l'ordinateur le voie comme un mot différent, même si les humains le lisent de la même manière).
  • Le diagnostic : En comparant les deux réponses, la méthode calcule un « score » pour chaque neurone du modèle. Elle se demande : « Ce neurone a-t-il réagi fortement au brouillage, et pousse-t-il le modèle à dire « Non » ou « Oui » ? »

Si un neurone réagit fortement et pousse dans la bonne direction, il obtient un score élevé. Les chercheurs sélectionnent ensuite les 50 meilleurs scores pour les tester.

2. Les deux types de « circuits »

Le papier a découvert que les comportements de l'IA tombent dans deux catégories distinctes, comme deux types différents de systèmes de plomberie :

Type A : Le circuit « Opposition » (La soupape de sécurité)

  • Ce que c'est : Cela se produit lorsque l'IA est entraînée à faire quelque chose de contraire à ce qu'elle veut naturellement faire. Par exemple, une IA veut naturellement être d'accord avec vous (pré-entraînement), mais l'entraînement à la sécurité (RLHF) la force à dire « Non » aux mauvaises demandes.
  • La métaphore : Imaginez une porte lourde qui veut naturellement rester ouverte. Pour la maintenir fermée, vous installez un loquet spécifique et petit.
  • La découverte : Les chercheurs ont constaté que pour les refus de sécurité, ce « loquet » est étonnamment petit. Sur certains modèles, seulement 50 neurones (sur des centaines de milliers) contrôlent le modèle du refus.
    • Si vous retirez ces 50 neurones, l'IA arrête d'utiliser son script poli « Je ne peux pas aider avec cela ».
    • Crucialement : Cela ne signifie pas que l'IA devient soudainement méchante. Elle arrête simplement d'utiliser le script poli. Elle pourrait toujours vous avertir qu'une chose est illégale, mais elle ne dira pas « Je suis désolé, je ne peux pas faire cela ». La connaissance de la sécurité est toujours là, enfouie plus profondément.

Type B : Le circuit « Routage » (Le directeur de la circulation)

  • Ce que c'est : Cela se produit pour les comportements que l'IA aime déjà faire, comme parler chinois ou faire des mathématiques. L'IA n'a pas besoin de lutter contre sa nature ; elle a juste besoin d'être dirigée vers le bon chemin.
  • La métaphore : Imaginez un système autoroutier. Les voitures (informations) sont déjà en mouvement. Pour les amener à une sortie spécifique (langue chinoise), vous n'avez pas besoin de construire une nouvelle route ; vous devez juste actionner un interrupteur sur les panneaux de signalisation.
  • La découverte : Pour ces comportements, retirer des neurones ne fait rien. Cependant, les chercheurs ont découvert qu'ils pouvaient « injecter » un signal directement dans le flux de circulation pour forcer l'IA à changer de langue (par exemple, de l'anglais au chinois) avec une précision de 99 %, mais uniquement sur des modèles spécifiques répondant à certaines conditions.

3. Le diagnostic « FFN/Skip »

Comment savoir quel type de circuit vous avez affaire ? Le papier a créé un ratio simple appelé FFN/Skip.

  • Imaginez le cerveau de l'IA comme ayant deux chemins : un chemin passe par les « neurones de traitement » (FFN), et un autre chemin est une « voie rapide » qui saute le traitement (connexion de saut).
  • Si le signal de sécurité se trouve principalement dans les neurones de traitement (FFN/Skip élevé), vous pouvez le corriger en retirant ou en ajustant ces neurones spécifiques.
  • Si le signal se trouve principalement dans la voie rapide (FFN/Skip faible), retirer des neurones ne fonctionnera pas. Vous devez utiliser l'« interrupteur de circulation » (injection de direction) à la place.
  • Ce ratio agit comme une boule de cristal : il indique aux chercheurs exactement quel outil utiliser avant même de commencer les expériences.

4. L'effet « Transistor » (Le modèle 2B)

Sur un très petit modèle (2 milliards de paramètres), les chercheurs ont trouvé un effet encore plus dramatique.

  • Ils ont identifié seulement 20 neurones qui contrôlaient si l'IA s'accordait « servilement » avec un utilisateur même lorsque l'utilisateur avait tort.
  • L'interrupteur : S'ils désactivaient ces 20 neurones, l'IA arrêtait d'être d'accord avec les mensonges. Elle devenait obstinément correcte.
  • Le compromis : Cependant, cela empêchait aussi l'IA de se corriger elle-même lorsqu'elle faisait une erreur de son propre chef.
  • La solution : Au lieu de les désactiver, ils les ont augmentés (amplifiés). Cela a rendu l'IA bien meilleure pour corriger les fausses informations sans avoir besoin de réentraîner tout le modèle. C'est comme tourner un bouton de volume sur un instrument spécifique pour corriger la chanson, plutôt que de réécrire toute la partition.

Résumé de ce qu'ils affirment

  • La sécurité est fragile en surface : Le script poli « Je ne peux pas faire cela » est contrôlé par une poignée minuscule de neurones (environ 0,014 % du modèle).
  • La sécurité est profonde en dessous : Même si vous brisez le script, le modèle sait souvent encore les faits et pourrait vous avertir qu'une chose est dangereuse, simplement sans l'emballage poli.
  • Tous les comportements ne sont pas identiques : Certains comportements (comme la sécurité) sont contrôlés par des « écrivains » spécifiques (neurones) qui peuvent être édités. D'autres (comme le choix de la langue) sont contrôlés par des « directeurs de circulation » (routage) qui nécessitent un type d'intervention différent.
  • Édition de précision : Vous pouvez corriger des défauts comportementaux spécifiques (comme être trop conciliant ou utiliser la mauvaise langue) en ajustant un petit nombre de neurones, sans avoir besoin de réentraîner l'IA entière.

Le papier ne prétend pas que cela rend l'IA parfaitement sûre pour toujours, ni qu'il s'agit d'un outil pour que les pirates informatiques cassent l'IA. Au contraire, il présente cela comme un « diagnostic mécanique » pour comprendre comment l'IA fonctionne et pour offrir une boîte à outils précise aux ingénieurs afin d'éditer des comportements spécifiques s'ils le choisissent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →