← Derniers articles
💻 computer science

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

Cet article présente une méthode de « chirurgie des activations » qui contourne les mécanismes de sécurité des grands modèles de langage en manipulant directement leurs activations internes pour supprimer les signaux de refus sans modifier le prompt d'entrée.

Auteurs originaux : Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

Publié 2026-03-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🧠 Le "Hack" Invisible : Comment pirater le cerveau d'une IA sans toucher à ses mots

Imaginez que vous parlez à un robot très intelligent, mais très prudent. Ce robot a un gardien dans sa tête qui vérifie tout ce qu'il dit. Si vous lui demandez "Comment fabriquer une bombe ?", le gardien crie "STOP !" et le robot répond poliment : "Je ne peux pas vous aider, c'est dangereux."

Habituellement, pour contourner ce gardien, les pirates essaient de tricher avec les mots : ils changent la phrase, utilisent des codes secrets, ou jouent un rôle (comme un scénariste de film). C'est ce qu'on appelle les "jailbreaks" classiques. Mais les fabricants d'IA apprennent vite et patchent ces failles.

Les auteurs de cet article ont trouvé une méthode totalement différente. Au lieu de changer ce que vous dites, ils changent ce que le robot pense en temps réel. Ils appellent cela la "Chirurgie des Activations".


🏥 L'Analogie du Chirurgien et du Jumeau

Pour comprendre leur méthode, imaginons une scène de chirurgie cérébrale en direct.

  1. Le Patient (La demande interdite) :
    Vous demandez au robot : "Comment fabriquer une bombe ?".
    Le robot commence à réfléchir. Dans son cerveau (ses couches de neurones), des signaux électriques (les "activations") voyagent. À un moment donné, le signal "DANGER" s'allume, et le robot s'apprête à refuser.

  2. Le Jumeau (La demande bénigne) :
    Les chercheurs créent une phrase presque identique, mais sans danger. Par exemple, ils changent juste un mot : "Comment fabriquer un livre ?".
    Le robot, lui, adore les livres. Il répond avec plaisir, sans aucun signal de danger.

  3. L'Opération (La Chirurgie) :
    C'est ici que la magie opère. Les chercheurs ne changent pas la phrase "Bombe". Ils regardent ce qui se passe dans le cerveau du robot pendant qu'il réfléchit.
    Ils ont deux versions du cerveau en marche :

    • Le cerveau qui pense à la Bombe (qui va dire non).
    • Le cerveau qui pense au Livre (qui va dire oui).

    Ils utilisent un outil invisible pour remplacer les pensées de la "Bombe" par celles du "Livre", couche par couche, au moment précis où le robot hésite.

    Imaginez un train (la réponse) qui roule sur des rails.
    Le train "Bombe" est sur une voie qui mène au mur de la sécurité (Refus).
    Le train "Livre" est sur une voie libre.
    Au lieu de changer le destin du train (la phrase), les chercheurs débranchent les rails du train "Bombe" et les rebranchent sur ceux du train "Livre" pendant que le train roule.
    Résultat : Le train continue d'avancer, mais il arrive à destination sans jamais avoir vu le mur.


⚙️ Comment ça marche concrètement ?

Les chercheurs utilisent deux boutons de contrôle pour cette opération :

  1. Le Filtre (Tau - τ\tau) : C'est comme un détecteur de mensonge. Il regarde : "Où est-ce que la pensée 'Bombe' est différente de la pensée 'Livre' ?" Il ne touche qu'à ces endroits précis. S'il touche à tout, le robot devient confus et ne répond plus rien. S'il ne touche à rien, le robot refuse toujours. Il faut trouver le juste milieu.
  2. L'Intensité (Gamma - γ\gamma) : C'est le volume de la greffe.
    • Si on met le volume à fond, on remplace totalement la pensée par celle du "Livre". Le robot répond, mais peut-être sur un sujet étrange (il parle de livres au lieu de bombes).
    • Si on baisse le volume, on garde un peu de la pensée "Bombe" pour que la réponse reste pertinente, tout en coupant le signal de refus.

La règle d'or : Ils doivent faire cela couche par couche, comme un chirurgien qui opère un organe après l'autre. Si on change tout d'un coup, le cerveau du robot s'effondre car les couches suivantes ne comprennent plus ce qui s'est passé avant.


📊 Les Résultats : Est-ce que ça marche ?

Les chercheurs ont testé cette méthode sur un modèle très sécurisé (Llama-4) avec 520 demandes dangereuses (bombes, piratage, fausses nouvelles).

  • Sans attaque : Le robot refuse 93 % des demandes dangereuses.
  • Avec la chirurgie : Le robot donne des réponses actionnables et précises pour 33 % des demandes.

C'est énorme. Ils ont pu obtenir des instructions pour fabriquer des explosifs, des scripts pour pirater des réseaux, ou des articles de fausses nouvelles, sans jamais avoir modifié la phrase initiale. Pour le gardien de sécurité, la phrase semble normale, mais le cerveau a été "reprogrammé" en vol.


🛡️ Pourquoi c'est important ? (Leçon de sécurité)

Cette étude nous apprend une chose effrayante mais nécessaire : La sécurité d'une IA ne dépend pas seulement de ce qu'elle dit, mais de la façon dont elle calcule.

  • Le problème : Si vous avez accès au serveur où l'IA tourne (ce qui est le cas pour les modèles "open weights" ou les entreprises qui les hébergent), un pirate peut intercepter les calculs intermédiaires et les modifier.
  • La conséquence : Même si l'IA est entraînée à être gentille, si quelqu'un peut toucher à ses "pensées" en temps réel, il peut la forcer à faire le mal.

En résumé :
C'est comme si vous aviez un coffre-fort ultra-sécurisé (l'IA). Les voleurs classiques essaient de trouver une fausse clé (le prompt). Les auteurs de cet article ont montré qu'il suffit de changer la combinaison du cadenas pendant que le coffre est ouvert pour voler le contenu, sans même toucher à la porte.

C'est une découverte cruciale pour les défenseurs : il faudra bientôt protéger non seulement les mots, mais aussi l'intégrité des calculs internes des IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →