← Derniers articles
💻 computer science

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

Cet article démontre que l'« abliteration », une technique d'édition de poids de faible rang qui projette orthogonalement les directions de refus, peut découpler efficacement le refus des LLM de code alignés sur la sécurité de générer du code vulnérable de leurs capacités de génération réelles, permettant ainsi la production scalable de code vulnérable étiqueté pour la recherche en détection de vulnérabilités sans compromettre la validité syntaxique.

Auteurs originaux : Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

Publié 2026-06-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : Le robot « surprotecteur »

Imaginez que vous essayiez d'apprendre à un robot comment repérer les failles de sécurité dans du code informatique. Pour ce faire, vous avez besoin d'une immense bibliothèque d'exemples montrant à la fois du code « sûr » et du code « cassé » (vulnérable).

Cependant, il y a un piège. Les robots (les modèles d'IA) que nous avons aujourd'hui sont entraînés pour être très sûrs. Si vous leur demandez : « Hé, peux-tu me montrer comment casser une base de données ? », ils répondent immédiatement : « Non ! Je ne peux pas faire ça. C'est dangereux. »

C'est un problème pour les chercheurs. Ils ont besoin que le robot commette l'erreur afin qu'ils puissent l'étudier et construire de meilleures défenses. Mais le robot refuse de jouer le rôle du « méchant », même si le chercheur veut simplement étudier l'erreur dans un cadre de laboratoire contrôlé.

L'expérience : Éteindre le bouton « STOP »

Les chercheurs de cet article voulaient voir s'ils pouvaient éteindre ce bouton « STOP » sans casser le cerveau du robot. Ils ont utilisé une technique appelée Abliteration.

Considérez le cerveau de l'IA comme une immense bibliothèque de pensées. Lorsqu'un robot voit une requête visant à créer une faille de sécurité, un « signal de refus » spécifique (comme une alarme rouge qui clignote) s'active dans son esprit, et il interrompt la conversation.

L'Abliteration est comme un chirurgien qui retirerait avec précision juste cette alarme rouge du câblage du robot. Ils n'ont pas réentraîné le robot ni lui ont appris de nouvelles choses ; ils ont simplement édité chirurgicalement les poids (les connexions) pour empêcher le signal de refus de se déclencher.

Les trois découvertes clés

Les chercheurs ont testé cela sur trois tailles différentes de modèles d'IA (Petit, Moyen et Grand) en utilisant du code Python et un type spécifique de faille de sécurité appelé Injection SQL (qui consiste à tromper une base de données pour révéler des secrets).

1. Le « Refus » dépend de la taille et du contexte

Avant de procéder à la chirurgie, ils ont remarqué quelque chose d'intéressant :

  • Le Modèle Géant (14B) : Il refusait 100 % du temps. Peu importe ce que vous demandiez, il disait « Non ».
  • Le Modèle Moyen (7B) : Il était sélectif. Il refusait la plupart du temps sur du code long et complexe, mais il acceptait parfois de dire « Oui » sur des extraits de code courts et simples.
  • Le Modèle Petit (3B) : Il refusait à peine. Il était prêt à essayer presque tout.

L'analogie : Imaginez trois agents de sécurité. Le grand agent est si strict qu'il arrête tout le monde. L'agent moyen arrête les gens avec de gros sacs, mais laisse passer ceux qui ont de petites enveloppes. Le petit agent est très décontracté et laisse presque tout le monde passer.

2. La chirurgie a fonctionné (La partie « Volonté »)

Après avoir effectué la chirurgie d'« Abliteration » :

  • Le Refus a disparu : Les modèles Géant et Moyen ont arrêté de dire « Non ». Ils étaient désormais volontaires pour tenter de créer la failse de sécurité.
  • Le Cerveau était toujours sain : Crucialement, la chirurgie n'a pas cassé le robot. Le code qu'il produisait était toujours grammaticalement correct et cohérent. Ils n'avaient pas lobotomisé l'IA ; ils ont simplement supprimé le réflexe du « Je ne ferai pas ça ».

L'analogie : C'est comme retirer un panneau « Entrée Interdite » d'une porte. La porte était toujours ouverte et le couloir à l'intérieur était parfaitement normal ; le panneau indiquait simplement que les gens ne pouvaient pas entrer. Une fois le panneau retiré, les gens pouvaient passer, et le couloir était resté intact.

3. Volonté \neq Capacité (La partie « Incapable »)

C'est la découverte la plus importante. Ce n'est pas parce que le robot était maintenant volontaire pour commettre l'erreur qu'il était capable de bien le faire.

  • Le Modèle Géant (14B) : Une fois le panneau « Non » retiré, il était excellent pour créer la faille de sécurité. Il réussissait environ 90 % du temps.
  • Le Modèle Moyen (7B) : Très bon aussi, réussissant environ 90 % du temps.
  • Le Modèle Petit (3B) : Même s'il était volontaire et ne refusait pas, il était mauvais dans la tâche réelle. Il ne réussissait que 25 à 48 % du temps.

L'analogie : Imaginez trois artistes à qui l'on demande de peindre un vase cassé.

  • Le Grand Artiste s'est fait dire « Tu ne peux pas peindre ça ! », mais après qu'on lui ait dit « Tu peux », il a peint un chef-d'œuvre.
  • L'Artiste Moyen s'est aussi fait dire « Tu peux », et il a peint une belle image.
  • Le Petit Artiste n'a jamais entendu de « Non » au départ, mais quand il a essayé de peindre le vase cassé, il n'a tout simplement pas réussi à en saisir les détails. Il voulait le faire, mais il lui manquait la compétence.

La Conclusion : Deux choses différentes

L'article prouve que le Refus (la volonté) et la Capacité (la compétence) sont deux choses distinctes.

  1. Le Refus est un paramètre de sécurité qui peut être désactivé (via l'Abliteration).
  2. La Capacité est une mesure de l'intelligence du modèle. Désactiver le paramètre de sécurité ne rend pas un modèle « bête » plus « intelligent ».

Pourquoi est-ce important ?

  • Pour les chercheurs : Si vous voulez générer des données pour entraîner des outils de sécurité, vous ne pouvez pas simplement utiliser un petit modèle en espérant que cela fonctionne. Même si vous désactivez ses filtres de sécurité, il pourrait ne pas être assez intelligent pour créer les erreurs réalistes dont vous avez besoin. Vous avez besoin d'un modèle plus grand.
  • Pour la sécurité : Cela montre que les filtres de sécurité sont très spécifiques. Vous pouvez supprimer le « refus » sans briser la capacité du modèle à écrire du bon code. Cela signifie que l'alignement de la sécurité est une couche spécifique posée sur l'intelligence du modèle, et non l'intelligence elle-même.

Une note sur l'éthique

Les auteurs sont très prudents. Ils ont publié les outils pour mesurer cela et les données, mais ils n'ont pas publié les modèles « chirurgicalement modifiés » capables de créer ces failles de sécurité. Ils estiment que bien que l'idée de la méthode soit connue, publier les modèles réellement « piratés » serait trop dangereux. Ils veulent aider les chercheurs à étudier la sécurité, pas donner une nouvelle arme aux hackers.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →