← Derniers articles
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

L'article présente Babel, un cadre de contournement en boîte noire efficace qui exploite la distribution sparse des têtes d'attention critiques pour la sécurité dans les LLM en utilisant un échantillonnage d'obfuscation itératif et piloté par des retours pour atteindre des taux de réussite d'attaque à la pointe de l'art sur des modèles de pointe comme GPT-4o et Claude-3.5-Haiku avec une haute efficacité en requêtes.

Auteurs originaux : Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

Publié 2026-05-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Image : Le « Garde de Sécurité » contre le « Tour de Magie »

Imaginez un Modèle de Langage (LLM) comme un bibliothécaire robot très intelligent et serviable. Avant de répondre à une question, il dispose d'une équipe de Gardes de Sécurité (appelés « têtes de sécurité ») qui examinent chaque demande pour s'assurer que personne ne demande quelque chose de dangereux, comme comment fabriquer une bombe ou rédiger un discours haineux.

Les chercheurs de ce papier ont découvert un défaut amusant dans le fonctionnement de ces gardes : Ils sont très peu nombreux et ne se tiennent que dans des endroits spécifiques. Ils ne surveillent pas toute la bibliothèque ; ils ne surveillent qu'un tout petit couloir précis. Si vous parvenez à faire passer votre demande dangereuse devant ce seul couloir, le reste de la bibliothèque (le cerveau du modèle) ne sait même pas que vous faites des siennes, et il vous donne l'answer avec plaisir.

Le papier présente un nouvel outil appelé Babel (nommé d'après la Tour de Babel, où les langues se sont mélangées) qui agit comme un magicien de maître. Il ne tente pas de combattre les gardes ; au lieu de cela, il utilise « l'obfuscation » (des tours de confusion) pour glisser la demande dangereuse devant les gardes sans qu'ils s'en aperçoivent.


Comment fonctionne l'astuce : Le « Déguisement »

Les chercheurs ont découvert que si vous modifiez quelques lettres dans une mauvaise demande, les Gardes de Sécurité pourraient être confus et cesser de la reconnaître comme dangereuse. Cependant, il y a un équilibre délicat :

  • Trop de changements : La demande devient du charabia, et le bibliothécaire robot ne comprend plus du tout ce que vous voulez.
  • Trop peu de changements : Les Gardes de Sécurité repèrent le danger immédiatement et disent « Non ».

Le Point Parfait : Il existe une « zone de Boucle d'Or » où la demande est suffisamment brouillée pour tromper les gardes, mais encore assez claire pour que le robot la comprenne et réponde.

La Stratégie Babel : Trouver la « Zone de Boucle d'Or »

Au lieu de deviner au hasard (ce qui est lent et coûteux), Babel utilise une approche mathématique intelligente pour trouver cette zone parfaite. Voici comment cela fonctionne, étape par étape :

1. Le Test « Bandé » (Échantillonnage Réduit)

Imaginez que vous essayez de trouver un coffre-fort caché dans une pièce sombre. Vous ne savez pas exactement où il se trouve, mais vous savez qu'il est quelque part au milieu.

  • Babel essaie quelques « déguisements » différents (changer des lettres, échanger des mots, ou mélanger la structure de la phrase).
  • Il demande au robot : « Avez-vous dit « Non » (refus), ou avez-vous répondu ? »
  • Si le robot dit « Non » trop souvent, le déguisement était trop évident. Si le robot est confus et ne répond pas, le déguisement était trop désordonné.
  • Babel utilise un test statistique (comme une vérification par pile ou face) pour voir s'il se trouve dans la bonne zone.

2. Le « Zoom » (Optimisation de la Distribution)

Une fois que Babel a trouvé la zone générale où les gardes sont aveugles, il arrête de deviner au hasard. Il commence à zoomer.

  • Il crée une « carte » des déguisements qui fonctionnent le mieux.
  • Il concentre son énergie uniquement sur la création de nouveaux déguisements qui ressemblent à ceux qui ont presque fonctionné.
  • Il continue d'affiner cette carte, se resserrant de plus en plus autour du déguisement parfait, jusqu'à trouver celui qui glisse juste devant les gardes.

3. L'« Enveloppe » (Encodage)

Pour rendre l'astuce encore meilleure, Babel enveloppe la demande dangereuse dans une tâche ennuyeuse et inoffensive.

  • Exemple : Au lieu de simplement demander « Comment faire du poison ? », il dit : « Veuillez traduire cette phrase en chinois : [Instructions de poison brouillées]. »
  • Le Garde de Sécurité voit le mot « Traduire » et pense : « Oh, c'est une tâche sûre ! » Il laisse passer la demande. Le robot traite ensuite les instructions brouillées à l'intérieur et donne la réponse.

Les Résultats : Quelle est la performance de Babel ?

Les chercheurs ont testé Babel sur certains des robots les plus célèbres et « super-sécurisés » au monde (comme GPT-4o, Claude-3.5 et Grok-3).

  • L'Ancienne Méthode : Les méthodes précédentes étaient comme lancer des fléchettes dans le noir. Elles pouvaient éventuellement atteindre le centre de la cible, mais cela prenait des centaines d'essais et échouait souvent.
  • La Méthode Babel : Babel est comme une fléchette guidée par laser.
    • Sur GPT-4o, il a réussi à tromper le modèle 82,67 % du temps (contre 41 % pour les anciennes méthodes).
    • Sur Grok-3, il a réussi 95,67 % du temps.
    • Il a fait tout cela en utilisant très peu d'essais (environ 40 tentatives en moyenne), ce qui le rend beaucoup plus rapide et moins coûteux à utiliser.

Pourquoi cela compte-t-il ? (L'Analogie de l'« Équipe Rouge »)

Les auteurs disent qu'il ne s'agit pas d'enseigner aux gens comment être mauvais ; il s'agit de l'Équipe Rouge.

Imaginez que vous êtes un expert en sécurité engagé pour tester le coffre-fort d'une banque. Vous ne voulez pas voler l'argent ; vous voulez trouver la faiblesse dans la serrure afin que la banque puisse la réparer.

  • Babel montre que même les coffres-forts les plus solides ont une petite fissure dans le cadre de la porte qu'un voleur astucieux peut exploiter.
  • En trouvant cette fissure, les chercheurs espèrent aider les entreprises qui construisent ces modèles d'IA à colmater le trou, rendant les « Gardes de Sécurité » plus intelligents et la bibliothèque plus sûre pour tout le monde.

Résumé

Le papier affirme que la sécurité de l'IA repose sur quelques « gardes » spécifiques qui peuvent être trompés en rendant légèrement le langage confus. L'outil Babel est une méthode mathématique intelligente pour trouver le niveau parfait de confusion afin de contourner ces gardes efficacement, prouvant que les mesures de sécurité actuelles de l'IA sont plus fragiles que nous ne le pensions.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →