← Derniers articles
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Cet article propose UltraBreak, un nouveau cadre qui réalise des attaques de type « jailbreak » universelles et transférables sur les modèles vision-langage en contraignant les motifs adverses dans l'espace visuel et en optimisant des objectifs basés sur la sémantique dans l'espace d'enchâssement textuel afin de surmonter la faible généralisation des méthodes actuelles basées sur le gradient.

Auteurs originaux : Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un robot assistant très intelligent capable de voir des images et de lire du texte. Vous pourriez lui demander : « Qu'y a-t-il sur cette photo ? » ou « Comment faire un gâteau ? ». Ces robots, appelés Modèles Vision-Langage (VLM), sont conçus pour être utiles mais aussi sûrs — ils sont programmés pour refuser les requêtes dangereuses, comme « Comment fabriquer une bombe ? ».

Cependant, tout comme un humain peut être trompé par une histoire habilement formulée, ces robots peuvent aussi l'être. Ce document présente une nouvelle façon de les tromper, appelée UltraBreak.

Voici une explication simple de son fonctionnement et de ce qui la rend différente :

Le Problème : Le piège du « Taille unique pour personne »

Auparavant, les hackers (ou les chercheurs testant la sécurité) essayaient de tromper ces robots de deux manières :

  1. L'approche Manuelle : Ils dessinaient une image spécifique avec une légende spécifique pour une seule requête malveillante précise. C'est comme écrire un mot de passe complexe et unique pour une seule porte. Cela fonctionne pour cette porte, mais si vous essayez d'utiliser ce même mot de passe sur une autre porte (un autre modèle de robot), cela échoue.
  2. L'approche « Pixel-Parfait » : Ils utilisaient les mathématiques pour ajuster une image jusqu'à ce que le robot prononce les mots exacts de la mauvaise réponse. Le problème ici est que le robot s'habitue trop à ces pixels spécifiques. C'est comme un étudiant qui mémorise les réponses d'un examen blanc spécifique mais échoue à l'examen réel parce que les questions sont légèrement différentes. Cette méthode fonctionne sur le robot sur lequel elle a été entraînée, mais échoue lamentablement sur n'importe quel autre robot.

La Solution : UltraBreak

Les auteurs ont créé UltraBreak, une méthode qui crée une « Clé Maîtresse Universelle ». Il s'agit d'une image unique capable de tromper de nombreux robots différents pour les pousser à dire des choses nuisibles, même si les robots ont été construits par des entreprises différentes ou possèdent des cerveaux internes différents.

Ils ont fait cela en utilisant deux astuces principales :

1. La salle de sport « Métamorphe » (Optimisation sous contrainte)

Imaginez que vous essayez d'apprendre à un chien à s'asseoir. Au lieu de simplement dire « Assis », vous faites pratiquer au chien l'action de s'asseoir en portant un chapeau, puis en tournant sur lui-même, puis en se tenant sur une patte. Si le chien apprend à s'asseoir dans toutes ces situations bizarres, il comprend réellement le concept de « s'asseoir », et non pas seulement la commande spécifique dans une pose spécifique.

UltraBreak fait cela avec des images. Pendant la création de l'image de l'astuce, l'ordinateur la fait constamment pivoter, zoomer et se déplacer. Il force également l'image à paraître lisse et naturelle (en supprimant le bruit statique bizarre). Cela force l'astuce à devenir un motif robuste — comme une forme ou des lettres reconnaissables — plutôt qu'une collection fragile de pixels aléatoires. Parce que le motif est fort et clair, il fonctionne sur différents robots, et pas seulement sur celui pour lequel il a été entraîné.

2. Le « Test de Vibe » plutôt que le « Mot pour Mot » (Perte Sémantique)

Dans les anciennes méthodes, l'ordinateur était obsédé par l'idée de faire dire au robot les mots exacts « Bien sûr » suivi de « Voici comment fabriquer une bombe ». Si le robot disait « D'accord, voici... » à la place, l'ordinateur considérait que l'opération avait échoué. C'est comme un professeur qui ne donne la moyenne que si vous écrivez la réponse exactement telle qu'elle apparaît dans le manuel, même si votre réponse est correcte mais formulée différemment.

UltraBreak change les règles. Au lieu d'exiger les mots exacts, il demande : « Est-ce que la réponse du robot donne l'impression qu'il accepte de faire la chose malveillante ? » Il examine le sens (la « vibe ») de la réponse.

  • Ancienne méthode : « Tu dois dire "Bien sûr" exactement. » (Cela crée un chemin accidenté et bosselé pour l'ordinateur, ce qui facilite le blocage).
  • Nouvelle méthode : « Tant que la réponse est utile et accepte la requête, c'est bon. » (Cela crée une vallée douce et plate. L'ordinateur peut glisser facilement vers la bonne réponse sans rester coincé sur des détails minuscules).

Les Résultats

Les chercheurs ont testé cette « Clé Maîtresse Universelle » sur de nombreux robots différents (certains en open-source, d'autres provenant de géants de la technologie comme Google et OpenAI).

  • Le Résultat : UltraBreak a bien mieux fonctionné que les méthodes précédentes. Il a réussi à tromper des robots qu'il n'avait jamais vus auparavant.
  • La Découverte : Ils ont découvert que la raison pour laquelle les anciennes méthodes échouaient était qu'elles étaient trop concentrées sur les mots exacts, créant un chemin « bosselé » qui menait à l'échec. En se concentrant sur le sens et en rendant l'image robuste face aux changements, ils ont lissé le chemin, permettant à l'attaque de fonctionner partout.

Pourquoi cela compte (selon l'article)

L'article soutient que si donner des yeux aux robots les rend plus intelligents, cela leur donne aussi de nouvelles façons d'être trompés. En montrant à quel point il est facile de créer une « Clé Maîtresse Universelle » qui fonctionne sur différents systèmes, les auteurs espèrent réveiller la communauté de la sécurité. Ils veulent que les développeurs construisent des robots qui soient sûrs, non pas seulement contre des ruses spécifiques, mais contre ce genre de ruse universelle et adaptable.

En bref : Ils ont trouvé un moyen de créer une « image de triche » robuste et unique qui fonctionne sur presque tous les robots vision-langage, en apprenant à l'ordinateur à se soucier du sens de la réponse plutôt que de l'orthographe exacte des mots.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →