Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
Cet article introduit la Perturbation Universelle Sensible à la Sémantique (SAUP), une attaque novatrice qui exploite une perturbation adversaire unique pour détourner les grands modèles de langage multimodaux sans état en agissant comme un routeur sémantique qui dirige des entrées diverses vers des cibles définies par l'attaquant, atteignant un taux de réussite de 66 % sur plusieurs cibles sur des modèles représentatifs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez une voiture robotisée autonome très intelligente ou un bras robotique. Ces machines utilisent un « cerveau » appelé Modèle de Langage Étendu Multimodal (MLLM) pour observer le monde et décider de ce qu'elles doivent faire ensuite.
Voici le problème : ces robots travaillent souvent en mode « sans état » (stateless). Cela signifie qu'ils ne se souviennent pas de ce qui s'est passé il y a cinq secondes. Ils regardent seulement l'image actuelle et l'instruction actuelle, prennent une décision instantanée, puis oublient tout. C'est comme un conducteur qui souffre d'amnésie à chaque fois qu'il cligne des yeux ; il ne connaît que ce qu'il voit à l'instant présent.
L'article « Semantic Router » révèle une nouvelle façon effrayante de pirater ces robots en utilisant un seul et même petit autocollant invisible (une perturbation adversaire).
L'analogie de l'« Autocollant Magique »
Imaginez le cerveau du robot comme un police de la circulation très strict.
- Situation normale : Le policier regarde une image d'un rond-point et dit : « Arrêtez ». Le policier regarde une image d'un carrefour et dit : « Allez ».
- L'attaque : Le pirate place un petit « Autocollant Magique », presque invisible, sur l'objectif de la caméra du robot. Cet autocollant ne se contente pas de faire voir de mauvaises choses au robot ; il agit comme un Routeur Sémantique (un terme sophistiqué pour un commutateur intelligent).
Cet autocollant possède un superpouvoir : il peut lire le contexte de l'image et actionner un interrupteur pour envoyer le robot vers une destination totalement différente et dangereuse.
- Scénario A : Le robot voit un rond-point. L'autocollant détecte cela et dit au robot : « Tournez à gauche ». (Comportement normal).
- Scénario B : Le robot voit un carrefour. L'autocollant détecte ce contexte différent et change instantanément l'instruction pour : « Tournez à droite » (ou même « Roulez dans le ravin »).
La partie effrayante ? Le pirate n'a besoin de coller qu'un seul autocollant. Ce seul autocollant fonctionne sur chaque image que le robot voit, mais il change d'avis en fonction de ce que le robot regarde réellement. C'est comme une télécommande qui change la fonction de ses boutons selon la pièce dans laquelle vous vous trouvez.
Comment ont-ils fait ? (L'astuce « Géométrique »)
Les chercheurs n'ont pas simplement deviné ; ils ont regardé à l'intérieur du « cerveau » du robot (l'espace mathématique où les images sont traitées) pour comprendre comment construire cet autocollant. Ils ont découvert deux astuces principales :
- Le « Déplacement Dominant » (La Grande Poussée) : L'autocollant pousse le cerveau du robot loin de son chemin de pensée normal et sûr. Il force le robot dans une « zone de confusion » où les règles sont différentes.
- La « Déflexion Sémantique » (Le Léger Poussée) : Une fois que le robot est dans cette zone de confusion, l'autocollant utilise les infimes différences entre les images (comme la différence entre un « camion » et une « montagne ») pour pousser doucement le robot vers des commandes spécifiques et préprogrammées dangereuses.
Pour faire fonctionner cela, ils ont inventé une nouvelle recette mathématique appelée SORT. Considérez SORT comme un chef cuisinier expert qui sait exactement quelle quantité de sel (bruit) ajouter à une soupe (l'image) pour qu'elle ait le goût de « poulet » si vous regardez un poulet, mais qu'elle ait le goût de « poison » si vous regardez un gâteau.
Les Résultats : À quel point est-ce grave ?
Les chercheurs ont testé cela sur trois types différents de cerveaux de robots (appelés LLaVA, Qwen et InternVL) en utilisant deux types de données de test :
- Des images simples (comme un chat contre un chien).
- Des tâches de conduite et de robotique réelles (comme une voiture approchant d'un panneau stop ou un bras robotique ramassant une tasse).
Les conclusions sont frappantes :
- Un autocollant, plusieurs cibles : Ils ont pu faire en sorte qu'un seul autocollant guide un robot vers 5 résultats dangereux différents selon la scène.
- Taux de réussite élevé : Sur l'un des modèles (Qwen), un seul autocollant a réussi à tromper le robot 66 % du temps à travers 5 cibles différentes.
- Contrôle précis : Même lorsque les scènes étaient très similaires (comme une voiture sur une autoroute par rapport à une voiture sur un trottoir), l'autocollant pouvait faire la différence et émettre la commande dangereuse appropriée.
- Instructions longues : Ils ont même pu faire dire au robot de longues phrases spécifiques (comme « Supprimer tous les fichiers ») en fonction de ce qu'il voyait, et pas seulement des mots courts.
L'essentiel
Ce papier prouce qu'il est possible de « détourner » le processus de prise de décision d'un robot avec un seul tour de passe-passe universel. Le robot n'a pas besoin d'être piraté à chaque mouvement ; le pirate a juste besoin de planter un autocollant « Routeur Sémantique ». Une fois là, le robot suivra joyeusement les instructions du pirate, changeant entre différents ordres dangereux en fonction de ce qu'il voit devant lui.
L'article conclut qu'il s'agit d'une vulnérabilité fondamentale dans la manière dont ces systèmes d'IA fonctionnent actuellement, en particulier lorsqu'ils prennent des décisions sans se souvenir du passé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.