Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
Cet article propose MAGA, un nouveau cadre d'attaque multiniveau qui exploite les vulnérabilités de l'attention cross-modale dans les modèles BLIP en construisant et en perturbant des graphes d'attaque cross-modaux, entraînant une dégradation significative des performances et des légendes adverses linguistiquement plausibles mais visuellement incohérentes.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde en évolution rapide de l'intelligence artificielle, une nouvelle génération de systèmes informatiques a émergé, capable de voir et de lire simultanément. Ces systèmes, connus sous le nom de modèles de vision-langage, sont entraînés sur des millions de paires d'images et de textes, apprenant comment une image de chien se rapporte au mot « chien ». Ils sont devenus le fondement d'outils qui décrivent des photos, répondent à des questions sur des scènes et recherchent des images en utilisant le langage naturel. Pour que ces machines fonctionnent bien, elles doivent constamment connecter des mots spécifiques à des parties spécifiques d'une image, décidant quels pixels appartiennent au concept de « cheval » et lesquels appartiennent à l'« herbe ». Ce processus repose sur un mécanisme interne complexe qui agit comme une carte dynamique, reliant chaque mot d'une phrase aux détails visuels pertinents d'une photographie. Si cette connexion se brise, la machine perd sa capacité à comprendre ce qu'elle regarde, ce qui peut conduire à la confusion ou à des descriptions incorrectes.
Des chercheurs de l'Université de Guangzhou ont découvert une faiblesse subtile dans la manière dont ces systèmes maintiennent ces connexions. Ils ont découvert qu'en plaçant un motif de petite taille, soigneusement conçu, sur une image, ils pouvaient tromper le modèle et le pousser à réorganiser sa carte interne de liens mots-images. Ce motif, qui ressemble à un simple patch de couleur ou de texture, n'a pas besoin d'être un déguisement complexe. Au lieu de cela, il agit comme un signal silencieux qui pousse le modèle à ignorer les parties les plus importantes d'une image pour se concentrer sur des zones de l'arrière-plan non pertinentes. Lorsque cela se produit, le modèle peut toujours parler avec fluidité et correction grammaticale, mais ce qu'il dit ne correspond plus à l'image. Il peut décrire un champ de fleurs alors que l'image montre clairement un cheval, ou prétendre qu'une personne tient un bol de ramen alors que la photo ne contient qu'un salon. Les chercheurs appellent ce phénomène « naturel mais faux », soulignant une vulnérabilité où la confiance de la machine reste élevée alors même que sa compréhension s'effondre.
L'équipe a développé une méthode pour créer ces motifs trompeurs, qu'elle a nommée une attaque multi-niveaux. Contra�ristant aux tentatives précédentes qui essayaient simplement de flouter une image ou d'en brouiller les couleurs, cette approche cible la manière spécifique dont le modèle connecte le texte à la vision. Les chercheurs ont construit un système qui cartographie la force des liens entre les mots et les parties de l'image, créant essentiellement un graphe qui montre à quels pixels les mots prêtent attention. Ils ont ensuite entraîné leur attaque pour maximiser la différence entre le graphe d'une image propre et le graphe de la même image avec le patch ajouté. Ce faisant, ils ont forcé le modèle à rompre les connexions fortes entre les mots clés et leurs preuves visuelles, tout en créant simultanément de nouvelles connexions fausses avec des zones aléatoires de l'arrière-plan. Ce processus a été combiné à d'autres objectifs pour garantir que l'attaque reste discrète et que le texte résultant paraisse naturel, bien qu'il soit factuellement incorrect.
Les résultats de leurs expériences ont été frappants. Lorsqu'ils ont appliqué leur patch généré à des images d'un ensemble de données standard, la capacité du modèle à trouver l'image correcte pour un texte donné a chuté de manière spectaculaire. Dans des tests où le système était sollicité pour associer une phrase à la bonne image, son taux de réussite est passé de plus de soixante-dix pour cent à seulement neuf pour cent. L'attaque était si efficace qu'elle fonctionnait même sur des images que le système n'avait jamais vues auparavant, suggérant que la faille est fondamentale dans la manière dont le modèle traite l'information plutôt qu'une simple erreur liée à des images spécifiques. Dans les tâches où le modèle devait décrire une image, la qualité de la description s'est effondrée. Les scores de précision du système ont considérablement diminué, pourtant les phrases produites restaient grammaticalement correctes et diversifiées, évitant le jargon répétitif qui signale souvent un système défaillant. Cela a confirmé que le modèle ne se contentait pas d'échouer à parler ; il décrivait avec assurance une réalité qui n'existait pas.
Les chercheurs ont également testé le système sur des questions visuelles, telles que le comptage d'objets ou l'identification de relations spatiales. L'attaque a provoqué l'échec du modèle lors de ces tâches logiques également, les taux de réussite chutant de près de quatre-vingts pour cent à seulement douze pour cent. Dans de nombreux cas, le modèle répondait à une question sur un chien par une description de chat, ou affirmait qu'il y avait trois animaux lorsqu'il n'y en avait qu'un seul. Ce qui a rendu ces échecs particulièrement notables, c'est que la carte d'attention interne du modèle avait été complètement recâblée. Les visualisations ont montré que le modèle, qui normalement concentre son attention sur le sujet principal de la photo, commençait à ignorer le sujet pour se concentrer à la place sur le ciel vide ou l'herbe. Le patch n'a pas caché l'objet ; il a simplement fait en sorte que le modèle détourne le regard.
Ce travail suggère que la génération actuelle de ces puissants systèmes d'IA est plus fragile qu'on ne le pensait. Alors que les tests de sécurité précédents se concentraient sur la possibilité de faire passer une image pour autre chose aux yeux de l'humain, cette recherche montre que le danger réside dans la manière dont la machine organise sa propre compréhension. L'attaque n'a pas besoin de tromper la machine pour qu'elle voie un objet différent ; elle doit seulement la convaincre que l'objet qu'elle voit est non pertinent. En perturbant le graphe interne qui lie les mots aux pixels, les chercheurs ont prouvé qu'un petit motif statique pouvait provoquer une cascade d'erreurs à travers différentes tâches, de la recherche d'images à la réponse à des questions complexes. L'étude conclut qu'à mesure que ces modèles seront intégrés dans la vie quotidienne, comprendre et protéger ces cartes de connexions internes sera aussi important que de protéger les images elles-mêmes. Les conclusions servent de rappel que même les systèmes les plus avancés peuvent être égarés, non pas en changeant ce qu'ils voient, mais en changeant la façon dont ils pensent ce qu'ils voient.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.