← Derniers articles
🤖 machine learning

One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP

Le document présente UnivIntruder, un nouveau cadre d'attaque adversaire qui exploite un modèle CLIP public unique et des concepts textuels pour générer des perturbations universelles, transférables et ciblées, atteignant des taux de réussite élevés contre divers réseaux de neurones profonds et systèmes réels sans nécessiter l'accès aux données d'entraînement de la cible ou des requêtes excessives au modèle.

Auteurs originaux : Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

Publié 2026-08-06
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que l'internet est une immense ville bouillonnante où les ordinateurs agissent comme des policiers, des médecins et des commerçants. Ces ordinateurs utilisent un type spécial de cerveau appelé Réseau de Neurones Profonds (DNN) pour prendre des décisions, comme reconnaître un chat sur une photo ou diagnostiquer une maladie. Pendant longtemps, les scientifiques ont découvert un étrange tour de passe-passe : on peut tromper ces cerveaux informatiques avec des « attaques adverses ». C'est comme coller un petit autocollant presque invisible sur un panneau stop pour faire croire à l'ordinateur qu'il s'agit d'un panneau de limitation de vitesse. Habituellement, pour réussir ce tour, un pirate doit soit jeter un coup d'œil à l'intérieur du code secret de l'ordinateur (ce qui est impossible dans le monde réel), soit poser des milliers de questions à l'ordinateur pour découvrir ses secrets (ce qui est trop lent et coûteux).

Mais et si vous pouviez tromper n'importe quel cerveau informatique sans jamais lui poser une seule question ? C'est la grande question que cet article aborde. Les chercheurs ont utilisé un outil puissant appelé CLIP, qui est comme un bibliothécaire super intelligent qui a lu des milliards de livres et vu des milliards d'images, apprenant comment les mots et les images se connectent. Ils voulaient voir si ce « bibliothécaire universel » pouvait être utilisé pour créer une clé maîtresse — une infime distorsion numérique — capable de tromper presque tout système de vision par ordinateur, des recherches Google aux robots de haute technologie, simplement en utilisant des mots simples comme « poule » ou « chat » comme guide.

La Clé Maîtresse : Un seul Substitut pour tous les Tromper

Découvrez UnivIntruder, un nouveau cadre d'attaque introduit par Binyan Xu et son équipe. Considérez-le comme une « clé maîtresse universelle » pour la vision par ordinateur. Par le passé, si un pirate voulait tromper un système informatique spécifique, il devait construire une copie factice de ce système (un « modèle substitut » ou surrogate model) en utilisant les mêmes données sur lesquelles le système réel a été entraîné. C'était comme essayer de crocheter une serrure spécifique en construisant d'abord une réplique parfaite du trou de serrure en utilisant le même métal et les mêmes vis. Si vous n'aviez pas les plans de la serrure originale ou le métal exact, votre fausse clé ne fonctionnerait pas.

UnivIntruder change la donne. Les chercheurs ont réalisé qu'ils n'avaient pas besoin d'une copie parfaite de la cible. Au lieu de cela, ils ont utilisé CLIP, une IA publiquement disponible et super intelligente qui comprend la relation entre les images et le texte. Ils ont traité CLIP comme leur « substitut » ou leur serrure d'entraînement. Voici la magie : ils n'ont pas essayé de copier les données d'entraînement de la cible. Au lieu de cela, ils ont utilisé un ensemble de données publiques d'images aléatoires (qui ne ressemblent peut-être pas du tout aux données de la cible) et des concepts textuels simples.

Comment le tour fonctionne :
Imaginez que vous vouliez tromper une caméra de sécurité pour qu'elle voie une image d'écureuil comme étant une « poule ».

  1. Le Guide Textuel : Vous dites au système : « Je veux que cela ressemble à une poule », et « Je ne veux pas que cela ressemble à un chat ou à un cheval ».
  2. Le Décalage Directionnel : Au lieu de simplement regarder l'image, le système regarde la différence entre l'image et le texte. Il calcule une « direction » dans le cerveau de l'ordinateur. Il demande : « Si je pousse cette image d'écureuil dans cette direction spécifique, est-ce qu'elle se rapprochera du concept de 'poule' et s'éloignera de celui de 'chat' ? »
  3. L'Autocollant Universel : Le système crée un petit « autocollant » universel (une perturbation) qui, lorsqu'il est ajouté à n'importe quelle image, la pousse dans cette direction.
  4. Le Twist : Pour s'assurer que cet autocollant fonctionne sur n'importe quelle caméra, et pas seulement sur celle sur laquelle ils se sont entraînés, ils font pivoter, zooment et recadrent les images pendant la création de l'autocollant. Cela force l'autocollant à être robuste, comme un autocollant qui fonctionne encore même si la voiture passe dans un lave-auto ou se retrouve couverte de boue.

Les Résultats : Tromper le Monde

L'équipe a testé cette « clé maîtresse » à une échelle massive. Ils n'ont pas seulement testé sur un seul ordinateur ; ils l'ont testée sur 85 modèles différents et des applications du monde réel.

  • Les Chiffres : Sur les ensembles de tests standards, leur attaque a été terrifiante d'efficacité. Sur le jeu de données CIFAR-10 (un test courant pour la reconnaissance d'images), ils ont atteint un taux de réussite de 99,4 %. Sur le gigantesque ensemble de données ImageNet (comprenant 1 000 catégories différentes), ils ont atteint 85,1 %.
  • Le Monde Réel : C'est là que cela devient effrayant. Ils ne se sont pas contentés de tests en laboratoire. Ils ont tenté de tromper de vrais services :
    • Moteurs de recherche : Ils ont téléchargé une image perturbée d'un singe sur Google, Baidu, Taobao et JD. Les moteurs de recherche, au lieu de montrer des singes, ont commencé à montrer des poules. Sur Baidu, le taux de réussite était de 84 %.
    • Super-IA : Ils ont testé cela sur GPT-4 et Claude-3.5, les chatbots les plus avancés. Lorsqu'on leur montrait une image perturbée d'un singe, ces IA décrivaient avec assurance l'animal comme étant une « poule » ou un « poussin ». Le taux de réussite sur Claude-3.5 était de 80 %.
    • Générateurs d'images : Même les IA qui dessinent des images, comme DALL·E 3, ont été trompées. Lorsqu'on leur demandait de générer une image basée sur l'entrée perturbée, elles produisaient des images de poules au lieu de singes.

Pourquoi les autres méthodes ont échoué

L'article est très clair sur ce qui ne fonctionne pas. Les méthodes précédentes tentaient d'utiliser CLIP comme un assistant, mais elles échouaient car elles ne tenaient pas compte du « biais » des données.

  • Le Problème du Biais : Si vous entraînez une fausse serrure en utilisant un jeu de données légèrement teinté de bleu, votre clé ne fonctionnera peut-être que sur les serrures teintées de bleu. Les chercheurs ont découvert qu'en utilisant des « directions » (en soustrayant les caractéristiques de l'image originale de celles des nouvelles) plutôt que des caractéristiques brutes, ils annulaient ces biais.
  • Le Problème du Substitut : D'autres méthodes ont tenté d'utiliser CLIP mais ont échoué à transférer l'attaque vers d'autres modèles. Les auteurs ont montré que sans leurs astuces spécifiques de « direction » et de « transformation aléatoire », même l'utilisation de CLIP entraînait des taux d'échec de plus de 70 % sur les modèles avancés. UnivIntruder est la seule méthode qui a réussi à combler le fossé entre le modèle CLIP public et les modèles divers et inconnus utilisés dans le monde réel.

Ce que cela signifie pour la sécurité

L'article suggère que notre conception actuelle de la sécurité est peut-être brisée. Habituellement, nous pensons que si nous cachons nos données d'entraînement et limitons le nombre de questions que les gens peuvent poser, nous sommes en sécurité. Univrintruder prouve qu'un attaquant peut contourner entièrement ces défenses. Ils n'ont pas besoin de vos données, et ils n'ont pas besoin de vous poser des questions. Ils ont juste besoin d'une IA publique (CLIP) et de quelques mots.

Les chercheurs ont également testé si nous pouvions arrêter cela. Ils ont essayé l'« entraînement adversaire » (apprendre à l'ordinateur à résister aux tours) et les « défenses au moment du test » (nettoyer l'image avant qu'elle ne soit traitée). Bien que ces méthodes aient aidé un peu, elles rendaient souvent l'ordinateur moins performant dans sa tâche réelle (comme reconnaître de vrais chats) ou étaient trop coûteuses à exécuter sur des systèmes massifs comme GPT-4. L'article conclut que nous devons repenser la façon dont nous sécurisons l'IA, car un seul modèle, disponible publiquement, peut désormais tromper presque tout.

En bref, Univintruder est un signal d'alarme. Il montre qu'avec la bonne « clé universelle », les systèmes de vision du monde numérique sont bien plus fragiles que nous ne le pensions, et que la seule chose qui sépare un singe d'une poule aux yeux d'une IA pourrait être un minuscule et invisible glitch numérique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →