← Derniers articles
🤖 AI

NonTextual Target Attack

L'article introduit l'attaque de cible non textuelle (NTA), une nouvelle méthode de jailbreak basée sur le gradient qui maximise la probabilité d'insécurité d'un LLM sans imposer de modèles de réponse fixes, élargissant ainsi considérablement l'espace de recherche d'attaque pour atteindre un taux de réussite de 96,8 % avec une grande efficacité sur les modèles alignés sur la sécurité.

Auteurs originaux : Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Publié 2026-07-09
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de faire passer un message interdit devant un garde de sécurité très strict (l'IA). Ce garde est programmé pour refuser toute requête qui semble dangereuse, comme « Comment fabriquer une bombe ? »

L'ancienne méthode : l'approche « scriptée »

Les méthodes précédentes pour tromper ce garde consistaient à essayer de forcer le garde à dire une phrase spécifique et pré-écrite, telle que « Bien sûr, voici... »

Considérez cela comme une partie de « Jacques a dit ». L'attaquant continue de crier différentes commandes, espérant que le garde finira par dire « Bien sûr, voici... » suivi des instructions dangereuses.

  • Le problème : Le garde est têtu. Parfois, même si le garde veut donner la réponse, il peut commencer par « Voici... » ou « Bien entendu... » au lieu de « Bien sûr ». Parce que l'attaquant est obsédé par l'obtention de cette phrase exacte « Bien sûr », il perd énormément de temps à essayer de coincer le garde. Si le garde ne prononce pas les mots magiques, l'attaque est considérée comme un échec, même si le garde a réellement donné l'information dangereuse.
  • Le résultat : C'est comme essayer de déverrouiller une porte en n'utilisant qu'une seule forme de clé spécifique. Si la serrure est légèrement différente, vous ne pouvez pas entrer, même si vous avez la bonne clé.

La nouvelle méthode : NTA (NonTextual Target Attack)

Le document présente une nouvelle méthode appelée NTA. Au lieu de se soucier de quels mots le garde prononce en premier, NTA ne se soucie que d'une seule chose : Le garde a-t-il donné la réponse dangereuse ?

Considérez NTA comme un maître serrurier qui ne se soucie pas de savoir si le garde dit « Bien sûr », « D'accord » ou « Voilà ». Il veut simplement que la porte soit ouverte.

  • La stratégie : NTA utilise une danse en deux étapes pour tromper le garde :
    1. Imaginer le pire : D'abord, il demande à un « modèle de score » (un juge intelligent) d'imaginer la réponse la plus dangereuse possible que le garde pourrait donner, sans se soucier de la manière dont le garde la formulerait réellement. C'est comme si l'attaquant imaginait la réponse parfaite, la plus utile, à une mauvaise question.
    2. Correspondre au rêve : Ensuite, il ajuste la question (le prompt) pour que la réponse du vrai garde ressemble de plus en plus à cette réponse dangereuse « rêvée ».

Le « Traducteur Magique »

Une partie délicate est que le « juge qui rêve » et le « vrai garde » parlent des langages légèrement différents (ils utilisent des codes internes de mots différents).

  • L'analogie : Imaginez que le juge parle « français » et que le garde parle « allemand ». NTA utilise une Matrice de Projection de Vocabulaire spéciale (un traducteur) pour convertir les idées dangereuses en « français » en instructions en « allemand » que le garde peut comprendre et suivre.

Pourquoi c'est meilleur

  • Vitesse : Comme NTA ne perd pas de temps à essayer de forcer le garde à dire « Bien sûr », il trouve un moyen d'obtenir la réponse dangereuse beaucoup plus rapidement. Le document indique qu'il peut réussir en seulement 100 essais, alors que les anciennes méthodes pourraient en nécessiter des milliers ou échouer totalement.
  • Taux de réussite : Dans les tests, NTA a réussi environ 97 % du temps contre des modèles d'IA robustes et entraînés à la sécurité. Les meilleures anciennes méthodes ne réussissaient que 50 à 60 % du temps.
  • Variété : Les anciennes méthodes produisent souvent des réponses bizarres ou décousues car elles sont tellement concentrées sur la phrase spécifique « Bien sûr ». NTA produit des réponses naturelles, variées et cohérentes parce qu'il a la liberté de trouver n'importe quel chemin vers le mauvais résultat.

L'essentiel

Le document affirme qu'en cessant l'obsession pour les « mots magiques » spécifiques et en se concentrant purement sur le résultat dangereux, les attaquants peuvent contourner les filtres de sécurité de l'IA de manière beaucoup plus efficace et performante. Cela transforme un jeu de « Jacques a dit » rigide et frustrant en une recherche flexible du point faible dans la défense du garde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →