← Derniers articles
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

Cette étude révèle que les vulnérabilités de contournement dans les grands modèles de langage multimodaux de pointe ne sont pas uniformes entre les langues, démontrant que le passage de l'anglais à l'espagnol modifie fondamentalement la surface d'attaque en affaiblissant les attaques par cadrage linguistique tout en renforçant les attaques visuelles, invalidant ainsi les classements de sécurité dérivés d'évaluations monolingues.

Auteurs originaux : Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Publié 2026-05-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un gardien de sécurité très intelligent et hautement formé pour un bâtiment numérique. Ce gardien a pour tâche d'empêcher les gens de demander des choses dangereuses, comme la fabrication d'une bombe ou la propagation de mensonges. Pendant longtemps, nous avons pensé que ce gardien était également efficace pour bloquer les demandes malveillantes, qu'elles soient chuchotées en anglais ou en espagnol.

Ce papier est comme une histoire de détective qui prouve que cette hypothèse est fausse. Les chercheurs ont découvert que les « oreilles » du gardien sont accordées très spécifiquement à l'anglais, mais que ses « yeux » fonctionnent différemment.

Voici la décomposition de leurs résultats à l'aide d'analogies simples :

1. Le « Filtre linguistique » contre la « Lentille visuelle »

Imaginez le modèle d'IA comme un gardien de sécurité qui a appris ses règles en regardant des milliers de films en anglais et en lisant des livres en anglais.

  • La faiblesse linguistique : Si un mauvais acteur tente de tromper le gardien en utilisant une histoire astucieuse en anglais (comme se faire passer pour un personnage de pièce de théâtre ou utiliser des arguments persuasifs), le gardien reconnaît immédiatement le schéma et dit : « Non, j'ai déjà vu cette astuce. »
  • La touche espagnole : Lorsque les chercheurs ont changé la langue pour l'espagnol mexicain, le « filtre linguistique » du gardien s'est retrouvé confus. Les astuces astucieuses de style anglais (comme le jeu de rôle) ont cessé de fonctionner car le gardien n'avait pas été formé pour reconnaître ces schémas rhétoriques spécifiques en espagnol. C'est comme essayer de crocheter une serrure avec une clé qui correspond à une autre porte ; l'astuce ne fonctionne plus.
  • La surprise visuelle : Cependant, lorsque les mauvais acteurs ont utilisé des images pour tromper le gardien, l'inverse s'est produit. En espagnol, les astuces visuelles sont devenues plus efficaces. C'est comme si les yeux du gardien étaient moins connectés à sa formation linguistique. Lorsqu'il voit une image, il la traite par un chemin différent qui se soucie moins de savoir si le texte est en anglais ou en espagnol.

2. Le « Renversement de classement » (La grande surprise)

Habituellement, lorsque vous testez des systèmes de sécurité, vous vous attendez à ce que le « meilleur » gardien reste le meilleur, et que le « pire » gardien reste le pire, quelle que soit la langue parlée.

  • En anglais : Un modèle (appelons-le « Pixtral ») était le pire gardien, se faisant facilement tromper. Un autre modèle (« Qwen ») se situait au milieu.
  • En espagnol : Les classements se sont inversés ! « Qwen » est soudainement devenu le pire gardien, tandis que « Pixtral » est devenu beaucoup plus difficile à tromper.
  • La conclusion : Vous ne pouvez pas simplement prendre les scores de sécurité en anglais et faire un peu de mathématiques pour deviner à quel point un modèle est sûr en espagnol. L'ordre de qui est sûr et de qui est dangereux change réellement en fonction de la langue.

3. Pourquoi cela se produit (L'analogie de la « diète de formation »)

Le papier suggère que cela se produit en raison de la façon dont ces modèles d'IA sont formés.

  • Imaginez que le modèle est un étudiant qui n'a suivi des cours de sécurité qu'en anglais. Il a appris à repérer les « mauvais comportements » en se basant sur les mots et les structures de phrases anglais.
  • Lorsqu'on lui pose une question en espagnol, il utilise toujours son cerveau formé en anglais pour analyser les mots. Il manque les astuces car le « vocabulaire de l'astuce » est différent.
  • Cependant, les images sont universelles. Une image d'une bombe ressemble à une bombe dans n'importe quelle langue. Parce que le traitement visuel du modèle n'est pas aussi étroitement lié à sa formation de sécurité en anglais, il échoue parfois à relier l'image au danger, surtout lorsque le texte qui l'entoure est dans une langue dans laquelle le modèle n'est pas aussi « formé à la sécurité ».

4. L'essentiel

Les chercheurs ont testé quatre modèles d'IA de premier plan différents avec 363 tentatives de « jailbreak » (astuces pour contourner les règles de sécurité) différentes, à la fois en anglais et en espagnol. Ils ont constaté :

  • La sécurité n'est pas un chiffre fixe. Un modèle n'est pas simplement « sûr » ou « non sûr ». Il est sûr dans certaines langues et non sûr dans d'autres.
  • Le test « taille unique » est brisé. Si vous ne testez ces modèles qu'en anglais, vous obtenez une fausse image de leur sécurité pour le reste du monde.
  • Les générations s'améliorent, mais les écarts persistent. Les modèles plus récents sont légèrement plus difficiles à tromper que les anciens, mais la différence étrange entre les niveaux de sécurité en anglais et en espagnol est toujours là.

En résumé : Si vous voulez savoir si une IA est sûre pour un utilisateur parlant espagnol, vous ne pouvez pas simplement consulter son rapport de sécurité en anglais. Vous devez le tester en espagnol, car les « points faibles » dans l'armure se trouvent à des endroits complètement différents selon la langue.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →