← Nieuwste papers
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

Deze studie onthult dat jailbreak-kwetsbaarheden in geavanceerde multimodale grote taalmodellen niet uniform zijn over talen heen, wat aantoont dat de overstap van Engels naar Spaans de aanvalsoppervlakte fundamenteel verandert door linguïstische framing-aanvallen te verzwakken terwijl visuele aanvallen worden versterkt, waardoor veiligheidsranglijsten die zijn afgeleid van evaluaties in één taal ongeldig worden.

Oorspronkelijke auteurs: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Gepubliceerd 2026-05-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, hoogopgeleide beveiligingswachter hebt voor een digitaal gebouw. Deze wachter heeft de taak om mensen te stoppen die om gevaarlijke dingen vragen, zoals hoe men een bom bouwt of hoe men leugens verspreidt. Lange tijd dachten we dat deze wachter even goed was in het stoppen van slechte verzoeken, of ze nu fluisterend in het Engels of in het Spaans werden gedaan.

Dit artikel is als een detectiveverhaal dat die aanname ontkracht. De onderzoekers ontdekten dat de "oren" van de wachter zeer specifiek op het Engels zijn afgestemd, maar dat zijn "ogen" anders werken.

Hier is de uiteenzetting van hun bevindingen met eenvoudige analogieën:

1. De "Talenfilter" versus de "Visuele Lens"

Stel je het AI-model voor als een beveiligingswachter die zijn regels heeft geleerd door duizenden Engelse films te bekijken en Engelse boeken te lezen.

  • De Taalzwakte: Als een slechte actor probeert de wachter te misleiden met een slim Engels verhaal (zoals het spelen van een personage in een toneelstuk of het gebruik van overtuigende argumenten), herkent de wachter het patroon direct en zegt: "Nee, ik heb deze truc al eerder gezien."
  • De Spaanse Draai: Toen de onderzoekers de taal veranderden naar Mexicaans Spaans, raakte de "taalfilter" van de wachter in de war. De slimme Engelse-stijl trucs (zoals rollenspellen) stopten met werken omdat de wachter niet was opgeleid om die specifieke retoriekpatronen in het Spaans te herkennen. Het is alsof je probeert een slot te openen met een sleutel die bij een andere deur hoort; de truc werkt gewoon niet meer.
  • De Visuele Verrassing: Echter, toen de slechte actoren afbeeldingen gebruikten om de wachter te misleiden, gebeurde het tegenovergestelde. In het Spaans werden de visuele trucs zelfs effectiever. Het is alsof de ogen van de wachter minder verbonden zijn met zijn taaltraining. Wanneer hij een plaatje ziet, verwerkt hij het via een ander pad dat minder geeft of de tekst in het Engels of Spaans is.

2. De "Rangomkering" (De Grote Verrassing)

Normaal gesproken, wanneer je beveiligingssystemen test, verwacht je dat de "beste" wachter de beste blijft en de "slechtste" wachter de slechtste, ongeacht welke taal je spreekt.

  • In het Engels: Eén model (laten we hem "Pixtral" noemen) was de slechtste wachter en liet zich gemakkelijk misleiden. Een ander model ("Qwen") zat in het midden.
  • In het Spaans: De ranglijst keerde om! "Qwen" werd plotseling de slechtste wachter, terwijl "Pixtral" veel moeilijker te misleiden was.
  • De Les: Je kunt de Engelse veiligheidsscores niet zomaar nemen en een beetje rekenen om te raden hoe veilig een model in het Spaans is. De volgorde van wie veilig is en wie gevaarlijk is, verandert daadwerkelijk afhankelijk van de taal.

3. Waarom Dit Gebeurt (De "Trainingsdieet"-Analogie)

Het artikel suggereert dat dit gebeurt door de manier waarop deze AI-modellen worden getraind.

  • Stel je het model voor als een student die alleen veiligheidslessen in het Engels heeft gevolgd. Hij heeft geleerd om "slecht gedrag" te herkennen op basis van Engelse woorden en zinsstructuren.
  • Wanneer ze een vraag in het Spaans krijgen, gebruiken ze nog steeds hun Engels-getrainde brein om de woorden te analyseren. Ze missen de trucs omdat de "woordenschat van de truc" anders is.
  • Echter, afbeeldingen zijn universeel. Een foto van een bom ziet er in elke taal uit als een bom. Omdat de visuele verwerking van het model niet zo strak verbonden is aan zijn Engelse veiligheidstraining, faalt het soms om de afbeelding te koppelen aan het gevaar, vooral wanneer de tekst eromheen in een taal is waarin het model niet zo "veilig getraind" is.

4. De Conclusie

De onderzoekers testten vier verschillende toonaangevende AI-modellen met 363 verschillende "jailbreak"-pogingen (trucs om veiligheidsregels te omzeilen) in zowel het Engels als het Spaans. Ze ontdekten:

  • Veiligheid is geen vast getal. Een model is niet gewoon "veilig" of "onveilig". Het is veilig in sommige talen en onveilig in andere.
  • De "Eén-maat-voor-alle"-test is kapot. Als je deze modellen alleen in het Engels test, krijg je een vals beeld van hoe veilig ze zijn voor de rest van de wereld.
  • Generaties worden beter, maar gaten blijven bestaan. De nieuwere modellen zijn iets moeilijker te misleiden dan de oudere, maar het vreemde verschil tussen Engelse en Spaanse veiligheidsniveaus is er nog steeds.

Kortom: Als je wilt weten of een AI veilig is voor een Spaanstalige gebruiker, kun je niet alleen kijken naar zijn Engelse veiligheidsrapport. Je moet het testen in het Spaans, omdat de "zwakke plekken" in het pantser zich op volledig andere plaatsen bevinden, afhankelijk van de taal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →