← Nieuwste papers
💬 NLP

Multilingual jailbreaking of LLMs using low-resource languages

Deze studie toont aan dat, terwijl enkelvoudige vertalingen van schadelijke prompts naar taalkundig minder vertegenwoordigde Afrikaanse talen de veiligheidsmechanismen van grote taalmodellen niet omzeilen, meervoudige gesprekken de succeskans van jailbreaks aanzienlijk verhogen, waarbij menselijke red-teaming en vertaalkwaliteit als kritieke factoren worden geïdentificeerd bij het exploiteren van deze kwetsbaarheden.

Oorspronkelijke auteurs: Dylan Marx, Marcel Dunaiski

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dylan Marx, Marcel Dunaiski

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je Large Language Models (LLM's) zoals ChatGPT of Claude voor als zeer beleefde, hoogopgeleide beveiligingsagenten bij een chique club. Hun taak is om het feest veilig te houden door te weigeren dat iemand gevaarlijke spullen (schadelijke inhoud, oplichting of cyberaanvallen) binnenbrengt. Al lang proberen kwaadwillenden deze agenten te bedriegen met "jailbreak"-technieken – in wezen het vinden van gaten in de regels om het slechte spul binnen te smokkelen.

Dit artikel is als een beveiligingsaudit die vraagt: "Wat gebeurt er als de kwaadwillenden stoppen met Engels te spreken en beginnen met het spreken van Afrikaanse talen die de agenten niet goed kennen?"

Hier is de uitleg van hun bevindingen met eenvoudige analogieën:

1. De "Eén Woord"-Truc Werkt Niet Meer

In het verleden probeerden aanvallers een simpele truc: een slechte aanvraag in het Engels vertalen naar een taal met weinig bronnen (zoals isiXhosa of Afrikaans) en deze naar de agent sturen.

  • Het Resultaat: Het werkte niet meer. De beveiligingsagenten (de AI-modellen) zijn slim genoeg om te beseffen: "Hé, dit klinkt als een slechte aanvraag, zelfs als het in een taal is waar ik niet vloeiend in ben."
  • De Analogie: Het is alsof je probeert een mes de club binnen te smokkelen door het te verpakken in een ander taal-etiket. De agent ziet nog steeds de vorm van het mes en stopt je.

2. De "Lange Conversatie"-Truc Werkt Nog Steeds

De onderzoekers ontdekten dat terwijl de "één woord"-truc faalde, een complexere strategie zeer goed werkte. In plaats van direct om het slechte ding te vragen, begint de aanvaller een lange, vriendelijke conversatie. Ze bouwen vertrouwen op, stellen onschadelijke vragen en sturen de conversatie langzaam, over vele beurten heen, naar het slechte doel.

  • Het Resultaat: Deze "multi-turn"-aanpak was zeer succesvol. In het Engels omzeilde het de agenten ongeveer 53% tot 84% van de tijd, afhankelijk van welk AI-model werd getest.
  • De Analogie: In plaats van te proberen met een wapen door de voordeur te lopen, gaat de aanvaller aan de bar zitten, trakteert de agent op een drankje, vertelt een lang verhaal en overtuigt de agent langzaam om de achterdeur te openen. De agent raakt afgeleid door het gesprek en vergeet het wapen te controleren.

3. Het Probleem met de "Slechte Vertaler"

De onderzoekers testten vier Afrikaanse talen: Afrikaans, Kiswahili, isiXhosa en isiZulu. Ze ontdekten een verrassend patroon:

  • Afrikaans & Kiswahili: Deze talen hadden hogere succespercentages voor de aanvallers.
  • isiXhosa & isiZulu: Deze talen hadden veel lagere succespercentages.

Waarom? Het was niet omdat de AI-agenten beter waren in het beschermen van isiXhosa of isiZulu. Het was omdat het Google Translate-hulpmiddel dat werd gebruikt om de aanvallen te creëren, een slechte job deed bij het vertalen van het complexe gesprek naar die specifieke talen.

  • De Analogie: Stel je voor dat de aanvaller probeert een geheim plan via een vertaler fluisterend aan de agent door te geven.
    • Voor Afrikaans fluisterde de vertaler het plan duidelijk. De agent hoorde het en raakte in de war.
    • Voor isiXhosa mompelde en verdraaide de vertaler de woorden. De agent dacht: "Ik begrijp niet wat je zegt," en negeerde gewoon de aanvraag. De aanval faalde niet omdat de agent sterker was, maar omdat het bericht te rommelig was om te begrijpen.

4. Mensen versus Robots (De "Red Teaming"-Test)

Om hun theorie over de "slechte vertaler" te bewijzen, haalden de onderzoekers echte moedertaalsprekers van deze talen erbij. Deze mensen namen de rommelige, door machines vertaalde gesprekken en repareerden ze, waardoor ze natuurlijk en duidelijk klonken.

  • Het Resultaat: Toen mensen de taal repareerden, schoot het succespercentage van de aanvallen omhoog.
    • Voor isiZulu steeg het succespercentage met meer dan 300% toen mensen de vertaling repareerden.
    • Voor isiXhosa steeg het met ongeveer 12%.
  • De Conclusie: De AI-modellen zijn niet daadwerkelijk veiliger voor deze talen; ze faalden gewoon om de "gebroken" vertalingen te begrijpen. Zodra de taal werd gerepareerd, waren de modellen net zo kwetsbaar als in het Engels.

5. Welke Agenten Waren Het Zwakst?

De studie testte verschillende AI-modellen (zoals GPT-4o, Claude, DeepSeek, enz.).

  • De Sterkste Agent: Claude 3.5 Haiku was het moeilijkst te bedriegen, zelfs met lange conversaties.
  • De Zwakste Agenten: DeepSeek en GPT-4o-mini waren het makkelijkst te bedriegen, waarbij schadelijke inhoud in sommige talen meer dan 70% van de tijd doorgelaten werd.

Samenvatting

Het artikel concludeert dat vertalkwaliteit de sleutel is.
Als je een moderne AI probeert aan te vallen door gewoon een slechte prompt te vertalen naar een taal met weinig bronnen, zal het waarschijnlijk niet meer werken. Als je echter een moedertaalspreker hebt die een lange, natuurlijke, meerstaps conversatie in die taal kan opzetten, kunnen de veiligheidsfilters van de AI nog steeds worden omzeild. De modellen zijn niet van nature veiliger voor deze talen; ze worstelen gewoon met het begrijpen van de "gebroken" versies ervan die machines produceren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →