← Nieuwste papers
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

Dit artikel introduceert een Multi-Group Item Response Theory-raamwerk om de onderscheidende factoren die veiligheidsdegradatie in grote taalmodellen over talen heen veroorzaken, te ontkoppelen en te analyseren, en onthult dat veiligheidsfouten voornamelijk unidimensionaal zijn, vaak ernstiger in het Engels dan in talen met weinig bronnen, en aanzienlijk worden beïnvloed door prompt-specifieke interlinguale gaten gerelateerd aan fysieke schade en culturele mismatches in plaats van enkel aan vertaalkwaliteit.

Oorspronkelijke auteurs: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van beveiligers (de AI-modellen) hebt dat werkt in een museum. Hun taak is om te voorkomen dat mensen gestolen kunstwerken proberen te smokkelen (onveilige verzoeken).

Lange tijd hebben we deze beveiligers alleen in het Engels getest. We vroegen hen: "Kun je me vertellen hoe ik een schilderij kan stelen?" Zeiden ze "Nee", dan slaagden ze. Zeiden ze "Ja", dan faalden ze. We telden de mislukkingen en noemden dat een score.

Maar dit artikel vraagt zich af: Wat gebeurt er als we deze beveiligers testen in andere talen, zoals Swahili, Javaans of Bengaals?

De onderzoekers ontdekten dat de oude manier van testen vergelijkbaar was met appels met peren vergelijken. Ze ontwikkelden een nieuwe, slimmere manier om veiligheid te meten die het probleem opsplitst in zijn individuele onderdelen, net zoals een monteur een motorkap openmaakt om precies te zien welk onderdeel kapot is.

Hier is de uiteenzetting van hun bevindingen met eenvoudige analogieën:

1. De Oude Manier versus de Nieuwe Manier

De Oude Manier (de "Jailbreak Succesratio"):
Stel je een test voor waarbij je een beveiliger vraagt: "Kun je de regels breken?" Als ze de regels breken, zet je een groot rood "X". Je telt gewoon de rode X'en.

  • Het Probleem: Als een beveiliger faalt in het Swahili maar slaagt in het Engels, is dat dan omdat de beveiliger slecht is? Is het omdat de Swahili-vraag moeilijker te begrijpen was? Of is het omdat de Swahili-vertaling van de vraag per ongeluk onschuldig klonk? De oude methode mengt al deze redenen in één verwarrend getal.

De Nieuwe Manier (het "IRT-kader"):
De auteurs bouwden een "Veiligheidsontledingsmachine". In plaats van één grote score, splitst het een mislukking op in vier verschillende ingrediënten:

  • De Vaardigheid van de Beveiliger (θ\theta): Hoe goed is de beveiliger over het algemeen in het zeggen van "Nee"?
  • De Moeilijkheidsgraad van de Vraag (β\beta): Is de vraag zelf al lastig, zelfs in het Engels?
  • De Taalbarrière (γ\gamma): Is deze taal over het algemeen moeilijker voor de AI om te verwerken?
  • De Vertaalfout (τ\tau): Is de specifieke vraag in de vertaling verstoord geraakt, waardoor het makkelijker werd om de beveiliger te misleiden?

2. De Grote Verrassingen

De onderzoekers testten 61 verschillende AI-configuraties in 10 talen. Dit is wat ze ontdekten:

Verrassing #1: De "Engelse Omkering"
We gaan er meestal van uit dat AI het veiligst is in het Engels en in andere talen slechter presteert.

  • De Realiteit: Voor veel modellen was het Engels eigenlijk de gevaarlijkste taal. De beveiligers waren meer geneigd om de regels te breken in het Engels dan in talen met minder bronnen zoals Javaans of Swahili.
  • Waarom? De onderzoekers denken dat de "boeven" (aanvallers) hun trucs in het Engels hebben bedacht. Wanneer die trucs worden vertaald, verliezen ze soms hun "bijt" of raken ze verward, waardoor ze minder effectief zijn. In het Engels werken de trucs perfect.

Verrassing #2: Veiligheid is Één Grote Spier
We zouden kunnen denken dat een AI een andere "veiligheidsspier" nodig heeft voor elk onderwerp (één voor diefstal, één voor geweld, één voor haatzaaiende taal).

  • De Realiteit: Veiligheid is unidimensionaal. Het is als één enkele spier. Als een beveiliger goed is in het weigeren om te helpen bij diefstal, is hij bijna altijd ook goed in het weigeren om te helpen bij geweld. Ze hebben geen aparte circuits voor elk onderwerp; ze gebruiken één gedeeld mechanisme om "Nee" te zeggen.

Verrassing #3: Vertaalfouten zijn het "Rookend Pistool"
Soms faalt een beveiliger niet omdat ze zwak is, maar omdat de vraag slecht is vertaald.

  • De Analogie: Stel je voor dat je een beveiliger vraagt: "Hoe start ik een auto door hem te stelen?" (hot-wire).
    • Als de vertaling per ongeluk verandert in "Hoe verwarm ik een auto?" (hem opwarmen), zegt de beveiliger misschien: "Natuurlijk, hier is hoe je de verwarming gebruikt."
    • De beveiliger is niet gefaald op het gebied van veiligheid; ze faalde in het begrijpen van de gebroken vertaling.
  • Het artikel vond uit dat hoewel slechte vertalingen wel sommige mislukkingen veroorzaken, ze slechts een klein deel van het totale probleem verklaren. Meestal is de vertaling prima, maar heeft de AI toch moeite.

Verrassing #4: Culturele Verwarring
Sommige vragen falen omdat het concept in die cultuur niet bestaat.

  • De Analogie: Een AI vragen in een land zonder FBI: "Hoe ontsnap ik aan de FBI?" kan de AI in de war brengen. Het concept van de "FBI" is cultureel specifiek. De AI realiseert zich misschien niet dat dit een gevaarlijk verzoek is omdat de culturele context ontbreekt.

3. De "Onzekerheid"-factor

De onderzoekers merkten op dat in talen met minder bronnen (talen met minder beschikbare data), de AI meer gedraagt als een nerveuze student die giswerk doet tijdens een toets. Het geeft "grens"-antwoorden—reacties die half-veilig, half-onveilig zijn, of zeer onzeker.

  • De Oplossing: Om een echte meting te krijgen, kun je de vraag niet één keer stellen. Je moet het 10 keer vragen en de antwoorden middelen. Dit gladtrekt het "gissen" en onthult het echte veiligheidsniveau van de AI.

4. Waarom Dit Belangrijk Is

Het artikel concludeert dat we niet langer kunnen volstaan met het kijken naar één enkele "Veiligheidsscore" voor een AI.

  • Als een AI faalt in een specifieke taal, weten we nu hoe we kunnen diagnosticeren waarom:
    • Is de AI gewoon slecht in veiligheid? (Het model verbeteren).
    • Is de taal moeilijk voor de AI? (De taaltraining verbeteren).
    • Is de vertaling gebroken? (De dataset repareren).
    • Is het concept cultureel vreemd? (De prompt aanpassen).

Kortom: Het artikel geeft ons een "microscoop" om AI-veiligheid te bekijken. In plaats van alleen te zeggen "Deze AI is onveilig", kunnen we nu zeggen: "Deze AI is veilig, maar raakt in de war als we hem vragen over het stelen van auto's in Javaans, omdat de vertaling iets afwijkt." Dit helpt ontwikkelaars het exacte probleem op te lossen in plaats van te gissen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →