← Nieuwste papers
💬 NLP

Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages

Dit artikel introduceert een "Safety Cost"-metriek om aan te tonen dat veiligheidsafstemming niet-Engelse talen onevenredig benadeelt met een groter verlies aan nut en zwakkere bescherming vergeleken met het Engels, wat een systematische ongelijkheid in de huidige veiligheidspraktijken onthult.

Oorspronkelijke auteurs: Chanwoong Yoon, Jungsoo Park, Alan Ritter

Gepubliceerd 2026-08-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chanwoong Yoon, Jungsoo Park, Alan Ritter

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie zijn grote taalmodellen de digitale motoren die chatbots, vertalers en assistenten aandrijven. Voordat deze machines nuttig kunnen zijn voor mensen, ondergaan ze een rigoureus trainingsproces dat alignment wordt genoemd. Beschouw dit als een schoolperiode waarin het model niet alleen leert om vragen te beantwoorden, maar om ze op een veilige manier te beantwoorden, waarbij het zich houdt aan menselijke waarden en weigert schadelijke inhoud te genereren, zoals instructies voor geweld of illegale handelingen. Deze veiligheidstraining is essentieel, maar brengt een verborgen prijs met zich mee. Net zoals een auto met overgevoelige remmen te snel kan stoppen voor een klein obstakel, kan een AI die te voorzichtig is onbehulpzaam worden, door onschuldige vragen te weigeren of vage, afgezwakte antwoorden te geven. Dit verlies aan behulpzaamheid staat bekend als een utility cost (bruikbaarheidskost). Jarenlang wisten onderzoekers dat veiligheidstraining de algehele prestaties van een model vermindert, maar een cruciale vraag bleef onbeantwoord: wordt deze prijs gelijkmatig verdeeld over iedereen, of lijden sommige talen meer dan andere?

Een team van onderzoekers ging op onderzoek uit om te kijken of de last van veiligheidsalignment eerlijk wordt gedeeld over de talen van de wereld. Ze richtten zich op een specifiek fenomeen waarbij modellen veilige verzoeken kunnen weigeren simpelweg omdat ze er een klein beetje riskant uitzien, een gedrag dat bekend staat als over-refusal (overmatige weigering). Om de werkelijke kosten van veiligheid te meten, bedacht het team een slimme vergelijkingsmethode. Ze namen krachtige, voor veiligheid afgestemde modellen en creëerden "niet-afgestemde" versies van dezelfde software. Deze niet-afgestemde versies waren niet getraind om gevaarlijk te zijn; in plaats daarvan hadden de onderzoekers de specifieke veiligheidsmechanismen die de modellen ertoe brachten verzoeken te weigeren, chirurgisch verwijderd, waardoor de rest van de kennis en het vermogen van het model om te spreken intact bleef. Door de reacties van het voor veiligheid afgestemde model te vergelijken met die van zijn niet-afgestemde tweeling voor dezelfde vraag, konden de onderzoekers precies isoleren hoeveel behulpzaamheid verloren ging door enkel de veiligheidstraining. Ze testten dit in het Engels en vijf andere talen, waaronder Chinees, Arabisch, Koreaans, Vietnamees en Thais, met behulp van een reeks vragen die onschadelijk waren maar waarschijnlijk een veiligheidsalarm zouden triggeren.

De resultaten onthulden een scherpe en systematische ongelijkheid. De onderzoekers ontdekten dat niet-Engelse gebruikers consequent een hogere prijs betalen voor veiligheid dan Engelse sprekers. In veel gevallen waren de veiligheidsfilters minder effectief in het beschermen van niet-Engelse sprekers tegen daadwerkelijk gevaar, terwijl deze gebruikers toch aanzienlijk slechtere, minder behulpzame antwoorden kregen op hun onschuldige vragen. De studie identificeerde drie duidelijke patronen achter deze ongelijkheid. Ten eerste vielen veel talen in een "dubbele straf"-zone: ze ontvingen zwakkere bescherming tegen echte gevaren en leden tegelijkertijd aan een veel grotere daling in de kwaliteit van hun antwoorden. Ten tweede leek een taal in sommige gevallen een lage veiligheidskost te hebben omdat de veiligheidsfilters helemaal niet waren geactiveerd, waardoor gebruikers werden blootgesteld aan schadelijke inhoud zonder dat het model zich daar zelfs van bewust was. Ten derde, zelfs voor talen met veel middelen zoals het Chinees, die over enorme hoeveelheden trainingsdata beschikken, was de kost van het bereiken van hetzelfde niveau van veiligheid als het Engels aanzienlijk hoger. Het verlies aan bruikbaarheid ging niet alleen over het feit dat het model "nee" zei wanneer het "ja" had moeten zeggen. De onderzoekers ontdekten dat zelfs wanneer het model wel antwoordde, de reactie vaak dunner, minder gedetailleerd en feitelijk minder precies was. De veiligheidstraining had stilletjes de diepgang en nuance weggehaald, waardoor de AI minder nuttig werd zonder dat de gebruiker noodzakelijkerwijs besefte waarom.

Dit werk suggereert dat de huidige methoden om AI veilig te maken niet eerlijk zijn gekalibreerd voor verschillende culturen en talen. De veiligheidstraining, die sterk wordt beïnvloed door Engelstalige data en normen, creëert onbedoeld een structurele kloof waarbij niet-Engelse sprekers een slechtere ervaring krijgen. De onderzoekers stellen dat dit geen onvermijdelijk bijeffect is van het veilig maken van AI, maar eerder een fout in de manier waarop veiligheid momenteel wordt geïmplementeerd. Door de specifieke kosten van veiligheid in elke taal te meten, legt de studie een fundamentele ongelijkheid in de technologie bloot. Het laat zien dat terwijl Engelse sprekers een veilige en behulpzame reactie kunnen krijgen, een spreker van een andere taal een reactie kan krijgen die ofwel onveilig of onbehulpzaam vaag is, simpelweg omdat de veiligheidsmechanismen niet zijn afgestemd op hun specifieke linguïstische context. De bevindingen pleiten voor een nieuwe aanpak van veiligheidsalignment, een aanpak die ervoor zorgt dat de kosten van veiligheid gelijkmatig worden verdeeld, zodat de voordelen van kunstmatige intelligentie niet worden verminderd door de taal waarin het wordt gesproken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →