← Nieuwste papers
💻 computer science

Language-Specific Gaps in AI Safety Training Datasets

Dit artikel legt kritische, vaak onbehandelde tekortkomingen bloot in de herkomst, annotatie en dekking van de schadetaxonomie van AI-veiligheidstrainsingsdatasets over laag-, midden- en hoog-resource talen heen, waarbij wordt aangetoond dat deze structurele tekortkomingen — met name in Afrikaanse talen en specifieke schadecategorieën — de meertalige veiligheidsclaims ondermijnen en bijdragen aan persistente kwetsbaarheden tegen multi-turn jailbreak-aanvallen.

Oorspronkelijke auteurs: Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

Gepubliceerd 2026-08-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, bruisende bibliotheek waar boeken in elke denkbare taal zijn geschreven. Lange tijd spraken de bibliothecarissen (de mensen die AI bouwen) voornamelijk Engels, dus schreven ze alle veiligheidsregels en "verboden toegang"-borden in het Engels. Onlangs realiseerden ze zich dat ze lezers in andere talen moesten verwelkomen, dus begonnen ze die borden te vertalen. Maar hier komt de crux: alleen omdat een bibliotheek zegt dat er veiligheidsregels zijn voor 20 verschillende talen, betekent dat nog niet dat de regels er ook daadwerkelijk zijn, of dat ze zin maken in die talen. Dit artikel duikt in de "AI-veiligheid"-hoek van de informatica. Het onderzoekt hoe we computers leren om beleefd, veilig en behulpzaam te zijn, en controleert specifiek of het trainingsmateriaal dat wordt gebruikt om hen te onderwijzen wel goed genoeg is voor niet-Engelstaligen. De grote vraag is: plakken we slechts een vertaalsticker op een bord, of hebben we echt een nieuw, cultureel passend regelboek voor iedereen geschreven?

De auteurs van dit artikel besloten een detective te spelen. Ze namen niet simpelweg het woord van de AI-bedrijven dat hun modellen veilig zijn voor iedereen. In plaats daarvan gingen ze de archieven in en auditeerden ze 21 verschillende collecties veiligheidsdata (de "regelboeken" die worden gebruikt om AI te trainen) over 25 verschillende taalsneden. Ze concentreerden zich op drie talen om verschillende niveaus van middelen te vertegenwoordigen: Hausa (weinig middelen, zoals een kleine dorpsbibliotheek), Swahili (gemiddelde middelen, zoals een stadsbibliotheek) en Frans (veel middelen, zoals een enorme stadsbibliotheek).

Dit is wat ze vonden, en het is een beetje alsof je ontdekt dat de sectie "Veiligheid" in de dorpsbibliotheek grotendeels leeg is, terwijl de sectie in de stadsbibliotheek vol staat met boeken die gewoon zijn gefotocopieerd uit het Engels.

De "Vertaalval"
De grootste verrassing was dat veel datasets beweren "native" te zijn (geschreven door mensen die de taal als moedertaal hebben), maar toen de auteurs nauwkeurig keken, waren ze in werkelijkheid machinaal vertaald vanuit het Engels. Het is alsof een restaurant beweert "authentieke lokale keuken" te serveren, maar wanneer je even in de keuken kijkt, zie je een robot die een menu uit een ander land vertaalt en het op een bord plakt. Voor de taal met weinig middelen (Hausa) was bijna alle veiligheidsdata ofwel vertaald, ofwel door computers bedacht, en niet geschreven door moedertaalsprekers. Erger nog, in sommige gevallen was de vertaling zo slecht dat deze onder de kwaliteitsscore zakte die de onderzoekers zelf als de minimale acceptabele standaard hadden ingesteld. Eén specifieke pijplijn testte zowel Hausa als Swahili; de Swahili-versie slaagde gemakkelijk voor de test, maar de Hausa-versie faalde, ook al gebruikten ze exact hetzelfde proces. Dit bewijst dat het probleem niet is dat de taal "moeilijk" te vertalen is; het is dat het proces niet voorzichtig genoeg was voor de specifieke taal.

Het "Ontbrekende Hoofdstukken"-probleem
De auteurs controleerden ook of de veiligheidsregels alle gevaarlijke onderwerpen dekten. Ze ontdekten een enorme kloof: voor de Afrikaanse talen die zij bestudeerden, waren er bijna geen originele regels over zelfbeschadiging of seksuele inhoud. Het is alsof de bibliotheek een hele sectie heeft over "Niet stelen" en "Niet vechten", maar de planken voor "Zorg niet voor jezelf" en "Houd privézaken privé" volledig leeg zijn. Dit is een totale leegte, niet slechts een kleine tekortkoming. Voor het Frans werden deze onderwerpen wel gedekt, maar voor Hausa en Swahili bestond de data simpelweg niet in een originele vorm. Dit betekent dat als een gebruiker de AI in hun moedertaal over deze gevoelige onderwerpen vraagt, de AI de culturele nuances mogelijk niet begrijpt of een gevaarlijk antwoord kan geven omdat de juiste regels nooit zijn aangeleerd.

De "Dubbeltellingen"-illusie
Nog een truc die de auteurs ontdekten, was "dubbeltellen". Stel je een bibliotheek voor die beweert 10.000 unieke boeken te hebben. Maar als je goed kijkt, merk je dat ze gewoon dezelfde 1.000 boeken hebben genomen, er een andere kaft omheen hebben geplakt en ze als nieuw hebben geteld. De onderzoekers ontdekten dat voor Swahili veel datasets simpelweg dezelfde originele tweets of berichten waren die door verschillende groepen opnieuw waren gelabeld (re-annotated). Dit gaf de indruk dat er een enorme hoeveelheid data beschikbaar was, maar in werkelijkheid was de "diversiteit" een illusie. Het is alsof je een afspeellijst hebt die zegt dat hij 500 nummers bevat, maar het zijn eigenlijk steeds dezelfde 50 nummers die telkens met een andere naam worden afgespeeld.

Waarom de term "weinig middelen" niet het hele verhaal is
Je zou kunnen denken: "Natuurlijk heeft de kleine dorpsbibliotheek minder boeken dan de grote stadsbibliotheek." De paper is het ermee eens dat talen met weinig middelen minder data hebben, maar het betoogt dat het niet alleen gaat om hoeveel data er is, maar om wat voor soort data het is. Ze ontdekten dat soms de taal met gemiddelde middelen (Swahili) lagere kwaliteitsscores behaalde dan de taal met weinig middelen (Hausa) voor specifieke taken, en dat soms de taal met veel middelen (Frans) gaten vertoonde op gebieden waar de taal met gemiddelde middelen juist sterke, originele dekking had. Dit suggereert dat het probleem niet alleen een gebrek aan geld of computers is; het gaat erom hoe onderzoeksgemeenschappen bepalen wat ze bouwen. Als een gemeenschap diep geeft om desinformatie tijdens verkiezingen, bouwen ze geweldige data voor dat onderwerp. Als ze dat niet doen, bestaat die data niet, ongeacht hoe "rijk" de taal is.

De Gevolgen in de Praktijk
Waarom is dit belangrijk? Het artikel verbindt deze hiaten in data of slechte data aan een echt veiligheidsprobleem. Onderzoekers hebben ontdekt dat hoewel AI-modellen beter worden in het stoppen van eenvoudige, eenzijdige "jailbreaks" (trucs om de AI iets slechts te laten zeggen) in Afrikaanse talen, ze nog steeds falen bij complexe, meerlaagse gesprekken. De auteurs stellen dat dit komt doordat de trainingsdata voor die complexe gesprekken grotendeels synthetisch (door computers gemaakt) en vertaald is, en niet origineel. Het is alsof je een bestuurder leert om te stoppen voor een rood licht (een eenvoudige stap), maar hem nooit leert hoe hij moet omgaan met een plotselinge storm of een glad wegdek (complexe, meerstaps situaties). De AI kan de eenvoudige trucjes aan, maar valt uit elkaar wanneer het gesprek ingewikkelder wordt.

De Kernboodschap
Het artikel zegt niet dat we moeten stoppen met proberen om AI voor iedereen veilig te maken. In plaats daarvan zegt het dat we moeten stoppen met pretenderen dat een "meertalige" claim betekent dat alles in orde is. Alleen omdat een dataset beweert dat deze 14 talen dekt, betekent dat niet dat de veiligheidsregels er ook daadwerkelijk zijn voor alle talen. De auteurs suggereren dat makers eerlijk moeten zijn: als een taalsnit is vertaald, zeg dan dat het vertaald is. Als een onderwerp ontbreekt, geef dan toe dat het ontbreekt. Ze willen dat we stoppen met het tellen van de "koptekst"-cijfers en beginnen met kijken naar de individuele stukken van de taart. Tot die tijd navigeert de AI voor veel anderen nog steeds door een bibliotheek met ontbrekende boeken en kapotte borden, ook al is ze voor Engelstaligen wel veilig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →