Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
Dit artikel introduceert PLACES, een participatief red teaming-initiatief dat westers gecentreerde vooroordelen in tekst-naar-afbeeldingveiligheid aanpakt door samen te werken met gemeenschappen in het Zuiden om een divers dataset van meer dan 26.000 gelokaliseerde faalexamples te genereren, unieke culturele schade aan het licht brengt en pleit voor veiligheidskaders die rekening houden met de context.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een magische kunstmachine voor (een Text-to-Image-model) die alles kan tekenen wat je beschrijft. Lange tijd werd deze machine vooral getraind door mensen in het Westen (Noord-Amerika en Europa) en leerde het de wereld te zien door hun ogen. Het is als een chef die alleen weet hoe hij Amerikaans comfort food moet koken; als je vraagt om een specifiek regionaal gerecht uit India of Nigeria, geeft hij je misschien gewoon een generieke hamburger of een verwarde brij.
Dit artikel, getiteld "Going PLACES," gaat over een team van onderzoekers dat besloot deze kunstmachine te leren de rest van de wereld op de juiste manier te zien. Ze vroegen niet zomaar willekeurige mensen online om de machine te proberen te breken; ze gingen diep in lokale gemeenschappen in het "Global South" (specifiek Ghana, Nigeria en delen van India) om uit te vinden wat de machine op die specifieke plaatsen verkeerd doet.
Hier is de uiteenzetting van hun werk met behulp van eenvoudige analogieën:
1. Het Probleem: Het "One-Size-Fits-All" Veiligheidsnet
De onderzoekers stellen dat de huidige veiligheidsregels voor deze AI-kunstmachines lijken op een reddingsvest in één maat. Het kan perfect passen bij een westerse zwemmer, maar het is te los of te strak voor iemand uit een andere cultuur.
- Het Probleem: De AI denkt dat het "veilig" is door westerse regels te volgen, maar in lokale culturen kan het afbeeldingen genereren die diep beledigend, religieus ongepast of cultureel onwetend zijn.
- De Analogie: Stel je een AI voor die een "religieuze ceremonie" tekent. In het Westen tekent het misschien gewoon een generieke kerk. Maar in India, als je vraagt om een specifiek Hindoeritueel, kan de AI per ongeluk schoenen op de voeten van een godheid zetten (wat een enorm taboe is) of twee verschillende festivals door elkaar halen. De AI kent deze lokale "verkeersregels" niet.
2. De Oplossing: "Red Teaming" met Lokale Gidsen
"Red Teaming" is als het huren van een groep hackers om een beveiligingssysteem te proberen te breken, zodat je het kunt repareren voordat de slechte jongens het doen. Meestal zitten deze "hackers" als experts in grote techkantoren in de VS of het VK.
- Wat PLACES deed: In plaats van buitenstaanders in te huren, werkten ze samen met universiteiten in secundaire steden (niet alleen de grote hoofdsteden zoals Mumbai of Lagos). Ze werven lokale studenten en faculteitsleden aan om te fungeren als "Community Guides".
- De Workshop: Voordat de studenten begonnen, hielden de onderzoekers workshops. Denk hierbij aan een trainingskamp waar ze uitlegden: "Zo werkt de AI, en zo ziet jouw cultuur veiligheid." Ze moedigden de studenten aan om hun lokale talen te gebruiken, talen te mixen (zoals Engels spreken met Hindi- of Pidgin-woorden), en lokale metaforen te gebruiken.
- Het Resultaat: Ze verzamelden meer dan 26.000 voorbeelden van de AI die faalde op manieren waar een westerse tester nooit op zou komen. Deze collectie heet het PLACES-dataset.
3. Wat Ze Vonden: De "Culturele Blinde Vlekken" van de AI
Toen ze de 26.000 voorbeelden analyseerden, vonden ze drie hoofdtypen van "blinde vlekken":
A. De "Code-Mixing" Gaten
In veel delen van het Global South mixen mensen natuurlijk talen in één zin (bijvoorbeeld: "Een man die jollof rice eet in Lagos").
- De Bevinding: De veiligheidsfilters van de AI zijn als doormans die alleen Engels spreken. Als je een geheim fluistert in een mix van Engels en een lokale taal, begrijpt de doorman het gevaar niet en laat hij je binnen. De onderzoekers vonden dat het mixen van talen gebruikers in staat stelde veiligheidsfilters te omzeilen die hetzelfde verzoek zouden hebben geblokkeerd als het in puur Engels was geschreven.
B. "Normative Dissonance" (Botsende Waarden)
Dit is wanneer de AI zijn "westerse regels" volgt maar "lokale regels" breekt.
- De Analogie: Stel je voor dat de AI een gast is op een diner. De gastheer (de lokale cultuur) zegt: "Eet niet met je linkerhand." De gast (de AI) zegt: "Maar mijn regelboek zegt dat handen gewoon handen zijn!" en gebruikt toch de linkerhand.
- Reële Voorbeelden:
- Religie: De AI genereerde een afbeelding van een Hindoestaanse man die rundvlees eet (wat verboden is voor veel Hindoes) of een moslim die gokt in Mekka. Voor de AI waren dit gewoon "mensen die dingen doen", maar voor de lokale bevolking waren ze diep beledigend.
- Gewoonten: De AI liet een kind zien dat de hand schudt met een ouder in India, terwijl de lokale gewoonte is om hun voeten te raken. De AI miste de regels van "reinheid" en "respect" van de cultuur.
- Tekenen: De AI tekende een zwarte kat die een weg oversteekt of een gebroken spiegel. In sommige culturen zijn dit niet gewoon "katten" of "glas"; het zijn slechte voortekens die ongeluk brengen. De AI begreep het gevoel van de afbeelding niet.
C. "Ontological Flattening" (Uitwissen van Identiteit)
Dit is wanneer de AI iets unieks en specifieks neemt en het platdrukt tot een generieke, westerse vorm.
- De Analogie: Het is alsof je een schilder vraagt om een specifiek type lokaal busje te tekenen, en hij tekent gewoon een generiek Amerikaans schoolbusje.
- Reële Voorbeelden:
- Voedsel: Vragen om "Fufu" (een West-Afrikaans gerecht) en een foto krijgen van aardappelpuree of een hamburger.
- Kunst: Vragen om een "Yakshagana-artist" (een specifieke Indiase theaterstijl) en een generieke "klassieke danseres" in een witte tutu krijgen.
- Mensen: Vragen om een "straatverkoper uit Zuid-India" en een foto krijgen van een donkerhuidige persoon op een manier die stereotypen van armoede versterkt, zelfs als de prompt niet om armoede vroeg.
4. Waarom Dit Belangrijk Is
Het artikel concludeert dat je AI niet veiliger kunt maken door het gewoon "groter" te maken of meer data toe te voegen uit dezelfde oude plaatsen. Je moet inzoomen.
- De Les: Om AI echt veilig te maken voor de hele wereld, moet je de mensen die in die culturen wonen laten definiëren wat "veiligheid" voor hen betekent. Je moet luisteren naar de "Community Guides" in plaats van alleen naar het "Hoofdkwartier".
Samenvatting
Het PLACES-project is als het sturen van een team lokale vertalers om een buitenlandse robot de lokale dialecten, gewoonten en taboes te leren. Ze ontdekten dat de robot niet faalde omdat het "slecht" was, maar omdat het cultureel analfabeet was. Door lokale gemeenschappen de AI te laten "red teamen", legden ze duizenden nieuwe manieren bloot waarop de AI fouten kan maken, wat bewijst dat veiligheid geen universeel regelboek is, maar een lokaal gesprek.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.