Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets
Deze studie onthult dat de veelgebruikte LAION-5B-dataset significante en consistente demografische vooroordelen vertoont, waaronder de oververtegenwoordiging van jonge witte mannen en de ondervertegenwoordiging van minderheidsgroepen en oudere vrouwen, naast stereotiepe associaties tussen gender en emotionele expressies die een negatieve impact kunnen hebben op downstream AI-systemen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, chaotische bibliotheek met miljarden boeken (afbeeldingen) en hun titels (bijschriften). De LAION-5B-dataset is als een gigantische, geautomatiseerde robot die in deze bibliotheek is gegaan, een enorme stapel van deze boeken heeft gegrepen en ze aan AI-kunstenaars heeft gegeven om hen te leren tekenen.
Dit paper is een "boekverslag" over die specifieke stapel boeken. De auteurs wilden weten: Wie staat er eigenlijk op deze foto's, en wat doen zij? Ze ontdekten dat de robot geen eerlijke, willekeurige steekproef van de mensheid heeft genomen. In plaats daarvan heeft de robot een zeer specifieke, scheve groep gegrepen.
Hier is wat ze ontdekten, eenvoudig uitgelegd:
1. Het "Wie"-probleem: Een scheve menigte
De auteurs bekeken ongeveer 80.000 gezichten in de dataset met behulp van twee verschillende "slimme camera's" (AI-modellen genaamd FairFace en DeepFace) om de leeftijd, het geslacht en de etniciteit van mensen te raden.
- De leeftijdsgap: De dataset is geobsedeerd door jongvolwassenen. Het is als een feestje waar bijna iedereen tussen de 20 en 39 jaar oud is. Er zijn zeer weinig kinderen, tieners of oudere mensen (vooral mensen boven de 60).
- De genderonbalans: De menigte bestaat voornamelijk uit mannen. In sommige tellingen maken mannen meer dan 70% van de gezichten uit. Vrouwen zijn sterk ondervertegenwoordigd.
- De raciale mix: De dataset wordt gedomineerd door witte mensen (ongeveer 50–60%). Andere raciale groepen, zoals zwarte, Indiase en Latino individuen, komen veel minder vaak voor dan in de echte wereld.
De analogie: Stel je voor dat je een robot hebt gevraagd om een foto van "mensen" te maken voor een schooltekstboek. In plaats van een foto van een divers stadsplein te maken, heeft de robot alleen foto's gemaakt van een specifieke groep jonge, witte mannen die in een koffiebar rondhangen. Als je een AI leert tekenen over "mensen" op basis hiervan, zal de AI denken dat dit alles is wat er bestaat.
2. Het "Wat"-probleem: Stereotypische emoties
De auteurs keken ook naar welke emoties deze mensen lieten zien (blij, boos, verdrietig, enzovoort). Ze ontdekten dat de dataset oude stereotypen versterkt over hoe verschillende groepen "zouden moeten" handelen.
- Mannen = Boos: Wanneer de dataset mannen laat zien, is de kans groter dat zij boos of walgend kijken.
- Vrouwen = Blij: Wanneer de dataset vrouwen laat zien, is de kans groter dat zij blij kijken.
- De "Boze Man, Blije Vrouw"-regel: Dit is een klassiek stereotype, en de data laat zien dat dit ingebakken zit in het trainingsmateriaal.
De analogie: Het is als een filmscript waarin de enige keer dat een man verschijnt, hij aan het schreeuwen is, en de enige keer dat een vrouw verschijnt, zij aan het glimlachen is. Als een AI leert van dit script, zal de AI denken dat dit is hoe de wereld werkt.
3. Het "Dubbele Probleem": Intersectionele bias
De auteurs keken niet alleen naar leeftijd of geslacht afzonderlijk; ze keken naar hoe deze zaken samenkomen (zoals "oudere vrouwen" of "jonge zwarte mannen").
- De ontbrekende middenleeftijdse vrouw: Deze groep is bijna onzichtbaar in de data.
- De oververtegenwoordigde jonge vrouw: Jonge vrouwen (onder de 30) komen heel vaak voor, maar naarmate vrouwen ouder worden, verdwijnen ze uit de dataset.
- De oververtegenwoordigde witte baby: Hoewel minderheid-baby's zeldzaam zijn, zijn witte baby's verrassend algemeen in de dataset.
De analogie: Als je een puzzel van de mensheid zou bouwen, zou je een enorme stapel stukjes van "Jonge Witte Mannen" en "Jonge Witte Vrouwen" hebben, maar je zou bijna alle stukjes van "Oudere Vrouwen" en "Oudere Minderheden" missen. Het beeld dat je bouwt, zou incompleet en vertekend zijn.
4. Waarom doet dit ertoe?
Het paper legt uit dat AI-modellen (zoals de modellen die afbeeldingen genereren vanuit tekst) leren door patronen in deze dataset te memoriseren.
- Het Spiegel-effect: Als de dataset een vervormde spiegel is, zal de output van de AI een vervormde reflectie zijn.
- De consequentie: Als je een AI vraagt om "een CEO te tekenen", kan hij een jonge witte man tekenen omdat dat is wat hij het vaakst heeft gezien. Als je hem vraagt om "een gelukkig persoon te tekenen", kan hij een vrouw tekenen, en bij "een boos persoon" kan hij een man tekenen.
Wat het paper niet zegt
Het is belangrijk om vast te houden aan wat de auteurs daadwerkelijk hebben gevonden:
- Ze hebben de AI-modellen zelf (zoals Stable Diffusion) niet getest om te zien of ze slechte afbeeldingen produceren; ze hebben alleen het bronmateriaal (de dataset) geanalyseerd.
- Ze hebben niet beweerd dat deze dataset het enige probleem is, maar ze zeiden wel dat het een "fundamenteel" probleem is, wat betekent dat veel andere tools erop gebouwd zijn.
- Ze hebben in dit paper geen oplossing geboden, behalve het suggereren dat toekomstige datasets betere curatie nodig hebben en dat we betere tools nodig hebben om diversiteit te meten.
De kern
De LAION-5B-dataset, die de basis vormt voor veel moderne AI, is als een bevooroordeelde cameralens. Het focust sterk op jonge, witte mannen en koppelt hen aan woede, terwijl het vrouwen en oudere mensen naar de achtergrond duwt of koppelt aan geluk. Omdat AI leert via deze lens, waarschuwt het paper dat het "wereldbeeld" dat deze machines ontwikkelen fundamenteel uit balans is, waarbij het internet-biases reflecteert in plaats van de werkelijke menselijke diversiteit.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.