BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models
Dit artikel introduceert BAFIS, een dataset en raamwerk bestaande uit 21.140 meertalige afbeeldingen en menselijke voorkeursfeedback, om systematische beroepsbiases in vijf leidende tekst-naar-afbeelding-modellen te evalueren en te onthullen, waarmee de kritieke noodzaak wordt aangetoond om menselijk oordeel naast gevestigde metrieken te integreren voor het ontwikkelen van eerlijkere AI-systemen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een magische schildermachine hebt. Je typt een beschrijving in zoals "een dokter" en het schildert direct een plaatje. Een tijd lang dachten mensen dat deze machines gewoon neutrale hulpmiddelen waren, zoals een camera. Maar dit artikel betoogt dat deze machines meer lijken op bevooroordeelde spiegels — ze laten niet alleen de werkelijkheid zien, maar een vertekende versie daarvan op basis van wat ze van het internet hebben geleerd.
De auteurs van dit artikel, Thomas, Adrian en Biying, wilden vijf van de meest populaire "schildermachines" (Midjourney, Stable Diffusion, DALL-E 3, Playground en FLUX) testen om te zien hoe ze omgaan met beroepen en mensen. Ze bouwden een speciale testomgeving genaamd BAFIS (Battle-Arena for Fair Image Synthesis).
Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën:
1. De Arena: BAFIS
Zie BAFIS als een blind proeverij-competitie.
- De Opzet: In plaats van een computer de plaatjes te laten beoordelen, lieten ze twee verschillende machines in een "gevecht" gaan.
- De Wedstrijd: Een gebruiker krijgt een prompt te zien (bijv. "een verpleegkundige") en twee anonieme afbeeldingen gegenereerd door twee verschillende machines.
- De Stem: De gebruiker stemt op drie zaken:
- Bias (Vooroordeel): Ziet de afbeelding eruit als een realistische mix van mensen, of laat het slechts één type zien?
- Kwaliteit: Is de afbeelding mooi en helder?
- Alignment (Afstemming): Komt de afbeelding daadwerkelijk overeen met de woorden die je typte?
- De Score: Ze gebruikten een rankingsysteem (zoals schaakratings) om te zien welke machine de meeste stemmen won.
2. De Dataset: Een Gigantische Bibliotheek van Beroepen
Om de test eerlijk te houden, vroegen ze niet alleen om "een dokter". Ze creëerden een enorme bibliotheek van 21.140 afbeeldingen gebaseerd op 1.057 verschillende beroepsomschrijvingen.
- Ze gebruikten twee talen: Engels en Duits.
- Ze probeerden verschillende manieren van vragen:
- Direct: "Een foto van een mannelijke accountant."
- Indirect: "Een foto van een persoon die financiën beheert."
- Groepen: "Een foto van een groep accountants."
- Ze vergeleken de resultaten met echte wereld statistieken van de Duitse overheid (zoals het controleren van een recept tegen de werkelijke ingrediëntenlijst) om te zien of de machines loog over wie deze banen bekleedt.
3. De Bevindingen: Wat de Machines Fout Deden
Het Genderprobleem (De "Bouw vs. Verpleging" Splitsing)
De machines hebben sterke stereotypen over gender.
- Bouw & Engineering: Wanneer gevraagd werd om deze beroepen te tekenen, tekenden de machines bijna altijd mannen. Het was alsof ze dachten dat alleen mannen dingen konden bouwen.
- Zorg & Kantoorwerk: Wanneer gevraagd werd om verpleegkundigen of kantoormedewerkers te tekenen, neigden de machines sterk naar vrouwen.
- De Verrassing: Eén machine, DALL-E 3, was het meest gebalanceerd. Het tekende mannen en vrouwen bijna evenveel, als een eerlijke muntworp. Een andere machine, FLUX, tekende zelfs meer vrouwen dan mannen voor sommige banen, wat een nieuw soort bias is.
Het Etniciteitsprobleem (De "Witte Muur")
Dit was het grootste probleem. Ongeacht welk beroep je vroeg, tekenden de machines overweldigend witte gezichten.
- Het was alsof de machines een standaardinstelling hadden die zei: "Als je geen ras specificeert, maak ze dan wit."
- Deze bias was zelfs sterker in het Duits dan in het Engels. Wanneer de prompt in het Duits was, tekenden de machines zelfs nog minder niet-witte gezichten.
- DALL-E 3 was de enige machine die erin slaagde het percentage witte gezichten onder de 50% te houden in beide talen, wat het meest divers was.
De "Mens vs. Robot" Scorekaart
Hier wordt het ingewikkeld. Het artikel vond dat computer-metrieken (wiskundige formules die beeldkwaliteit beoordelen) vaak verschilden van menselijke gevoelens.
- Beeldkwaliteit: Een machine genaamd FLUX werd door mensen beoordeeld als de mooiste en meest realistische. Echter, de computerwiskunde (FID-score) zei dat DALL-E 3 de beste was.
- De Les: De wiskundige formules zijn als een robot die een schilderij beoordeelt; ze meten pixels maar missen de "ziel" of het gevoel dat mensen krijgen bij het bekijken van een afbeelding. Mensen gaven de voorkeur aan FLUX, zelfs als de wiskunde dat niet zei.
De Taal Twist
- DALL-E 3 heeft een geheim wapen: het herschrijft je prompt. Als je een Duitse prompt typt, vertaalt en past het deze stiekem aan naar het Engels voordat het gaat schilderen. Dit hielp het de vraag beter te begrijpen en hogere scores te halen voor "alignment" (afstemming) in Duitse gevechten.
- Stable Diffusion 3 was de kampioen voor Engelse prompts, maar had moeite met Duits.
4. De Conclusie
Het artikel concludeert dat deze AI-schildermachines niet neutraal zijn. Ze dragen de vooroordelen met zich mee van de data waarop ze getraind zijn.
- Ze vertegenwoordigen mannen overmatig in "harde" banen en vrouwen in "zorg"-banen.
- Ze kiezen bijna altijd standaard voor witte gezichten.
- Computertests zijn niet genoeg. We moeten echte mensen vragen wat zij vinden, omdat de wiskunde niet altijd vangt wat voor ons "eerlijk" of "echt" voelt.
De auteurs suggereren dat ontwikkelaars, om dit op te lossen, menselijke feedback nauwer moeten beluisteren en hun machines moeten controleren tegen de realiteit van de wereld, in plaats van alleen tegen computerformules. Ze hebben BAFIS gebouwd zodat we deze machines in de toekomst verantwoordelijk kunnen houden in een "battle arena" om ervoor te zorgen dat ze eerlijker worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.