A Large-scale Evaluation of Text-guided Models for Facial Editing
Dit artikel presenteert de eerste grootschalige evaluatie van zes tekstgestuurde modellen voor gezichtsbewerking, waarbij een nieuwe dataset van 169 attributen wordt geïntroduceerd en wordt onthuld dat hoewel deze modellen uitblinken in het aanpassen van haar en accessoires, ze moeite hebben met houdingsveranderingen en aanzienlijke demografische vooroordelen vertonen bij het overmatig bewerken van donkerhuidige mannen en oudere gezichten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een digitale kunstenaar voor die de haarkleur van een persoon kan veranderen, een bril kan toevoegen of het hoofd van een persoon naar de horizon kan laten kijken, alles door een eenvoudige zin in een computer te typen. Dit is de belofte van tekstgestuurde beeldbewerking, een snel groeiend veld waarin kunstmatige intelligentie leert menselijke taal te begrijpen en die instructies toe te passen op foto's. Jarenlang hebben onderzoekers systemen gebouwd die in staat zijn tot deze prestaties, maar ze hadden vaak moeite met een specifieke uitdaging: de persoon op de foto herkenbaar te houden terwijl de gevraagde wijzigingen worden aangebracht. Oudere methoden konden ofwel het gezicht te veel veranderen, waardoor het onherkenbaar werd, of ze konden slechts zeer beperkte aanpassingen maken, zoals het veranderen van de hoek van het hoofd. Nu is er een nieuwe generatie hulpmiddelen opgekomen die beweert deze problemen op te lossen, door het vermogen te bieden om complexe, realistische bewerkingen te maken op basis van tekstuele prompts. Maar naarmate deze hulpmiddelen krachtiger worden, blijft een kritische vraag over: werken ze even goed voor iedereen, of hebben ze verborgen gebreken die verschillende groepen mensen onrechtvaardig behandelen?
Een team van onderzoekers zette zich in om deze vraag te beantwoorden door de zes meest populaire tekstgestuurde bewerkingsmodellen op de proef te stellen. Ze vroegen de computers niet alleen om een paar willekeurige wijzigingen te maken; ze voerden een massale, systematische evaluatie uit met bijna één miljoen beeldbewerkingen. Het doel was om te zien hoe goed deze modellen een opeenvolging van vier verschillende instructies achter elkaar konden afhandelen, zoals het veranderen van iemands haarkleur, dan een hoed toevoegen, vervolgens de hoed veranderen, en tot slot het hoofd draaien. Hiervoor creëerden de onderzoekers een nieuwe, uitgebreide bibliotheek van 169 specifieke bewerkingstaken gericht op haar, accessoires en hoofdpositie. Ze testten de modellen op twee grote collecties beroemdhedenfoto's, waarbij ze zorgden voor een diverse mix van mannen en vrouwen, jong en oud, en mensen met een lichte en donkere huidskleur.
De resultaten gaven een duidelijk beeld van waar deze technologieën vandaag de dag staan. De modellen bleken zeer goed in staat om veranderingen aan haar en accessoires af te handelen. Wanneer hen werd gevraagd een kapsel te veranderen of een zonnebril toe te voegen, presteerden de meeste systemen goed, waarbij ze erin slaagden de instructies op te volgen terwijl ze het gezicht van de persoon herkenbaar hielden. De modellen hadden echter aanzienlijk meer moeite wanneer hen werd gevraagd om een houding van een persoon te veranderen, zoals iemand naar links of rechts laten kijken. In die gevallen faalden de systemen vaak in het opvolgen van het commando of veranderden ze het gezicht op manieren die de persoon onherkenbaar maakten.
Misschien nog wel zorgwekkender was de ontdekking dat alle modellen de neiging hadden om "overmatig te bewerken". Dit betekent dat wanneer een specifieke instructie wordt gegeven, de computer vaak dingen verandert die niet gevraagd zijn. Bijvoorbeeld, als een gebruiker het model vraagt om het kapsel van een persoon te veranderen in een bob, kan het model ook de haarkleur naar bruin veranderen, zelfs als de gebruiker nooit om een kleurverandering heeft gevraagd. De onderzoekers ontdekten dat dit frequent gebeurde, waarbij de modellen ongeveer 25 extra, ongewenste wijzigingen maakten voor elke 100 gegeven instructies. Deze fouten waren niet willekeurig; ze kwamen vaak voort uit het feit dat de modellen onjuiste associaties hadden geleerd, zoals de overtuiging dat een specifiek kapsel altijd bij een specifieke haarkleur hoort.
De studie bracht ook significante vooroordelen aan het licht in de manier waarop deze modellen verschillende mensen behandelden. Het overmatige bewerken was niet gelijkmatig verdeeld over alle gezichten. De modellen waren veel eerder geneigd om ongewenste wijzigingen aan te brengen bij het bewerken van de gezichten van mannen, met name die met een donkere huidskleur, en bij het bewerken van de gezichten van oudere mensen. Zo was het systeem bijvoorbeeld veel eerder geneigd om andere kenmerken te veranderen, zoals het toevoegen van gezichtsbeharing of het wijzigen van de huidskleur, wanneer er aan de haren van een donkerhuidige man werd gewerkt, vergeleken met wanneer het de gezichten van lichtgekleurde vrouwen bewerkte. Op dezelfde manier waren de modellen minder succesvol in het behouden van de identiteit van oudere gezichten, waarbij ze hen jonger maakten of hun kenmerken drastischer veranderden dan die van jongere mensen.
Deze bevindingen suggereren dat hoewel tekstgestuurde bewerkingshulpmiddelen krachtig genoeg worden voor echt gebruik, ze nog niet perfect zijn. Ze werken goed voor eenvoudige taken zoals het toevoegen van een hoed of het veranderen van de haarkleur, maar ze worstelen nog steeds met complexere bewegingen en dragen verborgen vooroordelen met zich mee die kunnen leiden tot onrechtvaardige of onnauwkeurige resultaten voor bepaalde groepen. De onderzoekers benadrukken dat toekomstig werk zich moet richten op het oplossen van deze overmatige bewerkingsgewoonten en het waarborgen dat de technologie elk gezicht met dezelfde mate van nauwkeurigheid en respect behandelt, ongeacht leeftijd, geslacht of huidskleur. Totdat deze problemen zijn opgelost, moeten gebruikers zich ervan bewust zijn dat deze digitale kunstenaars nog aan het leren zijn, en dat ze soms meer veranderen dan de vraag was.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.