← Nieuwste papers
🤖 machine learning

From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition

Het artikel stelt "From Fake to Real" (FFR) voor, een tweestaps trainingspipeline die modellen voorgetraind op gebalanceerde synthetische data om robuuste subgroeprepresentaties te leren voordat ze wordt gefinetuned op echte data, waardoor het voorkomen van schijncorrelaties veroorzaakt door het mengen van synthetische en echte distributies wordt en de nauwkeurigheid voor de slechtste groep aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Maan Qraitem, Kate Saenko, Bryan A. Plummer

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maan Qraitem, Kate Saenko, Bryan A. Plummer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om dieren te herkennen. Je laat het de robot duizenden foto's zien, maar er is een sluipend probleem: bijna elke foto van een "Grote Hond" is toevallig genomen in een gezellige woonkamer, terwijl bijna elke foto van een "Kleine Hond" buiten in een park is genomen. De robot is slim, maar hij is ook een beetje efficiënt. In plaats van te leren hoe een hond er echt uitziet, leert de robot een afkorting: "Als ik een bank zie, is het een Grote Hond. Als ik gras zie, is het een Kleine Hond." In de wereld van de informatica wordt dit een "spurious correlation" (schijncorrelatie) genoemd. De robot heeft geleerd om op de achtergrond te vertrouwen in plaats van op het onderwerp. Dit is een groot probleem, want wanneer de robot buiten een Grote Hond tegenkomt, raakt hij in de war en faalt hij. Wetenschappers proberen dit te repareren zodat AI de wereld helder kan zien, en niet alleen de patronen die hem hebben misleid.

Om dit op te lossen, hebben onderzoekers een slimme truc geprobeerd: ze gebruiken "generatieve AI" (zoals een digitale kunstenaar) om nieuwe, nepfoto's te maken om de boeken in evenwicht te brengen. Als er niet genoeg foto's van Grote Honden buiten zijn, tekent de computer er een paar bij. Het idee was dat door deze nieuwe nepfoto's te mengen met de echte foto's, de robot eindelijk zou leren de achtergrond te negeren. Maar, zo bleek, had deze mix-en-match aanpak een verborgen gebrek. De nieuwe paper, "From Fake to Real," suggereert dat het simpelweg mengen van echte en nepfoto's samen eigenlijk een nieuw soort afhankelijkheid creëert. De robot begint op te merken dat de nepfoto's er net even anders uitzien dan de echte foto's—misschien hebben de nep-honden een vreemde textuur of is de belichting net een klein beetje anders. Dus leert de robot een nieuwe, nog genieperdere afkorting: "Als de foto eruitziet als een echte foto, is het een Kleine Hond. Als de foto eruitziet als een neptekening, is het een Grote Hond." Hij kijkt helemaal niet naar de hond; hij kijkt naar of de afbeelding echt of synthetisch is.

De auteurs van deze paper, Maan Qraitem, Kate Saenko en Bryan A. Plummer, realiseerden zich dat het proberen te onderwijzen van de robot met zowel echte als nepfoto's tegelijkertijd het probleem was. Ze stelden een nieuwe tweestaps-trainingsmethode voor genaamd "From Fake to Real" (FFR). Denk aan het leren van een student voor een wiskundetoets. Eerst geef je ze een stapel oefenopgaven die perfect in balans zijn en gemakkelijk te begrijpen, zodat ze de kernconcepten leren zonder verwarring. Dit is de "Fake"-fase: de robot traint alleen op de perfect gebalanceerde, door de computer gegenereerde afbeeldingen. Hij leert wat een hond is zonder de rommelige achtergrondafleidingen. Zodra de robot een stevige basis heeft, ga je over naar de tweede stap: de "Real"-fase. Nu laat je hem de rommelige, echte foto's zien. Omdat de robot al weet waar hij naar moet kijken door de eerste stap, laat hij zich niet misleiden door de achtergrond of door het feit dat de afbeeldingen echt zijn. Hij past simpelweg toe wat hij heeft geleerd.

De onderzoekers testten dit idee op drie verschillende datasets, inclusief foto's van gezichten en dieren, met biasniveaus variërend van matig tot extreem ernstig (tot 99,9% van één groep in een specifieke omgeving). Ze ontdekten dat hun tweestaps-methode een game-changer was. Terwijl eerdere methoden die echte en nepdata samen mengden moeite hadden naarmate de bias erger werd, bleef de "From Fake to Real"-aanpak sterk. Sterker nog, het verbeterde de nauwkeurigheid van de robot op de moeilijkste gevallen (de "slechtste groep") met wel 20% vergeleken met de beste bestaande methoden. Wanneer ze nauwkeurig keken naar waar de robot daadwerkelijk op lette, zagen ze dat de oude methoden nog steeds werden afgeleid door de achtergrond of de "nepheid" van de afbeeldingen, maar de nieuwe methode concentreerde zich precies op de hond of het gezicht van de persoon.

De paper voerde ook simulaties uit om te bewijzen waarom de oude manier niet werkte. Ze lieten zien dat zolang je echte en synthetische data mengt, de robot bijna altijd een manier zal vinden om het verschil tussen beide als een onderscheidende factor te gebruiken. Door de training in twee afzonderlijke fasen te splitsen, blokkeerden ze effectief de mogelijkheid dat de robot het "verschil" tussen echt en nep ooit als een aanwijzing zou gebruiken. De auteurs merken op dat deze methode goed werkt wanneer deze wordt gecombineerd met andere technieken, maar ze wijzen ook op een beperking: het vertrouwt erop dat de computerkunstenaar in staat is om een perfect gebalanceerde set nepafbeeldingen te tekenen. Als de kunstenaar de balans in de eerste stap verkeerd krijgt, lijdt het hele systeem eronder. Echter, voor nu biedt deze "Eerst Fake, dan Real"-strategie een verrassend eenvoudige en effectieve manier om te voorkomen dat AI de verkeerde lessen leert, zodat het, wanneer het naar een hond kijkt, een hond ziet en niet de kamer waarin hij zit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →