InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion
InsertFuse is een verenigd framework voor multi-categorie referentie-gestuurde beeldinsertie dat state-of-the-art prestaties bereikt door de categorie-specifieke expert-training te ontkoppelen van consolidatie via Insertion On-Policy Distillation, terwijl het ruimtelijke controle en referentietrouw verbetert door middel van Token-Aligned Geometry Conditioning, Region-Balanced Flow Matching en Reference CFG.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een meesterkok bent die alles kan koken, van een delicate soufflé tot een stevige stoofpot. Stel je nu voor dat iemand je vraagt om één enkel gerecht te maken dat tegelijkertijd zowel een perfecte soufflé als een perfecte stoofpot is, met dezelfde pan en dezelfde set instructies. Je zou het kunnen proberen, maar het resultaat zou waarschijnlijk een zompige bende zijn: de hitte die nodig is voor de stoofpot zou de delicate rijzing van de soufflé verpesten, en de smaken zouden botsen. Dit is het soort probleem waar informaticus tegenaan lopen wanneer ze kunstmatige intelligentie (AI) leren om foto's te bewerken.
In de wereld van AI zijn "diffusiemodellen" als deze meesterkoks. Het zijn ongelooflijk slimme systemen die afbeeldingen kunnen creëren of veranderen door langzaam willekeurige statische ruis (zoals tv-sneeuw) stap voor stap om te zetten in een helder beeld. Onlangs zijn deze modellen zo goed geworden dat we ze kunnen vragen om "een kat in deze stoel te zetten" of "de lucht te veranderen in een zonsondergang". Maar er is een addertje onder het gras: verschillende soorten bewerkingen vereisen zeer verschillende vaardigheden. Het plaatsen van een kleine ring op een vinger vereist fijne, delicate precisie. Het plaatsen van een heel persoon in een scène vereist begrip van hoe dat lichaam buigt en hoe hun kleding eruitziet. Proberen één enkel AI-model te leren om in alle deze verschillende taken tegelijkertijd een expert te zijn, is als vragen aan die meesterkok om de soufflé en de stoofpot tegelijkertijd te bereiden; de AI raakt in de war, en de resultaten zien er vaak vreemd of wazig uit.
Hier komt een nieuw artikel genaamd InsertFuse om de hoek kijken. De onderzoekers, geleid door een team van de Shanghai Jiao Tong University en anderen, realiseerden zich dat de oude manier waarop deze AI-koks werden getraind het probleem was. In plaats van één model te dwingen om alles tegelijk te leren, bouwden ze een slim tweestapsysteem. Eerst trainden ze vijf verschillende "expert"-koks, die elk gespecialiseerd waren in slechts één type ingrediënt: één voor accessoires (zoals sieraden), één voor dieren, één voor kleding, één voor algemene objecten en één voor mensen. Elke expert werd een meester in zijn specifieke domein, waarbij hij precies leerde hoe hij met de unieke eigenaardigheden van zijn categorie moest omgaan zonder afgeleid te worden door de anderen.
Maar het hebben van vijf verschillende koks is vervelend als je gewoon één app wilt die alles kan doen. Daarom heeft het team een speciale trainingsmethode uitgevonden die Insertion On-Policy Distillation (IOPD) wordt genoemd. Denk hierbij aan een "student"-kok die toekijkt hoe de vijf experts werken. De student leert niet alleen de recepten uit het hoofd; de student oefent ook met het zelf bereiden van het gerecht, en wanneer hij ergens vastloopt, vraagt hij de juiste expert om de exacte zet die hij moet maken. Als de student probeert een hoed op een hoofd te zetten, vraagt hij aan de "accessoire-expert". Als de student probeert een persoon in een kamer te plaatsen, vraft hij de "menselijke expert". Door op het juiste moment van de juiste expert te leren, wordt de student een verenigde meesterkok die elke invoegtaak perfect kan afhandelen, zonder de verwarring van het tegelijkertijd leren van alles.
Om er zeker van te zijn dat de student-kok niet zomaar gokt waar hij dingen moet plaatsen, voegde het team ook twee speciale hulpmiddelen toe. De eerste is Token-Aligned Geometry Conditioning, wat lijkt op het geven van een nauwkeurige GPS-kaart aan de AI over precies waar het nieuwe object moet komen, zodat het de vorm van de opening perfect past zonder in de achtergrond uit te lopen. Het tweede is Region-Balanced Flow Matching, dat fungeert als een eerlijke rechter. Tijdens de normale training kan de AI een klein object (zoals een armband) negeren omdat de enorme achtergrond (zoals een muur) het grootste deel van het scherm inneemt. Dit nieuwe hulpmiddel vertelt de AI: "Hé, ook al is de armband klein, hij is superbelangrijk, dus besteed extra aandacht aan dit deel," waardoor ervoor wordt gezorgd dat kleine details niet verloren gaan.
Ten slotte, om er zeker van te zijn dat het ingevoegde object precies lijkt op de referentiefoto (waarbij de unieke textuur en identiteit behouden blijven), gebruikten ze een techniek genaamd Reference CFG. Dit is als het geven van een strikte regel aan de student-kok: "Je moet het oorspronkelijke patroon op dit shirt behouden, ongeacht hoe je het uitrekt."
De resultaten zijn indrukwekkend. Wanneer de onderzoekers hun nieuwe "student"-model testten tegen andere top AI-editors, wonnen ze in bijna elke categorie. Het behield het uiterlijk van de originele objecten beter, plaatste ze nauwkeuriger en hield de achtergrond natuurlijk. In een gebruikersstudie, waarbij mensen stemden op hun favoriete afbeeldingen, werd InsertFuse door meer dan 50% van de deelnemers gekozen, waarmee het de concurrentie ruim versloeg. Het artikel suggereert dat door het proces van het leren van specifieke vaardigheden te scheiden van het proces van het combineren ervan, we een AI kunnen bouwen die zowel een specialist als een generalist is, waarmee het "zompige stoofpot"-probleem van beeldbewerking eenmaal en voor altijd wordt opgelost.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.