MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4
Dit artikel introduceert MiniGPT-Reverse-Designing, een gefinetuned MiniGPT-4-model dat de visuele taalvaardigheden uitbreidt naar de complexe taak van het voorspellen van beeldbewerkingen en hun parameters op basis van een bronafbeelding, een bewerkte versie en optionele tekstuele beschrijvingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de moderne wereld van kunstmatige intelligentie zijn computers bijzonder goed geworden in twee afzonderlijke zaken: zien en spreken. Aan de ene kant kunnen visiesystemen naar een foto kijken en met verrassende nauwkeurigheid beschrijven wat er gebeurt. Aan de andere kant kunnen taalmodellen verhalen schrijven, vragen beantwoorden en gesprekken voeren door enorme hoeveelheden tekst te verwerken. Recentelijk zijn wetenschappers begonnen deze twee vermogens te overbruggen door systemen te creëren die een afbeelding en een zin tegelijkertijd kunnen begrijpen. Deze hybride hulpmiddelen, bekend als vision-language modellen, kunnen al taken uitvoeren zoals het beantwoorden van vragen over een afbeelding of het schrijven van een bijschrift voor een scène. De meeste van deze systemen zijn echter getraind om naar een enkele afbeelding te kijken en deze te beschrijven, of om naar een afbeelding en een vraag te kijken en een antwoord te geven. Ze zijn nog niet getraind om naar een voor-en-na paar afbeeldingen te kijken en precies te achterhalen wat er tussen hen is veranderd, vooral wanneer die verandering specifieke aanpassingen inhoudt zoals helderheid, contrast of kleurbalans.
Deze kloof in begrip is de focus van een nieuwe studie door onderzoekers Vahid Azizi en Fatemeh Koochaki. Zij gingen onderzoeken of een krachtig, open-source vision-language model genaamd MiniGPT-4 geleerd kon worden om een taak uit te voeren die zij "reverse designing" noemen. Stel je voor dat je een foto hebt van een zonsondergang, en je hebt vervolgens een tweede versie van diezelfde foto waarbij de lucht oranjerder is gemaakt en het water donkerder. Een menselijke editor zou precies weten welke schuifregelaars zijn verschoven om dat uiterlijk te bereiken. De onderzoekers wilden weten of een computer naar de originele en de bewerkte versie kon kijken, bijvoorbeeld met een vage hint zoals "maak het dramatischer", en vervolgens de specifiend technische stappen en getallen kon voorspellen die zijn gebruikt om die bewerking te creëren. Dit is een complexe uitdaging omdat de computer tegelijkertijd twee verschillende afbeeldingen en de relatie tussen hen moet begrijpen, een taak die verder gaat dan simpelweg beschrijven wat er in een enkele afbeelding te zien is.
Om dit te testen, namen de onderzoekers het MiniGPT-4 model, dat al getraind was om afbeeldingen en tekst te begrijpen, en verfijnden (fine-tuned) dit met een specifieke dataset genaamd I-MAD-Dense. Deze dataset bevat ongeveer 22.000 voorbeelden, elk bestaande uit een bronafbeelding, een bewerkte versie van die afbeelding en een hoog niveau van beschrijving van het creatieve idee achter de bewerking. Cruciaal is dat de dataset ook de "ground truth" bevat, wat de exacte lijst is van operaties en hun numerieke waarden die op de originele afbeelding zijn toegepast om de nieuwe te creëren. De onderzoekers zetten deze technische lijsten van operaties om in zinnen, zodat het taalgedeelte van het model ze kon lezen. Vervolgens voedden ze het model met paren afbeeldingen samen met optionele tekstuele beschrijvingen en vroegen het om de lijst met veranderingen te voorspellen die de eerste afbeelding in de tweede hebben veranderd.
Het team voerde verschillende experimenten uit om te zien hoe goed het model deze vaardigheid kon leren. In hun eerste poging verfijnden ze het bestaande model simpelweg zonder de structuur te veranderen. De resultaten lieten zien dat het model de taak kon leren, waarbij het de soorten veranderingen gemiddeld 72 procent van de tijd succesvol voorspelde. De onderzoekers merkten echter op dat het model soms het verkeerde aantal veranderingen raadde of de specifieke waarden iets onnauwkeurig kreeg. Om dit te verbeteren, probeerden ze een wiskundige straf toe te voegen aan het trainingsproces wanneer de voorspelde getallen van het model voor de aanpassingen ver aflagen van de juiste waarden. Deze kleine aanpassing hielp het model om de getallen nauwkeuriger te maken, waardoor de gemiddelde fout in de voorspellingen afnam. Ze testten ook of het geven van een specifiek commando in de tekst, zoals "pas de helderheid aan", zou helpen. De resultaten bevestigden dat het hebben van deze extra tekstuele context de capaciteit van het model aanzienlijk verbeterde om de juiste veranderingen te vinden, vooral wanneer de instructies duidelijk waren.
De onderzoekers verkenden ook of het toevoegen van speciale markeringen aan de tekst om de afbeeldingen van de woorden te scheiden, het model zou helpen om de verschillende inputs bij te houden. Ze probeerden een specifieke token in te voegen om aan te geven waar één afbeelding eindigde en de volgende begon, maar dit maakte de prestaties van het model juist slechter. Deze bevinding suggereert dat de bestaande manier van het model om afbeeldingen en tekst te verwerken voldoende was en dat het toevoegen van extra, kunstmatige markeringen het eerder verwarde dan verhelderde. Een ander experiment betrof het proberen te leren aan het model om het aantal veranderingen nauwkeuriger te voorspellen door het te straffen voor het raden van te veel of te weinig veranderingen, maar deze aanpak slaagde er ook niet in de resultaten te verbeteren en maakte ze in sommige gevallen zelfs slechter.
De meest succesvolle versie van hun systeem, die het verfijnde model combineerde met een specifieke manier om met numerieke fouten om te gaan, toonde aan dat deze vision-language modellen inderdaad in staat zijn om complexe, meerstapsrelaties tussen afbeeldingen te leren. Het model presteerde het best wanneer het een tekstuele beschrijving van de bewerking kreeg, wat het belang van taal bij het sturen van visueel begrip benadrukt. Hoewel het systeem nog niet perfect is en nog steeds worstelt met sommige complexe scenario's, demonstreert de studie dat standaardmodellen kunnen worden uitgebreid om geavanceerde taken zoals het reverse engineeren van beeldbewerkingen aan te kunnen. De onderzoekers concluderen dat hoewel hun huidige resultaten veelbelovend zijn, er nog steeds ruimte is voor verbetering, zoals het gebruik van afbeeldingen met een hogere resolutie om fijnere details vast te leggen of het trainen van het model op nog zorgvuldiger samengestelde, door mensen gegenereerde data. Dit werk opent een deur voor toekomstige hulpmiddelen die editors kunnen helpen hun eigen workflows te begrijpen of computers kunnen toestaan om te leren van de geschiedenis van hoe afbeeldingen worden gemaakt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.