DreamOmni3: Scribble-based Editing and Generation
Het artikel introduceert DreamOmni3, een uniek model dat GUI-gebaseerde creatie vooruit helpt door flexibele scribble-gebaseerde bewerking en generatie mogelijk te maken via een nieuwe datasynthese-pipeline en een gezamenlijk invoerkader dat originele en geschetste afbeeldingen combineert voor precieze visuele controle.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je praat met een superintelligente kunstenaar die alles kan tekenen wat jij beschrijft. Als je zegt: "Teken een kat," doet hij het. Als je zegt: "Maak de kat een hoed dragen," verandert hij de afbeelding. Dit is de wereld van AI-afbeeldingsgeneratie en -bewerking, een veld waar computers leren om afbeeldingen te creëren en te wijzigen op basis van jouw woorden. Lange tijd was tekst de enige manier om met deze digitale kunstenaars te communiceren. Maar hier is het probleem: woorden zijn soms onhandig. Proberen exact te beschrijven waar je een nieuw object moet plaatsen, of hoe je een specif kind deel van een slordige tekening moet veranderen, is als het geven van een routebeschrijving aan een vriend met alleen een kaart zonder herkenningspunten. Je zegt misschien: "Zet de boom aan de linkerkant," maar de AI zet hem heel ver naar links, of aan de verkeerde kant.
Om dit op te lossen, hebben wetenschappers een nieuwe manier verkend om met deze kunstenaars te praten: krabbelen. In plaats van alleen te typen, kun je een digitale pen pakken en cirkels, vakken of slordige krabbels direct op het scherm tekenen om de AI precies te laten begrijpen wat je bedoelt. Het is alsof je op een plek op een kaart wijst en zegt: "Hier!" in plaats van de straatnaam te beschrijven. Dit artikel, DreamOmni3, duikt diep in het perfectioneren van deze "aanwijzen-en-tekenen"-methode. Het pakt de lastige onderdelen aan van het leren aan computers hoe ze niet alleen jouw woorden, maar ook jouw slordige, handgetekende lijnen moeten begrijpen, en combineert deze om met ongelooflijke precisie afbeeldingen te creëren of te bewerken.
Het Probleem: Wanneer Woorden Niet Genoeg Zijn
Stel je voor dat je een spel speelt waarbij je een foto moet bewerken. Je wilt een speeltje in een rode cirkel vervangen door een handtas. Als je alleen typt "zet hier een handtas", kan de AI in de war raken. Welk speeltje? Waar is "hier"? Is de cirkel rood of zwart? Is het de eerste of de tweede afbeelding? Taal is geweldig voor grote ideeën, maar het is slecht in het aanwijzen van specifieke, kleine details op een scherm.
De auteurs van dit artikel realiseerden zich dat hoewel AI erg goed is geworden in het volgen van tekstinstructies, het vaak de "waar" en de "hoe" mist wanneer zaken ingewikkeld worden. Gebruikers hebben een manier nodig om directer te zijn. Ze moeten een cirkel om een gezicht kunnen tekenen en kunnen zeggen: "Verander dit haar," of een kronkelige lijn kunnen tekenen en kunnen zeggen: "Zet hier een auto." Dit is het concept van scribble-based editing and generation (bewerking en generatie op basis van krabbels). Het gaat erom dat gebruikers tekst, afbeeldingen en hun eigen vrije tekeningen kunnen combineren om de AI te besturen.
De Oplossing: DreamOmni3
Het team achter DreamOmni3 besloot een model te bouwen dat krabbels behandelt als een volwaardig onderdeel, net als tekst en afbeeldingen. Maar er was een enorme hindernis: data. AI-modellen zijn als studenten; ze moeten duizenden voorbeelden zien om te leren. Er waren geen bestaande tekstboeken (datasets) die de AI lieten zien hoe een slordige handgetekende cirkel te interpreteren en om te zetten in een perfecte bewerking.
Dus was het eerste wat de auteurs deden het uitvinden van een datafabriek. Ze namen bestaande afbeeldingen en gebruikten een slimme pijplijn om miljoenen nieuwe trainingsvoorbeelden te maken.
- Voor bewerking: Ze namen foto's, vonden objecten en tekenden vervolgens handmatig (of met behulp van een hulpprogramma-AI) cirkels, vakken en krabbels over deze objecten. Ze creëerden vier soorten taken:
- Scribble + Tekst: "Zet een auto in de rode cirkel."
- Scribble + Tekst + Afbeelding: "Zet de auto uit deze foto in de rode cirkel."
- Afbeelding Fusie: Het nemen van een object uit één foto en het in een andere plakken, geleid door een krabbel.
- Doodle Bewerking: Een ruwe schets veranderen in een realistisch object in de foto.
- Voor generatie: Ze deden hetzelfde, maar begonnen met een leeg wit canvas in plaats van een foto, om de AI te leren nieuwe dingen te tekenen op basis van waar je krabbelde.
Ze genereerden een enorme dataset met tienduizenden van deze voorbeelden (32.000 voor multimodale bewerking, 29.000 voor multimodale generatie, en meer voor de andere taken) om het model te leren hoe het de gedachten van de gebruiker kan lezen via hun tekeningen.
De Magische Truc: Hoe het Model de Krabbel "Ziet"
Hier wordt het artikel echt slim. Meestal, wanneer je wilt dat een AI een specifiek deel van een afbeelding bewerkt, gebruik je een binair masker. Denk aan een masker als een sjabloon: het is een zwart-wit afbeelding waarbij wit betekent "verander dit" en zwart betekent "laat dit ongemoeid".
De auteurs stellen dat maskers te rigide zijn. Als je drie verschillende dingen in één foto wilt veranderen, heb je drie verschillende zwart-wit maskers nodig. Dat is rommelig en moeilijk te beschrijven in woorden. In plaats daarvan gebruikt DreamOmni3 gekleurde krabbels. Je kunt een rode cirkel tekenen voor de auto, een blauw vierkant voor de boom en een groene lijn voor de lucht. De AI kan ze gemakkelijk van elkaar onderscheiden door de kleur.
Maar er is een addertje onder het gras: als je een rode cirkel over een auto tekent, kan de AI de auto niet meer zien omdat de rode inkt deze afdekt! Om dit op te lossen, gebruikt DreamOmni3 een gezamenlijk invoerschema (joint input scheme).
- Het voert de AI twee afbeeldingen tegelijkertijd: de originele foto en de foto met de krabbels eroverheen.
- Het gebruikt een speciaal encoding systeem (een manier van pixels labelen) dat de AI vertelt: "Hé, de rode cirkel in deze afbeelding bevindt zich op exact dezelfde plek als de auto in die andere afbeelding."
- Dit stelt de AI in staat om de krabbel te zien (om te weten wat je wilt) en de originele pixels (om te weten wat het verandert), waardoor de bewerking precies is en de rest van de afbeelding perfect blijft.
De Hersenen: De AI Leren "Slordigheid" te Begrijpen
De auteurs realiseerden zich ook dat menselijke tekeningen vaak slordig zijn. Een cirkel kan op een ei lijken; een lijn kan wiebelig zijn. Om de AI te helpen deze imperfecte tekeningen te begrijpen, introduceerden ze een Visual Language Model (VLM)—een type AI dat erg goed is in redeneren.
Ze trainden deze VLM samen met de beeldgenerator. De VLM fungeert als een vertaler. Hij kijkt naar je krabbel en de tekst die je schreef, begrijpt wat je eigenlijk bedoelde (bijv. "Oh, ze tekenden een wiebelige cirkel, maar ze willen duidelijk een auto") en vertelt de beeldgenerator vervolgens precies wat hij moet doen. Deze gezamenlijke training zorgt ervoor dat de AI niet alleen blind regels volgt, maar ook de intentie achter de krabbel begrijpt.
De Resultaten: Werkt het?
Het team testte DreamOmni3 op een nieuwe benchmark die zij zelf hadden gecreëerd, gevuld met realistische afbeeldingen en lastige taken. Ze vergeleken het met andere topmodellen, inclus�ر de bekende commerciële modellen zoals GPT-4o en Nano Banana.
De resultaten waren indrukwekkend. DreamOmns3 presteerde consequent beter dan andere open-source modellen en evenaarde of versloeg de commerciële reuzen op veel gebieden.
- Menselijke beoordelaars (echte mensen) gaven de succesrate van DreamOmni3 voor bewerkingstaken een score van 55,88%, wat hoger was dan GPT-4o (59,56% op één metriek, maar DreamOmni3 was consistenter in andere aspecten) en aanzienlijk hoger dan anderen zoals Omnigen2 (2,94%).
- In generatietaken behaalde DreamOmni3 een succesrate van 54,55%, waarmee het opnieuw de meeste concurrenten versloeg.
- Het artikel merkt op dat hoewel commerciële modellen sterk zijn, ze soms moeite hebben met specifieke instructies via krabbels, waarbij ze vaak de krabbels in de uiteindelijke afbeelding laten staan of de proporties fout doen. DreamOmni3 was echter specifief ontworpen om deze nuances aan te pakken, wat resulteerde in schonere resultaten waarbij de krabbels verdwenen en de bewerkingen er natuurlijk uitzagen.
Waarom Dit Belangrijk Is
DreamOmni3 gaat niet alleen over het slimmer maken van AI; het gaat over het menselijker maken van AI. Het overbrugt de kloof tussen wat we ons voorstellen en wat we kunnen beschrijven. Door ons te laten tekenen, aanwijzen en krabbelen, verandert het beeldbewerking van een technische taak in een creatieve conversatie. Het artikel suggereert dat deze aanpak—het combineren van tekst, afbeeldingen en vrije handtekeningen met slimme datasynthese en gezamenlijke training—de toekomst is van hoe we met digitale creatietools zullen interageren. Het laat zien dat wanneer we stoppen met proberen computers onze vage woorden te laten begrijpen en in plaats daarvan toestaan dat ze onze directe acties zien, de resultaten veel magischer zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.