JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation
JoLT introduceert een nieuw raamwerk voor hoogresolutie beeldgeneratie dat gelijktijdig de ruis uit laagresolutie en hoogresolutie latente trajecten verwijdert in twee onderling verbonden stromen, waardoor globale lay-outcontrole effectief wordt gecombineerd met synthese van fijne details om rijk gedetailleerde en visueel aantrekkelijke beelden te produceren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Decennialang werd de droom om kunst met een computer te creëren beperkt door een eenvoudige afweging: je kon óf een helder, samenhangend beeld hebben, óf een beeld vol complexe details, maar zelden beide. Moderne kunstmatige intelligentie, getraind om geschreven beschrijvingen in afbeeldingen te veranderen, is opmerkelijk goed geworden in het vastleggen van het grote plaatje. Het kan een kasteel op een heuvel of een kat op een mat plaatsen met perfecte logica. Echter, wanneer kunstenaars vragen om een enorme, hoog-definitie afbeelding bedoeld voor een grote wand of een fine art-print, worstelen deze systemen vaak. Ze hebben de neiging om afbeeldingen te produceren die van een afstand scherp lijken, maar uit elkaar vallen wanneer je van dichtbij kijkt, omdat ze de dichte, rijke texturen missen die een scène echt laten aanvoelen. De standaardmanier om dit op te lossen is geweest via een tweestaps-proces: eerst een kleine, laag-resolutie afbeelding genereren om de lay-out goed te krijgen, en vervolgens proberen daar details aan toe te voegen. Maar deze aanpak heeft een fundamenteel gebrek. Zodra de kleine afbeelding is gemaakt, kan de computer niet teruggaan om het grote plaatje aan te passen om de nieuwe details te accommoderen, wat leidt tot een eindresultaat waarbij de fijne texturen aanvoelen als een plakkerig laagje bovenop in plaats van verweven in de scène.
Een team van onderzoekers heeft een andere manier voorgesteld om dit probleem op te lossen door een methode genaamd JoLT te introduceren, wat staat voor Joint Latent Trajectories. In plaats van een afbeelding van onderaf op te bouwen, beginnend klein en groeiend naar groot, bouwt JoLT de afbeelding van binnenuit op, waarbij de brede compositie en de fijne details op exact hetzelfde moment worden gecreëerd. Stel je een kunstenaar voor die, in plaats van eerst een ruwe schets te maken en die later in te vullen, het hele canvas in één continue beweging schildert, waarbij hij voortdurend de brede streken van een bergketen aanpast terwijl hij tegelijkertijd de individuele bladeren aan een boom verfijnt. Dit is de kern van de nieuwe aanpak. Het systeem voert twee parallelle processen uit die constant met elkaar communiceren. Eén proces richt zich op de algemene lay-out en compositie, om ervoor te zorgen dat de scène globaal zinvol is. Het andere proces richt zich op de hoog-resolutie details, waarbij textuur en complexiteit aan specifieke gebieden worden toegevoegd. Cruciaal is dat deze twee processen niet gescheiden zijn; ze delen informatie bij elke stap van het creatieproces. Het lay-outproces vertelt het detailproces waar elementen geplaatst moeten worden, en het detailproces voert de evoluerende rijkdom terug naar het lay-outproces, waardoor de algehele scène zich kan aanpassen en de nieuwe complexiteit kan accommoderen.
De onderzoekers testten deze methode met behulp van een krachtige beeldgenerator en vergeleken deze met de beste bestaande technieken. Ze vroegen de computer om afbeeldingen te maken op basis van complexe beschrijvingen die veel verschillende objecten en omgevingen bevatten, zoals een overstroomde hotelatrium gevuld met boten, klokken en bomen. De resultaten waren opmerkelijk. De door JoLT geproduceerde afbeeldingen waren niet alleen groter; ze waren aanzienlijk complexer en gedetailleerder dan die van andere methoden. Wanneer de onderzoekers de informatiedichtheid in de afbeeldingen maten, vertoonden de creaties van JoLT een enorme toename in detail, waarbij sommige metrieken een verbetering van vijftig procent lieten zien ten opzichte van de op één na beste methode. Belangrijker nog, deze afbeeldingen bleven coherent. De extra details verstoorden de scène niet of maakten het niet chaotisch; in plaats daarvan voelden ze als een natuurlijk onderdeel van de afgebeelde wereld. Het systeem gaf gebruikers ook een nieuwe vorm van controle. Door een eenvoudige instelling aan te passen, kon een gebruiker de hoeveelheid detail omhoog of omlaag draaien, en precies beslissen hoe intrikat de uiteindelijke afbeelding moest zijn zonder de hele beschrijving opnieuw te hoeven schrijven.
Om te zien of deze verbeteringen ertoe deden voor echte mensen, voerden de onderzoekers een studie uit waarbij menselijke deelnemers afbeeldingen gemaakt door JoLT vergeleken met afbeeldingen van andere toonaangevende systemen. De deelnemers gaven consequent de voorkeur aan de JoLT-afbeeldingen en vonden ze gedetailleerder, visueel complexer en artistiek aantrekkelijker. Ze vonden ook dat de afbeeldingen de oorspronkelijke geschreven beschrijvingen net zo goed matchten als de andere methoden, wat bewees dat het toevoegen van zoveel detail niet ten koste ging van de nauwkeurigheid. De studie suggereert dat de oude manier van denken over hoog-resolutie beeldgeneratie — beginnen klein en het vervolgens proberen uit te breiden — niet de enige weg vooruit is. Door de creatie van een scène te behandelen als een enkel, verenigd proces waarbij het grote plaatje en de minuscule details samen evolueren, is het mogelijk om afbeeldingen te genereren die zowel enorm groot in schaal als rijk in textuur zijn. Dit opent nieuwe mogelijkheden voor kunstenaars en makers die afbeeldingen nodig hebben die bestand zijn tegen nadere inspectie, waardoor de computer verandert van een hulpmiddel dat eenvoudige plaatjes maakt naar een partner die in staat is om dichte, hoog-getrouwe werelden te genereren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.