← Nieuwste papers
💻 computer science

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O is een verenigd Masked Diffusion Model dat een innovatieve Elastic Mixture-of-Transformers-architectuur en iteratieve zelfreflectie-mogelijkheden bevat en state-of-the-art prestaties behaalt in hoogresolutie beeldgeneratie, objectgronding en beeldbewerking, terwijl het bestaande autoregressieve en continue diffusiemodellen overtreft.

Oorspronkelijke auteurs: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

Gepubliceerd 2026-07-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers naar een foto kunnen kijken en precies kunnen vertellen wat er gebeurt, of een eenvoudige zin kunnen nemen om vanuit het niets een gloednieuw beeld te schilderen. Lange tijd moesten wetenschappers twee verschillende soorten robots bouwen voor deze taken: één "brein" om afbeeldingen te begrijpen en een andere "kunstenaar" om ze te creëren. Maar net zoals een mens zowel een kaart kan lezen als een schets kan tekenen, proberen onderzoekers nu een enkele, superintelligente AI te bouwerken die beide tegelijkertijd kan doen. Dit vakgebied wordt "multimodale modellering" genoemd, en de nieuwste ster van de show is een type AI dat een "Masked Diffusion Model" wordt genoemd. Denk aan dit model als een spelletje "Raad het plaatje". De computer begint met een leeg canvas vol vraagtekens (masks) en vult deze langzaam in, één voor één, totdat er een heldere afbeelding verschijnt. Het is een beetje zoals het wegpeelen van lagen mist om een verborgen landschap te onthullen. De grote vraag die wetenschappers stellen is: Kunnen we dit proces van het wegpeelen van de mist zo slim maken dat de AI niet alleen de afbeelding raadt, maar ook het verhaal erachter begrijpt, de scène aanpast en zelfs zijn eigen meesterwerk plant voordat hij ook maar één lijn tekent?

Maak kennis met LaVida-O, een nieuw AI-model dat zegt: "Ja, dat kunnen we!" De onderzoekers achter dit project hebben een verenigd systeem gebouwd dat fungeert als zowel een detective als een schilder. In tegenstelling tot eerdere modellen die óf geweldig waren in begrijpen maar slecht in tekenen, óf snel waren in tekenen maar traag in denken, probeert LaVida-O het beste van beide werelden te zijn. Het kan naar een foto kijken en precies aanwijzen waar een "hond" naast een "das" staat, of het kan een opdracht zoals "een cyberpunk-elf" nemen en een hoogwaardige, gedetailleerde afbeelding genereren. Nog cooler is dat het bestaande foto's kan bewerken, zoals het vervangen van een tv door een boekenkast, of het kan "hardop nadenken" terwijl het werkt, door zijn eigen fouten te controlか controleren en te herstellen voordat het het eindresultaat aan je laat zien.

Het geheime ingrediënt achter LaVida-O is een slim architecturaal trucje genaamd Elastic Mixture-of-Transformers (of Elastic-MoT voor kort). Stel je een fabriek voor met twee assemblagelijnen. Meestal, als je twee verschillende producten wilt maken, bouw je misschien twee aparte, enorme fabrieken, wat duur en traag is. Of je gebruikt één gigantische fabriek die alles tegelijk probeert te doen, wat rommelig kan worden. LaVida-O is als een slimme fabriek die zijn personeelsbestand kan verkleinen of uitbreiden afhankelijk van de klus. Wanneer het alleen een afbeelding moet begrijpen, gebruikt het een groot, zwaar materieel team. Maar wanneer het een nieuwe afbeelding moet genereren, activeert het alleen een kleiner, gespecialiseerd team, wat enorm veel energie en tijd bespaart. Het is als een Zwitsers zakmes dat alleen de schroevendraaier tevoorschijn haalt wanneer je moet schroeven, in plaats van de hele zware gereedschapskist mee te dragen.

Om het tekenproces nog beter te maken, voegde het team nog een paar trucjes toe. Ze leerden het model om Stratified Sampling te gebruiken, wat lijkt op een schilder die niet alleen eerst de linkerbovenhoek van een canvas invult. In plaats daarvan verspreiden ze hun penseelstreken gelijkmatig over de hele afbeelding, zodat de afbeelding overal tegelijkertig gelijkmatig wordt opgebouwd, in plaats van vast te lopen in één plek. Ze gaven het model ook een "universele tekstconditiering", waardoor gebruikers extra instructies kunnen geven zoals "maak het lichter" of "verhoog het contrast" door simpelweg die woorden te typen, zonder complexe technische codes nodig te hebben.

Misschien wel het meest opwindende kenmerk is Planning en Zelfreflectie. Voordat het model begint te tekenen, kan het pauzeren en de lay-out "plannen", waarbij het precies beslist waar objecten moeten komen te staan. Als het een foto bewerkt, lokaliseert het eerst het object dat veranderd moet worden. Nadat het een afbeelding heeft gemaakt, kan het naar zijn eigen werk kijken en zeggen: "Wacht, de hond overlapt de das; dat is fout," en het dan corrigeren. Dit vermogen om zichzelf te bekritiseren en te corrigeren leidt tot veel hogere kwaliteit resultaten.

Het paper laat zien dat LaVida-O niet alleen een theorie is; het werkt ook echt. In tests versloeg het veel bestaande modellen bij taken zoals het vinden van objecten in foto's, het genereren van afbeeldingen vanuit tekst en het bewerken van foto's. Het was in staat om afbeeldingen te genereren met een resolutie van 1024x1024 pixels, wat veel scherper is dan veel eerdere pogingen. Het bewees ook ongelooflijk snel te zijn, met een snelheidswinst van wel 6,8x vergeleken met sommige van de oudere, tragere modellen bij het uitvoeren van objectdetectie. Ho hoewel het nog steeds enkele beperkingen heeft — zoals moeite met het renderen van zeer kleine tekst binnen afbeeldingen of soms kleine wijzigingen aan delen van een foto die niet zouden mogen veranderen — suggereren de resultaten dat deze "elastische" aanpak een grote stap voorwaarts is. LaVida-O suggereert dat door begrip en generatie te combineren in één flexibel kader, we AI kunnen bouwen die niet alleen bevelen opvolgt, maar ook echt denkt, plant en creëert met een niveau van zorg en precisie dat we voorheen niet hebben gezien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →