LaViDa: A Large Diffusion Language Model for Multimodal Understanding
LaViDa introduceert een nieuwe familie van Vision-Language Modellen gebouwd op discrete diffusiemechanismen die parallelle decodering en bidirectionele context benutten om competitieve prestaties, snellere inferentie en verbeterde controleerbaarheid te bereiken in vergelijking met traditionele autoregressieve modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers tegelijkertijd kunnen "zien" en "spreken". Dit is het domein van Vision-Language Models (VLM's), de superintelligente AI-assistenten die naar een foto van een zonsondergang kunnen kijken en er een gedicht over kunnen schrijven, of een complexe grafiek kunnen analyseren en de trends kunnen uitleggen. Jarenlang was de standaardmanier waarop deze modellen denken als een student die een toets maakt: ze beantwoorden deze woord voor woord, strikt van links naar rechts. Ze schrijven "De", dan "hemel", dan "is", zonder ooit terug te kijken om een eerder woord te veranderen. Hoewel dit goed werkt, is het traag omdat ze niet parallel kunnen schrijven, en het is rigide; als ze het eerste woord van een zin fout doen, kunnen ze niet gemakkelijk teruggaan om het te herstellen zonder opnieuw te beginnen.
Maar wat als er een andere manier was? Stel je voor dat je, in plaats van een zin woord voor woord te schrijven, begint met een blanco pagina vol vraagtekens en deze langzaam invult, waarbij je beslist welke woorden waar komen, terwijl je je keuzes constant verfijnt tot het beeld duidelijk is. Dit is het idee achter "diffusiemodellen". Oorspronkelijk beroemd geworden door het creëren van prachtige afbeeldingen vanuit ruis, hebben onderzoekers onlangs geprobeerd deze "invul-de-blanks"-aanpak voor tekst te gebruiken. De grote vraag is: Kunnen we deze flexibele, parallelle manier van denken combineren met het vermogen om afbeeldingen te zien? Als we dat zouden kunnen, zouden we AI kunnen krijgen die niet alleen slimmer is in het volgen van strikte regels (zoals het schrijven van een gedicht waarbij elke regel met een specifieke letter begint), maar ook veel sneller, omdat het niet hoeft te wachten tot het ene woord klaar is voordat het aan het volgende kan beginnen.
Maak kennis met LaViDa (Large Vision-Language Diffusion Model), een nieuwe familie van AI-modellen geïntroduceerd door onderzoekers van UCLA, Panasonic, Adobe en Salesforce. Denk aan LaViDa als de eerste "multitasking-kunstenaar" die de diffusiemethode gebruikt om afbeeldingen te begrijpen en erover te schrijven. In plaats van een verhaal woord voor woord te schrijven zoals een traditionele robot, begint LaViDa met een blanco canvas van "masks" (placeholders) en onthult geleidelijk het antwoord, waarbij het de gaten invult op een manier die het model toestaat om naar de hele zin tegelijkertijd te kijken.
De onderzoekers ontdekten dat deze aanpak een paar superkrachten heeft. Omdat LaViDa de hele zinstructuur kan bekijken voordat het de definitieve versie maakt, is het ongelooflijk goed in taken die strikte regels vereisen, zoals het voltooien van een gedicht waarbij elke regel met een specifieke letter moet beginnen. In tests versloeg het de concurrentie op deze "beperkte" taken grondig, met een verbetering van 59% vergeleken met de beste standaardmodellen. Het biedt ook een unieke "snelheidsregelaar" voor gebruikers: je kunt het de opdracht geven om super snel te zijn door minder gaten tegelijk in te vullen, of superhoogwaardig door meer stappen te nemen om het antwoord te verfijnen. Op het gebied van beeldbeschrijvingen (image captioning) wist het bijna 2 keer sneller te zijn dan zijn rivalen, terwijl het tegelijkertijd betere beschrijvingen schreef (een score van +4,1 punten hoger op een kwaliteitsmetriek genaamd CIDEr).
De paper merkt echter ook op dat deze nieuwe methode geen toverstaf is die alles direct oplost. De onderzoekers moesten een aantal slimme trucs bedenken om het goed te laten werken. Voor één ding creëerden ze een "complementaire masking"-techniek, wat er eigenlijk op neerkomt het model twee verschillende versies van een puzzel te geven om tegelijkertig op te lossen, zodat het geen belangrijke aanwijzingen mist. Ze bouwden ook een "Prefix-DLM"-systeem, dat fungeert als een slimme snelkoppeling, waardoor het model de afbeelding en de vraag kan onthouden zonder ze elke keer dat het een nieuw woord raadt, opnieuw te moeten lezen.
Ondanks deze successen is de paper voorzichtig in het benoemen van de gebieden waar LaViDa nog groeiruimte heeft. Hoewel het andere modellen verslaat op veel redeneer- en algemene kennisvragen, worstelt het soms met het lezen van kleine tekst in afbeeldingen (OCR), omdat het de details van de afbeelding moest comprimeren om in zijn geheugen te passen. De auteurs suggereren dat, hoewel diffusiemodellen een krachtig en veelbelovend alternatief zijn voor de standaard "woord-voor-woord"-aanpak, ze nog steeds leren hoe ze kunnen opschalen om te kunnen wedijveren met de allergrootste, meest data-hongerige AI-modellen die er zijn. Uiteindelijk bewijst LaViDa dat de "vul-de-blanks"-methode niet alleen bedoeld is voor het maken van plaatjes; het kan een sterke, flexibele en snelle manier zijn voor computers om onze visuele wereld te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.