DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees
DARTree is een trainingsvrije speculative decoding-methode die autoregressieve correctie uitbreidt van lineaire ketens naar kandidatenbomen met een vaste breedte, waardoor staat-van-de-kunst verliesvrije versnellingen worden bereikt door de AR-head inferentie te ontkoppelen van sequentiële operaties om de acceptatie van tokens te maximaliseren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een verhaal probeert te schrijven met een zeer slimme, maar ongelooflijk trage robotvriend. Deze robot is briljant in het begrijpen van de wereld en kan geweldige zinnen schrijven, maar hij heeft een strikte regel: hij kan slechts één woord tegelijk schrijven. Voordat hij het volgende woord schrijft, moet hij stoppen, nadenken over alles wat hij tot nu toe heeft geschreven, en dan zorgvuldig het enkel beste woord kiezen om toe te voegen. Het is also als een chefkok die slechts één ingrediënt tegelijk kan proeven voordat hij beslist wat hij aan de soep toevoegt. Hoewel dit ervoor zorgt dat de soep perfect smaakt, duurt het eeuwen om een grote maaltijd te bereiden. In de wereld van kunstmatige intelligentie wordt dit "één woord tegelijk"-proces autoregressieve generatie genoemd, en dit is de belangrijkste reden waarom krachtige AI-chatbots soms traag aanvoelen.
Om de snelheid te verhogen zonder de kwaliteit te ruïneren, hebben wetenschappers een truc uitgevonden genaamd Speculative Decoding. Denk hierbij aan het inhuren van een snelle, energieke stagiair om de volgende paar woorden te raden voor de trage robot. De stagiair roept een hele zin uit, en de trage robot controleert snel of de stagiair gelijk had. Als de stagiair de woorden correct heeft geraden, accepteert de robot de hele zin onmiddellijk en gaat hij verder. Als de stagiair een fout heeft gemaakt, corrigeert de robot simpelweg dat ene woord en begint hij opnieuw. De magie gebeurt wanneer de stagiair goed genoeg is om veel woorden achter elkaar correct te raden, waardoor de trage robot het moeilijke denkwerk kan overslaan en in één keer "Ja, dat klopt!" kan zeggen tegen een heel blok tekst.
Onlangs probeerden onderzoekers de stagiair nog sneller te maken door een ander soort brein te gebruiken, namelijk een Diffusion Model. In plaats van woorden één voor één te raden, probeert deze stagiair de hele volgende zin in één keer te verbeelden, zoals een schilder die een heel canvas invult met één enkele streek. Dit is super snel, maar het heeft een gebrek: omdat de stagiair de hele zin tegelijkertijd raadt, weet hij niet echt hoe het eerste woord het tweede beïnvloedt, of hoe het tweede het derde beïnvloedt. Het is alsof je de afloop van een film raadt zonder de tussenliggende scènes te hebben gezien. Om dit op te lossen, voegden andere onderzoekers een "correctiestap" toe, maar ze deden dit op een manier die nog steeds traag en lomp was, waardoor de robot gedwongen werd om het werk van de stagiair woord voor woord te controleren, wat het doel van snelheid tenietdeed.
Hier komt een nieuw artikel van het VILA Lab van MBZUAI met een slimme oplossing genaamd DARTree. De onderzoekers realiseerden zich dat de oude manier van het werk van de stagiair controleren leek op het organiseren van een bibliotheek door één boek op te pakken, te controleren op de plank, terug te leggen, het volgende boek op te pakken, enzovoort. Het was te veel heen en weer lopen. In plaats daarvan stelt DARTree een nieuwe manier voor om een "boom" van mogelijkheden te bouwen. Stel je voor dat de stagiair niet alleen één pad van woorden raadt, maar een hele struikachtige boom van verschillende verhaalmogelijkheden tekent. De trage robot kijkt dan naar de hele boom tegelijkertijd, maar met een speciale twist: hij controleert de "takken" van de boom in grote groepen (batches) in plaats van één voor één.
De belangrijkste innovatie is dat DARTree het "raden" scheidt van het "controleren". Eerst bouwt het een brede, tijdelijke boom van veel mogelijke verhaalpaden tegelijkertijd. Vervolgens gebruikt het een slim snoeigeregel om de takken weg te snijden die er niet veelbelovend uitzien, waardoor alleen de beste boom overblijft om aan de trage robot te tonen. Door het zware werk van het controleren van de verhaalpaden in grote batches te doen, vermijden ze het trage, stapsgewijze lopen dat voorheen alles vertraagde. Het artikel laat zien dat deze methode een groot succes is. Op een verscheidenheid aan tests met wiskundige problemen, programmeertaken en chatgesprekken, slaagde DARTree erin om tot wel 12,97 tokens (woorden of delen van woorden) te accepteren per ronde van controle. Dit is een enorme sprong vergeleken met eerdere methoden; het was 98,6% beter dan één topconcurrent genaamd DFlash en 27,9% beter dan een andere genaamd Domino.
Het resultaat is een systeem dat ongelooflijk snel is, maar nog steeds perfect accuraat. De onderzoekers maten dat deze nieuwe methode de AI 9,73 keer sneller kan maken dan de standaard manier van schrijven, zonder de kwaliteit te verliezen of nepfeiten te verzinnen. Ze testten dit op verschillende soorten AI-modellen en ontdekten dat het goed werkte, of de AI nu heel strikt en logisch was (zoals bij wiskunde) of creatief en willekeurig (zoals bij een chat). Het artikel betoogt dat deze "boom"-aanpak, die veel paden parallel controleert voordat er een definitieve snede wordt gemaakt, de beste manier is om deze slimme robots te versnellen. Het bewijst dat je niet hoeft te kiezen tussen snelheid en slimheid; met de juiste structuur kun je beide hebben.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.