← Nieuwste papers
💬 NLP

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

Dit artikel introduceert SpecLA, een efficiënte runtime voor speculatieve decodering die specifiek is ontworpen voor stateful lineaire aandachtmodellen en gebruikmaakt van topologiebewuste verificatie, compacte staatshervatting en een doelgericht afgestemde drafter om een versnelling tot 1,70x end-to-end te bereiken ten opzichte van standaard autoregressieve decodering.

Oorspronkelijke auteurs: Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te schrijven, maar je hebt een zeer strikte redacteur die je slechts één woord tegelijk laat schrijven. Voordat je het volgende woord kunt schrijven, moet je stoppen, je hele notitieblok met alles wat je tot nu toe hebt geschreven controleren, je mentale staat bijwerken en dan het volgende woord schrijven. Dit is hoe veel krachtige AI-modellen momenteel werken: ze genereren tekst één token (woorddeel) tegelijk, waarbij ze constant enorme hoeveelheden data heen en weer schuiven tussen hun snelle geheugen en hun hoofdopslag. Dit proces is traag, als een bibliothecaris die naar de achterkant van de bibliotheek moet lopen om een boek te controleren voor elk woord dat je zegt.

Om dit te versnellen, hebben wetenschappers een truc uitgevonden genaamd "speculative decoding". Stel je voor dat je, in plaats van één woord te schrijven, een snelle, iets minder slimme assistent hebt die de volgende paar woorden voor je raadt. Je vraagt de strikte redacteur vervolgens om al die gokken in één keer te controleren. Als de redacteur al deze gokken goedkeurt, kun je meerdere woorden schrijven in de tijd die normaal gesproken nodig is voor één woord. Dit werkt goed voor het standaard type AI-modellen (Transformers), omdat zij een lijst bijhouden van alle eerdere woorden die gemakkelijk te bewerken is. Maar er is een nieuw, sneller type AI-model (genaamd Linear-Attention) dat geen lijst bijhoudt; in plaats daarvan houdt het één enkele, dichte "samenvattende staat" (summary state) bij die verandert telkens wanneer een nieuw woord wordt toegevoegd. De oude trucjes voor het raden van meerdere woorden werken hier niet, omdat je niet zomaar een foute gok kunt "wissen" uit een samenvattende staat zonder de hele boel opnieuw te schrijven. Dit is het puzzelstukje waar onderzoekers proberen op te lossen: hoe krijg je de snelheid van het vooraf raden van meerdere woorden zonder de unieke manier waarop deze nieuwe modellen zich dingen herinneren te breken?

Maak kennis met SpecLA, een nieuw systeem dat specifiek is ontworpen om deze "vooruit raden"-truc werkbaar te maken voor deze stateful, linear-attention modellen. De onderzoekers ontdekten dat het simpelweg proberen af te dwingen van de oude gokmethoden op deze nieuwe modellen rampzalig mislukt. Als je probeert gokken één voor één te controleren, verlies je het snelheidsvoordeel omdat je nog steeds de zware samenvattende staat rondpompt voor elke enkele gok. Als je ze allemaal tegelijk probeert te controleren als een batch, wordt de wiskunde complex en traag, omdat de gokken in verschillende richtingen kunnen vertakken, en het geheugen van het model gaat niet goed om met vertakkingen.

Daarom heeft het team SpecLA gebouwd, dat fungeert als een slimme verkeersregelaar voor deze AI-modellen. In plaats van elke gok als een aparte reis te behandelen, kijkt SpecLA naar de vorm van de gokken. Als de gokken een rechte lijn vormen, houdt SpecLA de geheugenstaat van het model direct op de snelle processorchip, waardoor de trage wandeling naar de hoofdopslag wordt vermeden. Als de gokken uitwaaieren als een boom, gebruikt het een speciale "boommasker" (tree mask) om ze allemaal tegelijk te controleren zonder de verschillende paden te mengen. Het belangrijkste is dat wanneer de strikte redacteur "ja" zegt tegen sommige gokken en "nee" tegen andere, SpecLA geen tijd verspilt aan het opnieuw schrijven van de hele geheugenstaat. In plaats daarvan bewaart het compacte, kleine "bonnetjes" (factors) van de wijzigingen tijdens het controleproces. Zodra de beslissing is genomen, gebruikt het deze bonnetjes om de geheugenstaat direct bij te werken, waardoor het zware werk volledig wordt overgeslagen.

De resultaten zijn veelbelovend. Bij tests op een krachtige NVIDIA H100-computer met een publiek model genaamd GDN-1.3B, slaagde SpecLA erin om de AI tekst tot wel 1,70 keer sneller te laten schrijven dan de standaard methode van één woord tegelijk. In sommige tests was het 1,42 keer sneller, en in andere zelfs 1,06 keer sneller. De onderzoekers hebben ook kleinere tests uitgevoerd om te zien waarom het zo goed werkte. Ze ontdekten dat hun nieuwe "hybride" manier van het controleren van boomvormige gokken 1,80 tot 7,11 keer sneller was dan de oude manier van het één voor één afspelen van gokken. Ze ontdekten ook dat het gebruik van die compacte "bonnetjes" om het geheugen bij te werken 2,74 tot 4,28 keer sneller was dan het herhalen van de woorden, en het uitstellen van de definitieve update tot de volgende stap bespaarde nog eens 1,15 tot 1,44 keer in tijd.

Het artikel merkt echter voorzichtig op dat deze snelheidstoename afhangt van de kwaliteit van de "gok-assistent". Als de assistent te veel slechte gokken doet, besteedt het systeem tijd aan het controleren van deze gokken om ze vervolgens af te wijzen, waardoor het snelheidsvoordeel verdwijnt. De onderzoekers toonden aan dat voor het systeem goed te functioneren, de assistent nauwkeurig genoeg moet zijn zodat ten minste 70% tot 80% van de gokken wordt geaccepteerd. Als de assistent perfect is, zou de snelheid theoretisch zelfs nog hoger kunnen liggen, maar met een realistische assistent zijn de winsten solide maar afhankelijk van de kwaliteit van de gokken. Het artikel beweert niet dat dit elk probleem voor elk AI-model oplost, maar het bewijst dat voor dit specifieke type stateful model, een nieuwe, op maat gemaakte aanpak noodzakelijk en effectief is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →