← Nieuwste papers
💬 NLP

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec introduceert een verenigd trainingsframework dat onderscheidende conceptie-structuren (MTP voor chat en block-diffusion voor code/wiskunde) co-specialiseert en de middelen voor inferentie-verificatie dynamisch optimaliseert om significante doorvoersnelheidverbeteringen en hogere acceptatiegraden te bereiken over diverse real-world workloads.

Oorspronkelijke auteurs: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Gepubliceerd 2026-07-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe hij verhalen moet schrijven, wiskundige problemen moet oplossen of computercode moet schrijven. Deze robot, een Large Language Model (LLM) genoemd, is ongelooflijk getalenteerd, maar heeft een heel specifieke eigenschap: hij denkt één woord per keer. Om een zin te schrijven, moet hij stoppen, nadenken en het eerste woord genereren, en dan weer stoppen om over het tweede woord na te denken, enzovoort. Het is als een chef-kok die slechts één groente kan snijden, en dan moet wachten tot de hele keuken is afgekoeld voordat hij de volgende kan snijden. Naarmate de robot slimmer wordt en de verzoeken complexer worden, wordt dit "één-voor-één"-proces pijnlijk traag, zoals het kijken naar een schilderij dat droogt in slow motion.

Om dit te versnellen, hebben wetenschappers een truc uitgevonden genaamd "speculative decoding". Denk aan een teaminspanning. Je hebt een kleine, snelle "drafting" robot die de volgende paar woorden in een zin raadt, en een gigantische, trage "target" robot die controleert of die gokken correct zijn. Als de grote robot het eens is met de gokken, kan het team meerdere woorden tegelijk schrijven in plaats van slechts één. Het is als een snelle hardloper die het pad vooruit raadt voor een zware wandelaar; als de gok goed is, bewegen ze beiden samen vooruit, wat een enorme hoeveelheid tijd bespaart. Echter, er is een addertje onder het gras: de snelle hardloper heeft niet altijd gelijk. Als de hardloper te veel verkeerde woorden raadt, moet de grote robot tijd verspillen aan het corrigeren ervan, en wordt het hele proces trager. De grote vraag voor wetenschappers is: hoe zorgen we ervoor dat de snelle hardloper beter raadt, en hoe weten we wanneer we moeten stoppen met raden zodat we geen tijd verspillen?

Hier komt een nieuw project genaamd AngelSpec om de hoek kijken. De onderzoekers bij Tencent realiseerden zich dat een enkele "snelle hardloper"-strategie niet voor elke situatie werkt. Net zoals een sprinter geweldig kan zijn in een korte race maar verschrikkelijk in een marathon, vereisen verschillende soorten tekst verschillende gokstrategieën. Bijvoorbeeld, het schrijven van een informeel chatbericht is chaotisch en vol verrassingen (hoge entropie), terwijl het schrijven van een wiskundig bewijs of een computerprogramma zeer gestructureerd en voorspelbaar is. Het artikel betoogt dat het proberen te gebruiken van één "universele" gokrobot voor alles een fout is. In plaats daarvan hebben ze een systeem gebouwd dat twee verschillende soorten gokkers gebruikt, afhankelijk van de taak, en een slimme manager die beslist precies hoeveel tijd er wordt besteed aan het controleren van die gokken op basis van hoe druk het systeem is.

Het team introduceerde een nieuwe methode genaamd DFly voor de gestructureerde taken zoals coderen en wiskunde. Stel je DFly voor als een team detectives die niet alleen de volgende aanwijzing één voor één raden, maar het hele puzzelstuk in één keer bekijken om het patroon te zien. Ze gebruiken een speciale "hybride" hersenstructuur die naar het grote plaatje kijft en vervolgens hun gokken verfijnt op basis van wat er direct voorafging. Dit stelt hen in staat om lange ketens van code of wiskundige stappen met hoge nauwkeurigheid te voorspellen. Voor de rommelige, creatieve chat-taken houden ze vast aan een eenvoudigere, snellere methode genaamd MTP (Multi-Token Prediction), die uitstekend is voor snelle, conversationele uitbarstingen.

Maar een goede gokker hebben is niet genoeg; je hebt ook een slimme manager nodig. Het artikel introduceert een functie genaamd D-cut, die fungeert als een verkeersregelaar. In een drukbezet serverpark kan het soms gebeuren dat het "controleproces" een opstopping krijgt. D-cut kijkt in realtime naar het vertrouwen in de gokken. Als een gok wankel lijkt, kapt D-cut deze vroegtijdig af om tijd te besparen. Als het systeem soepel draait en de gokken solide lijken, laat het de groep langer doorgaan. Het is als een dirigent die het orkest versnelt wanneer de muziek makkelijk is en het vertraagt wanneer de noten lastig worden, om ervoor te zorgen dat de hele uitvoering snel blijft zonder vast te lopen.

De resultaten van deze aanpak zijn indrukwekkend. Wanneer ze hun nieuwe systeem testten op het Hy3-A21B-model, ontdekten ze dat het tekst veel sneller kon verwerken dan voorheen. Specifiek bereikte het systeem een versnelling van 1,98 tot 2,40 keer vergeleken met de oude "één-woord-tegelijk"-methode. Nog beter is dat het 10,5% tot 11,8% sneller was dan de vorige beste methode, bekend als DFlash. De onderzoekers hebben aangetoond dat door de gokstrategie aan te passen aan het specifieke type tekst (chat versus code) en door een slimme manager te gebruiken om zich aan te passen aan de werklast, ze het meeste uit hun rekenkracht kunnen halen. Ze hebben zelfs hun volledige toolkit, genaamd AngelSpec, publiekelijk beschikbaar gesteld, zodat andere wetenschappers deze trucs kunnen gebruiken om hun eigen AI-modellen sneller en efficiënter te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →