← Nieuwste papers
💬 NLP

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

Dit artikel introduceert Progressive Tree Drafting (PTD), een trainingsvrije en model-agnostische speculative decoding-methode die een gestructureerde, geleide parallelle strategie binnen het doel-LLM benut om tot 2x versnelling van de decodering te bereiken zonder hulpmodules.

Oorspronkelijke auteurs: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te schrijven met een super-slimme robotvriend. Normaal gesproken is deze robot erg voorzichtig maar ook erg traag: hij schrijft één woord tegelijk, stopt om na te denken, controleert zijn werk en schrijft dan het volgende woord. Dit "één-voor-één"-proces is als een eenbaansweg waar gemakkelijk files ontstaan omdat de robot moet wachten op elk afzonderlijk woord voordat hij verder kan gaan.

Een tijdje probeerden mensen dit te versnellen door een "conceptie-assistent" in te huren—een kleinere, snellere robot die de volgende paar woorden probeert te raden. Maar dit creëerde een nieuw probleem: je moest de assistent betalen, hem leren om te spreken zoals de grote robot, en constant briefjes tussen hen uitwisselen. Het was alsof je een boodschapper inhuurde die heen en weer moest rennen, wat alles vertraagde.

Toen probeerden slimme onderzoekers een andere truc: ze vroegen de grote robot om zijn eigen toekomstige woorden te raden zonder hulp van anderen. Ze probeerden de robot om te laten nadenken over verschillende verhaallijnen tegelijkertijd. Echter, het artikel betoogt dat deze eerdere "zelf-radende" methoden een beetje rommelig waren. De robot schreef vaak twee of drie verschillende zinnen die bijna exact hetzelfde waren, waardoor hij zijn hersencapaciteit verspilde aan dubbele ideeën. Het was alsof je een chef-kok vroeg om drie verschillende maaltijden te koken, om er vervolgens achter te komen dat ze allemaal precies dezelfde soep waren geworden.

Het Grote Idee van het Papier: De "Boom"-truc

De auteurs van dit papier, geaccepteerd bij COLM 2026, stellen een nieuwe manier voor om het denken van de robot te organiseren, genaamd Progressive Tree Drafting (PTD). In plaats van de robot willekeurige, aparte paden te laten bewandelen, leiden ze hem om een "boom" van ideeën te laten groeien.

Zo werkt het op een speelse manier:

  1. De Vertakking: Stel je voor dat de robot met één zin begint. In plaats van alleen het volgende woord te raden, vertakt hij zich als een boom, waarbij hij tegelijkertijd een paar verschillende eindes probeert (zoals "Hawaï is een vreugdevolle plek" versus "Hawaï is een beroemde plek").
  2. Het Snoeien: Dit is het magische deel. Als twee takken van de boom te veel op elkaar gaan lijken (zoals twee takken die in exact dezelfde richting groeien), "snoeit" de robot de overtollige takken weg. Hij knipt de duplicaten af om energie te besparen.
  3. De Groei: De robot blijft deze boom stap voor stap te laten groeien, maar hij controleert constant of de takken daadwerkelijk verschillend zijn en logisch zijn. Het is als een tuinman die de plant wild laat groeien, maar de dode of identieke twijgjes wegknipt zodat de plant gezond en divers blijft.

Wat Ze Vonden

De onderzoekers testten dit idee op verschillende beroemde robotbreinen (zoals LLaMA en Qwen) en vonden enkele opwindende resultaten:

  • Snelheid: Door deze boommethode te gebruiken, kon de robot tot wel 2,30 keer sneller schrijven bij wiskundige problemen en 2,08 keer sneller bij programmeertaken vergeleken met de oude trage methode. Bij algemene chattaken was het ongeveer 1,67 keer sneller.
  • Geen Extra Hulp Nodig: Het beste deel is dat deze methode geen extra "assistent-robots" of speciale training nodig heeft. Het werkt direct met de bestaande robot.
  • Betere Kwaliteit: Omdat de robot wordt gedwongen om verschillende paden te verkennen (de boomtakken) in plaats van alleen maar zijn eigen voorspelling te herhalen, zijn de woorden die hij accepteert langer en maken ze meer zin samen.

Wat Ze Hebben Uitgesloten

Het papier is zeer duidelijk over wat niet zo goed werkt als hun nieuwe methode. Ze zijn tegen het idee dat het simpelweg laten raden van meerdere lineaire paden (zoals een rechte lijn van voorspellingen) door de robot voldoende is. Hun analyse toonde aan dat zonder de "boom"-structuur en het "snoeien" van duplicaten, de robot meer dan de helft van zijn tijd verspilt aan nadenken over ideeën die voor 80% identiek zijn. Ze toonden ook aan dat het toevoegen van externe "drafting modules" (de assistent-robots) te veel communicatieruis creëert en te veel training vereist, waardoor ze minder efficiënt zijn dan hun zelfgestuurde boommethode.

Hoe Zeker Zijn Ze?

De auteurs zijn vrij zelfverzekerd over deze cijfers omdat ze echte experimenten hebben uitgevoerd op echte hardware (NVIDIA L20 GPU's). Ze hebben het niet alleen gesimuleerd; ze hebben de snelheid gemeten in "tokens per seconde" en vonden dat hun methode consequent andere populaire "geen-training" methoden zoals Lookahead Decoding en Self-Draft versloeg. Bijvoorbeeld, op de GSM-8k wiskunde benchmark bereikte hun methode een versnelling van 2,30×, terwijl de op één na beste methode slechts 1,90× bereikte.

Kortom, het papier suggereert dat als je een AI sneller wilt laten praten zonder extra hulp in te huren, je niet moet proberen het hem in rechte lijnen te laten wandelen, maar hem moet begeleiden om een slimme, getrimde boom van ideeën te laten groeien. Het is een manier om het meeste uit het brein van de robot te halen door ervoor te zorgen dat hij niet twee keer over hetzelfde ding nadenkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →