← Nieuwste papers
🤖 machine learning

TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

TreeFlash is een nieuwe parallelle speculatieve decodeermethode die one-shot block drafters verbetert door een MLP-laag te integreren om autoregressieve distributies te benaderen, waardoor de block-efficiëntie en versnelling aanzienlijk worden verbeterd terwijl de constante decodeertijdcomplexiteit behouden blijft.

Oorspronkelijke auteurs: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Gepubliceerd 2026-06-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert het volgende woord in een zin te voorspellen, zoals het afmaken van het verhaal van een vriend.

De Oude Manier (Autoregressief)
Normaal gesproken zijn grote AI-modellen (zoals de modellen die deze paper schrijven) erg voorzichtig maar traag. Ze schrijven één woord, controleren het, en schrijven dan het volgende woord op basis van dat ene woord, enzovoort. Het is alsoals één persoon die een zin typt, één letter tegelijk. Ze kunnen niet versnellen omdat ze moeten wachten op de vorige letter voordat ze de volgende kunnen typen.

De "Speculatieve" Afkorting
Om de boel te versnellen, hebben onderzoekers een "drafting"-systeem uitgevonden. Een kleine, snelle AI (de Drafter) raadt een heel blok woorden tegelijk. Daarna controleert de grote, trage AI (de Verifier) ze allemaal in één keer. Als de gokken kloppen, accepteert de grote AI ze allemaal direct, wat enorm veel tijd bespaart.

Het Probleem met "One-Shot" Drafting
Onlangs werd een methode genaamd DFlash geïntroduceerd. In plaats van woorden één voor één te raden, probeert de Drafter een heel blok woorden in één enkel moment uit te spugen (een "one-shot").

  • De Analogie: Stel je een chef-kok voor die probeert de volgende 10 ingrediënten voor een soep te raden, allemaal tegelijkertijd, zonder eerst de eerste 9 te proeven.
  • De Fout: Omdat de chef de vorige ingrediënten niet heeft geproefd, is hun gok voor het 10e ingrediënt alleen gebaseerd op het oorspronkelijke recept, en niet op het feit dat ze net "zout" of "peper" hebben toegevoegd. Naarmate de lijst met gokken langer wordt, begint de gok van de chef steeds verder af te wijken van wat het echte recept (de Verifier) eigenlijk wil.
  • Het Boom-probleem: Nieuwere methoden proberen meerdere verschillende paden tegelijk te raden (zoals een boom met veel takken). Maar als de takken een gemeenschappelijk begin delen, worden ze gedwongen om voor de volgende stap dezelfde gok te gebruiken, zelfs als de ene tak "zout" had en de andere "suiker". Dit maakt de boom rommelig en minder nauwkeurig.

De Oplossing: TreeFlash
De auteurs van deze paper hebben TreeFlash gecreëerd. Ze realiseerden zich dat de chef een klein beetje hulp nodig heeft om te onthouden wat hij zojuist heeft "geproefd".

  • De Magische Truk: Ze hebben een zeer kleine, lichtgewicht "helper"-laag (een AR-Approximator) aan de Drafter toegevoegd.
  • Hoe het werkt: Hoewel de Drafter nog steeds het hele blok in één keer raadt (waardoor het super snel blijft), kijkt deze helper naar het onmiddellijk voorafgaande woord in de draft en fluistert: "Hé, aangezien we net 'zout' zeiden, moet het volgende woord waarschijnlijk 'peper' zijn, en niet 'suiker'."
  • Het Resultaat: De Drafter kan nu gokken die afhankelijk zijn van de woorden vlak voor hen, precies zoals een normaal mens dat zou doen, maar het doet dit nog steeds in één enkel instant.

Waarom het een Groot Ding is
Het paper beweert dat door deze kleine helper toe te voegen:

  1. Het blijft snel: Het vertraagt het proces niet omdat de helper zo klein is en de berekeningen parallel worden uitgevoerd.
  2. Het is nauwkeuriger: De gokken blijven veel dichter bij wat de grote AI eigenlijk wil, vooral voor de latere woorden in het blok.
  3. Het bouwt betere bomen: Wanneer er tegelijkertelijk meerdere paden worden geraden, kan TreeFlash de verschillende takken correct afhandelen (bijv. de ene tak krijgt "zout", de andere krijgt "suiker", en de volgende woorden passen zich daarop aan).

De Resultaten
Toen ze TreeFlash testten op diverse taken (zoals wiskundige problemen, coderen en algemene gesprekken) met verschillende groottes van AI-modellen, versloeg het consistent de vorige beste methoden.

  • Het accepteert meer correcte woorden per gok (hogere efficiëntie).
  • Het maakt het hele proces sneller (hogere snelheidswinst).
  • De verbetering werd zelfs groter wanneer ze de AI vroegen om langere lijsten met woorden te raden.

In een Notendop
TreeFlash is als het geven van een kleine geheugenstick aan een snellezende robot. Het stelt de robot in staat om in één seconde een hele paragraaf te raden, maar in plaats van blind te gokken, onthoudt de robot het laatste woord dat hij heeft geraden om de volgende gok slimmer te maken. Dit zorgt ervoor dat de AI veel sneller schrijft zonder aan kwaliteit in te boeten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →