← Nieuwste papers
🤖 machine learning

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

Dit artikel introduceert MTPC, een op probabilistische circuits gebaseerd framework voor multi-token voorspelling dat de afweging tussen expressiviteit en latentie optimaliseert door gezamenlijke distributies over toekomstige tokens te coderen, waardoor de generatie van byte-niveau en subword LLM's aanzienlijk wordt versneld terwijl de oorspronkelijke prestaties van het model behouden blijven.

Oorspronkelijke auteurs: Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te schrijven, maar je hebt een zeer strikte regel: je mag slechts één letter tegelijk schrijven. Elke keer als je een letter typt, moet je stoppen, nadenken en je superintelligente brein (de AI) vragen wat de volgende letter is. Dit is hoe de meeste huidige Large Language Models (LLM's) werken. Het is accuraat, maar ook ongelooflijk traag, vooral als je in "bytes" schrijft (de ruwe bouwstenen van tekst) in plaats van hele woorden, omdat je duizenden letters moet typen om een enkele zin te schrijven.

Dit paper introduceert een nieuwe methode genaamd MTPC (Multi-Token Prediction Circuits) om dit snelheidsprobleem op te lossen zonder de kwaliteit van het verhaal te verliezen.

Zo werkt het, met behulp van alledaagse analogieën:

1. Het Probleem: Het "Raadspelletje" vs. De "Kristallen Bol"

Om de snelheid te verhogen, probeerden onderzoekers een truc genaamd Multi-Token Prediction (MTP). In plaats van één letter te raden, probeert de AI een heel blok letters tegelijk te raden (zoals het raden van de volgende 8 letters van een woord).

  • De Oude Manier (Onafhankelijkheidsveronderstelling): Stel je voor dat je de volgende 8 letters van een woord raadt, maar je behandelt elke letter alsof deze geen relatie heeft met de anderen. Je raadt de eerste letter, dan de tweede, dan de derde, waarbij je de andere letters volledig negeert.

    • Het Resultaat: Dit is snel, maar leidt tot onzin. Je krijgt misschien "Cretoria" in plaats van "Pretoria" of "Craporia", omdat het model niet besefte dat die letters bij elkaar moesten passen. Het is alsof je een huis probeert te bouwen door willekeurig bakstenen te kiezen zonder te controleren of ze passen.
  • De Nieuwe Manier (MTPC): De auteurs zeggen: "Laten we stoppen met het isoleren van letters. Laten we het hele blok als een verbonden groep raden." Ze gebruiken een wiskundig hulpmiddel genaamd een Probabilistisch Circuit.

    • De Analogie: Denk aan de oude manier als een rij mensen die een briefje doorgeven, waarbij iedereen een willekeurig woord fluistert. De nieuwe manier is als een dirigent die een orkest leidt. De dirigent (het circuit) weet dat als het eerste instrument een C-majeur akkoord speelt, de volgende instrumenten moeten spelen wat bij dat akkoord past. Het begrijpt de afhankelijkheden tussen de letters.

2. De Gereedschapskist: De "Circuit Architect"

Het paper stelt een flexibel framework voor (MTPC) waarmee je kunt kiezen hoe "verbonden" de letters moeten zijn. Ze bieden verschillende "architecturen" (vormen van het circuit) aan om een balans te vinden tussen snelheid en intelligentie:

  • FF (Fully Factorised): De "Willekeurig Raden" modus. Snel, maar dom. (De orkestleden spelen alleen).
  • CP (Canonical Polyadic): Een "Groep Raden." Ze raden een paar hoofdthema's en bouwen de letters eromheen. Iets slimmer.
  • HMM (Hidden Markov Model): Een "Kettingreactie." De eerste letter beïnvloedt de tweede, die de derde beïnvloedt, enzovoort. Dit is erg slim maar traag, omdat je moet wachten tot de een klaar is voordat de volgende kan beginnen.
  • BTree (Binary Tree): De "Teamoverleg" modus. Dit is de ster van het paper. Stel je voor dat je de 8 letters splitst in twee groepen van 4. Het model raadt de eerste groep en de tweede groep tegelijkertijd, maar ze zijn verbonden door een "teamleider" (een verborgen variabele) die ervoor zorgt dat ze het eens zijn over het algemene thema.
    • Waarom het geweldig is: Het krijgt de intelligentie van de "Kettingreactie" maar de snelheid van de "Willekeurig Raden" omdat het twee dingen tegelijk doet.

3. Het Veiligheidsnet: "Speculative Decoding"

Je zou je kunnen afvragen: "Als de AI een heel blok in één keer raadt, wat als het fout gaat?"

Het paper gebruikt een techniek genaamd Speculative Decoding.

  • De Analogie: Stel je een snelle hardloper voor (het Draft Model) en een trage, uiterst nauwkeurige rechter (de Verifier).
    1. De snelle hardloper sprint vooruit en raadt de volgende 8 letters.
    2. De trage rechter controleert ze één voor één.
    3. Als de rechter het eens is met de gok van de hardloper, geweldig! We houden die letters aan.
    4. Als de rechter het er niet mee eens is, stoppen we direct daar, gooien de slechte gokken weg en houden alleen de letters over die de rechter heeft goedgekeurd.

Omdat het Draft Model (MTPC) zo goed is in het begrijpen van hoe letters met elkaar verbonden zijn (dankzij de BTree-circuit), is de rechter veel vaker het eens met de hardloper dan voorheen. Dit betekent dat we meer van de snelle gokken kunnen behouden, wat het hele proces versnelt.

4. De Resultaten: Versnellen zonder de boel te breken

De auteurs hebben dit getest op twee specifieieve AI-modellen:

  1. EvaByte: Een model dat al in bytes schrijft.
  2. Llama 3.2 3B (Byte): Een populair model dat is omgezet om in bytes te schrijven.

De Bevindingen:

  • Massale Versnelling: Vergeleken met de oude "één letter tegelijk" methode, maakte MTPC EvaByte 5,15 keer sneller en Llama 2,24 keer sneller.
  • Beter dan de "Onafhankelijkheid" Truc: Zelfs vergeleken met andere snelle methoden die simpelweg letters onafhankelijk van elkaar raden, was MTPC 1,17 keer sneller.
  • Geen Kwaliteitsverlies: Cruciaal is dat, dankzij het "Veiligheidsnet" (Speculative Decoding), de uiteindelijke output exact dezelfde kwaliteit heeft als wanneer de AI het één letter tegelijk had geschreven. Je verliest geen nauwkeurigheid voor snelheid.

Samenvatting

Het paper presenteert een nieuwe manier om AI-tekstgeneratie sneller te maken door de AI te leren om blokken tekst als een verbonden groep te raden in plaats van geïsoleerde letters. Door een slimme "Binary Tree" structuur (BTree) te gebruiken om deze gokken te organiseren en een "Rechter" in te zetten om ze te verifiëren, hebben ze een enorme snelheidswinst behaald (tot wel 5x) terwijl ze garanderen dat de tekst perfect blijft. Het is alsof je een typist leert om hele woorden in één keer te typen, maar dan met een veiligheidsnet dat typefouten direct vangt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →