← Nieuwste papers
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP is een training-vrije scheduler die de diepte van multi-token voorspelling dynamisch aanpast op basis van lokale generatie-entropie om de inferentie-doorvoer te maximaliseren terwijl de outputkwaliteit behouden blijft, waarbij een versnelling van tot liefst 1,36x wordt bereikt ten opzichte van bestaande baselines.

Oorspronkelijke auteurs: Carrie Chen

Gepubliceerd 2026-06-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Carrie Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te schrijven, maar je hebt een zeer strikte regel: je mag slechts één woord tegelijk schrijven, en na elk enkel woord moet je stoppen, je hele levenswerk controleren om te zien of dat woord perfect is, en dan pas verdergaan. Dit is hoe huidige Large Language Models (LLM's) meestal werken. Het is ongelooflijk nauwkeurig, maar het is ook pijnlijk traag omdat je constant stopt om je werk te controleren.

Om dit te versnellen, hebben onderzoekers een truc uitgevonden genaamd Multi-Token Prediction (MTP). In plaats van één woord te schrijven en te controleren, probeert het model de volgende drie of vier woorden tegelijk te raden, als een conceptversie. Daarna doet het een grote "controle" om te zien hoeveel van die gokken juist waren. Als het drie woorden correct had geraden, bespaart het veel tijd.

Echter, het paper EntMTP wijst op een gebrek in hoe deze truc momenteel wordt gebruikt.

Het Probleem: De "One-Size-Fits-All" Fout

Huidige modellen gebruiken een statische strategie. Stel je voor dat je een auto rijdt. De huidige methode zegt: "No matter of je nu op een gladde snelweg rijdt of op een hobbelige zandweg, je moet altijd je voet op het gaspedaal houden met exact dezelfde snelheid en precies 100 voet vooruit kijken."

  • Op een gladde snelweg (lage entropie): De weg is voorspelbaar. Je zou veilig 100 voet vooruit kunnen kijken en de volgende bochten perfect kunnen raden.
  • Op een hobbelige zandweg (hoge entropie): De weg is chaotisch. Ver vooruit kijken is een verspilling van tijd, want je kunt een kuil of een hert raken. Je zou slechts een paar voet vooruit moeten kijken en voorzichtig moeten rijden.

Bestaande modellen (zoals Hydra en Medusa) kiezen één "kijk-afstand" (een specifieke boomstructuur) voordat ze beginnen en houden daar de hele tijd aan vast. Dit is inefficiënt. Soms raden ze te ver vooruit en verspillen ze energie; andere keren raden ze te weinig vooruit en missen ze een kans om op te trekken.

De Oplossing: EntMTP (De Slimme Co-Piloot)

De auteurs stellen EntMTP voor (Entropy-guided Multi-Token Prediction). Denk aan dit als een slimme co-piloot die constant de wegcondities controleert en de bestuurder vertelt hoe ver hij vooruit moet kijken.

  1. Het lezen van de "Entropie" (De Wegcondities):
    Het model meet constant hoe "verrassend" de volgende woorden zijn.

    • Lage Entropie (Voorspelbaar): De tekst vloeit soepel (bijv. "De zon komt op in de..."). De co-piloot zegt: "Makkelijk! Laten we de volgende 4 woorden raden!"
    • Hoge Entropie (Chaotisch): De tekst is lastig of complex (bijv. een moeilijk wiskundig probleem of een plotselinge plotwending). De co-piloot zegt: "Ho, dit is riskant. Laten we slechts de volgende 1 woord raden om veilig te blijven."
  2. De "Tree Bank" (De Gereedschapskist):
    Voordat het model zelfs begint met schrijven, bereiden de onderzoekers een kleine "bank" van verschillende gokstrategieën (bomen) voor. Sommige zijn groot en agressief (veel woorden raden), en sommige zijn klein en conservatief (weinig woorden raden).

    • Cruciaal is dat ze niet zomaar één kiezen. Ze maken een menu van de beste opties voor verschillende situaties.
  3. De Wisseling (De Versnellingsbak):
    Tijdens het schrijfproces werkt EntMTP als een versnellingsbak.

    • Als de tekst makkelijk is, schakelt het naar een Hoge Versnelling (de grote boom) om vooruit te razen.
    • Als de tekst moeilijker wordt, schakelt het direct naar een Lage Versnelling (de kleine boom) om een crash te voorkomen.
    • De Magie: Schakelen kost bijna geen tijd. Het is slechts een snelle pointer-wissel in het geheugen van de computer, geen zware herbouw.

De Resultaten: Sneller Zonder Kwaliteitsverlies

Het paper testte deze nieuwe "Slimme Co-Piloot" op drie zeer verschillende soorten taken:

  • Coderen (HumanEval): Het schrijven van computerprogramma's.
  • Wiskunde (GSM8K): Het oplossen van basisschool wiskundeproblemen.
  • Chatten (ShareGPT): Het voeren van een gesprek.

De Uitkomst:

  • Snelheid: EntMTP was consequent 9% tot 15% sneller dan de vorige beste methoden (Hydra). In sommige gevallen was het 36% sneller dan oudere methoden.
  • Kwaliteit: Omdat het model zijn werk nog steeds perfect controleert, is de kwaliteit van het schrijven helemaal niet gedaald. Het is also wordt sneller gereden maar arriveer je op exact dezelfde bestemming met dezelfde veiligheid.
  • Efficiëntie: Het bereikte deze versnelling niet door de computer sterker te maken, maar door de computer slimmer te maken over wanneer het ver vooruit moet raden en wanneer het voorzichtig moet zijn.

De Kernboodschap

Denk aan de oude manier als een hardloper die op volle snelheid 100 meter sprint, stopt om zijn veters te strikken, weer 100 meter sprint, en weer stopt, ongeacht of het parcours vlak is of vol hindernissen zit.

EntMTP is de hardloper die naar het parcours kijkt. Als het vlak is, sprint hij hard. Als hij een hindernis ziet aankomen, vertraagt hij net genoeg om er veilig overheen te stappen, om vervolgens direct weer te sprinten. Hierdoor kan hij de race veel sneller voltooien zonder te struikelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →