← Nieuwste papers
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

MARS is een lichtgewicht fijnafstemmingsmethode die autoregressieve modellen in staat stelt om meerdere tokens per doorvoer te genereren zonder architecturale wijzigingen, waardoor de doorvoersnelheid met 1,5 tot 1,7 keer wordt verhoogd terwijl de nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

Gepubliceerd 2026-04-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een slimme computer (een AI) een verhaal schrijft. Normaal gesproken werkt deze AI als een zeer voorzichtig schrijver die één woord per keer schrijft. Hij kijkt naar wat hij al heeft geschreven, denkt na, schrijft het volgende woord, en begint dan pas weer opnieuw met denken voor het woord daarna.

Dit is heel nauwkeurig, maar het kan traag zijn. Stel je voor dat de AI een zin schrijft als "De zon schijnt". Het woord "De" is makkelijk, "zon" is ook makkelijk, en "schijnt" is bijna voorspelbaar. Maar de computer doet toch precies evenveel werk voor elk woord alsof het een heel moeilijk, raadselachtig woord was. Het is alsof je elke stap in een bekende wandeling opnieuw uitrekent, terwijl je eigenlijk gewoon kunt rennen.

MARS is een nieuwe manier om deze AI te trainen, zodat hij meerdere woorden in één keer kan "schrijven" als hij zeker is van zijn zaak.

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het Probleem: De "Eén-woord-per-tijd" Regering

Normaal gesproken is de AI gebonden aan een strikte regel: één vooruitgang, één woord.

  • Speculatie (andere methoden): Andere methoden proberen dit op te lossen door een "stagewerk" (een tweede, kleinere AI) naast de grote AI te zetten. De kleine AI gis wat er komt, en de grote AI controleert het. Dit is als een regisseur die een extra assistent moet inhuren om de tekst te controleren. Het kost meer ruimte en is ingewikkeld.
  • MARS: MARS doet iets slimmers. Het is alsof je de zelfde schrijver een nieuwe vaardigheid leert zonder hem een nieuwe hoed op te zetten of een assistent te geven. Je leert hem gewoon om, als hij zeker weet wat er komt, een hele zin of een paar woorden in één keer weg te tikken.

2. Hoe MARS het doet: De "Gok-En-Check" Methode

Stel je voor dat de AI een tekst moet invullen waar sommige woorden ontbreken (vervangen door [MASK] of een zwart vakje).

  • De Oude Methode (Block Diffusion): Sommige eerdere methoden lieten de AI naar voren en achteren kijken om de ontbrekende woorden te raden. Dit verwarde de AI, omdat hij opeens niet meer "van links naar rechts" schreef, maar als een puzzel oploste. Hierdoor werd hij dommer in logisch denken.
  • De MARS Methode: MARS zegt: "Nee, we blijven strikt van links naar rechts schrijven, net als altijd."
    • De AI krijgt een zin met een paar zwart vakjes aan het einde.
    • Hij kijkt naar wat er al staat.
    • Als hij denkt: "Ah, dit is heel voorspelbaar!", dan schrijft hij alle ontbrekende woorden in één keer in.
    • Als hij denkt: "Hmm, dit is lastig", dan schrijft hij maar één woord en kijkt hij opnieuw.

Het is alsof je een boek leest. Bij bekende zinnen (zoals "Hij ging naar...") lees je de rest van de zin in je hoofd in één flits. Bij moeilijke zinnen (zoals een wiskundig probleem) lees je woord voor woord. MARS leert de AI om die "flits" te gebruiken waar hij kan.

3. Het Geheim: De "Twee-in-Één" Training

Een groot probleem bij het leren van meervoudige woorden is dat de AI zijn originele vaardigheid (één woord per keer) kan vergeten.

  • De Oplossing: MARS gebruikt een slimme truc tijdens het trainen. Het laat de AI twee dingen tegelijk doen:
    1. Hij schrijft de tekst normaal (één woord per keer) om zijn basisvaardigheid te behouden.
    2. Tegelijkertijd probeert hij de zwart vakjes in te vullen om de snelheid te leren.
  • Analogie: Het is alsof je een pianist traint. Je laat hem oefenen op een stuk waarbij hij alle noten één voor één speelt (voor de precisie), maar ook een stuk waarbij hij akkoorden mag spelen (voor de snelheid). Zo wordt hij niet alleen sneller, maar vergeet hij ook niet hoe hij de noten correct moet spelen.

4. De Resultaten: Sneller zonder Dommer te Worden

  • Kwaliteit: Als de AI in de "normale modus" werkt (één woord per keer), is hij net zo goed als de originele AI. Soms zelfs beter, omdat het trainen met de "gok-methode" hem slimmer maakt.
  • Snelheid: Als de AI in de "snelle modus" werkt, accepteert hij 1,5 tot 1,7 keer meer woorden per seconde.
  • Flexibiliteit: Het systeem kan tijdens het werken worden aangepast. Als er veel mensen tegelijk een vraag stellen, kan de server de AI zeggen: "Wees iets minder voorzichtig, neem meer woorden in één keer!" zonder de AI opnieuw te hoeven installeren.

Samenvattend

MARS is als het geven van een snelheidsboost aan een slimme schrijver zonder zijn intelligentie te verliezen.

  • Geen extra apparatuur nodig.
  • Geen ingewikkelde extra systemen.
  • Gewoon een slimme hersenslag die de AI leert: "Als je het zeker weet, tik dan een hele zin weg. Als je twijfelt, tik dan één woord."

Dit maakt AI-chatbots en schrijfhulpen veel sneller, vooral als ze veel tekst moeten genereren, terwijl ze net zo slim blijven als voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →