← Nieuwste papers
🤖 machine learning

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

Dit artikel introduceert Scratchpad Patching (SP), een techniek die de rekencapaciteit ontkoppelt van de patchgrootte in byte-niveau taalmodellen door dynamisch tijdelijke scratchpads in te voegen om patchvertraging te mitigeren, waardoor grotere patches mogelijk worden voor verlaagde KV-cache- en rekencosts zonder in te leveren op de modelkwaliteit.

Oorspronkelijke auteurs: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer lang boek te lezen, maar je hebt een strikte regel: je mag alleen naar de tekst kijken in grote stukken, alsof je een handvol pagina's tegelijk pakt. Zo werken moderne "patch-based" AI-modellen. In plaats van woord voor woord (tokens) te lezen, lezen ze byte voor byte (de ruwe computercode voor letters) in groepen die patches worden genoemd.

Het probleem met deze "pak een handvol"-aanpak is een fenomeen dat de auteurs Patch Lag noemen.

Het Probleem: Het "Verouderde" Handvol

Stel je voor dat je een alinea leest. Je pakt een stuk tekst (een patch) om te verwerken.

  • De Laatste Pagina: Wanneer je bij de allerlaatste pagina van dat stuk komt, heb je het volledige beeld van wat je zojuist hebt gelezen. Je kunt een perfecte voorspelling doen over wat er als volgt.
  • De Eerste Pagina: Maar wanneer je op de eerste pagina van datzelfde stuk zit, heb je het overige deel van het stuk nog niet echt gezien! Je bent gedwongen om te gokken op basis van het vorige stuk dat je las.

Als je stukken enorm zijn (zeg maar 16 bytes lang), gokken de eerste 15 bytes op basis van "verouderde" informatie uit het verleden. Hoe groter het stuk, hoe langer deze "lag" duurt, en hoe slechter de AI wordt in het voorspellen van de volgende letter.

Meestal moet je kiezen:

  1. Kleine Stukken: Grote nauwkeurigheid, maar de AI moet veel werk verzetten (traag en duur).
  2. Grote Stukken: Snel en goedkoop, maar de AI maakt meer fouten omdat het te ver vooruit gokt.

De Oplossing: Het "Schraapbord"

De auteurs introduceren een slimme truc genaamd Scratchpad Patching (SP).

Denk het zo: je pakt nog steeds die grote handvol pagina's (patches) om dingen efficiënt te houden. Maar, in je hand heb je een tijdelijk schraapbord.

Terwijl je naar de eerste paar pagina's van het stuk kijkt, maak je snel notities op je schraapbord.

  • De Magie: Deze notities zijn tijdelijk. Je gebruikt ze om je begrip onmiddellijk bij te werken, zodat je betere voorspellingen kunt doen voor de volgende paar pagina's.
  • De Haken en Ogen: Zodra je het stuk hebt afgewerkt en naar het volgende gaat, gooi je het schraapbord weg. Je bewaart het niet in je langetermijngeheugen (de "KV-cache").

Dit stelt de AI in staat om het tempo van grote stukken te hebben (omdat het alleen het eindresultaat van het stuk opslaat) maar het intelligentieniveau van kleine stukken (omdat het zijn kennis halverwege het stuk ververst).

Hoe Weet Het Wanneer Het Het Schraapbord Moet Gebruiken?

De AI gebruikt het schraapbord niet voor elke enkele letter; dat zou te traag zijn. In plaats daarvan gebruikt het een "verkeerslichtsysteem" gebaseerd op Entropie (een chique woord voor "verassing" of "onzekerheid").

  • Lage Verrassing: Als de tekst saai en voorspelbaar is (zoals "de kat zat op de..."), slaat de AI het schraapbord over. Het weet wat er komt.
  • Hoge Verrassing: Als de tekst complex of onvoorspelbaar wordt (zoals een plotselinge variabele-naam in code of een vreemd symbool), activeert de AI het schraapbord. Het zegt: "Wacht, dit is belangrijk! Laat me pauzeren en alles wat ik tot nu toe in dit stuk heb gezien opnieuw evalueren voordat ik de volgende letter gok."

De Resultaten: Het Beste van Beide Werelden

Het artikel toont aan dat deze methode werkt als een magische schakelaar:

  1. Kwaliteit zonder de Kosten: Zelfs bij het gebruik van zeer grote stukken (16 bytes) presteert de AI met schraapborden bijna net zo goed als wanneer het byte voor byte zou lezen.
  2. Geheugenvoordeel: Omdat het schraapbord direct wordt weggegooid, hoeft de AI geen extra geheugen op te slaan. Het houdt de "KV-cache" (het kortetermijngeheugen van de AI) 16 keer kleiner dan een standaard byte-voor-byte-model.
  3. Flexibele Snelheid: Je kunt de "schraapbordschakelaar" na het trainen van het model omhoog of omlaag zetten. Als je wilt dat het supersnel is, zet je de schraapborden uit. Als je wilt dat het slimmer is, zet je ze aan. Je hoeft het model niet opnieuw te trainen om dit te doen.

Samenvattende Analogie

Stel je voor dat je een kok bent die een enorme stoofpot kookt.

  • Oude Manier (Standaard Patching): Je proeft de stoofpot slechts één keer elke 10 minuten. Als je op minuut 1 een pittig ingrediënt toevoegt, proef je het pas weer op minuut 10. Tegen die tijd kan de smaak misschien al verkeerd zijn.
  • Nieuwe Manier (Scratchpad Patching): Je neemt nog steeds elke 10 minuten een volledige "officiële" proef om het recept te loggen. Maar ertussenin doop je een lepel in zodra de geur drastisch verandert (hoge entropie) om je kruiden direct aan te passen. Je gooit de lepel weg na het proeven, zodat je geen miljoen lepels hoeft te wassen (geheugen), maar je stoofpot smaakt perfect.

Het artikel bewijst dat door deze tijdelijke "proefmomenten" (schraapborden) toe te voegen, je een enorme pot stoofpot (lange tekst verwerken) snel, goedkoop en met perfecte smaak kunt koken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →