Compute Optimal Tokenization
Dit artikel toont aan dat bij compute-optimale taalmodelconfiguraties het aantal parameters evenredig schaalt met de gegevensgrootte gemeten in bytes in plaats van tokens, wat aantoont dat de optimale tokencompressiegraad afwijkt van de standaard BPE en afneemt naarmate de rekenkracht toeneemt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de ultieme kennisbibliotheek bouwt. Je hebt een vast bedrag (je rekenbudget) om deze bibliotheek te bouwen. Je hebt twee hoofdkeuzes:
- Koop een enorm gebouw met miljoenen lege planken (Modelgrootte).
- Koop een enorme stapel boeken om die planken te vullen (Trainingsdata).
Jarenlang vertelden experts bibliothecarissen: "Voor de beste bibliotheek koop je 20 boeken voor elke plank die je bouwt." Maar dit advies had een verborgen gebrek: het ging ervan uit dat elk boek even groot was. In werkelijkheid zijn sommige boeken dikke encyclopedieën, terwijl andere dunne pamfletten zijn.
Dit artikel, getiteld "Compute Optimal Tokenization", betoogt dat we onze boeken in de verkeerde eenheid hebben gemeten. In plaats van "boeken" (tokens) te tellen, zouden we "pagina's" (bytes) moeten tellen.
Hier is de uitleg van hun bevindingen met eenvoudige analogieën:
1. Het "Boekgrootte"-probleem (Compressiegraad)
In de wereld van AI wordt tekst opgedeeld in stukjes die tokens worden genoemd.
- Lage compressie: Stel je voor dat je een zin opdeelt in individuele letters. Je krijgt een enorme stapel kleine snippers (veel tokens).
- Hoge compressie: Stel je voor dat je hele woorden of zelfs zinsdelen groepeert tot één enkel stukje. Je krijgt een kleinere stapel grote stukken (minder tokens).
Het artikel vraagt: Maakt het uit hoe groot onze stukjes zijn?
Het antwoord is ja. De grootte van het stukje (de compressiegraad) bepaalt hoe efficiënt we onze bibliotheek kunnen bouwen.
2. De Zoete Vlek vinden: De "Bytes versus Tokens"-regel
De onderzoekers trainden bijna 1.000 verschillende AI-modellen, waarbij ze de grootte van de stukjes en de grootte van het model aanpasten. Ze ontdekten een nieuwe regel voor de perfecte balans:
- De Oude Regel: "Koop 20 tokens per parameter." (Dit werkt alleen als je tokens een specifieke grootte hebben, zoals standaard BPE-tokens).
- De Nieuwe Regel: "Koop 60 bytes tekst per parameter."
De Analogie:
Stel je je AI-model voor als een chef-kok en de data als ingrediënten.
- Als je de chef kleine, voorgesneden ingrediënten geeft (hoge compressie), kan hij veel maaltijden snel bereiden.
- Als je hem hele groenten geeft (lage compressie), moet hij ze eerst snijden, wat tijd kost.
- Het artikel vond dat, ongeacht hoe je de groenten snijdt, de chef het beste presteert wanneer hij een specifiek gewicht aan ingrediënten (60 bytes) heeft voor elke eenheid van zijn vaardigheid (parameter). Het maakt niet uit of dat gewicht 20 grote stukken is of 100 kleine kruimels; het totale gewicht is wat telt.
3. De "Goudlokje"-compressiegraad
Je zou kunnen denken: "Als ik de stukjes groter maak, bespaar ik meer tijd, dus ik zou ze zo groot mogelijk moeten maken!"
Het artikel zegt: Niet zo snel.
Ze ontdekten dat er een Goudlokje-zone is voor de stukgrootte.
- Te klein: Het model raakt overweldigd door te veel kleine stukjes data.
- Te groot: Het model verliest te veel detail omdat de stukjes te grof zijn.
- Precies goed: Er is een specifieke compressiegraad die het slimste model oplevert voor een bepaald budget.
De Twist: Naarmate je meer geld krijgt (meer rekenkracht), wordt de "Precies goed"-grootte eigenlijk kleiner.
- Analogie: Als je een kleine keuken hebt, wil je misschien voorgesneden groenten om tijd te besparen. Maar als je een enorme, professionele keuken hebt met onbeperkt personeel, kun je misschien liever hele groenten omdat je ze zo efficiënt kunt verwerken dat de extra detail het moeite waard is.
4. Eén maat past niet bij iedereen (Taal is van belang)
De onderzoekers testten dit op verschillende talen (Engels, Hindi, Arabisch, Russisch, enz.). Ze ontdekten dat de "Precies goed"-stukgrootte afhankelijk is van de taal.
- De Analogie: Stel je voor dat je koffers inpakt voor verschillende reizen.
- Voor een reis naar een land waar mensen een taal spreken met zeer compacte woorden (zoals Engels), pak je misschien iets grotere items in.
- Voor een reis naar een land waar woorden langer zijn of andere schriftsystemen gebruiken (zoals Hindi of Arabisch), verandert de "optimale" manier van inpakken.
- Het artikel vond dat populaire AI-tools (zoals Llama 3 of Qwen) vaak een "één-maat-past-bij-aller"-inpakmethode gebruiken. Dit werkt prima voor Engels, maar is vaak te gecomprimeerd voor sommige talen en niet gecomprimeerd genoeg voor andere. Ze pakken in wezen de verkeerde grootte items in voor de specifieke reis.
Samenvatting van Belangrijkste Punten
- Stop met het tellen van tokens, begin met het tellen van bytes. Bij het plannen hoeveel data je aan een AI moet voeren, meet dan de ruwe grootte van de tekst (bytes), niet het aantal stukjes (tokens). De verhouding zou ongeveer 60 bytes tekst per 1 miljoen parameters in het model moeten zijn.
- Er is een perfecte stukgrootte. Tokens te groot of te klein maken schaadt de prestaties. Er is een specifieke "zoete vlek" voor compressie.
- De zoete vlek verandert. Naarmate je krachtigere computers krijgt, moet je eigenlijk iets kleinere stukjes gebruiken (lagere compressie) om de beste resultaten te behalen.
- Taal is van belang. De perfecte stukgrootte is anders voor Hindi dan voor Engels. Huidige AI-modellen gebruiken vaak een algemene instelling die niet optimaal is voor elke taal.
Kortom: Om de slimste AI mogelijk te bouwen, volg niet zomaar de oude regel van "20 tokens per parameter". Pas in plaats daarvan het gewicht van de tekst af op de grootte van het brein, en pas de grootte van de tekststukjes aan op basis van hoeveel rekenkracht je hebt en welke taal je het leert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.