← Nieuwste papers
💬 NLP

Token-Native Storage: Read and Write in your Agent's Language

Dit artikel pleit voor "token-native opslag", een paradigma waarbij tekst direct wordt opgeslagen als BPE-token-ID's in plaats van UTF-8-tekens, met het argument dat deze aanpak de opslaggrootte aanzienlijk verkleint en lees-/schrijfacties voor AI-agenten versnelt door de noodzaak van herhaalde vertaling en re-tokenisatie te elimineren.

Oorspronkelijke auteurs: Kumar Shivendu

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kumar Shivendu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De taal van machines versus de taal van mensen

Stel je voor dat je een superintelligënte robot probeert te leren om een bibliotheek te lezen. De boeken zijn geschreven in een menselijke taal, met letters en woorden die wij kunnen zien en begrijpen. Maar de robot "ziet" geen letters; hij ziet getallen. Voor de robot is het woord "cat" helemaal geen woord; het is een specifieke code, zoals een geheim ID-nummer. Dit is hoe moderne kunstmatige intelligentie werkt: het verwerkt tekst door deze op te delen in piepkleine stukjes die "tokens" worden genoemd en elk stukje een uniek nummer toe te kennen.

Decennialang hebben computers tekst opgeslagen zoals mensen het schrijven: als reeksen letters (zoals UTF-8). Dit is geweldig voor ons, maar het is een beetje onhandig voor robots. Elke keer dat een robot een boek uit de bibliotheek wil lezen, moet hij de menselijke letters vertalen naar zijn eigen geheime getallen, zijn werk doen, en de getallen vervolgens weer terugvertalen naar letters om het aan ons te tonen. Dit vertaalproces kost tijd en ruimte, een beetje alsof je een boek telkens opnieuw in een vreemde taal moet vertalen telkens wanneer je slechts één pagina wilt lezen. Nu robots steeds meer lezen en schrijven in onze digitale wereld, wordt deze constante vertaling een flessenhals, wat alles vertraagt en extra ruimte in beslag neemt.

Het grote idee van het artikel: Stop met vertalen, begin met "Robot" spreken

Dit artikel, getiteld "Token-Native Storage", betoogt dat we moeten stoppen met het dwingen van robots om menselijke tekst te vertalen elke keer dat ze toegang krijgen tot een database. In plaats daarvan stelt de auteur voor om de tekst precies zo op te slaan als de robot deze ziet: als een lijst met token-nummers. Ze noemen dit "Token-Native Storage".

Denk er zo over na: Momenteel zijn onze digitale bibliotheken als een museum waar elk schilderij is ingepakt in een beschermend, voor mensen leesbaar label. Om het schilderij aan een robot te tonen, moeten we het label uitpakken, het label vertalen naar robot-code, de robot laten kijken, en het dan weer inpakken. De auteur stelt een nieuw soort museum voor waar de schilderijen al in de natuurlijke taal van de robot hangen. Wanneer de robot binnenloopt, kan hij direct naar de kunst kijken zonder enige verpakking of vertaling.

Wat ze ontdekten:
De onderzoeker testte dit idee en kwam tot de conclusie dat het opslaan van tekst als token-nummers niet alleen sneller is, maar ook minder ruimte inneemt dan het opslaan als letters.

  • Snelheid: Wanneer een robot leest uit dit nieuwe type opslag, slaat hij de vertaalstap volledig over. Het artikel mat dit als ongeveer 10 tot 600 keer sneller dan de oude methode, afhankelijk van de taak. Het is het verschil tussen wachten tot een vertaler een zin heeft afgemaakt en gewoon de gedachte direct horen.
  • Ruimte: Omdat token-nummers kleine gehele getallen zijn (zoals 1, 2, 3) in plaats van lange reeksen letters, zijn ze van nature compacter. Zelfs zonder gebruik te maken van speciale compressietechnieken, bespaart het simpelweg bij elkaar pakken van deze getallen al ruimte. Voor Engelse tekst was deze ruwe verpakking alleen al 2,25 keer kleiner dan standaard tekstopslag. Toen ze een simpele compressietechniek toevoegden (het herordenen van de getallen zodat de meest voorkomende de kleinste zijn), konden ze de data nog verder verkleinen, wat resulteerde in een omvang die 3,30 keer kleiner was dan standaard tekst.

Waar ze tegen pleiten:
Het artikel voert expliciet argumenten aan tegen de huidige standaard van het opslaan van tekst als menselijk leesbare letters (UTF-8) voor systemen waarbij robots de primaire lezers en schrijvers zijn. Ze wijzen erop dat het bewaren van de tekst in menselijk formaat het systeem dwingt om bij elke enkele lees- en schrijfoperatie een "vertaalbelasting" te betalen. Ze zijn ook tegen het idee dat we complexe, zware compressie-algoritmen nodig hebben om ruimte te besparen; ze vonden dat het simpelweg veranderen van hoe de token-nummers worden geordend (op basis van frequentie in plaats van wanneer ze werden ontdekt) zeer snelle decodering mogelijk maakt zonder dat er trage, complexe decompressie-instrumenten nodig zijn.

Hoe zeker zijn ze?
De auteur is zeer zelfverzekerd over hun metingen. Ze hebben niet alleen gegokt; ze hebben tests uitgevoerd op echte gegevens, waaronder Engelse artikelen, computercode en Hindi-tekst. Ze vergeleken hun nieuwe methode met de beste bestaande compressietools (zoals zstd en gzip) en vonden dat hun token-native benadering consequent beter presteerde of gelijkwaardig was aan hen, zowel in snelheid als in omvang. Ze maten de tijd die nodig is om gegevens te lezen en te schrijven in microseconden (miljoensten van een seconde), waarmee ze lieten zien dat het snelheidsverschil echt en aanzienlijk is.

De "Frequentievolgorde" truc

Een van de slimste onderdelen van het artikel is een suggestie voor hoe AI-labs hun token-lijsten zouden moeten organiseren. Momenteel worden token-nummers enigszins willekeurig toegewezen op basis van wanneer de AI ze tijdens de training heeft ontdekt. De auteur ontdekte dat als je deze nummers simpelweg herordent zodat de meest voorkomende woorden de kleinste nummers krijgen (zoals 1, 2, 3) en zeldzame woorden grotere nummers, je de data veel beter kunt comprimeren.

Ze noemen dit de "+freq" methode. Het is als het organiseren van een kast: als je je meest gedragen kleding op de makkelijkst bereikbare planken legt (kleine nummers), bespaar je tijd en ruimte. Door dit te doen, konden ze bijna alle voordelen van complexe compressie behalen, maar met een decodersnelheid die 7 keer sneller is. Ze vragen AI-bedrijven om hun token-lijsten in deze "frequentievolgorde" te publiceren, zodat iedereen kan profiteren van deze gratis snelheidsboost.

De Hindernis: Dezelfde Taal Spreken

Het artikel geeft toe dat er één grote complicatie is. Voor dit systeem om perfect te werken, moet elke robot in het systeem exact dezelfde "token-taal" spreken (dezelfde vocabulaire gebruiken). Op dit moment gebruiken verschillende AI-modellen vaak verschillende woordenboeken. Als de ene robot een woordenboek gebruikt waar "cat" nummer 500 is, en een andere een woordenboek gebruikt waar "cat" nummer 12 is, kunnen ze de opslag niet gemakkelijk delen.

De auteur suggereert dat de oplossing standaardisatie is, vergelijkbaar met hoe we allemaal hebben afgesproken hetzelfde alfabet (ASCII) of dezelfde karaktercodering (UTF-8) te gebruiken voor menselijke tekst. Als de AI-wereld instemt met een gedeelde "Token-Alfabet", dan kan deze token-native opslag de nieuwe standaard worden, wat onze digitale infrastructuur sneller en goedkoper maakt voor de robots die het draaien.

Kortom, het artikel suggereert dat naarmate robots meer van ons digitale lezen en schrijven overnemen, we moeten stoppen met het opslaan van hun data in menselijk formaat en moeten beginnen met het opslaan in het formaat waarin ze geboren zijn om te lezen. Het is een kleine verandering in hoe we bestanden opslaan, maar het zou in de toekomst een enorme hoeveelheid tijd en geld kunnen besparen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →