The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty
Dit artikel kwantificeert een "tokenizer-taks" over 25 Europese talen en onthult dat niet-Engelse talen, met name het Oekraïens en talen met complexe morfologie, te lijden hebben onder aanzienlijk hogere token-tot-woord-verhoudingen als gevolg van ondervertegenwoordiging in de pre-training-data, terwijl het aantoont dat deze vruchtbaarheidsranglijsten consistent blijven over domeinen heen en dat few-shot-effecten model-intrinsiek zijn in plaats van taalafhankelijk.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een taxirit betaalt. In het Engels rekent de taxi af per "stop" (een woord). Maar in het Oekraïens坚持t de taxichauffeur erop om af te rekenen per "stap" (een klein stukje van een woord). Omdat Oekraïense woorden vaak langer en complexer zijn, moet de chauffeur veel meer stappen zetten om dezelfde bestemming te bereiken. Je betaalt uiteindelijk twee keer zo veel voor exact dezelfde rit, ook al is de afstand niet veranderd.
Dit artikel, geschreven door Volodymyr Ovcharov, gaat over die verborgen "belasting" voor niet-Engelse talen bij het gebruik van AI. Hier is de opsplitsing van wat ze hebben gevonden, met eenvoudige analogieën:
1. De "Stap"-belasting (Tokenizer-fruitbaarheid)
AI-modellen lezen niet hele woorden zoals mensen dat doen. Ze hakken tekst op in kleine stukjes die tokens worden genoemd.
- De Analogie: Stel je een woord voor als een brood.
- Engels: De AI snijdt het brood in grote, dikke plakken. Je hebt slechts 1,2 plakken nodig om één woord weer te geven.
- Oekraïens: De AI gebruikt een bot mes en snijdt hetzelfde brood in kleine, kruimelige stukjes. Het kost 2,7 plakken om één woord weer te geven.
- De Kosten: Omdat AI-bedrijven je per "plak" (token) rekenen, kost het spreken van Oekraïens ongeveer 2,2 keer meer dan het spreken van Engels voor dezelfde hoeveelheid tekst.
- De Hiërarchie: Het artikel mat 25 Europese talen.
- De Goedkope Groep: Engels, Spaans en Frans (1,2 tot 1,7 plakken per woord).
- De Middelste Groep: Duits en Nederlands (1,7 tot 1,9 plakken).
- De Duurdere Groep: Slavische talen zoals Pools en Tsjechisch (2,2 tot 2,5 plakken).
- De Duurste: Oekraïens, Grieks en Maltees (rond de 3,1 plakken).
2. De "Oekraïense Strafe"
De onderzoekers vonden iets verrassends over het Oekraïens. Hoewel Oekraïens, Pools en Tsjechisch allemaal Slavische verwanten zijn met vergelijkbare woordstructuren, is Oekraïens aanzienlijk duurder om te verwerken.
- De Analogie: Stel je twee identieke fabrieken voor. De ene (Pools) heeft een goed gevulde voorraad voorgesneden bakstenen omdat het al lang bouwt. De andere (Oekraïens) moet elke baksteen uit ruwe steen hakken omdat het in het verleden werd genegeerd.
- De Oorzaak: Het artikel toont aan dat Oekraïens 2 tot 6 keer minder trainingsdata heeft in de "bibliotheek" van de AI in vergelijking met Pools of Tsjechisch. Omdat de AI Oekraïense woorden niet vaak genoeg heeft gezien, weet het niet hoe het ze efficiënt kan groeperen. Het blijft ze hakken in kleine, inefficiënte stukjes.
3. De "Eén-maat-voor-Allen"-mes
Het artikel testte of deze "belasting" verandert afhankelijk van waar je het over hebt (bijvoorbeeld juridische contracten versus nieuws versus Wikipedia).
- De Bevinding: Het maakt niet uit. De rangschikking van welke AI "goedkoop" is en welke "duur" blijft precies hetzelfde, of je nu het hebt over voetbal, recht of geschiedenis.
- De Les: Als je een AI test op één type tekst, weet je precies hoeveel het je zal kosten voor elk ander type tekst. Je hoeft het niet elke keer opnieuw te testen.
4. De "Goedkope Truc" (Few-Shot Learning)
AI kan soms een nieuwe taak leren door slechts een paar voorbeelden te zien (zoals het tonen van een voorbeeldvraag en antwoord). De onderzoekers testten of deze "goede truc" anders werkte voor verschillende talen.
- De Bevinding: De truc gaat niet over de taal; het gaat over de persoonlijkheid van de AI (zijn ontwerp).
- Sommige AI's (zoals "Nemotron") worden slimmer wanneer voorbeelden worden getoond, ongeacht of de tekst Oekraïens, Pools of Russisch is.
- Andere AI's (zoals "Maverick") worden juist dommer wanneer voorbeelden worden getoond, wederom ongeacht de taal.
- De Les: Schrijf de verwarring van de AI niet toe aan de taal. Schrijf het toe aan het ontwerp van de AI. Als een AI faalt met voorbeelden in het Engels, zal het waarschijnlijk ook falen met voorbeelden in het Oekraïens.
5. Waarom sommige AI's beter zijn in hakken
De onderzoekers keken onder de motorkap om te zien hoe verschillende AI's de woorden hakken.
- De Goede Hakkers: Sommige AI's (zoals Gemma 2) hakken Oekraïense woorden op natuurlijke "morfemegrenzen" (de betekenisvolle delen van een woord, zoals wortels en uitgangen). Dit is efficiënt.
- De Slechte Hakkers: Andere AI's (zoals Qwen3) hakken woorden op willekeurige plekken, soms zelfs een enkel betekenisvol deel in tweeën. Het is alsof je een sandwich precies door het midden van een augurk snijdt in plaats van tussen de sneetjes brood.
- De Verrassing: Een groter woordenboek (vocabulary) hebben garandeert geen beter hakken. Sommige AI's met enorme woordenboeken hakken Oekraïense woorden nog steeds in kleine, inefficiënte stukjes, omdat ze gewoon niet genoeg Oekraïense voorbeelden in hun trainingsdata hadden om de juiste hakken te leren.
Samenvatting van Aanbevelingen
Het artikel stelt drie eenvoudige regels voor voor iedereen die AI gebruikt met Oekraïens of vergelijkbare talen:
- Verwacht de Belasting: Reken erop dat Oekraïens ongeveer dubbel zo duur zal zijn als Engels.
- Test Eén Keer: Je hoeft de "belasting" maar één keer te meten; deze geldt voor alle onderwerpen.
- Wees Voorzichtig met Voorbeelden: Ga er niet van uit dat het tonen van voorbeelden aan een AI zal helpen. Voor sommige modellen kan het de prestaties juist verslechteren, en dit gebeurt in elke taal.
De Conclusie: De AI-wereld is momenteel gebouwd met een Engelse bias. Totdat de "bibliotheken" van trainingsdata in evenwicht zijn, zullen talen zoals Oekraïens een verborgen "stapbelasting" betalen om alleen maar begrepen te worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.