Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study
Deze studie benchmarkt zeven foundation-modellen op Oekraïense juridische tekst en onthult dat de efficiëntie van tokenizers de API-kosten aanzienlijk beïnvloedt, dat de NVIDIA Nemotron Super 3 met 120 miljard parameters de grotere Mistral Large 3 overtreft voor een fractie van de kosten, en dat zero-shot prompting superieur is aan few-shot prompting voor deze morfologisch rijke taal.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek met Oekraïense gerechtelijke uitspraken runt. Je wilt een team van superslimme AI-bibliothecarissen (Foundation-modellen) in dienst nemen om deze documenten te lezen, in categorieën in te delen, te bepalen wie de zaak heeft gewonnen en de specifieke genoemde wetten eruit te halen.
Dit artikel is als een rapportkaart die zeven verschillende AI-bibliothecarissen vergelijkt om te zien welke het beste werkt, het minst kost en de minste fouten maakt bij het omgaan met de Oekraïense taal.
Hier is de opsplitsing van hun bevindingen, met behulp van eenvoudige analogieën:
1. De "woord-naar-token"-belasting (Tokenizer-vruchtbaarheid)
Denk aan een AI-model als een vertaler die niet hele woorden leest. In plaats daarvan breekt het elk woord op in kleine puzzelstukjes die "tokens" heten.
- Het probleem: Sommige AI's zijn hier verschrikkelijk slecht in. Ze hakken Oekraïense woorden op in veel te veel kleine stukjes. Het artikel noemt dit "vruchtbaarheid" (hoeveel stukjes een woord oplevert).
- De bevinding: Een familie van AI's (Llama) is zeer efficiënt. Het breekt een woord op in ongeveer 2,4 stukjes. Een andere familie (Qwen) is verspillend en breekt hetzelfde woord op in 3,9 stukjes.
- De analogie: Stel je voor dat je voor een taxirit betaalt op basis van het aantal stappen dat je zet. De "verspillende" AI zet 60% meer stappen om dezelfde bestemming te bereiken. Dit betekent dat je 60% meer geld betaalt om hetzelfde document te lezen.
- Conclusie: Voordat je een AI kiest, controleer hoeveel "stappen" (tokens) het nodig heeft om Oekraïens te lezen. Dit heeft direct invloed op je portemonnee.
2. Groter is niet altijd beter
In de wereld van AI gaan mensen er vaak van uit dat het model met de meeste "hersencapaciteit" (parameters) het slimste is.
- De bevinding: Het artikel testte een gigantisch model (Mistral Large 3) met 675 miljard parameters tegen een kleiner model (NVIDIA Nemotron Super 3) met slechts 120 miljard parameters.
- Het resultaat: Het kleinere model (Nemotron) won eigenlijk. Het behaalde hogere scores op alle drie de taken en kostte een derde zo veel om te draaien.
- De analogie: Het is alsof je een bouwteam van 675 personen huurt om een klein schuurtje te bouwen, terwijl een hoogopgeleid team van 12 personen met betere gereedschappen het werk sneller, goedkoper en van hogere kwaliteit kan doen. De grootte van het team maakte niet uit; de opleiding en de gereedschappen wel.
3. De "voorbeeld"-valkuil (Few-Shot versus Zero-Shot)
Normaal gesproken geef je een mens die een nieuwe taak leert eerst een paar voorbeelden. Bij AI heet dit "few-shot prompting".
- De bevinding: Voor Oekraïense juridische teksten maakte het geven van voorbeelden aan de AI deze vaak dommer. In sommige gevallen daalde de prestatie met 26 procentpunten!
- De analogie: Stel je voor dat je een chef-kok leert een specifiek Oekraïens gerecht te bereiden. Als je hen een foto toont van een iets andere versie van het gerecht, raken ze misschien in de war en vergeten ze het originele recept. De AI werd "geankerd" door de voorbeelden en stopte met het gebruik van zijn eigen kennis van de taal.
- De draai: Het artikel testte of dit kwam doordat de voorbeelden onbalans waren (te veel van het ene type) of doordat de prompt slecht was geschreven. Dat was niet het geval. Zelfs toen ze de voorbeelden en de prompts corrigeerden, werd de AI er nog steeds slechter op.
- Conclusie: Voor het Oekraïens is het vaak beter om gewoon te zeggen: "Hier is het document, vertel me het resultaat", zonder eerst voorbeelden te tonen.
4. De beste strategie: het "specialisten-team"
Omdat geen enkele AI perfect was in alles, stelden de auteurs een "routing"-systeem voor, zoals een verpleegkundige voor triage in een ziekenhuis.
- Taak 1 (Zaken sorteren): Gebruik de goedkoopste, snelste AI (Llama 4 Maverick). Deze is geweldig in eenvoudig sorteren en kost bijna niets.
- Taak 2 (Winnaars bepalen): Gebruik de slimste AI (NVIDIA Nemotron). Dit is het moeilijke deel, dus je betaalt iets meer voor de beste hersenen.
- Taak 3 (Wetten vinden): Gebruik een andere AI (Llama 3.3) die echt goed is in het opsporen van specifieke patronen in tekst.
- Het resultaat: Door te mixen en te matchen, behaalden ze de resultaten van de hoogste kwaliteit voor 37% minder geld dan wanneer ze alleen de "beste" enkele AI voor alles hadden gebruikt.
5. Het morele verhaal voor praktici
Als je een legal-tech tool voor Oekraïne bouwt:
- Controleer eerst de "stapenteller": Kijk niet alleen naar de grootte van het model; controleer hoe efficiënt het Oekraïense woorden leest.
- Vertrouw niet op de mythe "groter is beter": Een kleiner, goed getraind model kan een gigantisch model verslaan.
- Sla de voorbeelden over: Voor Oekraïense juridische teksten is het vragen aan de AI om te werken zonder voorbeelden (Zero-Shot) meestal betrouwbaarder dan het geven van voorbeelden.
- Mix je team: Gebruik verschillende AI's voor verschillende taken om geld te besparen en betere resultaten te behalen.
De kosten: De gehele studie, waarbij zeven modellen werden getest op honderden documenten, kostte de onderzoekers in totaal slechts ongeveer 60 dollar aan API-kosten. Dit bewijst dat je geen enorm budget nodig hebt om serieus, hoogwaardig testen van taalmodellen uit te voeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.