← Nieuwste papers
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

Het artikel introduceert ModernBERT-TR, een Turkse encoder met 150 miljoen parameters die vanaf nul is voorgetraind op 144,4 miljard tokens met behulp van de ModernBERT-architectuur en een aangepaste tokenizer, die bestaande Turkse baselines aanzienlijk overtreft en grotere gelijktijdige modellen evenaart ondanks dat deze met aanzienlijk minder middelen is getraind.

Oorspronkelijke auteurs: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Gepubliceerd 2026-07-29
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een gigantische, chaotische bibliotheek waar elk boek in een andere taal is geschreven. Lange tijd bouwden de bibliothecarissen (computerwetenschappers) één enorme, superdichte encyclopedie om computers te helpen álle talen tegelijk te begrijpen. Maar wanneer je probeert een specifiek feit over een kleine, specifieke taal in dat enorme boek te vinden, wordt de informatie een beetje wazig. Het is alsof je een fluistering probeert te horen in een overvol stadion; het signaal raakt verloren in het lawaai.

Om dit op te lossen, begonnen onderzoekers kleinere, gespecialiseerde woordenboeken te bouwen voor individuele talen. Het bekendste hiervan voor het Turks werd in 2020 gebouwd. Het was een goed begin, maar het werd gebouwd met oude gereedschappen, zoals een fiets terwijl de rest van de wereld al in sportwagens reed. Ondertussen ging de rest van de wereld over op "Moderne" motoren die sneller konden lezen, langere zinnen konden onthouden en de kronkels van de grammatica veel beter begrepen. De grote vraag was: konden we een gloednieuwe, supersnelle sportwagen specifiek voor het Turks bouwen, met deze moderne tools, zonder een miljardenbudget of een bibliotheek ter grootte van de maan nodig te hebben?

Dit artikel introduceert ModernBERT-TR, een nieuw kunstmatig intelligentiemodel ontworpen om de ultieme "Turkse hersenen" voor computers te zijn. De onderzoekers namen de nieuwste, meest geavanceerde architecturale ontwerpen (de "ModernBERT"-motor) en trainden deze vanaf nul met uitsluitend Turkse tekst. Ze hebben niet alleen een enorme hoeveelheid data op het model afgevuurd; ze hebben zorgvuldig een gebalanceerde mix van hoogwaardige Turkse teksten samengesteld en een op maat gemaakt woordenboek (tokenizer) gebruikt dat specifiek is afgestemd op de unieke manier waarop Turkse woorden worden opgebouwd.

De resultaten zijn verrassend krachtig. Hoewel dit nieuwe model relatief klein is — met ongeveer 150 miljoen "neuronen" (parameters) — presteerde het veel grotere modellen, waaronder sommige met bijna vier keer zoveel neuronen. Bij tests op 11 verschillende Turkse taken, zoals het opsporen van haatzaaiende taal of het begrijpen van filmrecensies, scoorde ModernBERT-TR gemiddeld 60,2%, waarmee het de op één na beste model met een aanzienlijke marge versloeg. Het evenaarde zelfs een concurrent die werd getraind op ongeveer 7 keer meer data (1 biljoen tokens versus de 144,4 miljard tokens van het model) in een volledige fine-tuning test, wat bewijst dat slimme training en een betere architectuur het kunnen winnen van pure datavolume.

De auteurs suggereren dat het geheime ingrediënt niet alleen de grootte van het model was, maar de kwaliteit van de datamix. Ze ontdekten dat het vijf keer herhalen van een specifieke, hoogwaardige Turkse dataset tijdens de training veel belangrijker was dan het aanpassen van andere instellingen zoals de batchgrootte. Kortom, ze hebben een slanke, efficiënte, Turks sprekende machine gebouwd die bewijst dat je niet de grootste hoeft te zijn om de beste te zijn; je moet gewoon het meest moderne en het meest gefocuste zijn. Ze hebben al hun code en het model zelf aan het publiek vrijgegeven, in de hoop een enorme stimulans te geven aan iedereen die technologie probeert te bouwen die Turks spreekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →