← Nieuwste papers
💬 NLP

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

Dit artikel introduceert MoganBert-TR, een Turks encoder-fundamentmodel met 149 miljoen parameters dat vanaf nul is getraind met behulp van een nieuw CLM-naar-MLM-curriculum en gespecialiseerde long-context scheduling, wat een state-of-the-art prestatie bereikt op Turkse NLP-benchmarks en een uiterst efficiënt embeddingmodel oplevert dat 99,5% van de score van zijn 7,57 miljard parameters tellende leraar bereikt.

Oorspronkelijke auteurs: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

Gepubliceerd 2026-08-27
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het uitgestrekte landschap van kunstmatige intelligentie zijn er twee hoofdwijzen waarop computers leren menselijke taal te begrijpen. Eén benadering, die vaak in het nieuws komt, betreft modellen die tekst genereren, waarbij ze verhalen schrijven of vragen beantwoorden vanuit het niets. De andere, stillere maar even vitale benadering, gebruikt modellen die fungeren als krachtige zoekmachines en classificatiemodellen. Deze "encoder"-modellen lezen een zin en zetten deze om in een compacte wiskundige samenvatting, waardoor computers ideeën kunnen vergelijken, relevante documenten kunnen vinden of informatie met ongelooflijke snelheid kunnen sorteren. Jarenlang was de standaardmethode om deze modellen te onderwijzen een specifiek type raadspel: de computer ziet een zin met enkele verborgen woorden en moet de ontbrekende delen voorspellen. Deze methode, bekend als masked language modeling, heeft goed gewerkt, maar onderzoekers vroegen zich al lang af of er een betere manier is om de machine de structuur van een taal te leren, vooral voor talen die complex en rijk zijn aan woordvormen, zoals het Turks.

Een team van onderzoekers heeft nu een nieuw fundament gebouwd voor het begrip van de Turkse taal, waarbij zij hebben aangetoond dat de manier waarop een model wordt onderwezen even belangrijk is als de architectuur waarop het is gebouwd. Ze creëerden een model genaamd MoganBert-TR, dat vanaf de grond af aan is getraind op een enorme collectie Turkse teksten. In plaats van vast te houden aan het traditionele raadspel, introduceerden ze een leercurriculum van twee fasen. Eerst leerde het model tekst van links naar rechts te lezen, waarbij het het volgende woord in een sequentie voorspelde, net zoals een mens een boek leest. Pas na deze initiële fase schakelden ze over naar de traditionele methode van het verbergen van woorden en het vragen om de gaten in te vullen. Deze verschuiving in onderwijsstrategie, gecombineerd met een zorgvuldig schoongemaakte dataset en een nieuwe manier om met lange zinnen om te gaan, resulteerde in een model dat de Turkse taal beter begrijpt dan eerdere versies, met name wanneer het gaat om het vinden van relevante informatie in grote databases.

De onderzoekers begonnen met het verzamelen van een enorme hoeveelheid tekst van het internet, inclusief recente webpagina's en oudere archieven, maar ze gooiden deze data niet simpelweg in het trainingssysteem. Ze bouwden een geavanceerde pijplijn om kwalitatief lage inhoud, zoals spam of repetitieve advertenties, eruit te filteren en om te garanderen dat de tekst werkelijk nuttig was. Omdat er geen bestaand hulpmiddel was om automatisch de kwaliteit van Turkse tekst te beoordelen, trainden ze een kleiner, gespecialiseerd model om als leraar te fungeren, dat vervolgens een sneller systeem leerde hoe het dezelfde kwaliteitsoordelen kon vellen. Dit stelde hen in staat om miljoenen documenten efficiënt te verwerken, waarbij alleen het hoogwaardige materiaal werd behouden. Ze creëerden ook een nieuw woordenboek voor het model, een dat Turkse woorden efficiënter in kleinere stukjes opbreekt dan eerdere pogingen, wat cruciaal is omdat Turkse woorden aanzienlijk van vorm kunnen veranderen afhankelijk van hun rol in een zin.

De kern van hun ontdekking ligt in de volgorde van handelingen tijdens de training. Ze testten of het starten met de links-naar-rechts voorspellingsmethode vóór het overschakelen naar de methode van het verbergen van woorden een verschil maakte. In een gecontroleerd experiment met dezelfde hoeveelheid rekenkracht en dezelfde data, presteerde de nieuwe tweefasenbenadering aanzienlijk beter dan de traditionele methode wanneer het aankwam op het ophalen van informatie. Terwijl beide methoden vergelijkbaar presteerden op eenvoudige classificatietaken, was de nieuwe benadering bijna vier keer beter in het vinden van relevante documenten in een zoektest. De onderzoekers ontdekten dat de traditionele methode ervoor zorgde dat de interne representaties van het model inklapten tot een smalle, onnutte vorm, waarbij alle betekenissen te veel op elkaar leken. Het nieuwe curriculum voorkwam deze inkapping, waardoor het model een breder, meer onderscheidend beeld van de betekenis van taal kon behouden.

Om het model verder te verfijnen, experimenteerden de onderzoekers met hoe de computer leerde tijdens de laatste stadia van de training. Ze splitsten het proces op in twee paden: één waarbij het model doorging met het leren met korte zinnen, en een andere waarbij het leerde met veel langere zinnen. Door de resultaten van deze twee paden te vergelijken, ontdekten ze dat het voltooien van de training met kortere zinnen de algehele prestaties van het model meer verbeterde dan het voltooien met lange zinnen. Deze bevinding was verrassend, aangezien er vaak van wordt uitgegaan dat langere contexten beter zijn. Ze testten ook een techniek genaamd "model soup", waarbij ze de gewichten van verschillende getrainde modellen samenvoegden, in de hoop het beste van beide werelden te krijgen. Echter, hun eenvoudige vertakkingsmethode, die slechts een fractie meer kostte om uit te voeren, leverde een beter resultaat op dan de complexe gemiddelde techniek.

Het eindproduct, MoganBert-TR, behaalde de hoogste score onder de Turkse modellen gebaseerd op de moderne architectuur die in deze studie werd gebruikt. Het presteerde uitzonderlijk goed op taken die te maken hebben met code-retrieval, het vinden van de juiste fragmenten van programmeercode vanuit natuurlijke taalbeschrijvingen, een taak waarbij het oudere modellen aanzienlijk overtrof. Deze success werd toegeschreven aan de combinatie van hun nieuwe woordenboek, dat de tussenruimtes en structuur van code behield, en de bewuste inclusie van een grote hoeveelheid programmeertekst in de trainingsdata. Het team creëerde ook een begeleidend model dat specifief is ontworpen voor het maken van zoekvriendelijke samenvattingen van tekst. Door dit kleinere model te leren om een veel grotere, krachtigere leraar na te bootsen, bereikten ze een resultaat dat bijna net zo goed was als de gigantische leraar, maar waarbij vijftien keer minder rekenkracht nodig was om te draaien.

Het werk benadrukt dat voor talen zoals het Turks, het simpelweg updaten van de structuur van een model niet voldoende is; de trainingsmethode zelf moet opnieuw worden bedacht. De onderzoekers toonden aan dat een tweefasen-curriculum, beginnend met sequentiële voorspelling en overgaand naar woordmaskering, een robuuster begrip van de taal creëert. Ze toonden ook aan dat de laatste stadia van de training een kritieke ontwerpplek zijn waar kleine veranderingen, zoals de lengte van de te verwerken tekst, een meetbare impact kunnen hebben op de prestaties. Hoewel het model nog steeds enkele zwakheden heeft op specifieke gebieden, zoals het begrijpen van zinsstructuur in bepaalde grammaticale tests, vertegenwoordigt het een belangrijke stap voorwaarts. Het team heeft hun model, het woordenboek en de code die gebruikt is om het te bouwen, publiekelijk beschikbaar gesteld, zodat anderen voort kunnen bouwen op dit fundament voor Turkse taaltechnologie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →