← Nieuwste papers
💬 NLP

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

Dit artikel toont aan dat het combineren van voortgezette pretraining met door het Ests verrijkte meertalige replay en lichtgewicht post-training alignment de Estse taalvaardigheden in meertalige LLM's aanzienlijk verbetert, terwijl de Engelse prestaties en algemene redeneervaardigheden effectief behouden blijven.

Oorspronkelijke auteurs: Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

Gepubliceerd 2026-08-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter veel van de meest geavanceerde kunstmatige intelligentie-instrumenten van vandaag, in staat om verhalen te schrijven, problemen op te lossen en vragen te beantwoorden. Deze systemen worden getraind op enorme hoeveelheden tekst van het internet, waarbij ze patronen van menselijke taal leren door miljarden voorbeelden te lezen. Echter, de data die wordt gebruikt om hen te onderwijzen, is zwaar scheefgetrokken naar het Engels. Omdat het Engels de digitale wereld domineert, worden deze modellen experts in het Engels, terwijl ze vaak moeite hebben met kleinere talen zoals Ests, die een veel kleinere digitale representatie hebben. Deze onbalans betekent dat terwijl een AI een perfect essay in het Engels kan schrijven, het verwarrende of incorrecte tekst kan produceren wanneer het wordt gevraagd hetzelfde in het Ests te doen. Onderzoekers werken nu aan het oplossen van deze kloof, door te vragen of het mogelijk is om deze krachtige, Engels-zware modellen een nieuwe taal te leren zonder de vaardigheden die ze al bezitten te breken.

Een team van onderzoekers uit Estland zette zich af om deze vraag te beantwoorden door een gespecialiseerde versie van een groot taalmodel te creëren die is afgestemd op de Estse taal. Ze begonnen met twee bestaande modellen: één die zwaar was getraind op Engelse data en een andere die al enigszins bekend was met vele talen. De onderzoekers hebben niet een nieuw model vanaf nul opgebouwd. In plaats daarvan namen ze deze bestaande systemen en gaven ze een gerichte "heropvoeding" met een specifieke mix van data. Eerst stelden ze de modellen bloot aan een grote hoeveelheid Estse tekst, inclusief literatuur, academische teksten en webcontent, om een fundament van taalbeheersing op te bouwen. Om ervoor te zorgen dat de modellen niet vergaten hoe ze moesten redeneren of andere onderwerpen moesten begrijpen, mengden ze tijdens deze trainingsfase Engelse tekst, code en wiskundige problemen. Dit proces, bekend als voortgezette pretraining, stelde de modellen in staat om Ests te leren terwijl hun algemene intelligentie intact bleef.

Na deze initiële training verfijnden de onderzoekers de modellen om ze beter te laten worden in het opvolgen van instructies, een cruciale vaardigheid voor chatbots en assistenten. Ze leerden de modellen hoe ze op gebruikersopdrachten moesten reageren in zowel het Ests als het Engels, gebruikmakend van een mix van echte menselijke gesprekken en synthetische voorbeelden. Een belangrijke stap in hun proces betrof een techniek genaamd chat vector merging. Stel je een model voor als een student die een nieuwe taal heeft geleerd, maar vergeten is hoe hij beleefd moet spreken of complexe regels moet volgen. De onderzoekers namen de "kennis" van het opvolgen van instructies van de originele Engelse versie van het model en mengden deze in hun nieuwe, op het Ests getrainde versie. Dit stelde het eindproduct in staat om vloeiend Ests te spreken terwijl het het vermogen behield om instructies duidelijk op te volgen in beide talen.

De resultaten van dit experiment waren verrassend en significant. Voordat de training begon, presteerde het model dat al meertalig was beter op Estse taken dan het model dat primair gericht was op het Engels. Echter, na het aanpassingsproces keerde de situatie om. Het model dat begon met een sterke Engelse basis vertoonde veel grotere verbeteringen in het Ests en presteerde uiteindelijk beter dan het meertalige model. Dit sugggeert dat het startpunt van een model in een specifieke taal niet noodzakelijkerwijs voorspelt hoe goed het die taal later zal leren. De onderzoekers ontdekten dat de aangepaste modellen grammatica konden begrijpen, tekst konden vertalen en logische puzzels in het Ests konden oplossen veel beter dan voorheen. Ze testten deze modellen ook in een publiek domein waar menselijke gebruikers met hen konden chatten en stemden op het beste antwoord. De nieuwe Estse modellen scoorden hoog en concurreerden succesvol met veel grotere en complexere systemen.

De studie onthulde ook belangrijke beperkingen aan hoe deze modellen leren. De onderzoekers testten of het herhaaldelijk doorlopen van de Estse trainingsdata de modellen zou helpen beter te leren, een methode die andere studies hebben gebruikt. Ze vonden dat voor deze omvang van het model, het een tweede keer doorlopen van de data geen echt voordeel bood en simpelweg een verspilling van rekenkracht was. Eén trainingscyclus was voldoende. Bovendien ontdekten de onderzoekers dat hoewel de modellen uitstekend werden in het Ests, er een lichte trade-off was: hun vermogen om instructies in het Engels op te volgen daalde licht. Echter, de chat vector merging-techniek herstelde het grootste deel van deze verloren Engelse vaardigheid, wat bewees dat het mogelijk is om een model te specialiseren voor een kleinere taal zonder de algemene capaciteiten op te offeren.

Dit werk biedt een duidelijke weg vooruit voor het verbeteren van kunstmatige intelligentie in talen die vaak over het hoofd worden gezien. Door zorgvuldig nieuwe taaldata te mengen met bestaande kennis en slimme technieken te gebruiken om verschillende modelgedragingen te mengen, kunnen onderzoekers krachtige instrumenten voor specifieke gemeenschappen creëren zonder vanaf nul te hoeven beginnen. De bevindingen suggereren dat de meest effectieve manier om een groot taalmodel aan te passen niet is om te beginnen met een model dat de taal al kent, maar om een model te nemen dat sterk is in algemeen redeneren en het de nieuwe taal te leren met een gebalanceerd dieet aan data. De resulterende modellen zijn nu beschikbaar voor anderen om te gebruiken, wat een hoogwaardige, native-niveau ervaring biedt voor Estse sprekers terwijl de robuustheid van een wereldwijde intelligentie behouden blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →