← Nieuwste papers
💬 NLP

Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque

Deze studie toont aan dat het fine-tunen van instructie-tuned multilinguale modellen met synthetische instructies en bestaande Baskische corpora leidt tot robuuste modellen voor het Baskisch die zonder echte Baskische instructies concurreren met veel grotere frontier-modellen.

Oorspronkelijke auteurs: Oscar Sainz, Naiara Perez, Julen Etxaniz, Joseba Fernandez de Landa, Itziar Aldabe, Iker García-Ferrero, Aimar Zabala, Ekhi Azurmendi, German Rigau, Eneko Agirre, Mikel Artetxe, Aitor Soroa

Gepubliceerd 2026-03-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Oscar Sainz, Naiara Perez, Julen Etxaniz, Joseba Fernandez de Landa, Itziar Aldabe, Iker García-Ferrero, Aimar Zabala, Ekhi Azurmendi, German Rigau, Eneko Agirre, Mikel Artetxe, Aitor Soroa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Hoe maak je een slimme Basque-sprekende AI, als je geen handleiding hebt?

Stel je voor dat je een zeer intelligente robot wilt bouwen die niet alleen Engels spreekt, maar ook Baskisch (de taal van de Basken in Spanje/Frankrijk). Het probleem? Er zijn maar heel weinig boeken, handleidingen of instructies in het Baskisch beschikbaar om die robot te leren wat hij moet doen. De meeste "trainingsboeken" zijn in het Engels.

De onderzoekers van dit paper hebben een slimme manier bedacht om deze robot (een Large Language Model of LLM) toch Baskisch te leren, zonder dat ze duizenden menselijke instructies hoeven te schrijven. Ze noemen hun project Latxa.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Blinde" Robot

Normaal gesproken leer je een AI door hem duizenden voorbeelden te geven van: "Vraag: Wat is de hoofdstad? Antwoord: Parijs."
Voor talen als Engels of Chinees zijn er miljarden van deze voorbeelden. Voor het Baskisch zijn er bijna geen. De onderzoekers hadden alleen:

  • Een basis-robot die al wat Engels kon (maar geen Baskisch).
  • Een hoop Baskische teksten (nieuws, Wikipedia), maar geen vragen en antwoorden.
  • Een slimme, instructie-georiënteerde robot die al Engels kon (hij wist hoe hij vragen moest beantwoorden).

2. De Oplossing: De "Vertaler" en de "Oefenboeken"

De onderzoekers hebben drie slimme stappen bedacht, die we kunnen vergelijken met het leren van een nieuwe taal voor een student:

  • Stap 1: De Basis (Het "Spreekgebouw")
    Je kunt een robot niet direct vragen om Baskische zinnen te maken als hij de taal nog niet kent. Eerst moeten ze de robot laten "lezen" van alle Baskische teksten die ze konden vinden (nieuws, Wikipedia). Dit is alsof je een student eerst een jaar laat lezen in een taal voordat je hem vraagt om een essay te schrijven. Dit noemen ze Continued Pretraining.

  • Stap 2: De "Magische Vertaler" (Synthetische Instructies)
    Omdat er geen Baskische vragenlijsten waren, gebruikten ze de slimme Engelse robot om die zelf te bedenken!

    • Ze lieten de Engelse robot duizenden vragen bedenken (over wiskunde, coderen, vertalen, etc.).
    • Vervolgens vroegen ze hun eigen, net-geleerde Baskische robot: "Vertaal deze Engelse vragen naar het Baskisch, maar zorg dat het natuurlijk klinkt."
    • Dit is alsof je een vertaler vraagt om een Engelse quiz te vertalen, zodat je die quiz in het Baskisch kunt gebruiken om te oefenen. Ze noemen dit synthetische instructies.
  • Stap 3: De Leermeester (De "Instructie-Model" Back-bone)
    Dit was de grootste verrassing. De onderzoekers dachten eerst: "Laten we de basis-robot eerst Baskisch leren, en dan pas leren hoe hij vragen moet beantwoorden."
    Maar ze ontdekten dat het veel beter werkt om te beginnen met de slimme Engelse robot (die al weet hoe hij vragen moet beantwoorden) en die dan Baskisch te leren.

    • Analogie: Het is makkelijker om een ervaren leraar (die al weet hoe hij les moet geven) te leren een nieuwe taal te spreken, dan om een beginnende student eerst de taal te leren en hem dan te proberen te leren hoe hij een les moet geven. De "instructie-kennis" zit al in het hoofd van de Engelse robot; ze hoefden alleen de "taal" te vervangen.

3. De Resultaten: Een Slimme Baskische Robot

Ze bouwden verschillende versies van hun robot en lieten ze het tegen elkaar opnemen in een "arena" (een soort gevechtshoek) waar echte mensen (1.680 Baskische sprekers!) stemden op wie het beste antwoord gaf.

  • Wat werkte het beste? De robot die begon als een slimme Engelse instructie-robot, die daarna Baskische teksten had gelezen, en die vervolgens geoefend had met de zelf-gegenereerde (synthetische) Baskische vragen.
  • Hoe goed was het? Hun 70-miljard-parameter model (een heel groot brein) deed het bijna net zo goed als de beroemde, dure commerciële modellen van Google (GPT-4o) en Anthropic (Claude), zelfs zonder dat ze ooit menselijk geschreven Baskische instructies hadden gebruikt.
  • De "Baskische" factor: De robot die ze maakten, wist heel veel over lokale Baskische cultuur en geschiedenis, iets waar de grote Amerikaanse modellen vaak minder goed in waren.

4. Waarom is dit belangrijk?

Vroeger dachten mensen dat je voor elke taal duizenden menselijke experts nodig had om een AI te trainen. Dit paper bewijst dat je dat niet nodig hebt.

  • Je hebt alleen een goede basis-robot nodig.
  • Een hoop tekst in die taal.
  • En een slimme manier om die tekst om te zetten in oefeningen.

Dit betekent dat talen die "arm" zijn aan digitale bronnen (zoals het Baskisch, maar ook andere minderheidstalen) eindelijk een eerlijke kans krijgen om een slimme AI te hebben. De onderzoekers hebben al hun code, data en modellen gratis beschikbaar gesteld, zodat iedereen dit kan nabouwen voor andere talen.

Kortom: Ze hebben bewezen dat je een slimme AI voor een "moeilijke" taal kunt maken door slimme vertaalspellen te spelen met bestaande modellen, in plaats van te wachten tot er genoeg menselijke data is. Het is alsof je een genie bent dat een nieuwe taal leert door alleen maar naar films te kijken en die dan zelf te vertalen, in plaats van wachten tot er een schoolboek voor die taal is geschreven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →