← Nieuwste papers
💬 NLP

EuroLLM-22B: Technical Report

Dit artikel introduceert EuroLLM-22B, een groot taalmodel dat vanaf de basis is getraind om 35 talen te ondersteunen (inclusief alle 24 officiële EU-talen), waarmee de ondervertegenwoordiging van Europese talen in bestaande modellen wordt aangepakt, terwijl het concurrerende prestaties behaalt in redeneren, instructieopvolging en vertaling, waarbij alle gerelateerde datasets, modellen en code zijn vrijgegeven om toekomstig onderzoek te ondersteunen.

Oorspronkelijke auteurs: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Ma
Gepubliceerd 2026-02-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

EuroLLM-22B: De Meertalige Bibliothecaris van Europa

Stel je de wereld van Kunstmatige Intelligentie voor als een enorme bibliotheek. Een lange tijd werd deze bibliotheek gedomineerd door boeken die in het Engels zijn geschreven. Als je naar binnen zou lopen en zou vragen om een verhaal in het Frans, Duits of Portugees, zou je misschien een paar boeken vinden, maar dat waren vaak vertalingen van Engelse verhalen of geschreven door auteurs die de lokale cultuur niet volledig begrepen.

EuroLLM-22B is een nieuw, grootschalig project dat is ontworien om dit op te lossen. Het is een "Large Language Model" (denk aan een superintelligente, digitale bibliothecaris) dat vanaf de basis is gebouwd om specifiek te spreken, te begrijpen en te redeneren in alle 24 officiële talen van de Europese Unie, plus 11 andere belangrijke talen zoals Arabisch, Chinees en Japans.

Hier is hoe het team deze digitale bibliothecaris heeft gebouwd, uitgelegd in eenvoudige termen:

1. Het Blauwdruk (De Architectuur)

Voordat je een huis bouwt, heb je een blauwdruk nodig. Het team heeft niet zomaar een bestaand ontwerp gekopieerd; ze hebben de blauwdruk aangepast om een enorme hoeveelheid informatie te kunnen verwerken.

  • De Grootte: Dit model heeft 22 miljard "neuronen" (parameters). Om een analogie te gebruiken: als de vorige versie (9B) een slimme middelbare scholier was, dan is deze versie een ervaren hoogleraar met een zeer groot geheugen.
  • Het Lange Geheugen: Een van de grootste upgrades is het "contextvenster". Stel je voor dat je een roman probeert te lezen. Oudere modellen konden zich alleen de laatste paar pagina's herinneren voordat ze het begin vergaten. EuroLLM-22B kan 32.000 woorden tegelijk in zijn hoofd houden. Het kan een heel kort verhaal of een lang juridisch document lezen en de details van de eerste pagina tot de laatste onthouden zonder de draad kwijt te raken.

2. Het Trainingsdieet (De Data)

Je kunt geen geweldige chef maken met slechte ingrediënten. Het team was erg kieskeurig over het "voedsel" dat ze het model tijdens de training gaven.

  • De Filter: Ze hebben niet simpelweg het hele internet in het model gedumpt. Ze gebruikten een speciale filter (genaamd EuroFilter) om de kwaliteit van de tekst te beoordelen, waarbij ze een score van 0 tot 5 gaven. Ze gooiden de troep weg (zoals willekeurige code of websites van lage kwaliteit) en hielden alleen de hoogwaardige educatieve en literaire inhoud over.
  • De Fasen: Ze trainden het model in drie stadia, zoals een student die door de schoolgaat:
    1. Basisonderwijs: Ze begonnen met een enorme hoeveelheid algemene data om de basis te leren.
    2. Middelbare School: Ze introduceerden kwalitatief hogere data om het redeneervermogen te verfijnen.
    3. Universiteit: In de laatste fase voerden ze de allerbeste beschikbare data in, inclus bij complexe wiskunde, programmeren en vertaalde boeken, om de intelligentie aan te scherpen.
  • De Taalmengeling: In tegen tegenstelling tot andere modellen die sterk op Engels gericht zijn, kreeg EuroLLM-22B vanaf dag één een gebalanceerd dieet van alle Europese talen, zodat het geen voorkeur heeft voor de een boven de ander.

3. De Laatste Afwerking (Instruction Tuning)

Nadat het model de feiten had geleerd, moest het leren hoe het zich moest gedragen. Dit wordt "post-training" genoemd.

  • Het Klaslokaal: Het team gebruikte een nieuwe dataset genaamd EuroBlocks. Stel je dit voor als een enorme collectie oefenvragen en antwoorden die alles beslaan van "Schrijf een gedicht over regen" tot "Los dit wiskundige probleem op" en "Vertaal deze zin".
  • De Docent: Ze gebruikten andere geavanceerde AI-modellen om hoogwaardige antwoorden op deze vragen te generen, en selecteerden vervolgens de beste antwoorden om EuroLLM-22B te leren hoe het instructies nauwkeurig moet opvolgen. Ze verwijderden alle "redeneersporen" (de interne monoloog) om de uiteindelijke output helder en direct te maken.

4. Het Rapportcijfer (De Resultaten)

Het team heeft EuroLLM-22B getest tegen andere beroemde AI-modellen om te zien hoe het presteerde.

  • De Competitie: Ze vergeleken het met andere "volledig open" modellen (modellen waarvan de code en gewichten gratis beschikbaar zijn voor iedereen) en sommige "open-weight" modellen (waarbij je het model kunt gebruiken, maar niet kunt zien hoe het is gebouwd).
  • De Uitkomst:
    • Europese Kampioen: Onder de volledig open modellen die in Europa zijn gemaakt, is EuroLLM-22B de sterkste. Het presteerde beter dan andere Europese modellen, zelfs die die veel groter waren (zoals een model met 70 miljard parameters).
    • Vertaling: Het is uitstekend in het vertalen tussen talen en evennaat vaak de prestaties van modellen die twee keer zo groot zijn.
    • Redeneren: Het is zeer goed in logische puzzels, wiskunde en het opvolgen van complexe instructies.
    • Efficiëntie: Het artikel merkt op dat EuroLLM-22B deze resultaten bereikte met een "bescheiden" hoeveelheid trainingsdata (4 biljoen woorden) vergeleken met sommige concurrenten die 15 biljoen woorden gebruikten, wat suggereert dat de kwaliteit van de data belangrijker is dan alleen een enorme hoeveelheid.

5. Het Cadeau aan de Wereld

Het belangrijkste deel van dit artikel is dat het team de bibliotheek niet voor zichzelf houdt. Ze brengen alles naar het publiek:

  • De Modellen: Zowel de "base" versie (het ruwe brein) als de "instruct" versie (de behulpzame assistent).
  • De Data: De eigenlijke datasets die ze hebben gebruikt om het model te trainen (EuroWeb en EuroBlocks), zodat andere onderzoekers ervan kunnen leren.
  • De Code: De softwaretools die ze hebben gebruikt om het model te bouwen en te testen.

Samengevat: EuroLLM-22B is een krachtig, open-source AI-instrument dat is ontworpen om ervoor te zorgen dat Europese talen niet worden achtergelaten in de AI-revolutie. Het bewijst dat je met zorgvuldige dataselectie en een focus op kwaliteit een wereldklasse AI kunt bouwen die jouw taal vloeiend spreekt, zonder dat het een gesloten, geheim project hoeft te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →