← Derniers articles
💬 NLP

EuroLLM-22B: Technical Report

Cet article présente EuroLLM-22B, un grand modèle de langage entraîné à partir de zéro pour prendre en charge 35 langues (incluant les 24 langues officielles de l'UE), remédiant ainsi à la sous-représentation des langues européennes dans les modèles existants tout en atteignant des performances compétitives en matière de raisonnement, de suivi d'instructions et de traduction, l'ensemble des jeux de données, des modèles et du code associés étant publié pour soutenir la recherche future.

Auteurs originaux : Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Ma
Publié 2026-02-06
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

EuroLLM-22B : Le bibliothécaire multilingue de l'Europe

Imaginez le monde de l'intelligence artificielle comme une immense bibliothèque. Pendant longtemps, cette bibliothèque a été dominée par des livres écrits en anglais. Si vous y entriez et demandiez une histoire en français, en allemand ou en portugais, vous pourriez en trouver quelques-uns, mais il s'agissait souvent de traductions d'histoires anglaises ou d'œuvres écrites par des auteurs qui ne comprenaient pas pleinement la culture locale.

EuroLLM-22B est un nouveau projet massif conçu pour remédier à cela. C'est un « Grand Modèle de Langage » (imaginez un bibliothécaire numérique super intelligent) construit de toutes pièces spécifiquement pour parler, comprendre et raisonner dans les 24 langues officielles de l'Union européenne, ainsi que dans 11 autres langues majeures comme l'arabe, le chinois et le japonais.

Voici comment l'équipe a construit ce bibliothécaire numérique, expliqué en termes simples :

1. Le plan (L'architecture)

Avant de construire une maison, il faut un plan. L'équipe n'a pas simplement fait un copier-coller d'un design existant ; elle a ajusté le plan pour gérer une quantité massive d'informations.

  • La taille : Ce modèle possède 22 milliards de « neurones » (paramètres). Pour utiliser une analogie, si la version précédente (9B) était un élève de lycée brillant, celle-ci est un professeur d'université chevronné doté d'une très grande mémoire.
  • La mémoire longue : L'une des plus grandes améliorations est la « fenêtre de contexte ». Imaginez que vous essayez de lire un roman. Les modèles plus anciens ne pouvaient se souvenir que des dernières pages avant d'oublier le début. EuroLLM-22B peut contenir 32 000 mots dans sa tête à la fois. Il peut lire une nouvelle entière ou un document juridique complexe et se souvenir des détails de la première page jusqu'à la dernière sans se perdre.

2. Le régime d'entraînement (Les données)

On ne peut pas faire un grand chef avec de mauvais ingrédients. L'équipe a été très exigeante sur la « nourriture » qu'elle a donnée au modèle pendant son entraînement.

  • Le filtre : Ils n'ont pas simplement déversé tout l'internet dans le modèle. Ils ont utilisé un filtre spécial (appelé EuroFilter) pour noter la qualité du texte, lui attribuant un score de 0 à 5. Ils ont jeté les déchets (comme le code aléatoire ou les pages web de faible qualité) et n'ont gardé que le contenu éducatif et littéraire de haute qualité.
  • Les phases : Ils ont entraîné le modèle en trois étapes, comme un élève progressant dans sa scolarité :
    1. Élémentaire : Ils ont commencé avec une énorme quantité de données générales pour enseigner les bases.
    2. Lycée : Ils ont introduit des données de plus haute qualité pour affiner son raisonnement.
    3. Université : Dans la phase finale, ils lui ont donné les meilleures données disponibles, y compris des mathématiques complexes, du codage et des livres traduits, pour aiguiser son intelligence.
  • Le mélange linguistique : Contrairement à d'autres modèles qui se concentrent fortement sur l'anglais, EuroLLM-22B a été nourri d'un régime équilibré de toutes les langues européennes dès le premier jour, garantissant qu'il n'en favorise aucune par rapport aux autres.

3. Le polissage final (L'ajustement d'instructions)

Après avoir appris les faits, le modèle devait apprendre comment se comporter. C'est ce qu'on appelle le « post-entraînement ».

  • La salle de classe : L'équipe a utilisé un nouvel ensemble de données appelé EuroBlocks. Imaginez cela comme une vaste collection de questions et de réponses d'entraînement couvrant tout, de « Écrivez un poème sur la pluie » à « Résolvez ce problème de mathématiques » et « Traduisez cette phrase ».
  • Le professeur : Ils ont utilisé d'autres modèles d'IA avancés pour générer des réponses de haute qualité pour ces questions, puis ont sélectionné les meilleures pour apprendre à EuroLLM-22B à suivre les instructions avec précision. Ils ont supprimé toute « trace de raisonnement » (le monologue interne) pour rendre la sortie finale propre et directe.

4. Le bulletin de notes (Les résultats)

L'équipe a testé EuroLLM-22B face à d'autres modèles d'IA célèbres pour voir ses performances.

  • La compétition : Ils l'ont comparé à d'autres modèles « entièrement ouverts » (modèles dont le code et les poids sont gratuits pour tous) et à certains modèles à « poids ouverts » (où vous pouvez utiliser le modèle mais ne pouvez pas voir comment il a été construit).
  • Le résultat :
    • Champion européen : Parmi les modèles entièrement ouverts fabriqués en Europe, EuroLLM-22B est le plus fort. Il a surpassé d'autres modèles européens, même ceux qui sont beaucoup plus grands (comme un modèle à 70 milliards de paramètres).
    • Traduction : Il est excellent pour traduire entre les langues, égalant souvent les performances de modèles deux fois plus grands que lui.
    • Raisonnement : Il est très bon pour les énigmes logiques, les mathématiques et le suivi d'instructions complexes.
    • Efficacité : L'article note qu'EuroLLM-22B a obtenu ces résultats avec une quantité de données d'entraînement « modeste » (4 billions de mots) par rapport à certains concurrents qui en ont utilisé 15 billions, suggérant que la qualité des données importe plus que la simple quantité massive.

5. Un cadeau au monde

La partie la plus importante de ce document est que l'équipe n'a pas gardé la bibliothèque pour elle seule. Ils publient tout au grand public :

  • Les modèles : À la fois la version « base » (le cerveau brut) et la version « instruct » (l'assistant utile).
  • Les données : Les ensembles de données réels qu'ils ont utilisés pour entraîner le modèle (EuroWeb et EuroBlocks), afin que d'autres chercheurs puissent apprendre d'eux.
  • Le code : Les outils logiciels qu'ils ont utilisés pour construire et tester le modèle.

En résumé : EuroLLM-22B est un outil d'IA puissant et open-source conçu pour garantir que les langues européennes ne soient pas laissées pour compte dans la révolution de l'IA. Il prouve qu'avec une sélection de données minutieuse et un accent sur la qualité, on peut construire une IA de classe mondiale qui parle votre langue couramment, sans avoir besoin d'être un projet fermé et secret.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →