← Neueste Arbeiten
💬 NLP

EuroLLM-22B: Technical Report

Dieses Paper stellt EuroLLM-22B vor, ein von Grund auf neu trainiertes großes Sprachmodell zur Unterstützung von 35 Sprachen (einschließlich aller 24 Amtssprachen der EU), das die Unterrepräsentanz europäischer Sprachen in bestehenden Modellen adressiert und gleichzeitig eine wettbewerbsfähige Leistung in den Bereichen Schlussfolgerung, Befolgung von Anweisungen und Übersetzung erzielt, wobei alle zugehörigen Datensätze, Modelle und Codes zur Unterstützung zukünftiger Forschung veröffentlicht werden.

Ursprüngliche Autoren: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Ma
Veröffentlicht 2026-02-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

EuroLLM-22B: Der mehrsprachige Bibliothekar Europas

Stellen Sie sich die Welt der Künstlichen Intelligenz als eine riesige Bibliothek vor. Lange Zeit wurde diese Bibliothek von Büchern dominiert, die auf Englisch geschrieben sind. Wenn Sie hineingehen und nach einer Geschichte auf Französisch, Deutsch oder Portugiesisch fragen würden, fänden Sie vielleicht ein paar Bücher, aber es waren oft Übersetzungen englischer Geschichten oder Werke von Autoren, die die lokale Kultur nicht vollständig verstanden.

EuroLLM-22B ist ein neues, massives Projekt, das genau dies korrigieren soll. Es ist ein „Large Language Model“ (denken Sie an einen superintelligenten, digitalen Bibliothekar), das von Grund auf speziell entwickelt wurde, um alle 24 Amtssprachen der Europäischen Union sowie 11 weitere wichtige Sprachen wie Arabisch, Chinesisch und Japanisch zu sprechen, zu verstehen und zu kombinieren.

Hier ist die Erklärung, wie das Team diesen digitalen Bibliothekar gebaut hat, in einfachen Worten:

1. Der Bauplan (Die Architektur)

Bevor man ein Haus baut, braucht man einen Bauplan. Das Team hat nicht einfach ein bestehendes Design kopiert, sondern den Bauplan angepasst, um eine massive Menge an Informationen zu bewältigen.

  • Die Größe: Dieses Modell besitzt 22 Milliarden „Neuronen“ (Parameter). Um eine Analogie zu verwenden: Wenn die vorherige Version (9B) ein kluger Oberstufenschüler war, dann ist diese hier ein erfahrener Universitätsprofessor mit einem sehr großen Gedächtnis.
  • Das Langzeitgedächtnis: Eines der größten Upgrades ist das „Kontextfenster“. Stellen Sie sich vor, Sie versuchen, einen Roman zu lesen. Ältere Modelle konnten sich nur an die letzten paar Seiten erinnern, bevor sie den Anfang vergaßen. EuroLLM-22B kann gleichzeitig 32.000 Wörter im Kopf behalten. Es kann eine ganze Kurzgeschichte oder ein langes juristisches Dokument lesen und sich die Details von der ersten bis zur letzten Seite merken, ohne den Faden zu verlieren.

2. Die Trainingsdiät (Die Daten)

Man kann keinen großartigen Koch mit schlechten Zutaten erschaffen. Das Team war bei dem „Essen“, das es dem Modell während des Trainings gab, sehr wählerisch.

  • Der Filter: Sie haben nicht einfach das gesamte Internet in das Modell geschüttet. Sie verwendeten einen speziellen Filter (genannt EuroFilter), um die Qualität des Textes zu bewerten und ihm eine Punktzahl von 0 bis 5 zu geben. Sie warfen den Müll (wie zufälligen Code oder minderwertige Webseiten) weg und behielten nur die hochwertigen Bildungs- und Literaturinhalte.
  • Die Phasen: Sie trainierten das Modell in drei Phasen, wie einen Schüler, der durch die Klassenstufen geht:
    1. Grundschule: Sie begannen mit einer riesigen Menge an allgemeinen Daten, um die Grundlagen zu lehren.
    2. Gymnasium: Sie führten hochwertigere Daten ein, um das logische Denken zu verfeinern.
    3. Universität: In der letzten Phase fütterten sie das Modell mit den absolut besten verfügbaren Daten, einschließlich komplexer Mathematik, Programmierung und übersetzter Bücher, um seine Intelligenz zu schärfen.
  • Der Sprachmix: Im Gegensatz zu anderen Modellen, die sich stark auf Englisch konzentrieren, wurde EuroLLM-22B von Beginn an mit einer ausgewogenen Diät aller europäischen Sprachen gefüttert, um sicherzustellen, dass es keine Sprache bevorzugt.

3. Der letzte Schliff (Instruction Tuning)

Nachdem das Modell die Fakten gelernt hatte, musste es lernen, wie es sich verhalten soll. Dies wird als „Post-Training“ bezeichnet.

  • Das Klassenzimmer: Das Team verwendete einen neuen Datensatz namens EuroBlocks. Stellen Sie sich dies als eine riesige Sammlung von Übungsfragen und Antworten vor, die alles abdecken – von „Schreibe ein Gedicht über den Regen“ bis hin zu „Löse diese Matheaufgabe“ und „Übersetze diesen Satz“.
  • Der Lehrer: Sie nutzten andere fortgeschrittene KI-Modelle, um hochwertige Antworten auf diese Fragen zu generen, und wählten dann die besten aus, um EuroLLM-22B beizubringen, Anweisungen präzise zu folgen. Sie entfernten jegliche „Reasoning Traces“ (den internen Monolog), um die endgültige Ausgabe sauber und direkt zu gestalten.

4. Das Zeugnis (Die Ergebnisse)

Das Team testete EuroLLM-22B gegen andere berühmte KI-Modelle, um zu sehen, wie es abschneidet.

  • Der Wettbewerb: Sie verglichen es mit anderen „vollständig offenen“ Modellen (Modelle, bei denen der Code und die Gewichte frei für jeden nutzbar sind) und einigen „Open-Weight“-Modellen (bei denen man das Modell zwar nutzen, aber nicht sehen kann, wie es gebaut wurde).
  • Das Ergebnis:
    • Europäischer Champion: Unter den in Europa entwickelten, vollständig offenen Modellen ist EuroLLM-22B das stärkste. Es übertraf andere europäische Modelle, selbst solche, die viel größer waren (wie ein 70-Milliarden-Parameter-Modell).
    • Übersetzung: Es ist exzellent darin, zwischen Sprachen zu übersetzen, und erreicht oft die Leistung von Modellen, die doppelt so groß sind.
    • Logik: Es ist sehr gut in Logikrätseln, Mathematik und beim Befolgen komplexer Anweisungen.
    • Effizienz: Das Paper stellt fest, dass EuroLLM-22B diese Ergebnisse mit einer „bescheidenen“ Menge an Trainingsdaten (4 Billionen Wörter) erzielte, verglichen mit einigen Konkurrenten, die 15 Billionen verwendeten, was darauf hindeutet, dass die Qualität der Daten wichtiger ist als nur eine massive Quantität.

5. Ein Geschenk an die Welt

Der wichtigste Teil dieses Papers ist, dass das Team die Bibliothek nicht für sich behält. Sie stellen alles der Öffentlichkeit zur Verfügung:

  • Die Modelle: Sowohl die „Base“-Version (das rohe Gehirn) als auch die „Instruct“-Version (der hilfreiche Assistent).
  • Die Daten: Die tatsächlichen Datensätze, die sie zum Trainieren des Modells verwendet haben (EuroWeb und EuroBlocks), damit auch andere Forscher daraus lernen können.
  • Der Code: Die Software-Werkzeuge, mit denen sie das Modell gebaut und getestet haben.

Zusammenfassend lässt sich sagen: EuroLLM-22B ist ein leistungsstarkes, Open-Source-KI-Werkzeug, das entwickelt wurde, um sicherzustellen, dass europäische Sprachen in der KI-Revolution nicht zurückbleiben. Es beweist, dass man mit sorgfältiger Datenauswahl und einem Fokus auf Qualität eine erstklassige KI bauen kann, die Ihre Sprache fließend spricht, ohne dass es ein geschlossenes, geheimes Projekt sein muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →