← Neueste Arbeiten
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

Das Papier stellt ModernBERT-TR vor, einen 150 Millionen Parameter umfassenden türkischen Encoder, der von Grund auf mit 144,4 Milliarden Token unter Verwendung der ModernBERT-Architektur und eines benutzerdefinierten Tokenizers vortrainiert wurde, welcher bestehende türkische Baselines signifikant übertrifft und größere gleichzeitige Modelle erreicht, obwohl er mit wesentlich weniger Ressourcen trainiert wurde.

Ursprüngliche Autoren: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Veröffentlicht 2026-07-29
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich das Internet als eine riesige, chaotische Bibliothek vor, in der jedes Buch in einer anderen Sprache geschrieben ist. Lange Zeit bauten die Bibliothekare (Informatiker) eine einzige, massive, superdichte Enzyklopädie, um Computern zu helfen, alle Sprachen gleichzeitig zu verstehen. Aber wenn man versucht, eine ganz bestimmte Information über eine winzige, spezifische Sprache in diesem riesigen Buch zu finden, wird die Information etwas verschwommen. Es ist, als versuche man, ein Flüstern in einem überfüllten Stadion zu hören; das Signal geht im Lärm verloren.

Um dies zu beheben, begannen Forscher, kleinere, spezialisierte Wörterbücher für einzelne Sprachen zu erstellen. Das berühmteste davon für Türkisch wurde bereits 2020 gebaut. Es war ein guter Anfang, aber es wurde mit alten Werkzeugen gebaut, wie etwa einem Fahrrad, während alle anderen bereits Sportwagen fuhren. Währenddessen bewegte sich der Rest der Welt hin zu „modernen“ Motoren, die schneller lesen, sich längere Sätze merken und die Windungen der Grammatik viel besser verstehen konnten. Die große Frage war: Könnten wir ein brandneues, superschnelles Sportauto speziell für Türkisch bauen, unter Verwendung dieser modernen Werkzeuge, ohne ein Milliarden-Dollar-Budget oder eine Bibliothek in der Größe des Mondes zu benötigen?

Dieses Paper stellt ModernBERT-TR vor, ein neues Modell der künstlichen Intelligenz, das als das ultimative „türkische Gehirn“ für Computer konzipiert wurde. Die Forscher nahmen die neuesten, fortschrittlichsten Architekturdesigns (den „ModernBERT“-Motor) und trainierten ihn von Grund auf neu unter Verwendung ausschließlich türkischer Texte. Sie haben nicht einfach nur eine massive Menge an Daten auf das Modell geworfen; sie haben eine ausgewogene Mischung aus hochwertiger türkischer Literatur sorgfältig kuratiert und einen maßgeschneiderten, speziellen Wortschatz (Tokenizer) verwendet, der exakt auf die einzigartige Art und Weise abgestimmt ist, wie türkische Wörter aufgebaut sind.

Die Ergebnisse sind überraschend leistungsstark. Obwohl dieses neue Modell relativ klein ist – es enthält etwa 150 Millionen „Neuronen“ (Parameter) – übertraf es viel größere Modelle, einschließlich einiger, die fast viermal so viele Neuronen besitzen. Bei Tests auf 11 verschiedenen türkischen Aufgaben, wie dem Erkennen von Hassrede oder dem Verstehen von Filmrezensionen, erreichte ModernBERT-TR im Durchschnitt 60,2 % und schlug damit das nächstbeste Modell um eine signifikante Marge. In einem vollständigen Fine-Tuning-Test erreichte es sogar die Werte eines Konkurrenten, der mit etwa 7-mal mehr Daten trainiert wurde (1 Billion Token gegenüber den 144,4 Milliarden Token des Modells), was beweist, dass intelligentes Training und eine bessere Architektur das reine Datenvolumen schlagen können.

Die Autoren legen nahe, dass das Geheimrezept nicht allein die Größe des Modells war, sondern die Qualität der Datenmischung. Sie fanden heraus, dass das fünfmalige Wiederholen eines spezifischen, hochwertigen türkischen Datensatzes während des Trainings weitaus wichtiger war als das Anpassen anderer Einstellungen wie der Batch-Größe. Kurz gesagt: Sie haben eine schlanke, effiziente, türkisch sprechende Maschine gebaut, die beweist, dass man nicht der Größte sein muss, um der Beste zu sein; man muss nur der Modernste und der Fokussierteste sein. Sie haben ihren gesamten Code sowie das Modell selbst der Öffentlichkeit zur Verfügung gestellt, in der Hoffnung, jedem, der Technologie entwickeln möchte, die Türkisch spricht, einen enormen Schub zu geben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →