MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum
Dieses Paper stellt MoganBert-TR vor, ein 149M-Parameter starkes türkisches Encoder-Foundation-Modell, das von Grund auf unter Verwendung eines neuartigen CLM-zu-MLM-Curriculums und spezialisiertem Long-Context-Scheduling trainiert wurde, welches State-of-the-Art-Leistungen auf türkischen NLP-Benchmarks erzielt und ein hocheffizientes Embedding-Modell hervorbringt, das 99,5 % der Punktzahl seines 7,57B-Parameter starken Lehrers erreicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der weiten Landschaft der künstlichen Intelligenz gibt es zwei Hauptwege, wie Computer lernen, die menschliche Sprache zu verstehen. Ein Ansatz, der oft in den Nachrichten vorkommt, umfasst Modelle, die Text generieren und Geschichten schreiben oder Fragen aus dem Stegreif beantworten. Der andere, leisere, aber ebenso lebenswichtige Ansatz nutzt Modelle, die als leistungsstarke Suchmaschinen und Klassifizierer fungieren. Diese „Encoder“-Modelle lesen einen Satz und wandeln ihn in eine kompakte mathematische Zusammenfassung um, was es Computern ermöglicht, Ideen zu vergleichen, relevante Dokumente zu finden oder Informationen mit unglaublicher Geschwindigkeit zu sortieren. Jahrelang war die Standardmethode, um diese Modelle zu lehren, eine bestimmte Art von Ratespiel: Der Computer sieht einen Satz, in dem einige Wörter verborgen sind, und muss die fehlenden Teile vorhersagen. Diese Methode, bekannt als Masked Language Modeling, hat gut funktioniert, aber Forscher fragten sich schon lange, ob es einen besseren Weg gibt, der Maschine die Struktur einer Sprache beizubringen, insbesondere für Sprachen, die komplex und reich an Wortformen sind, wie etwa Türkisch.
Ein Team von Forschern hat nun ein neues Fundament für das Verständnis der türkischen Sprache geschaffen und dabei demonstriert, dass die Art und Weise, wie ein Modell gelehrt wird, genauso wichtig ist wie die Architektur, auf der es aufgebaut ist. Sie entwickelten ein Modell namens MoganBert-TR, das von Grund auf auf einer massiven Sammlung von türkischen Texten trainiert wurde. Anstatt an dem traditionellen Ratespiel festzuhalten, führten sie ein zweistufiges Lerncurriculum ein. Zuerst lernte das Modell, Texte von links nach rechts zu lesen und das nächste Wort in einer Sequenz vorherzusagen, ganz so, wie ein Mensch ein Buch liža. Erst nach dieser ersten Phase wechselten sie zur traditionellen Methode des Versteckens von Wörtern und der Aufforderung an das Modell, diese auszufüllen. Dieser Wechsel der Lehrstrategie, kombiniert mit einem sorgfältig bereinigten Datensatz und einer neuen Methode zum Umgang mit langen Sätzen, führte zu einem Modell, das Türkisch besser versteht als frühere Versionen, insbesondere wenn es darum geht, relevante Informationen in großen Datenbanken zu finden.
Die Forscher begannen damit, eine gewaltige Menge an Text aus dem Internet zu sammeln, einschließlich aktueller Webseiten und älterer Archive, aber sie haben diese Daten nicht einfach in das Trainingssystem hineingekippt. Sie bauten eine ausgeklügelte Pipeline auf, um minderwertige Inhalte wie Spam oder repetitive Werbung herauszufiltern und sicherzustellen, dass der Text tatsächlich nützlich ist. Da es kein bestehendes Werkzeug gab, um die Qualität türkischer Texte automatisch zu beurteilen, trainierten sie ein kleineres, spezialisiertes Modell, das als Lehrer fungieren sollte, welches dann einem schnelleren System beibrachte, dieselben Qualitätsurteile zu fällen. Dies ermöglichte es ihnen, Millionen von Dokumenten effizient zu verarbeiten und nur das hochwertige Material beizubehalten. Sie erstellten auch ein neues Wörterbuch für das Modell, das türkische Wörter effizienter in kleinere Teile zerlegt als bisherige Versuche, was entscheidend ist, da sich türkische Wörter je nach ihrer Rolle im Satz erheblich verändern können.
Der Kern ihrer Entdeckung liegt in der Reihenfolge der Operationen während des Trainings. Sie testeten, ob der Beginn mit der Methode der Links-rechts-Vorhersage vor dem Wechsel zur Wort-Versteck-Methode einen Unterschied machte. In einem kontrollierten Experiment, bei dem die gleiche Rechenleistung und dieselben Daten verwendet wurden, übertraf der neue zweistufige Ansatz die traditionelle Methode bei der Informationsabfrage bei weitem. Während beide Methoden bei einfachen Klassifizierungsaufgaben ähnlich abschnitten, war der neue Ansatz bei einem Suchtest fast viermal besser darin, relevante Dokumente zu finden. Die Forscher entdeckten, dass die traditionelle Methode dazu führte, dass die internen Repräsentationen des Modells in eine enge, wenig hilfreiche Form kollabierten, in der alle Bedeutungen zu ähnlich aussahnen. Das neue Curriculum verhinderte diesen Kollaps und ermöglichte es dem Modell, eine breitere, deutlichere Sicht auf die Sprachbedeutung zu behalten.
Um das Modell weiter zu verfeinern, experimentierten die Forscher damit, wie der Computer während der letzten Phasen des Trainings lernte. Sie unterteilten den Prozess in zwei Pfade: einen, bei dem das Modell mit kurzen Sätzen weiterlernte, und einen, bei dem es mit viel längeren Sätzen lernte. Durch den Vergleich der Ergebnisse dieser beiden Pfade fanden sie heraus, dass es die Gesamtleistung des Modells tatsächlich mehr verbesserte, das Training mit kurzen Sätzen abzuschließen, als es mit langen zu beenden. Dieser Befund war überraschend, da man oft davon ausgeht, dass längere Kontexte besser sind. Sie testeten auch eine Technik namens „Model Soup“, bei der sie die Gewichte verschiedener trainierter Modelle zusammenmittelten, in der Hoffnung, das Beste aus beiden Welten zu erhalten. Ihr einfacher Verzweigungsweg produzierte jedoch ein besseres Ergebnis als die komplexe Mittelungstechnik, und das bei nur einem Bruchteil der zusätzlichen Rechenkosten.
Das Endprodukt, MoganBert-TR, erreichte die höchste Punktzahl unter den türkischen Modellen, die auf der in dieser Studie verwendeten modernen Architektur basieren. Es schnitt außergewöhnlich gut bei Aufgaben der Code-Retrieval ab – also dem Finden der richtigen Code-Schnipsel aus natürlichen Sprachbeschreibungen –, einer Aufgabe, bei der es ältere Modelle deutlich übertraf. Dieser Erfolg wurde der Kombination ihres neuen Wörterbuchs, das die Abstände und die Struktur von Code bewahrte, und der gezielten Einbeziehung einer hohen Menge an Programmiertext in den Trainingsdaten zugeschrieben. Das Team entwickelte auch ein Begleitmodell, das speziell für das Erstellen suchfreundlicher Zusammenfassungen von Texten konzipiert wurde. Indem sie dieses kleinere Modell lehrten, einem viel größeren, leistungsfähigeren Lehrer nachzuahmen, erreichten sie ein Ergebnis, das fast so gut wie das des riesigen Lehrers war, aber nur ein einundfünfzig Mal weniger Rechenleistung zum Ausführen benötigte.
Die Arbeit unterstreicht, dass es für Sprachen wie Türkisch nicht ausreicht, lediglich die Struktur eines Modells zu aktualisieren; die Trainingsmethode selbst muss neu überdacht werden. Die Forscher zeigten, dass ein zweistufiges Curriculum, das mit der sequenziellen Vorhersage beginnt und zur Wort-Maskierung übergeht, ein robusteres Sprachverständnis schafft. Sie demonstrierten auch, dass die letzten Phasen des Trainings ein kritischer Designraum sind, in dem kleine Änderungen, wie die Länge des verarbeiteten Textes, einen messbaren Einfluss auf die Leistung haben können. Obwohl das Modell in bestimmten Bereichen noch Schwächen aufweist, etwa beim Verständnis der Satzstruktur in bestimmten grammatikalischen Tests, stellt es einen bedeutenden Schritt nach vorn dar. Das Team hat sein Modell, das Wörterbuch und den Code, mit dem es gebaut wurde, der Öffentlichkeit zur Verfügung gestellt, damit andere auf diesem Fundament für türkische Sprachtechnologie aufbauen können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.