Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain
Dieses Paper stellt Mecellem vor, ein Framework für die Anpassung an den türkischen Rechtsbereich, das einen auf ModernBERT basierenden Encoder umfasst, der mittels einer innovativen Checkpoint-Selektionsstrategie von Grund auf mit 112,7 Milliarden Token vortrainiert wurde, sowie Qwen-basierte Decoder-Modelle, die durch ein vierphasiges Curriculum des kontinuierlichen Vortrainings verbessert wurden, wodurch kollektiv eine State-of-the-Art-Retrieval-Performance und eine signifikante Perplexity-Reduktion bei verbesserter Recheneffizienz erreicht werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Ganze: Ein türkisches Rechts-Gehirn erschaffen
Stellen Sie sich vor, Sie haben einen brillanten, mehrsprachigen Studenten (ein Large Language Model), der fast alles im Internet auf Englisch gelesen hat. Er ist klug, aber wenn Sie ihn nach türkischem Recht fragen, gerät er ins Straucheln. Er kennt die spezifischen Begriffe, die komplexen Satzstrukturen oder die strengen Regeln des türkischen Rechtssystems nicht.
Die Autoren dieser Arbeit wollten das ändern. Sie entwickelten Mecellem, ein spezialisiertes KI-Framework, das gezielt für die Welt des türkischen Rechts konzipiert wurde. Sie haben dem Studenten nicht nur ein paar neue Wörter „beigebracht“; sie gaben ihm zwei verschiedene Arten von intensivem Training, um ihn zu einem Rechtsexperten zu machen.
Strategie 1: Der „Spezialisierte Bibliothekar“ (Das Encoder-Modell)
Das Ziel: Ein Modell zu erschaffen, das wie ein superschneller Bibliothekar agiert. Wenn Sie eine Frage stellen, schreibt es keinen Essay, sondern findet sofort das exakte Rechtsdokument, das Sie benötigen, aus einer riesigen Bibliothek.
Wie sie es gemacht haben:
Anstatt einen bestehenden englischen Bibliothekar zu nehmen und zu versuchen, ihm Türkisch beizubringen, bauten sie einen neuen Bibliothekar von Grund auf neu.
- Das Training: Sie fütterten diesen neuen Bibliothekar mit 112,7 Milliarden Wörtern aus türkischen Texten. Dies beinhaltete Gerichtsurteile, akademische Abschlussarbeiten und Gesetze.
- Die „Goldlöckchen“-Entdeckung: Normalerweise stoppt man beim Training eines Modells, wenn die „Fehlerrate“ (wie viele Fehler das Modell macht) am niedrigsten ist. Die Autoren fanden jedoch eine Wendung: Der beste Bibliothekar war nicht derjenige mit der niedrigsten Fehlerrate.
- Die Analogie: Stellen Sie sich einen Studenten vor, der für eine Prüfung lernt. Wenn er lernt, bis er jede einzelne Tatsache perfekt auswendig kennt (niedrigster Fehler), vergisst er vielleicht tatsächlich, wie man diese Fakten auf eine reale Fragestellung anwendet. Die Autoren fanden heraus, dass das Modell an einem „Sweet Spot“ am besten funktionierte – einem Punkt bevor es fertig war, alles auswendig zu lernen. Wenn sie das Training zu lange fortgesetzt hätten, wäre es tatsächlich schlechter darin geworden, Antworten zu finden.
- Das Ergebnis: Sie schufen einen kleinen, effizienten Bibliothekar (nur 1 mit 155 Millionen „Gehirnzellen“ oder Parametern), der genauso gut abschneidet wie viel größere, langsamere Bibliothekare. Es ist wie ein kompakter Sportwagen, der genauso schnell fährt wie ein massiver LKW.
Strategie 2: Der „Rechtsgelehrte“ (Das Decoder-Modell)
Das Ziel: Ein Modell zu erschaffen, das in der Lage ist, ein rechtliches Problem zu lesen, die tiefe Logik dahinter zu verstehen und eine rechtliche Antwort oder Erklärung zu schreiben.
Wie sie es gemacht haben:
Sie nahmen zwei bestehende leistungsstarke Modelle (Qwen3-1.7B und Qwen3-4B) und gaben ihnen einen speziellen Lehrplan, vergleichbar mit einem Jurastudium.
- Der Curriculum-Learning-Ansatz: Sie haben dem Studenten nicht einfach alle Jura-Bücher auf einmal vorgeworfen. Sie nutzten einen Vier-Phasen-Plan:
- Phase 1: Einfache, allgemeine türkische Texte lesen, um sich mit der Sprache vertraut zu machen.
- Phase 2: Mit dem Lesen von juristischen Artikeln und Zusammenfassungen von Gerichtsurteilen beginnen.
- Phase 3: In lange, komplexe und schwierige juristische Dokumente (wie vollständige Urteile) eintauchen.
- Phase 4: Spezialisierte Verfeinerung, um die Fähigkeiten zu polieren.
- Warum das wichtig ist: Wenn man einen Studenten in eine Doktorarbeit wirft, bevor er die Grundlagen der Grammatik beherrscht, wird er verwirrt und vergisst das, was er bereits wusste (ein Problem, das als „katastrophales Vergessen“ bezeichnet wird). Dieser schrittweise Ansatz stellte sicher, dass das Modell den komplexen Juristendeutsch lernte, ohne die Fähigkeit zu verlieren, normales Türkisch zu sprechen.
- Das Ergebnis: Das Modell wurde signifikant besser im Verständnis türkischer Rechtstexte und reduzierte seine Verwirrung (Perplexität) um etwa 36 %.
Der „Qualitätskontroll“-Filter
Eine der größten Herausforderungen war die Bereinigung der Daten. Juristische Dokumente sind unordentlich: Sie enthalten Tabellen, Scans und seltsame Formatierungen.
- Die Analogie: Stellen Sie sich vor, Sie versuchen, einen Studenten mit einem Lehrbuch zu unterrichten, bei dem die Hälfte der Seiten herausgerissen, mit Kaffeeflecken bedeckt oder in einer anderen Sprache geschrieben ist.
- Die Lösung: Die Autoren bauten eine hochentwickelte „Reinigungsmaschine“ unter Verwendung fortschrittlicher KI (Vision-Language-Modelle), um gescannte Dokumente zu lesen und den Text perfekt zu extrahieren. Sie verwendeten auch einen speziellen Filter basierend auf türkischen Grammatikregeln.
- Die Analogie: Türkisch ist eine „agglutinierende“ Sprache, was bedeutet, dass man viele kleine Teile (Suffixe) an ein Wort hängt, um dessen Bedeutung zu ändern. Die Autoren entwickelten einen Filter, der prüft, ob ein Text diese Wortteile auf eine natürliche, reiche Weise verwendet. Wenn ein Text zu repetitiv oder roboterhaft ist (wie eine Vorlage), wirft der Filter ihn raus. Dies stellte sicher, dass das Modell aus hochwertiger, menschenähnlicher juristischer Sprache lernte.
Wichtige Erkenntnisse für das allgemeine Publikum
- Jagen Sie nicht nur dem niedrigsten Fehler hinterher: Bei der Ausbildung von KI für komplexe Aufgaben ist der Punkt, an dem das Modell während des Trainings die wenigsten „Fehler“ macht, nicht immer der Punkt, an dem es am nützlichsten ist. Manchmal liefert ein vorzeitiger Abbruch des Trainings ein klügeres Modell.
- Klein kann besser sein: Man braucht kein massives, teures Computergehirn, um gut im türkischen Recht zu sein. Ein kleineres, besser trainiertes Modell kann riesige, generische Modelle übertreffen.
- Schritt für Schritt funktioniert: Das Lehren komplexer juristischer Logik funktioniert am besten, wenn man mit einfachen Konzepten beginnt und die Schwierigkeit schrittweise erhöht, anstatt das Modell sofort zu überfordern.
- Sprache spielt eine Rolle: Was im Englischen funktioniert, funktioniert nicht immer im Türkischen. Da Türkisch grammatikalisch so komplex ist, muss die KI speziell für diese Sprache gebaut und trainiert werden, anstatt sie nur aus dem Englischen zu übersetzen.
Kurz gesagt: Die Autoren bauten eine spezialisierte türkische Rechts-KI, indem sie sie von Grund auf neu entwickelten, sie mit einem intelligenten, schrittweisen Lehrplan trainierten und genau wussten, wann sie das Training stoppen mussten, um die besten Ergebnisse zu erzielen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.