← Nieuwste papers
💬 NLP

Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain

Dit artikel introduceert Mecellem, een framework voor domeinadaptatie voor het Turkse recht dat een ModernBERT-gebaseerde encoder bevat die vanaf nul is voorgetraind op 112,7 miljard tokens met een innovatieve checkpointselectiestrategie, en Qwen-gebaseerde decodermodellen die zijn verbeterd door middel van een curriculum van continue voortraining in vier fasen, wat gezamenlijk een staat van de kunst in retrieval-prestaties en een significante reductie in perplexiteit bereikt met verbeterde computationele efficiëntie.

Oorspronkelijke auteurs: Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer Can Sağbaş

Gepubliceerd 2026-01-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer Can Sağbaş

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het Bouwen van een Turks Juridisch Brein

Stel je voor dat je een briljante, meertalige student hebt (een Large Language Model) die bijna alles op het internet in het Engels heeft gelezen. Ze zijn slim, maar als je ze iets over het Turkse recht vraagt, struikelen ze. Ze kennen de specifieke woorden, de complexe zinsstructuren of de strikte regels van het Turkse rechtssysteem niet.

De auteurs van dit paper wilden dit oplossen. Ze bouwden Mecellem, een gespecialiseerd AI-framework dat specifiek is ontworpen voor de Turkse juridische wereld. Ze hebben de student niet alleen "een paar nieuwe woorden geleerd"; ze gaven ze twee verschillende soorten intensieve training om een juridisch expert te worden.


Strategie 1: De "Gespecialiseerde Bibliothecaris" (Het Encoder Model)

Het Doel: Een model creëren dat fungeert als een supersnelle bibliothecaris. Wanneer je een vraag stelt, schrijft het geen essay; het vindt direct het exacte juridische document dat je nodig hebt uit een enorme bibliotheek.

Hoe ze het deden:
In plaats van een bestaande Engelse bibliothecaris te nemen en te proberen die Turks te leren, bouwden ze een nieuwe bibliothecaris vanaf nul.

  • De Training: Ze voerden deze nieuwe bibliothecaris 112,7 miljard woorden aan Turkse tekst. Dit omvatte rechterlijke uitspraken, academische scripties en wetten.
  • De "Goldilocks"-ontdekking: Normaal gesproken stop je met het trainen van een model wanneer de "foutmarge" (hoeveel fouten het model maakt) het laagst is. De auteurs ontdekten een wending: de beste bibliothecaris was niet degene met de laagste foutmarge.
    • De Analogie: Stel je een student voor die studeert voor een toets. Als ze studeren totdat ze elk enkel feit perfect uit het hoofd kennen (laagste fout), kunnen ze er zelfs in slagen om te vergeten hoe ze die feiten in de praktijk moeten toepassen op een echte vraag. De auteurs ontdekten dat het model het beste presteerde op een "sweet spot" voordat het klaar was met het volledig uit het hoofd leren van alles. Als ze het te lang bleven trainen, werd het model eigenlijk slechter in het vinden van antwoorden.
  • Het Resultaat: Ze creëerden een kleine, efficiënte bibliothecaris (slechts 155 miljoen "hersencellen" of parameters) die net zo goed presteert als veel grotere, tragere bibliothecarissen. Het is alsof je een compacte sportwagen hebt die even snel rijdt als een enorme vrachtwagen.

Strategie 2: De "Juridisch Geleerde" (Het Decoder Model)

Het Doel: Een model creëren dat een juridisch probleem kan lezen, de diepe redenering kan begrijpen en een juridisch antwoord of uitleg kan schrijven.

Hoe ze het deden:
Ze namen twee bestaande krachtige modellen (Qwen3-1.7B en Qwen3-4B) en gaven ze een speciaal curriculum, vergelijkbaar met een juridische opleiding.

  • De Curriculum Learning Aanpak: Ze gooiden niet alle juridische boeken in één keer bij de student op de stapel. Ze gebruikten een vierfasenplan:
    1. Fase 1: Simpele, algemene Turkse teksten lezen om vertrouwd te raken met de taal.
    2. Fase 2: Beginnen met het lezen van juridische artikelen en samenvattingen van rechtszaken.
    3. Fase 3: Duiken in lange, complexe en moeilijke juridische documenten (zoals volledige rechterlijke uitspraken).
    4. Fase 4: Gespecialiseerde verfijning om de vaardigheden te polijsten.
  • Waarom dit belangrijk is: Als je een student in een PhD-thesis werpt voordat ze de basisgrammatica kennen, raken ze in de war en vergeten ze wat ze al wisten (een probleem dat "catastrofaal vergeten" wordt genoemd). Deze stapsgewijze aanpak zorgde ervoor dat het model de complexe juridische jargon leerde zonder het vermogen te verliezen om normaal Turks te spreken.
  • Het Resultaat: Het model werd aanzienlijk beter in het begrijpen van Turkse juridische teksten, waarbij de verwarring (perplexity) met ongeveer 36% werd verminderd.

De "Kwaliteitscontrole" Filter

Een van de grootste uitdagingen was het opschonen van de data. Juridische documenten zijn rommelig: ze bevatten tabellen, gescande afbeeldingen en vreemde opmaak.

  • De Analogie: Stel je voor dat je een student probeert te onderwijzen met een tekstboek waarvan de helft van de pagina's is uitgescheurd, bedekt met koffievlekken of geschreven is in een andere taal.
  • De Oplossing: De auteurs bouwden een geavanceerde "schoonmaakmachine" met behulp van geavanceerde AI (Vision-Language Models) om gescande documenten te lezen en de tekst perfect te extraheren. Ze gebruikten ook een speciale filter gebaseerd op Turkse grammaticaregels.
    • De Analogie: Turks is een "agglutinerende" taal, wat betekent dat je veel kleine stukjes (achtervoegsels) aan een woord plakt om de betekenis te veranderen. De auteurs creëerden een filter die controleert of de tekst deze woordstukken op een natuurlijke, rijke manier gebruikt. Als een tekst te repetitief of robotachtig is (zoals een sjabloon), gooit de filter het eruit. Dit zorgde ervoor dat het model leerde van hoogwaardige, mensachtige juridische teksten.

Belangrijkste Punten voor een Algemeen Publiek

  1. Jaag niet alleen op de laagste foutmarge: Bij het trainen van AI voor complexe taken is het punt waarop het model de minste "fouten" maakt tijdens de training niet altijd het punt waarop het het meest nuttig is. Soms levert eerder stoppen een slimmer model op.
  2. Klein kan beter zijn: Je hebt geen massief, duur computerbrein nodig om goed te zijn in het Turkse recht. Een kleiner, goed getraind model kan grotere, generieke modellen overtreffen.
  3. Stapsgewijs werkt het best: Het aanleren van complexe juridische redenering aan een model werkt het beste wanneer je begint met eenvoudige concepten en de moeilijkheid geleidelijk verhoogt, in plaats van het er in één keer mee te overladen.
  4. Taal maakt uit: Wat werkt voor het Engels, werkt niet altijd voor het Turks. Omdat Turks grammaticaal zo complex is, moet de AI specifiek voor die taal worden gebouwd en getraind, en niet alleen vertaald vanuit het Engels.

Kortom, de auteurs hebben een gespecialiseerde Turkse juridische AI gebouwd door deze vanaf de grond op te bouwen, te trainen met een slim, stapsgewijs curriculum, en precies te weten wanneer ze de training moesten stoppen om het beste resultaat te krijgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →