← Últimos artigos
💬 NLP

Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain

Este artigo apresenta o Mecellem, um framework para adaptação ao domínio jurídico turco que apresenta um codificador baseado em ModernBERT pré-treinado do zero em 112,7 bilhões de tokens com uma estratégia inovadora de seleção de checkpoints, e modelos decodificadores baseados em Qwen aprimorados por meio de um currículo de pré-treinamento contínuo de quatro fases, alcançando coletivamente o estado da arte em desempenho de recuperação e redução significativa de perplexidade com eficiência computacional melhorada.

Autores originais: Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer Can Sağbaş

Publicado 2026-01-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Özgür Uğur, Mahmut Göksu, Mahmut Çimen, Musa Yılmaz, Esra Şavirdi, Alp Talha Demir, Rumeysa Güllüce, İclal Çetin, Ömer Can Sağbaş

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Construindo um Cérebro Jurídico Turco

Imagine que você tem um estudante brilhante e multilíngue (um Grande Modelo de Linguagem) que leu quase tudo na internet em inglês. Ele é inteligente, mas se você lhe perguntar sobre o direito turco, ele tropeça. Ele não conhece as palavras específicas, as estruturas de frases complexas ou as regras rigorosas do sistema jurídico turco.

Os autores deste artigo quiseram consertar isso. Eles construíram o Mecellem, uma estrutura de IA especializada, projetada especificamente para o mundo jurídico turco. Eles não apenas "ensinaram" ao estudante algumas palavras novas; eles deram a ele dois tipos diferentes de treinamento intensivo para se tornar um especialista jurídico.


Estratégia 1: O "Bibliotecário Especializado" (O Modelo Encoder)

O Objetivo: Criar um modelo que atue como um bibliotecário super-rápido. Quando você faz uma pergunta, ele não escreve uma redação; ele encontra instantaneamente o documento jurídico exato de que você precisa em uma biblioteca massiva.

Como eles fizeram:
Em vez de pegar um bibliotecário de inglês existente e tentar ensiná-lo o turco, eles construíram um novo bibliotecário do zero.

  • O Treinamento: Eles alimentaram este novo bibliotecário com 112,7 bilhões de palavras de texto em turco. Isso incluiu decisões judiciais, teses acadêmicas e leis.
  • A Descoberta do "Ponto Ideal": Normalmente, ao treinar um modelo, você para quando a "taxa de erro" (quantos erros o modelo comete) é a menor possível. Os autores descobriram uma reviravolta: o melhor bibliotecário não era aquele com a menor taxa de erro.
    • A Analogia: Imagine um estudante estudando para uma prova. Se ele estudar até memorizar cada fato perfeitamente (menor erro), ele pode acabar esquecendo como aplicar esses fatos a uma questão do mundo real. Os autores descobriram que o modelo performava melhor em um "ponto ideal" antes de terminar de memorizar tudo. Se continuassem treinando-o demais, ele na verdade ficava pior em encontrar respostas.
  • O Resultado: Eles criaram um bibliotecário pequeno e eficiente (apenas 155 milhões de "células cerebrais" ou parâmetros) que performa tão bem quanto bibliotecários muito maiores e mais lentos. É como ter um carro esportivo compacto que dirige tão rápido quanto um caminhão enorme.

Estratégia 2: O "Erudito Jurídico" (O Modelo Decoder)

O Objetivo: Criar um modelo que possa ler um problema jurídico, entender o raciocínio profundo e escrever uma resposta ou explicação jurídica.

Como eles fizeram:
Eles pegaram dois modelos poderosos existentes (Qwen3-1.7B e Qwen3-4B) e deram a eles um currículo especial, semelhante a uma educação de faculdade de direito.

  • A Abordagem de Aprendizado por Currículo: Eles não jogaram todos os livros de direito no estudante de uma só vez. Eles usaram um plano de quatro fases:
    1. Fase 1: Ler textos turcos simples e gerais para se familiarizar com o idioma.
    2. Fase 2: Começar a ler artigos jurídicos e resumos de tribunais.
    3. Fase 3: Mergulhar em documentos jurídicos longos, complexos e difíceis (como decisões judiciais completas).
    4. Fase 4: Refinamento especializado para polir as habilidades.
  • Por que isso importa: Se você jogar um estudante em uma tese de doutorado antes de ele saber gramática básica, ele ficará confuso e esquecerá o que já sabia (um problema chamado "esquecimento catastrófico"). Essa abordagem passo a passo garantiu que o modelo aprendesse o jargão jurídico complexo sem perder sua capacidade de falar o turco normal.
  • O Resultado: O modelo tornou-se significativamente melhor em compreender textos jurídicos turcos, reduzindo sua confusão (perplexidade) em cerca de 36%.

O Filtro de "Controle de Qualidade"

Um dos maiores desafios foi a limpeza dos dados. Documentos jurídicos são bagunçados: possuem tabelas, imagens digitalizadas e formatações estranhas.

  • A Analogia: Imagine tentar ensinar um estudante usando um livro didático onde metade das páginas estão rasgadas, cobertas de manchas de café ou escritas em uma língua diferente.
  • A Solução: Os autores construíram uma "máquina de limpeza" sofisticada usando IA avançada (Modelos de Visão-Linguagem) para ler documentos digitalizados e extrair o texto perfeitamente. Eles também usaram um filtro especial baseado em regras gramaticais do turco.
    • A Analogia: O turco é uma língua "aglutinante", o que significa que você gruda muitos pequenos pedaços (sufixos) em uma palavra para mudar seu significado. Os autores criaram um filtro que verifica se o texto usa esses pedaços de palavras de uma forma natural e rica. Se um texto for muito repetitivo ou robótico (como um modelo/template), o filtro o descarta. Isso garantiu que o modelo aprendesse com uma escrita jurídica de alta qualidade e humana.

Principais Conclusões para o Público Geral

  1. Não busque apenas o menor erro: Ao treinar IA para tarefas complexas, o ponto em que o modelo comete o menor número de "erros" durante o treinamento nem sempre é o ponto em que ele é mais útil. Às vezes, parar cedo gera um modelo mais inteligente.
  2. Pequeno pode ser melhor: Você não precisa de um cérebro de computador massivo e caro para ser bom em direito turco. Um modelo menor e bem treinado pode superar modelos gigantes e genéricos.
  3. Passo a passo funciona: Ensinar raciocínio jurídico complexo a um modelo funciona melhor quando você começa com conceitos simples e aumenta gradualmente a dificuldade, em vez de sobrecarregá-lo de uma só vez.
  4. A língua importa: O que funciona para o inglês nem sempre funciona para o turco. Como o turco é gramaticalmente complexo, a IA precisa ser construída e treinada especificamente para esse idioma, não apenas traduzida do inglês.

Em resumo, os autores construíram uma IA jurídica turca especializada construindo-a do zero, treinando-a com um currículo inteligente e passo a passo, e sabendo exatamente quando parar o treinamento para obter os melhores resultados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →