← Últimos artigos
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

O artigo apresenta o ModernBERT-TR, um codificador turco de 150 milhões de parâmetros pré-treinado do zero em 144,4 bilhões de tokens usando a arquitetura ModernBERT e um tokenizador personalizado, que supera significativamente os baselines turcos existentes e iguala modelos concorrentes maiores, apesar de ter sido treinado com substancialmente menos recursos.

Autores originais: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Publicado 2026-07-29
📖 3 min de leitura☕ Leitura rápida

Autores originais: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma biblioteca gigante e caótica onde cada livro é escrito em uma língua diferente. Por muito tempo, os bibliotecários (cientistas da computação) construíram uma enciclopédia massiva e superdensa para ajudar os computadores a entenderem todas as línguas de uma só vez. Mas quando você tenta encontrar um fato específico sobre uma língua minúscula e específica dentro desse livro gigante, a informação fica um pouco borrada. É como tentar ouvir um sussurro em um estádio lotado; o sinal se perde no ruído.

Para corrigir isso, pesquisadores começaram a construir dicionários menores e especializados apenas para línguas individuais. O mais famoso deles para o turco foi construído em 2020. Foi um bom começo, mas foi construído com ferramentas antigas, como uma bicicleta enquanto todos os outros dirigiam carros esportivos. Enquanto isso, o resto do mundo avançou para motores "Modernos" que podiam ler mais rápido, lembrar de frases mais longas e entender as reviravoltas da gramática muito melhor. A grande questão era: Poderíamos construir um carro esportivo novo e superveloz especificamente para o turco, usando essas ferramentas modernas, sem precisar de um orçamento de um bilhão de dólares ou de uma biblioteca do tamanho da lua?

Este artigo apresenta o ModernBERT-TR, um novo modelo de inteligência artificial projetado para ser o "cérebro turco" definitivo para os computadores. Os pesquisadores pegaram os designs arquitetônicos mais recentes e avançados (o motor "ModernBERT") e o treinaram do zero usando apenas texto em turco. Eles não apenas jogaram uma quantidade massiva de dados nele; eles curaram cuidadosamente uma mistura equilibrada de escrita de alta qualidade em turco e usaram um dicionário customizado (tokenizador) especificamente ajustado para a maneira única como as palavras turcas são construídas.

Os resultados são surpreendentemente poderosos. Embora este novo modelo seja relativamente pequeno — contendo cerca de 150 milhões de "neurônios" (parâmetros) — ele superou modelos muito maiores, incluindo alguns com quase quatro vezes mais neurônios. Ao ser testado em 11 tarefas diferentes de turco, como detectar discurso de ódio ou entender críticas de filmes, o ModernBERT-TR obteve uma média de 60,2%, superando o segundo melhor modelo por uma margem significativa. Ele até igualou um competidor que foi treinado com aproximadamente 7 vezes mais dados (1 trilhão de tokens vs. os 144,4 bilhões de tokens do modelo) em um teste de ajuste fino completo, provando que um treinamento inteligente e uma arquitetura melhor podem vencer o volume bruto de dados.

Os autores sugerem que o ingrediente secreto não foi apenas o tamanho do modelo, mas a qualidade da mistura de dados. Eles descobriram que repetir um conjunto de dados específico e de alta qualidade cinco vezes durante o treinamento foi muito mais importante do que ajustar outras configurações, como o tamanho do lote (batch size). Em resumo, eles construíram uma máquina de fala turca enxuta e eficiente que prova que você não precisa ser o maior para ser o melhor; você só precisa ser o mais moderno e o mais focado. Eles disponibilizaram todo o seu código e o próprio modelo para o público, esperando dar um grande impulso a qualquer pessoa que esteja tentando construir tecnologia que fale turco.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →