← Últimos artículos
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

El artículo presenta ModernBERT-TR, un codificador turco de 150 millones de parámetros preentrenado desde cero con 144,4 mil millones de tokens utilizando la arquitectura ModernBERT y un tokenizador personalizado, el cual supera significativamente a las líneas base turcas existentes y iguala a modelos concurrentes más grandes a pesar de haber sido entrenado con sustancialmente menos recursos.

Autores originales: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Publicado 2026-07-29
📖 3 min de lectura☕ Lectura para el café

Autores originales: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una biblioteca gigante y caótica donde cada libro está escrito en un idioma diferente. Durante mucho tiempo, los bibliotecarios (científicos de la computación) construyeron una enciclopedia masiva y superdensa para ayudar a las computadoras a entender todos los idiomas a la vez. Pero cuando intentas encontrar un dato específico sobre un idioma diminuto y particular dentro de ese libro gigante, la información se vuelve un poco borrosa. Es como intentar escuchar un susurro en un estadio lleno de gente; la señal se pierde en el ruido.

Para solucionar esto, los investigadores comenzaron a construir diccionarios más pequeños y especializados solo para idiomas individuales. El más famoso de estos para el turco fue construido allá por el 2020. Fue un buen comienzo, pero fue construido con herramientas viejas, como una bicicleta cuando todos los demás conducían autos deportivos. Mientras tanto, el resto del mundo avanzó hacia motores "Modernos" que podían leer más rápido, recordar oraciones más largas y entender mejor los giros de la gramática. La gran pregunta era: ¿Podríamos construir un auto deportivo nuevo y superrápido específicamente para el turco, usando estas herramientas modernas, sin necesitar un presupuesto de mil millones de dólares o una biblioteca del tamaño de la luna?

Este artículo presenta ModernBERT-TR, un nuevo modelo de inteligencia artificial diseñado para ser el "cerebro turco" definitivo para las computadoras. Los investigadores tomaron los diseños arquitectónicos más recientes y avanzados (el motor "ModernBERT") y lo entrenaron desde cero utilizando únicamente texto en turco. No solo lanzaron una cantidad masiva de datos hacia él; curaron cuidadosamente una mezcla equilibrada de escritura de alta calidad en turco y utilizaron un diccionario personalizado (tokenizador) ajustado específicamente para la forma única en que se construyen las palabras en turco.

Los resultados son sorprendentemente poderosos. Aunque este nuevo modelo es relativamente pequeño —conteniendo unos 150 millones de "neuronas" (parámetros)—, superó a modelos mucho más grandes, incluyendo algunos con casi cuatro veces más neuronas. Al ser probado en 11 tareas diferentes en turco, como detectar discursos de odio o comprender reseñas de películas, ModernBERT-TR obtuvo un promedio del 60.2%, superando al siguiente mejor modelo por un margen significativo. Incluso igualó a un competidor que fue entrenado con aproximadamente 7 veces más datos (1 billón de tokens frente a los 144.4 mil millones de tokens del modelo) en una prueba de ajuste fino completo, demostando que un entrenamiento inteligente y una mejor arquitectura pueden vencer al volumen bruto de datos.

Los autores sugieren que la "fórmula secreta" no fue solo el tamaño del modelo, sino la calidad de la mezcla de datos. Descubrieron que repetir un conjunto de datos específico y de alta calidad en turco cinco veces durante el entrenamiento fue mucho más importante que ajustar otros parámetros como el tamaño del lote (batch size). En resumen, construyeron una máquina de habla turca ágil y eficiente que demuestra que no necesitas ser el más grande para ser el mejor; solo necesitas ser el más moderno y el más enfocado. Han liberado todo su código y el modelo mismo al público, con la esperanza de dar un gran impulso a cualquiera que intente construir tecnología que hable turco.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →