← Últimos artículos
💬 NLP

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

Este artículo presenta MoganBert-TR, un modelo base de codificador para el turco de 149 millones de parámetros entrenado desde cero mediante un novedoso currículo CLM-a-MLM y una programación especializada de contexto largo, el cual logra un rendimiento de vanguardia en los referentes de procesamiento de lenguaje natural para el turco y genera un modelo de incrustación altamente eficiente que alcanza el 99,5 % de la puntuación de su modelo maestro de 7,57 mil millones de parámetros.

Autores originales: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

Publicado 2026-08-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la inteligencia artificial, existen dos formas principales en las que las computadoras aprenden a entender el lenguaje humano. Un enfoque, a menudo presente en las noticias, involucra modelos que generan texto, escribiendo historias o respondiendo preguntas desde cero. El otro enfoque, más silencioso pero igualmente vital, utiliza modelos que actúan como potentes motores de búsqueda y clasificadores. Estos modelos "codificadores" (encoder) leen una oración y la convierten en un resumen matemático compacto, lo que permite a las computadoras comparar ideas, encontrar documentos relevantes o clasificar información con una velocidad increíble. Durante años, el método estándar para enseñar a estos modelos ha sido un tipo específico de juego de adivinanzas: la computadora ve una oración con algunas palabras ocultas y debe predecir las partes faltantes. Este método, conocido como modelado de lenguaje con máscara (masked language modeling), ha funcionado bien, pero los investigadores se han preguntado durante mucho tiempo si existe una mejor manera de enseñar a la máquina la estructura de un lenguaje, especialmente para idiomas que son complejos y ricos en formas de palabras, como el turco.

Un equipo de investigadores ha construido ahora un nuevo fundamento para la comprensión del idioma turco, demostrando que la forma en que se enseña a un modelo importa tanto como la arquitectura sobre la cual se construye. Crearon un modelo llamado MoganBert-TR, entrenado desde cero sobre una colección masiva de texto en turco. En lugar de aferrarse al tradicional juego de adivinanzas, introdujeron un currículo de aprendizaje de dos etapas. Primero, el modelo aprendió a leer texto de izquierda a derecha, prediciendo la siguiente palabra en una secuencia, muy parecido a un humano leyendo un libro. Solo después de esta fase inicial, cambiaron al método tradicional de ocultar palabras y pedir al modelo que las completara. Este cambio en la estrategia de enseñanza, combinado con un conjunto de datos cuidadosamente limpiado y una nueva forma de manejar oraciones largas, resultó en un modelo que entiende mejor el turco que las versiones anteriores, particularmente cuando se trata de encontrar información relevante en grandes bases de datos.

Los investigadores comenzaron reuniendo una cantidad masiva de texto de internet, incluyendo páginas web recientes y archivos antiguos, pero no simplemente vertieron estos datos en el sistema de entrenamiento. Construyeron un sofisticado proceso de filtrado para eliminar contenido de baja calidad, como spam o anuncios repetitivos, y para asegurar que el texto fuera genuinamente útil. Debido a que no existía una herramienta para juzgar automáticamente la calidad del texto en turco, entrenaron un modelo más pequeño y especializado para actuar como un maestro, que luego enseñó a un sistema más rápido cómo realizar los mismos juicios de calidad. Esto les permitió procesar millones de documentos de manera eficiente, conservando solo el material de alta calidad. También crearon un nuevo diccionario para el modelo, uno que divide las palabras turcas en piezas más pequeñas de manera más eficiente que intentos anteriores, lo cual es crucial porque las palabras turcas pueden cambiar de forma significativamente dependiendo de su función en una oración.

El núcleo de su descubrimiento reside en el orden de las operaciones durante el entrenamiento. Probaron si comenzar con el método de predicción de izquierda a derecha antes de cambiar al método de ocultación de palabras marcaba una diferencia. En un experimento controlado utilizando la misma cantidad de potencia de cómputo y los mismos datos, el nuevo enfoque de dos etapas superó ampliamente al método tradicional en lo que respecta a la recuperación de información. Mientras que ambos métodos funcionaron de manera similar en tareas simples de clasificación, el nuevo enfoque fue casi cuatro veces mejor en la búsqueda de documentos relevantes en una prueba de búsqueda. Los investigadores descubrieron que el método tradicional causaba que las representaciones internas del modelo colapsaran en una forma estrecha y poco útil, donde todos los significados parecían demasiado similares. El nuevo currículo evitó este colapso, permitiendo que el modelo mantuviera una visión más amplia y distinta del significado del lenguaje.

Para refinar aún más el modelo, los investigadores experimentaron con la forma en que la computadora aprendía durante las etapas finales del entrenamiento. Dividieron el proceso en dos caminos: uno donde el modelo continuaba aprendiendo con oraciones cortas, y otro donde aprendía con oraciones mucho más largas. Al comparar los resultados de estos dos caminos, encontraron que terminar el entrenamiento con oraciones cortas realmente mejoraba el rendimiento general del modelo más que terminar con las largas. Este hallazgo fue sorprendente, ya que a menudo se asume que los contextos más largos son mejores. También probaron una técnica llamada "sopa de modelos" (model soup), donde promediaron los pesos de diferentes modelos entrenados, con la esperanza de obtener lo mejor de ambos mundos. Sin embargo, su método de ramificación simple, que costó solo una fracción mínima más de ejecutar, produjo un mejor resultado que la compleja técnica de promediado.

El producto final, MoganBert-TR, alcanzó la puntuación más alta entre los modelos turcos basados en la arquitectura moderna utilizada en este estudio. Funcionó excepcionalmente bien en tareas que involucran la recuperación de código, encontrando fragmentos correctos de código de programación a partir de descripciones en lenguaje natural, una tarea en la que superó significativamente a los modelos anteriores. Este éxito se atribuyó a la combinación de su nuevo diccionario, que preserva el espaciado y la estructura del código, y la inclusión deliberada de una gran cantidad de texto de programación en los datos de entrenamiento. El equipo también creó un modelo compañero diseñado específicamente para crear resúmenes de texto aptos para la búsqueda. Al enseñar a este modelo más pequeño a imitar a un maestro mucho más grande y poderoso, lograron un resultado que era casi tan bueno como el del gigante maestro, pero requirió cincuenta y una veces menos potencia de cómputo para ejecutarse.

El trabajo destaca que para idiomas como el turco, actualizar simplemente la estructura de un modelo no es suficiente; el método de entrenamiento mismo debe ser repensado. Los investigadores demostraron que un currículo de dos etapas, comenzando con la predicción secuencial y pasando a la máscara de palabras, crea una comprensión más robusta del lenguaje. También demostraron que las etapas finales del entrenamiento son un espacio de diseño crítico donde los cambios pequeños, como la longitud del texto que se procesa, pueden tener un impacto mensurable en el rendimiento. Aunque el modelo todavía tiene algunas debilidades en áreas específicas, como la comprensión de la estructura de las oraciones en ciertas pruebas gramaticales, representa un paso significativo hacia adelante. El equipo ha puesto a disposición del público su modelo, el diccionario y el código utilizado para construirlo, permitiendo que otros construyan sobre este fundamento para la tecnología del idioma turco.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →