← Últimos artículos
💬 NLP

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

El artículo presenta NorBERTo, un modelo moderno solo de codificador para el portugués de Brasil entrenado en el corpus monolingüe abierto más grande disponible (Aurora-PT) de 331 mil millones de tokens, que logra un rendimiento de vanguardia en varias pruebas semánticas y ofrece una solución eficiente y desplegable para tareas de PLN posteriores.

Autores originales: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreic
Publicado 2026-05-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreich, Vinicius F. Caridá

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot a entender el idioma portugués. Durante mucho tiempo, los mejores robots eran como estudiantes que habían leído unos cuantos buenos libros pero no habían visto toda la biblioteca. Este artículo presenta un nuevo robot llamado NorBERTo y una nueva biblioteca masiva llamada Aurora-PT que le ayuda a aprender.

Aquí está la historia de cómo lo hicieron, explicada de forma sencilla:

1. El Problema: El Robot Necesitaba una Biblioteca Más Grande

Antes de esto, los mejores robots de idioma portugués (como BERTimbau y Albertina) fueron entrenados en bibliotecas que contenían aproximadamente entre 2 y 3 mil millones de "palabras" (tokens). Aunque eran buenos, era como intentar aprender un idioma leyendo unas cuantas novelas y un diccionario.

Los autores se dieron cuenta de que para crear un robot verdaderamente inteligente, necesitaban una biblioteca del tamaño de una ciudad masiva. Querían construir un robot que pudiera entender los matices del portugués de Brasil sin necesidad de ser una supercomputadora gigante y costosa que genere historias interminables (las cuales son propensas a inventar cosas, o "alucinar").

2. La Nueva Biblioteca: Aurora-PT

El equipo construyó Aurora-PT, una colección de texto totalmente nueva.

  • La Escala: Contiene 331 mil millones de tokens. Para ponerlo en perspectiva, si las bibliotecas antiguas fueran una sola estantería, Aurora-PT sería todo un almacén. Actualmente es la biblioteca abierta más grande de su tipo para el portugués.
  • La Limpieza: No simplemente tiraron todo dentro. Actuaron como bibliotecarios estrictos, utilizando herramientas automatizadas para desechar basura, páginas duplicadas y contenido tóxico. Solo conservaron el texto de alta calidad y limpio de diversas fuentes como Wikipedia, blogs y páginas web.

3. El Nuevo Robot: NorBERTo

Utilizando esta biblioteca masiva, entrenaron un nuevo robot llamado NorBERTo.

  • El Diseño: En lugar de usar el diseño antiguo y estándar para robots, utilizaron un plano moderno llamado ModernBERT. Piensa en esto como actualizar de una bicicleta a una bicicleta eléctrica de alta velocidad. Tiene características especiales que le permiten leer oraciones más largas sin confundirse y procesar información mucho más rápido.
  • El Tamaño: Construyeron dos versiones: un modelo "Base" (aproximadamente 150 millones de "células cerebrales" o parámetros) y un modelo "Grande" (aproximadamente 395 millones).
  • El Entrenamiento: Enseñaron al robot desde cero utilizando únicamente texto en portugués. No hizo trampa comenzando con conocimientos del inglés; aprendió portugués puramente de la biblioteca Aurora-PT.

4. La Prueba de Manejo: ¿Cómo Rindió?

El equipo sometió a NorBERTo a una serie de pruebas de manejo (puntos de referencia) para ver qué tan bien entendía el portugués en comparación con los antiguos campeones.

  • La Prueba de "Lógica" (Implicación Textual): Imagina mostrarle al robot dos oraciones y preguntarle: "¿La segunda oración sigue lógicamente de la primera?".
    • Resultado: NorBERTo (Grande) ganó esta categoría, superando a los modelos anteriores. Demostró que un diseño moderno + una biblioteca enorme = mejor lógica.
  • La Prueba de "Significado" (Similitud Semántica): Imagina preguntar: "¿Estas dos oraciones dicen lo mismo?".
    • Resultado: El antiguo campeón, BERTimbau, aún mantenía el liderazgo aquí. Los autores explican que esto se debe probablemente a que BERTimbau comenzó con una ventaja gracias al entrenamiento en inglés, mientras que NorBERTo tuvo que aprender todo desde cero.
  • La Prueba de "Parafraseo" (MRPC): ¿Puede el robot decir si dos oraciones son simplemente diferentes formas de decir lo mismo?
    • Resultado: NorBERTo (Grande) aplastó a la competencia, logrando la puntuación más alta jamás registrada para esta tarea específica en portugués.

5. La Gran Conclusión

El artículo concluye que no necesitas un "super-robot" gigante y costoso (como los modelos masivos de IA que escriben historias) para realizar trabajos específicos bien.

Al combinar una biblioteca enorme y limpia (Aurora-PT) con un diseño moderno y eficiente (ModernBERT), crearon un robot "Ricitos de Oro":

  • No es demasiado pequeño (es más inteligente que los modelos antiguos).
  • No es demasiado grande (es más barato y rápido de ejecutar que la IA masiva).
  • Es justo lo adecuado para tareas del mundo real como clasificar correos electrónicos, entender preguntas de clientes o ayudar a los motores de búsqueda a encontrar las respuestas correctas.

En resumen: Construyeron una biblioteca más grande y limpia y un robot más inteligente y eficiente, demostrando que para entender el portugués no necesitas ser la IA más grande en la sala; solo necesitas las herramientas adecuadas y los datos adecuados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →