Language Models for Portuguese: A Systematic Mapping Study
Este artículo presenta un estudio de mapeo sistemático de 46 modelos de lenguaje desarrollados para el portugués, ofreciendo una visión integral de sus características técnicas, relaciones evolutivas y brechas de investigación actuales para guiar futuros avances en el campo.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el internet como una biblioteca gigante y bulliciosa donde cada libro está escrito en un idioma diferente. Durante mucho tiempo, las computadoras más inteligentes de esta biblioteca —aquellas que pueden leer, escribir y charlar como los humanos— fueron entrenadas principalmente con libros en inglés. Se volvieron increíblemente fluidas en inglés, pero cuando les preguntabas sobre historias de otras tierras, a menudo tropezaban, se confundían o simplemente inventaban cosas. Esto se debe a que el "cerebro" de estas computadoras está construido a partir de las palabras que han leído; si no han leído suficientes libros en un idioma específico, no pueden entender verdaderamente la cultura, los chistes o la historia detrás de esas palabras. Recientemente, los científicos han comenzado a construir computadoras especiales para el portugués, el idioma hablado por cientos de millones de personas en Brasil, Portugal y partes de África y Asia. Pero, al igual la que una biblioteca con libros dispersos, la información sobre estas nuevas computadoras de portugués es desordenada, está oculta en diferentes lugares y es difícil de encontrar toda a la vez.
Este artículo es como un bibliotecario súper organizado que decide limpiar toda la sección de portugués. Los autores, un equipo de una universidad en Brasil, emprendieron una búsqueda masiva para encontrar cada uno de los modelos de computadora diseñados para hablar portugués que fueron publicados entre 2020 y 2025. No solo los contaron; abrieron las cajas, revisaron los manuales e intentaron averiguar cómo fueron construidos, qué se les enseñó y si alguien realmente podía usarlos. Encontraron 46 modelos diferentes, que van desde chatbots generales hasta especialistas que solo hablan de derecho, medicina o petróleo y gas. ¿Su gran descubrimiento? Aunque hay un progreso emocionante, la "biblioteca" sigue siendo un poco caótica. Muchos de estos modelos son como recetas secretas que solo el chef conoce (el código no se comparte), algunos fueron enseñados usando libros traducidos que no capturan del todo el sabor local, y muy pocos han sido revisados para ver si son justos o seguros de usar. Los autores sugieren que para que estas computadoras sean verdaderamente útiles para todos los que hablan portugués, necesitamos dejar de depender de las traducciones, compartir nuestros planos de manera más abierta y asegurarnos de que las computadoras entiendan la rica diversidad del idioma, no solo la versión más popular de este.
La Gran Búsqueda de los Modelos de Portugués
Piensa en el mundo de la Inteligencia Artificial (IA) como un enorme sitio de construcción. Durante años, los rascacielos más grandes e impresionantes se construyeron usando ladrillos en inglés. Estos son los "Grandes Modelos de Lenguaje" (LLM), las computadoras inteligentes que pueden escribir ensayos, responder preguntas e incluso escribir código. Pero los trabajadores en este sitio se dieron cuenta de que si solo construyes con ladrillos en inglés, no puedes construir una casa que se sienta como un hogar para alguien que habla portugués. Así que, entre 2020 y 2025, una nueva ola de constructores comenzó a construir casas específicamente para los hablantes de portugués.
El problema era que estas nuevas casas estaban esparcidas por todo el mapa. Algunas eran descritas en revistas científicas elegantes, otras eran solo notas en un sitio web, y algunas estaban escondidas en informes técnicos que nadie leía. Era como intentar encontrar un juguete específico en una habitación donde los juguetes habían sido lanzados en diferentes pilas, algunas etiquetadas y otras no. Los autores de este artículo decidieron ordenar la habitación. Realizaron un "estudio de mapeo sistemático", que es una forma elegante de decir que crearon una lista maestra de cada modelo de lenguaje portugués que pudieron encontrar.
Encontraron 46 modelos en total. ¡Eso es un montón de computadoras diferentes! Los clasificaron como un coleccionista clasifica estampillas. Miraron qué "modelo base" era el punto de partida de cada uno (como si fue construido sobre una base de BERT, Llama o T5), para qué estaba diseñado (charla general, asesoría legal, diagnóstico médico o análisis de tweets) y qué tan grande era (variando desde modelos diminutos con 12 millones de parámetros hasta masivos con 72 mil millones).
El "Árbol Genealógico" de la IA en Portugués
Una de las cosas más geniales que hicieron los autores fue dibujar un "árbol filogenético". Imagina un árbol genealógico para estas computadoras. En lugar de mostrar cómo los humanos están relacionados con sus abuelos, este árbol muestra cómo estos modelos de IA están relacionados con sus "padres".
Descubrieron que la mayoría de los modelos de portugués son descendientes de unos pocos modelos "ancestros" famosos. La rama familiar más grande proviene de BERT, que es como el bisabuelo de muchos de estos modelos; 20 de los 46 modelos que encontraron fueron construidos directamente sobre BERT o sus primos. La segunda familia más grande proviene de la familia Llama, que es el ancestro nuevo y de moda en el que se basan 10 modelos.
El árbol también muestra cómo evolucionaron estos modelos. Algunos comenzaron como computadoras de propósito general (buenas para todo) y luego recibieron entrenamiento especializado para convertirse en expertos en campos específicos. Por ejemplo, hay una rama donde un modelo comenzó como un lector general, luego estudió libros de medicina para convertirse en un "CardioBERTpt" (una IA de cardiología), y luego otra versión estudió documentos legales para convertirse en un "JurisBERT" (una IA de abogados). Es como un estudiante que comienza en una escuela general y luego va a colegios especializados para convertirse en doctor o abogado.
El Problema de la "Puerta Abierta"
Los autores también revisaron las puertas de estas 46 casas para ver si alguien podía entrar. Buscaron tres cosas:
- El Código: ¿Puedes ver los planos?
- El Modelo: ¿Puedes descargar el cerebro de la computadora terminado?
- Los Datos: ¿Puedes ver los libros con los que la computadora fue entrenada?
Las noticias aquí son un poco mixtas. De los 46 modelos, solo 11 tenían su código fuente (los planos) disponible para que todos pudieran verlo. Cerca de 5 modelos estaban completamente cerrados: no podías usarlos para nada. Y para los datos de entrenamiento (los libros), solo 17 modelos utilizaron datos que estaban disponibles para descargar libremente. El resto utilizó datos que estaban ocultos tras un muro de pago, requerían un permiso especial para solicitarlo, o eran mantenidos en secreto por la empresa que los construyó.
Los autores también revisaron si estos modelos venían con una "Tarjeta de Modelo" (Model Card), que es como una etiqueta nutricional para la IA. Te dice en qué es bueno el modelo, en qué es malo y si tiene algún sesgo. Sorprendentemente, solo 3 de los 46 modelos tenían una etiqueta nutricional completa y perfecta. La mayoría tenía etiquetas a medio terminar, y 10 no tenían ninguna etiqueta. Esto significa que si usas estos modelos, podrías no saber exactamente a qué te estás enfrentando.
La "Trampa de la Traducción" y las Voces Faltantes
Uno de los hallazgos más importantes es sobre cómo aprendieron estos modelos a hablar. Los autores notaron que muchos modelos fueron enseñados usando libros que fueron traducidos del inglés al portugués. Imagina intentar aprender sobre la cultura brasileña leyendo un libro que fue escrito originalmente en Nueva York y luego traducido palabra por palabra. Podrías obtener la gramática correcta, pero perderías el argot, los chistes y los sentimientos locales.
El artículo sugiere que depender de datos traducidos es un problema. Significa que estos modelos podrían no entender los matices culturales únicos de los hablantes de portugués en Brasil, Portugal o África. Además, los autores señalan que casi todos los modelos que encontraron solo se enfocan en dos versiones del portugués: el portugués brasileño y el portugués europeo. Ignoraron por completo a los otros siete países donde el portugués es un idioma oficial, como Angola, Mozambique y Cabo Verde. Los autores argumentan que esto es una forma de "prejuicio lingüístico": asumir que solo porque un modelo habla portugués brasileño y europeo, puede hablar por todos los que hablan el idioma. Sugieren que los futuros modelos necesitan ser entrenados con datos que representen verdaderamente la diversidad de todas las naciones de habla portuguesa.
¿Qué Sigue?
Los autores concluyen que, si bien hemos hecho muchos progresos, aún tenemos un largo camino por recorrer. Sugieren que la próxima generación de la IA en portugués necesita:
- Dejar de usar datos traducidos y comenzar a usar libros y conversaciones reales y originales en portugués de todo el mundo.
- Compartir sus planos (código) para que otros científicos puedan revisar su trabajo y mejorarlo.
- Incluir más voces de los hablantes de portugués de África y Asia, no solo de Brasil y Portugal.
- Añadir más sentidos. Actualmente, la mayoría de estos modelos solo entienden texto. Los autores ven una gran oportunidad para construir modelos que también puedan entender imágenes y sonidos (modelos multimodales) específicamente para el portugués, como una computadora que pueda mirar una foto de una calle brasileña y describirla usando el argot local.
En resumen, la biblioteca de la IA en portugués está creciendo rápido, pero necesita una mejor organización, puertas más abiertas y una mayor variedad de voces para servir verdaderamente a los millones de personas que hablan el idioma.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.