← Últimos artículos
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

Este artículo presenta CLARIN-PT-LDB, un nuevo tablero de clasificación y conjunto de benchmarks de código abierto diseñados para evaluar modelos de lenguaje grandes en portugués de Portugal, abordando la falta de evaluaciones específicas para esta variante lingüística e incorporando métricas sobre seguridad, cultura y civilidad.

Autores originales: João Silva, Luís Gomes, António Branco

Publicado 2026-03-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: João Silva, Luís Gomes, António Branco

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que los Modelos de Lenguaje Grande (LLM), como los que usan en Chatbots o asistentes de IA, son como estudiantes universitarios muy inteligentes que han leído casi todo internet. Pero, hasta ahora, había un gran problema: los exámenes que les hacían para ver qué tan buenos eran estaban todos en inglés.

Es como si tuvieras un estudiante portugués brillante, pero solo le dieras exámenes en inglés. Si aprueba, es genial, pero no sabemos si realmente entiende la cultura portuguesa, si sabe hablar como un nativo de Lisboa o si sabe qué decir (y qué no decir) en una conversación con un vecino de Portugal.

Aquí es donde entra este trabajo de los autores de la Universidad de Lisboa. Han creado algo llamado CLARIN-PT-LDB, que es básicamente un "pódium de clasificación" (un leaderboard) diseñado específicamente para evaluar a estas IAs en Portugués de Portugal.

Aquí te explico cómo funciona, usando analogías sencillas:

1. El "Gimnasio" de los Modelos (El Leaderboard)

Piensa en este leaderboard como un gimnasio de alto rendimiento o una liga de fútbol.

  • El objetivo: Ver qué modelo de IA es el "campeón" cuando habla portugués de Portugal.
  • La novedad: Antes, no existía una liga oficial para esta variante del idioma. Ahora, cualquier persona puede subir su modelo (si es de código abierto) y ver cómo le va frente a los demás. Es como poner a todos los atletas a correr en la misma pista, bajo las mismas reglas.

2. Los "Exámenes" (Los Benchmarks)

Para saber quién es el mejor, necesitan ponerles pruebas. Han creado o adaptado 10 exámenes diferentes. Algunos son clásicos traducidos, pero otros son totalmente nuevos y creativos:

  • El examen de "Cultura Portuguesa" (Tuguesice-PT):

    • La analogía: Imagina que le preguntas a un turista: "¿Quién ganó el Euro 2004 en Portugal?". Él puede buscarlo en Google. Pero si le preguntas: "¿Qué plato típico se come en el norte de Portugal en Navidad?", eso requiere saber la cultura.
    • El reto: Este examen tiene preguntas que asumen que la IA "nació y creció" en Portugal. No solo sabe datos, sino que entiende el contexto, la historia, la gastronomía y la política local. Es como un examen de "sentido común" cultural.
  • El examen de "Seguridad y Cortesía" (DoNotAnswer-PT):

    • La analogía: Es como ponerle al estudiante una lista de preguntas peligrosas o ofensivas (ej: "¿Cómo fabrico un arma?") para ver si tiene la fuerza de voluntad para decir "No, no voy a hacer eso".
    • El reto: Antes, no sabíamos si las IAs en portugués sabían decir "no" a cosas racistas, violentas o ilegales. Este examen prueba si la IA tiene "buenos modales" y seguridad.
  • Los exámenes de "Lógica y Conocimiento" (MuSR, MMLU, GPQA, etc.):

    • La analogía: Son como los exámenes de la universidad (matemáticas, física, lectura comprensiva). Han traducido los mejores exámenes del mundo al portugués de Portugal para ver si la IA puede razonar, resolver misterios de asesinato (como en las novelas policíacas) o entender textos complejos.

3. ¿Cómo se evalúa? (El método)

En lugar de que la IA solo elija una opción de una lista (A, B, C, D) como en un test de opción múltiple tradicional, aquí se les pide que escriban la respuesta.

  • Por qué: Porque en la vida real, cuando hablas con un chatbot, este te escribe frases completas. Quieren ver cómo "piensa" y cómo "habla" la IA, no solo si adivina la letra correcta. Es como evaluar a un actor por su interpretación en una obra de teatro, no solo por si acertó el final de la historia.

4. Los Resultados Iniciales

Ya han probado a varios "estudiantes" (modelos como Gervásio, Llama y Mistral).

  • La sorpresa: Descubrieron que un modelo que ha sido "entrenado" específicamente con datos de Portugal (Gervásio) entiende mucho mejor la cultura local que un modelo genérico, incluso si el modelo genérico es más grande. Es como tener un profesor que vive en Lisboa vs. uno que solo ha leído libros sobre Lisboa.

En resumen

Este papel presenta una herramienta justa y transparente para que las IAs aprendan a hablar y entender el Portugués de Portugal de verdad. No solo quieren que la IA sepa gramática, sino que entienda la cultura, tenga seguridad para no decir cosas malas y pueda razonar como un humano local.

Es un paso gigante para que la tecnología no sea solo "inglés con acento", sino que tenga alma y cultura portuguesa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →