← Últimos artículos
💬 NLP

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

El artículo presenta CAPITU, un nuevo benchmark en portugués brasileño que evalúa la capacidad de seguimiento de instrucciones de modelos de lenguaje mediante tareas contextualizadas en obras literarias canónicas y restricciones lingüísticas verificables, revelando tanto el alto rendimiento de modelos avanzados como las ventajas de costo-eficiencia de modelos especializados en portugués.

Autores originales: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Publicado 2026-03-25
📖 4 min de lectura☕ Lectura para el café

Autores originales: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de estudiantes muy inteligentes (los modelos de Inteligencia Artificial) que hablan español, pero que a veces son un poco "despistados" cuando les das instrucciones específicas en portugués de Brasil.

El artículo que presentas introduce CAPITU, que es como un examen de la escuela primaria, pero diseñado específicamente para ver qué tan bien siguen las reglas estos estudiantes cuando hablan portugués.

Aquí te explico cómo funciona, usando analogías sencillas:

1. ¿Por qué es necesario este examen?

Hasta ahora, la mayoría de los exámenes para probar a la Inteligencia Artificial estaban en inglés. Traducir esos exámenes al portugués es como intentar enseñar a alguien a jugar al fútbol usando las reglas del béisbol: no encaja bien.

El portugués tiene sus propias "trampas" y reglas únicas, como:

  • Los diminutivos: En portugués, puedes hacer que una palabra sea "pequeñita" añadiendo "-inho" o "-inha" (como casinha en lugar de casa).
  • Los gerundios: Formas de verbos que terminan en "-ando", "-endo" o "-indo".

CAPITU no solo traduce preguntas; crea un examen nativo que usa estas reglas específicas del portugués.

2. El escenario: Una biblioteca de clásicos

Para que el examen no sea aburrido, CAPITU pone a los estudiantes en un escenario literario. Imagina que en lugar de decir "escribe un texto", les dicen: "Escribe una reseña sobre 'Dom Casmurro' (un libro famoso brasileño) pero...".

El examen se basa en 8 libros clásicos de la literatura brasileña. Esto asegura que la IA no solo esté siguiendo reglas, sino que entienda el contexto cultural y la historia de Brasil. Es como si el profesor dijera: "Escribe sobre este libro, pero asegúrate de que tu texto tenga exactamente 100 palabras y que no uses la palabra 'muy'".

3. Las reglas del juego (Las instrucciones)

El examen tiene 59 tipos de reglas diferentes, divididas en 7 categorías. Algunas son fáciles, otras son un verdadero reto:

  • Fáciles: "No uses la palabra 'siempre'". (Casi todos los estudiantes lo hacen bien).
  • Difíciles: "Usa exactamente 3 palabras que terminen en '-zinho'".
  • Imposibles (casi): "Escribe un texto donde la primera letra de cada frase forme la palabra 'AMOR'". (Esto es como un acróstico, muy difícil de planear).

Lo genial es que nadie humano tiene que corregir el examen. Un programa de computadora revisa automáticamente si se cumplieron las reglas, como un robot que cuenta palabras y busca letras específicas. Esto hace que el resultado sea 100% justo y repetible.

4. ¿Quién aprobó y quién reprobó?

Los autores probaron 18 modelos de Inteligencia Artificial diferentes. Aquí están los resultados principales:

  • Los "Genios" (GPT-5): Los modelos más avanzados de OpenAI (como GPT-5) obtuvieron notas casi perfectas (casi un 99%). Son como los estudiantes que leen las instrucciones tres veces antes de escribir.
  • Los "Especialistas Locales" (Sabiazinho): Aquí está la sorpresa. Un modelo hecho específicamente para portugués, llamado Sabiazinho-4, obtuvo un 87% de aciertos. ¡Y costó 8 veces menos que un modelo famoso como Claude! Es como si un estudiante local, que conoce bien el idioma y la cultura, rindiera mejor que un estudiante extranjero muy caro.
  • El problema de la memoria a largo plazo: Cuando el examen se hizo en varias rondas (como una conversación donde las reglas se acumulan), muchos estudiantes empezaron a olvidar las reglas de la primera ronda. Es como si en la segunda pregunta te dijeran: "Recuerda que en la primera pregunta no podías usar la palabra 'rojo', y ahora tampoco puedes usar 'azul'". Muchos modelos se confundían y olvidaban la primera regla.

5. ¿Qué nos enseña esto?

El mensaje principal es que la Inteligencia Artificial está mejorando mucho en portugués, pero aún tiene dificultades con:

  1. Contar exactamente: Decir "usa exactamente 50 palabras" es muy difícil para una IA.
  2. Las reglas de la gramática local: Usar los diminutivos o gerundios de forma controlada.
  3. Mantener el foco: No olvidar las reglas cuando la conversación se alarga.

En resumen: CAPITU es como un "entrenador de fútbol" que ha creado un campo de entrenamiento específico para el portugués, usando los clásicos de la literatura como balón. Nos dice qué modelos son los mejores para seguir instrucciones en este idioma y nos ayuda a construir IAs que no solo hablen portugués, sino que lo entiendan y respeten sus reglas culturales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →