BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams
Este artículo presenta BLUEX v2, un nuevo referente que comprende 395 preguntas abiertas de los principales exámenes de ingreso universitario de Brasil (2022–2025) para evaluar 21 modelos de lenguaje de gran tamaño de última generación en tareas discursivas en portugués, revelando brechas de rendimiento significativas y destacando desafíos en el razonamiento matemático y la comprensión de imágenes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que has estado probando qué tan inteligentes son un grupo de robots haciéndoles preguntas sencillas de opción múltiple, como "¿De qué color es el cielo? A) Azul, B) Rojo". Lo han estado haciendo de maravilla eligiendo la letra correcta. Pero los investigadores detrás de este artículo, BLUEX v2, se dieron cuenta de que elegir una letra es fácil. La verdadera prueba de inteligencia es escribir un ensayo completo, explicar por qué el cielo es azul y dibujar un diagrama para demostrarlo.
Este artículo presenta un nuevo "examen final" mucho más difícil para los modelos de IA, diseñado específicamente para probar su capacidad de hablar y escribir en portugués.
Aquí está el desgalle de su trabajo utilizando analogías simples:
1. El Problema: La trampa de la "opción múltiple"
Anteriormente, los investigadores probaban a la IA con exámenes de ingreso a universidades brasileñas, pero solo con la primera fase. Piensa en la primera fase como un juego de trivia donde solo marcas la respuesta correcta. Es fácil para la IA adivinar o reconocer patrones.
La segunda fase de estos exámenes (la en la que se enfoca BLUX v2) es como una defensa de tesis final. Los estudiantes deben escribir respuestas largas y detalladas, resolver problemas matemáticos complejos paso a paso e interpretar mapas o gráficos. Las pruebas antiguas no podían medir si una IA realmente podía pensar y escribir como un humano; solo medían si podía reconocer la respuesta correcta.
2. La Solución: Un nuevo "Examen Final" para la IA
El equipo creó BLUEX v2, un enorme conjunto de datos de 395 preguntas reales de las mejores universidades de Brasil (UNICAMP y USP) entre 2022 y 2025.
- Las Preguntas: Estas no son solo texto. Aproximadamente el 56% de ellas incluyen imágenes, tablas o mapas que debes comprender para responder correctamente.
- El Formato: La IA tiene que escribir respuestas de forma libre, no elegir A, B, C o D.
- Los Temas: Cubre 9 materias diferentes, desde Historia y Sociología hasta Física y Matemáticas.
3. Cómo calificaron a los robots: El "Profesor de IA"
Calificar un ensayo de 5 páginas es difícil de hacer para los humanos rápidamente para miles de pruebas. Por eso, los investigadores construyeron un sistema donde una IA actúa como el profesor.
- La Rúbrica: Primero, usaron una IA para leer la "respuesta correcta oficial" y desglosarla en una lista de verificación (una rúbrica). Por ejemplo, si la respuesta debe mencionar "ATP" y "contracción muscular", la lista de verificación tiene esos dos elementos.
- El Juez: Otra IA (el "Juez") lee la respuesta del robot estudiante y marca los elementos de la lista. ¿Mencionó el ATP? Sí. ¿Mencionó la contracción muscular? No.
- La Calificación: El robot recibe una puntuación de 0 a 10 basada en cuántos elementos de la lista de verificación cumplió.
- La Prueba: Para asegurar que el "Profesor de IA" no estuviera alucinando, compararon su calificación contra profesores humanos reales. La IA estuvo de acuerdo con los humanos el 89.5% de las veces. Ese es un puntaje muy alto, lo que demuestra que la calificación automatizada es confiable.
4. Los Resultados: ¿Quién aprobó y quién reprobó?
Probaron 21 modelos de IA diferentes (los "robots") en este examen.
- La Dispersión: Las puntuaciones variaron desde un bajo de 4.18 hasta un alto de 9.10. Esto muestra que la prueba es buena para distinguir entre un robot inteligente y uno no tan inteligente.
- Los Ganadores: Los mejores desempeños fueron de modelos gigantes y costosos como Gemini 3.1 Pro y GPT-5.
- Los Perdedores: Los modelos más pequeños y de código abierto tuvieron dificultades, con las puntuaciones más bajas alrededor de 4.18.
- Las Estrellas Brasileñas: Curiosamente, los modelos fabricados en Brasil (Sabiá-4) se desempeñaron muy bien, casi tan bien como los gigantes globales, demostiendo que el entrenamiento local ayuda.
5. Las "Partes Difíciles": Donde los robots tropiezan
Incluso los mejores robots tuvieron problemas con dos cosas específicas:
- Razonamiento Matemático: Este fue el tema más difícil. Al igual que un humano que puede escribir una gran historia pero no sabe hacer una división larga, las IA podían escribir hermosos ensayos en portugués pero a menudo fallaban en los pasos matemáticos.
- Comprensión de Imágenes: Cuando una pregunta incluía un gráfico o un mapa, las puntuaciones de los robots bajaron aproximadamente 0.5 puntos en promedio. Es como darle a un estudiante un problema de matemáticas pero dibujar los números en un papel arrugado; la IA luchaba por "ver" los detalles con suficiente claridad para resolver el problema.
6. El Costo de la Prueba
Los investigadores fueron transparentes sobre el precio. Ejecutar todo este experimento —hacer las preguntas, generar las descripciones de las imágenes y calificar las respuestas— costó alrededor de $127. Esto es sorprendentemente barato para un estudio de este tamaño, demostrando que podemos probar la IA de manera rigurosa sin gastar millones.
La Conclusión
BLUEX v2 es un nuevo y más duro estándar para probar la IA en portugués. Va más allá de la simple trivia y obliga a la IA a escribir, razonar y mirar imágenes. Los resultados muestran que, si bien la IA se está volviendo muy buena escribiendo y argumentando en portugués, todavía tiene dificultades con las matemáticas complejas y la interpretación de datos visuales. Este benchmark ofrece a los investigadores un mapa claro de dónde enfocar sus próximas mejoras.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.