← Últimos artículos
💻 computer science

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

Este artículo evalúa diez LLM frente al examen ENEM de Brasil para revelar que, si bien pueden clasificar moderadamente la dificultad de las preguntas, subestiman sistemáticamente la complejidad de los ítems, tienen dificultades con el contenido multimodal y carecen de la plasticidad contextual necesaria para la evaluación personalizada, lo que sugiere que son más adecuados como evaluadores calibrados que como generadores autoritativos.

Autores originales: Thiago Brant, Julien Kühn, Jun Pang

Publicado 2026-02-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Thiago Brant, Julien Kühn, Jun Pang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor intentando construir un nuevo examen de matemáticas. Tienes a un robot asistente súper inteligente (una IA) que puede escribir las preguntas por ti. Pero antes de entregar el examen a los estudiantes, necesitas saber: ¿Es esta pregunta demasiado fácil? ¿Es demasiado difícil?

Tradicionalmente, los profesores responden a esto aplicando el examen primero a miles de estudiantes, calificando los resultados y realizando matemáticas complejas para determinar la dificultad. Esto toma mucho tiempo y cuesta mucho dinero.

Este artículo plantea una pregunta sencilla: ¿Podemos simplemente preguntarle a la IA: "¿Qué tan difícil es esta pregunta?" y confiar en su respuesta?

Los investigadores probaron esta idea utilizando el enorme examen nacional de secundaria de Brasil (ENEM), que tiene más de 1,000 preguntas reales. Le pidieron a diez modelos de IA diferentes que adivinaran la dificultad de estas preguntas y compararon sus suposiciones con las puntuaciones de dificultad "oficiales" calculadas por expertos humanos.

Aquí está lo que encontraron, explicado con algunas analogías de la vida cotidiana:

1. El problema de "Bueno para clasificar, malo para los números"

Los modelos de IA son como un estudiante que es excelente ordenando libros por tamaño pero pésimo midiéndolos con una regla.

  • La buena noticia: Si le pides a la IA que clasifique 10 preguntas de la "más fácil" a la "más difícil", hace un trabajo decente. Puede decirte que la Pregunta A es más difícil que la Pregunta B.
  • La mala noticia: Si le preguntas a la IA: "En una escala del 1 al 10, ¿qué tan difícil es esto?", es consistentemente errónea. Casi siempre piensa que las preguntas son más fáciles de lo que realmente son. Es como una persona que piensa que un maratón es solo un "trote ligero" porque nunca ha corrido uno.

2. El efecto de la "Venda" (Visuales vs. Texto)

Muchas preguntas de exámenes tienen imágenes, gráficos o tablas. Dado que algunas IA no pueden "ver" imágenes, los investigadores tuvieron que describir las imágenes con palabras (como un ciego describiendo una pintura a un amigo).

  • El resultado: Cuando la IA tuvo que adivinar la dificultad basándose solo en la descripción textual de una imagen, se confundió. Fue mucho peor juzgando estas preguntas que las que eran solo de texto.
  • La analogía: Imagina intentar adivinar qué tan difícil es un rompecabezas leyendo una descripción de las piezas, en lugar de mirar el rompecabezas mismo. Podrías perderte una pista crucial, haciendo que el rompecabezas parezca más fácil o más difícil de lo que realmente es.

3. La trampa del "Talla única" (Antecedentes de los estudiantes)

Los investigadores querían ver si la IA podía ajustar su respuesta basándose en quién está tomando el examen. Le preguntaron a la IA: "¿Qué tan difícil es esto para un estudiante de Finlandia?" frente a "¿Qué tan difícil es esto para un estudiante de Brasil?".

  • El resultado: La IA apenas cambió su opinión. Fue mayormente "sorda" a estos cambios.
  • La analogía: Imagina a un chef que cocina una sopa. Si le preguntas: "¿Es esta sopa demasiado salada para un bebé?" o "¿Es demasiado salada para un fisicoculturista?", el chef solo se encoge de hombros y dice: "Es la misma sopa". La IA no entendió realmente que diferentes estudiantes tienen diferentes antecedentes y niveles de conocimiento. No pudo adaptar su "medidor de dificultad" para ajustarse a la persona.

4. El juego del "Prompt" (Cómo preguntas importa)

Los investigadores intentaron hacer la pregunta de diferentes maneras. A veces solo decían: "Califica esto". Otras veces decían: "Actúa como un profesor de matemáticas, piensa paso a paso y luego califica esto".

  • El resultado: La forma en que haces la pregunta cambió la respuesta significativamente. Algunos prompts de "pensamiento" ayudaron a la IA a acertar la clasificación, pero no solucionaron el problema de que pensara que todo era demasiado fácil.
  • La analogía: Es como pedirle una recomendación de película a un amigo. Si preguntas "¿Qué es una buena película?", puede que te diga una comedia. Si preguntas "¿Qué es una buena película para un martes lluvioso por la noche?", puede que te diga un thriller. La respuesta de la IA depende mucho de cómo redactes la pregunta.

La gran conclusión: La herramienta de "Cribado"

El artículo concluye que no debemos tratar a estos modelos de IA como Oráculos (dioses omniscientes que dan la respuesta perfecta). En su lugar, debemos tratarlos como Cribadores (un primer filtro).

  • La recomendación: Usa la IA para escanear rápidamente un montón de preguntas nuevas y decir: "Oye, esta parece que podría ser demasiado fácil, y esta otra parece que podría ser demasiado difícil".
  • El truco: No puedes confiar en el número exacto de la IA. Debes corregir su "sesgo" (enseñarle que está subestimando la dificultad) y debes tener a un humano revisando las preguntas, especialmente aquellas con imágenes.

En resumen: La IA es un asistente útil que puede ayudarte a separar las preguntas "fáciles" de las "difíciles", pero no está lista para ser el juez final de qué tan difícil es exactamente una pregunta, ni está lista para entender las necesidades específicas de diferentes tipos de estudiantes. Necesitamos calibrarla y mantener a un humano en el proceso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →