← Últimos artículos
💻 computer science

A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor

Este estudio presenta la primera comparación sistemática a gran escala de dieciocho modelos de lenguaje de gran tamaño contemporáneos para la calificación automatizada de tareas de programación, revelando variaciones significativas de rendimiento entre arquitecturas y proveedores, un bajo rendimiento constante de las variantes de modelos más pequeños y una brecha moderada persistente entre el consenso automatizado y las evaluaciones de profesores humanos.

Autores originales: Marcin Jukiewicz

Publicado 2026-08-04
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Marcin Jukiewicz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor con una montaña de tareas por calificar. Tienes 6.000 asignaciones de programación que revisar y tus ojos están cansados. Entra el "Calificador Digital": un tipo de cerebro informático superinteligente llamado Modelo de Lenguaje Extenso (LLM). Piensa en estos modelos como robots increíblemente cultos que han leído casi todo en internet, incluyendo millones de líneas de código. Están diseñados para entender el lenguaje y la lógica, por lo que parece una idea perfecta pedirles que califiquen el trabajo de los estudiantes al instante. Pero aquí está el truco: al igual que los humanos, estos robots tienen diferentes personalidades. Algunos son estrictos, otros son relajados y otros son simplemente extraños. La gran pregunta para las escuelas es: si dejamos que estos robots se encarguen de calificar, ¿serán justos? ¿Estarán de acuerdo con los profesores humanos? ¿O convertirán el sistema de calificación en un juego caótico donde un robot te da un A+ y otro te pone un F por el mismo código?

Este artículo es como una enorme "prueba de sabor" para estos calificadores digitales. El autor, Marcin Jukiewicz, recopiló 6.000 asignaciones reales de programación de un curso universitario y le pidió a 18 versiones diferentes de estos robots de IA que las calificaran todas. No se limitó a pedirles que dieran una puntuación; observó cómo pensaban, qué tan estrictos eran y si estaban de acuerdo entre sí o con los profesores humanos. El estudio revela que estos modelos de IA no son un bloque uniforme de inteligencia; son una familia de primos muy diferentes. Algunos son "liberales" y reparten puntuaciones altas como si fueran caramelos, mientras que otros son "restrictivos" y reprueban a los estudiantes por errores minúsculos. Incluso más sorprendente, los robots de la misma empresa (como OpenAI o Google) tienden a pensar y calificar de maneras muy similares, casi como si hubieran sido criados en la misma casa con las mismas reglas.

El hallazgo más importante, sin embargo, es un golpe de realidad. Incluso el robot de IA "mejor" del estudio mostró un nivel de alineación estadística moderado con los profesores humanos, lejos de ser una coincidencia perfecta. En el mundo de la calificación, eso es como dos jueces en un concurso de talentos dando puntuaciones completamente diferentes al mismo cantante. El estudio sugiere que, si bien la IA puede ser consistente consigo misma, todavía lucha por igualar la forma matizada, permisiva y consciente del contexto en que califican los profesores humanos. Además, el estudio encontró que las versiones "mini" o "nano" de estos modelos (las más pequeñas y baratas) eran generalmente peores calificando que sus hermanos más grandes y completos. Así que, si una escuela quiere usar IA para calificar tareas, no puede simplemente elegir cualquier robot; tiene que elegir cuidadosamente, porque la elección del robot cambiará realmente las notas que obtienen los estudiantes.

El Gran Duelo de Calificación de Robots

Imagina que entras en un aula donde 18 robots están sentados en sus pupitres, cada uno sosteniendo un bolígrafo rojo. Están a punto de calificar la misma pila de 6.000 asignaciones de programación. Estos no son cualquier tipo de robots; son los últimos y más avanzados "Modelos de Lenguaje Extenso" (LLM) de cuatro grandes gigantes tecnológicos: OpenAI, Google, Anthropic y DeepSeek. El objetivo de este estudio era ver si todos estos robots se pondrían de acuerdo sobre quién saca una A, quién una B y quién reprueba.

Los resultados fueron un poco como un programa de telerrealidad donde los jueces no logran ponerse de acuerdo en nada. El autor descubrió que estos robots tienen "filosofías de calificación" distintas.

Los Robots "Buenos" vs. Los Robots "Malos"
Algunos robots eran increíblemente generosos. Modelos como GPT-4o y Claude-haiku-3.5 eran los calificadores "liberales". Tendían a dar puntuaciones altas (un "1" o crédito total) muy a menudo. Si el código de un estudiante estaba mayormente correcto, estos robots estaban felices de darle una nota de aprobado. En el otro extremo del espectro, tenías a los robots "restrictivos" como DeepSeek-Reasoner y GPT-4.1-nano. Estos eran los disciplinadores estrictos. Eran mucho más propensos a dar un "0" (una nota de reprobado) si detectaban incluso un pequeño error. Eran los robots que te reprobarían por un punto y coma faltante, mientras que los robots buenos solo te darían un suave toque de atención.

Luego estaban los robots "equilibrados", como Claude-sonnet-4 y Gemini-2.0-flash-lite. Estos eran los calificadores de punto medio. No solo te daban una puntuación perfecta o una de reprobado; les encantaba la puntuación de "0.5". Eran los que decían: "Captaste la idea principal, pero te faltaron algunos detalles, así que aquí tienes un crédito parcial".

El Parecido Familiar
Uno de los descubrimientos más interesantes fue que los robots de la misma empresa actuaban como hermanos. Si observabas los patrones de calificación de los diferentes modelos de OpenAI (como GPT-4o, GPT-5 y sus versiones "mini"), estos se agrupaban. Pensaban de forma similar. Lo mismo ocurría con los modelos Gemini de Google y los modelos Claude de Anthropic. Es como si OpenAI hubiera enseñado a todos sus robots a calificar con un estilo específico, y Google hubiera enseñado a sus robots un estilo diferente. El estudio encontró seis grupos distintos de robots: cinco "clanes" principales con estilos compartidos (GPT-5, GPT-4, Gemini, DeepSeek y Claude) más un grupo especial de "Outlier" (valores atípicos) que agrupaba a dos modelos únicos porque no encajaban en ningún otro lugar.

El "Mini" vs. El "Mega"
El estudio también analizó el tamaño de los robots. Las empresas tecnológicas suelen lanzar versiones "mini" o "nano" de sus modelos, que son más pequeñas, rápidas y baratas de ejecutar. El artículo encontró que estos robots más pequeños eran generalmente peores calificando. Los modelos "flagship" (insignia) de tamaño completo eran más consistentes y fiables. Es como comparar a un chef profesional con un niño que acaba de ver un programa de cocina; el niño puede terminar el plato, pero el profesional tiene más probabilidades de acertar con el sabor cada vez. Los modelos "mini" y "nano" tenían un menor acuerdo con los profesores humanos, lo que sugiere que si una escuela intenta ahorrar dinero usando los modelos más baratos y pequeños, podría estar obteniendo calificaciones de menor calidad.

El Factor Humano
Aquí está el giro que podría sorprenderte. Cuando el autor comparó todos estos robots con los profesores humanos reales que calificaron las mismas asignaciones, los robots no coincidieron bien. De hecho, ¡los profesores humanos fueron los más generosos de todos! Ellos dieron las puntuaciones medias más altas (0.726) y eran mucho más propensos a dar un "1" completo que cualquiera de los robots.

El mejor robot, Claude-haiku-3.5, mostró un puntaje de acuerdo estadístico de 0.470 con los profesores humanos. En el mundo de la estadística, esto se considera un acuerdo "moderado", no uno "bueno". Para ser considerado "bueno", normalmente necesitas un puntaje superior a 0.75. Esto significa que si usaras este robot para calificar tu tarea, es probable que te diera una nota diferente a la que te daría tu profesor, y sería más estricto.

La Paradoja de la "Multitud"
El estudio hizo algo ingenioso para probar a los robots entre sí. En lugar de compararlos con los humanos, los investigadores preguntaron: "Si tomamos la nota más común dada por los 18 robots, ¿es esa la nota 'verdadera'?". Cuando lo hicieron, los robots estuvieron mucho más de acuerdo entre sí (más del 80% de acuerdo para los modelos superiores). Esto sugiere que los robots son muy consistentes con su propia especie, pero son consistentemente diferentes de los profesores humanos.

Esto plantea una gran pregunta: ¿Tienen razón los robots y los profesores son demasiado permisivos? ¿O están todos los robots cometiendo el mismo error porque fueron entrenados con datos similares? El artículo sugiere que, si bien los robots son consistentes, pueden estar careciendo del "toque humano": la capacidad de entender que un estudiante se esforzó o que un pequeño error no significa que no haya aprendido el concepto.

Lo Que Esto Significa para el Futuro

El artículo no dice que la calificación por IA esté rota o que debamos dejar de usarla. En cambio, advierte a las escuelas que tengan cuidado. Elegir un robot para calificar tu tarea no es una decisión neutral; es una elección que cambia el resultado. Si eliges un robot "liberal", los estudiantes podrían obtener notas más altas. Si eliges uno "restrictivo", los estudiantes podrían obtener notas más bajas.

El estudio concluye que no podemos simplemente dejar que la IA se encargue de calificar por completo. Todamente necesitamos profesores humanos para vigilar las cosas. Los robots son herramientas excelentes, pero son como diferentes tipos de calculadoras: algunas redondean hacia arriba, otras hacia abajo, y otras tienen botones diferentes. Hasta que no sepamos cómo hacer que coincidan con los profesores humanos, debemos recordar que la nota que te dé un robot puede no ser la misma que te daría tu profesor. Y en el mundo de la educación, esa diferencia importa mucho.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →