← Últimos artículos
💬 NLP

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

Este artículo propone un marco que combina las atribuciones de SHAP y las justificaciones generadas por LLM para evaluar la calificación de la calidad docente basada en rúbricas, encontrando que, si bien los PLM ajustados logran una mayor precisión, SHAP proporciona explicaciones más fieles, coherentes y transferibles que las justificaciones de los LLM.

Autores originales: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor calificando una pila de ensayos de estudiantes. Tienes una lista de verificación estricta (una "rúbrica") para decidir si los comentarios en el ensayo son buenos, malos o algo intermedio. Ahora, imagina que contratas a dos tipos diferentes de "asistentes de IA" para que realicen esta calificación por ti.

Este documento es un informe sobre qué tan bien trabajan estos dos asistentes de IA y, lo que es más importante, qué tan bien pueden explicar por qué dieron cierta calificación.

Aquí está el desglose del estudio utilizando analogías sencillas:

Los dos contendientes

Los investigadores probaron dos tipos de modelos de IA para calificar conversaciones de clase (transcripciones) basándose en una rúbrica específica llamada "Calidad de la Retroalimentación".

  1. El "Pasante Especializado" (PLMs ajustados/Fine-tuned): Estos son modelos de IA estándar que han sido entrenados específicamente en esta tarea de calificación exacta. Son como un estudiante que se ha memorizado el libro de texto y ha practicado para el examen cien veces.
  2. El "Generalista Inteligente" (LLMs con prompts): Estos son modelos de IA masivos y potentes (como los que podrías usar para chatear en línea) que no fueron entrenados específicamente para esta tarea. En su lugar, los investigadores simplemente les dieron un conjunto de instrucciones (un prompt) que decía: "Aquí está la rúbrica, califica esto". Son como un experto brillante que nunca ha visto este examen específico, pero se le pide que lo realice sobre la marcha.

La primera prueba: ¿Quién obtiene la calificación correcta? (Puntuación)

Los investigadores preguntaron: ¿Quién da la puntuación más precisa?

  • El Resultado: El Pasante Especializado fue mucho más preciso. Consistentemente daba puntuaciones muy cercanas a las que darían los expertos humanos.
  • El Problema: El Pasante tenía el hábito extraño de ser "conservador". Rara vez daba las puntuaciones más altas (7) o las más bajas (1). Tendía a agrupar todas sus calificaciones en el medio (3, 4 o 5). Era preciso, pero un poco aburrido y reacio al riesgo.
  • El Generalista: El Generalista Inteligente fue menos preciso en general. Sin embargo, fue más "valiente". Dio una variedad más amplia de puntuaciones, incluyendo las muy altas y las muy bajas, aunque no siempre estuviera en lo cierto.

La Conclusión: Si quieres el número más preciso, usa el modelo entrenado. Si quieres un modelo que no tenga miedo de dar puntuaciones extremas (aunque cometa más errores), usa el gran chatbot.

La segunda prueba: ¿Quién dice la verdad? (Explicaciones)

Esta es la parte más importante del documento. En la educación, no solo quieres una puntuación; quieres saber por qué.

  • El Pasante Especializado utilizó una herramienta matemática llamada SHAP. Piensa en SHAP como un contador forense. Observa la transcripción, oración por oración, y calcula exactamente cuánto cambió cada oración la puntuación final. Es como una calculadora que dice: "Esta oración añadió 0.5 puntos; esa otra restó 0.2".
  • El Generalista Inteligente simplemente habló. Generó una lista de oraciones que consideraba importantes, escribiéndolas en lenguaje natural. Es como un estudiante que levanta la mano y dice: "Creo que esta parte es importante porque...".

Los investigadores probaron quién decía la verdad jugando al juego de "Borrar y Ver".

  1. Tomaron las oraciones que la IA dijo que eran importantes.
  2. Borraron esas oraciones de la transcripción.
  3. Le pidieron a la IA que calificara la transcripción vacía nuevamente.

La Lógica: Si la IA realmente entendiera por qué dio una puntuación, borrar esas oraciones "importantes" debería causar que la puntuación caiga drásticamente o cambie significamente. Si la IA solo estaba inventando una historia, borrar esas oraciones no debería cambiar mucho la puntuación.

  • El Resultado: El Pasante Especializado (SHAP) fue honesto. Cuando borraron las oraciones que SHAP señaló, la puntuación cambió mucho. La IA claramente dependía de esas oraciones específicas para tomar su decisión.
  • El Resultado: El Generalista Inteligente (LLM) a menudo mentía. Cuando borraron las oraciones que el LLM dijo que eran importantes, la puntuación apenas cambió. El LLM estaba generando una explicación que "sonaba plausible", pero esas oraciones no eran las que realmente impulsaban su decisión. Era como un estudiante dando un discurso convincente sobre por qué merece un A, pero cuando eliminas la evidencia que citó, su calificación en realidad no cambia.

La tercera prueba: ¿Pueden intercambiar notas? (Inter-modelo)

Los investigadores intentaron ver si las explicaciones eran universales.

  • Tomaron las "oraciones importantes" identificadas por el Pasante Especializado y las borraron de la entrada del Generalista Inteligente. Resultado: La puntuación del Generalista cambió significamente. Las matemáticas del Pasante también funcionaron en el Generalista.
  • Tomaron las "oraciones importantes" identificadas por el Generalista Inteligente y las borraron de la entrada del Pasante Especializado. Resultado: La puntuación del Pasante apenas se movió. La "opinión" del Generalista no le importó al Pasante.

La Conclusión: La explicación matemática (SHAP) es una verdad universal que funciona en diferentes "cerebros" de IA. La explicación del chatbot es específica para ese chatbot y no se sostiene cuando se prueba contra otros.

El Veredicto Final

El documento concluye que, si bien los grandes y potentes chatbots (LLMs) son excelentes generando texto que suena como una buena explicación, son poco fiables para explicar por qué tomaron una decisión en situaciones de alto riesgo como la calificación de profesores.

  • SHAP (Las Matemáticas): Es como una ventana transparente. Puedes ver exactamente qué ladrillos sostienen el muro. Es confiable y consistente.
  • Las Racionalizaciones del LLM (La Charla): Son como el juego de manos de un mago. Parecen impresionantes y convincentes, pero si miras de cerca (eliminando las partes "importantes"), te das cuenta de que no están sosteniendo realmente el peso de la decisión.

En resumen: Si necesitas una razón confiable para una calificación en un entorno escolar, confía en las matemáticas (SHAP), no en la historia del chatbot. El chatbot es excelente para escribir, pero actualmente es un mal testigo de sus propias decisiones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →