← Últimos artículos
💻 computer science

Calibrating Gemini to Human Raters in Spoken Language Assessment for EFL Learners in Asia

Este estudio demuestra que, si bien Gemini 2.5 Flash puede lograr un nivel de concordancia humano al evaluar el inglés hablado de estudiantes de EFL mediante el uso de prompting de 10 disparos (10-shot) cuando los evaluadores humanos muestran una consistencia moderada, su rendimiento se deteriora cuando la concordancia humana es excelente, lo que resalta la necesidad de una calibración cuidadosa y supervisión humana a pesar de su capacidad para evaluar más allá de la mera precisión léxica.

Autores originales: Christopher Robert Cooper, John Maurice Gayed

Publicado 2026-08-07
📖 4 min de lectura☕ Lectura para el café

Autores originales: Christopher Robert Cooper, John Maurice Gayed

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor calificando cientos de ensayos. Es una montaña de trabajo, y aunque puedes leer fácilmente las palabras escritas de un estudiante, calificar su voz hablada es un desafío totalmente distinto. El habla es "fuerte y transitoria": ocurre en un instante y luego desaparece, lo que la hace difícil de capturar y juzgar de manera justa. Durante años, las computadoras han sido excelentes leyendo texto, pero han tenido dificultades para "escuchar" la conversación humana, dependiendo a menudo de transcripciones escritas que pierden el matiz del tono, las pausas y el acento. Ahora, ha llegado una nueva generación de "IA generativa". Piensa en estas IA como asistentes digitales superinteligentes que no solo pueden leer, sino también oír y comprender el contexto. La gran pregunta que todos se hacen es: ¿Podemos entrenar a estos asistentes digitales para que califiquen el inglés hablado de manera tan justa y precisa como un profesor humano? Esto no se trata solo de ahorrar tiempo a los profesores; se trata de asegurar que los estudiantes reciban la retroalimentación adecuada para mejorar, independientemente de dónde vengan o de cómo suenen.

Este documento profundiza en esa pregunta, probando un modelo de IA específico llamado Gemini 2.5 Flash. Los investigadores querían ver si podían "calibrar" esta IA —esencialmente, enseñarle cómo calificar— mostrándole ejemplos de cómo los profesores humanos califican los diálogos hablados. No se limitaron a alimentar a la IA con texto escrito; le entregaron los archivos de audio reales de los estudiantes hablando, lo cual es un gran paso adelante porque permite que la IA escuche la voz real, no solo una transcripción.

Los investigadores diseñaron un experimento ingenioso utilizando 129 conversaciones grabadas entre estudiantes de inglés asiáticos y sus profesores. Le pidieron a la IA que calificara estos discursos utilizando tres métodos diferentes:

  1. Zero-shot (Cero disparos): La IA simplemente recibió las reglas y calificó inmediatamente, sin ejemplos previos.
  2. 5-shot (5 disparos): La IA vio cinco ejemplos de cómo un profesor humano calificó antes de comenzar.
  3. 10-shot (10 disparos): La IA vio diez ejemplos.

Compararon las puntuaciones de la IA con dos pares de profesores humanos. Un par de profesores coincidía entre sí de manera moderada (sus puntuaciones eran similares, pero no idénticas), mientras que otro par de profesores coincidía casi perfectamente (eran como gemelos en su calificación).

Aquí está el giro: la IA funcionó mejor cuando aprendía de los profesores que tenían un acuerdo moderado. Cuando se le mostraron ejemplos del par de profesores que "coincidían perfectamente", la IA en realidad empeoró, fallando en igualar sus puntuaciones. Es como si la IA necesitara ver un poco de desacuerdo humano para entender el rango completo de lo que representa una puntuación "buena" o "mala". Si los ejemplos eran demasiado perfectos, la IA se confundía sobre dónde estaban los límites.

El estudio también comprobó si la IA podía realmente "escuchar" a los estudiantes correctamente. Midieron esto utilizando algo llamado Tasa de Error de Palabra (WER), que cuenta cuántas palabras la IA erró en su transcripción. La IA cometió errores, pero la mayoría de las veces era simplemente confundiendo quién estaba hablando (el estudiante o el profesor) en lugar de perder las palabras por completo. Los investigadores encontraron que la capacidad de la IA para escuchar las palabras no cambiaba realmente qué tan severa o amable calificaba a los estudiantes. Esto sugiere que la IA estaba escuchando más allá de las definiciones de diccionario de las palabras; también estaba captando el flujo y el ritmo del habla.

Sin embargo, hubo un pequeño y sorprendente inconveniente. La IA pareció dar puntuaciones ligeramente más bajas a los estudiantes de Pakistán, a pesar de que la IA transcribió su discurso con mucha precisión. Los investigadores señalaron esto como un posible sesgo que requiere más investigación, especialmente dado que solo había cuatro estudiantes de ese país en el estudio.

Al final, el documento sugiere que Gemini 2.5 Flash es una herramienta prometedora para ayudar a los profesores a calificar el inglés hablado, pero no es una varita mágica. Funciona mejor cuando se calibra con ejemplos humanos que muestran un rango de puntuaciones realista, y necesita un supervisor humano que vigile su desempeño. La IA puede escuchar el habla, comprender el contexto y dar retroalimentación que se parece mucho a la de un profesor humano, pero aún necesita un ajuste cuidadoso para asegurar que sea justa para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →