← Últimos artículos
💬 NLP

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

Este artículo revela que los jueces basados en LLM muestran una inconsistencia significativa intra-evaluador entre diferentes ejecuciones, lo que socava la fiabilidad de sus puntuaciones, e investiga si dichas evaluaciones pueden seguir utilizándose de manera efectiva mediante directrices específicas.

Autores originales: Rajarshi Haldar, Julia Hockenmaier

Publicado 2026-04-29
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Rajarshi Haldar, Julia Hockenmaier

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Juez "Montaña Rusa"

Imagina que contratas a un famoso crítico gastronómico para que revise un nuevo restaurante. Le pides que pruebe el mismo plato tres veces seguidas, sentado en la misma mesa, con la misma servilleta frente a él.

  • Prueba 1: Le da una calificación de 5 estrellas, llamándolo "una obra maestra".
  • Prueba 2: Le da una calificación de 2 estrellas, llamándolo "insípido y sobrecocido".
  • Prueba 3: Le da una calificación de 4 estrellas, diciendo que es "decente pero necesita más sal".

Si esto sucediera, no confiarías en ese crítico. Te darías cuenta de que su juicio es como una ruleta: gira y cae en un número diferente cada vez, aunque la comida (la entrada) nunca cambie.

Esto es exactamente lo que los investigadores descubrieron cuando pidieron a los Modelos de Lenguaje Grande (LLM) que actuaran como jueces para otro texto generado por IA. Descubrieron que estos jueces de IA están sufriendo de la "Ruleta de Calificaciones".

El Problema: El Juez de IA No Puede Estar de Acuerdo Consigo Mismo

En el mundo de la IA, a menudo usamos una IA para calificar el trabajo de otra IA. Esto se llama "LLM como Juez". Es popular porque es más rápido y barato que contratar humanos.

Sin embargo, los investigadores realizaron una prueba sencilla:

  1. Tomaron un fragmento de texto (como un resumen de noticias o una conversación de chat).
  2. Pidieron al mismo juez de IA que lo calificara tres veces usando las instrucciones exactas.
  3. Verificaron si la IA dio la misma puntuación cada vez.

El Resultado: Los jueces de IA estaban en todas partes.

  • En una tarea llamada SummaC (verificar si un resumen es factualmente verdadero), el mejor juez de IA solo estuvo de acuerdo consigo mismo aproximadamente el 79% de las veces.
  • En una tarea llamada MT-Bench (clasificar conversaciones de chatbots), el acuerdo cayó aún más. Un juez de IA solo dio exactamente la misma respuesta tres veces seguidas en solo el 61% de los casos.

Es como si el estado de ánimo del juez cambiara cada vez que le haces una pregunta, aunque la pregunta y la respuesta no hayan cambiado.

El "Truco de Magia" que Sale Mal

Podrías pensar: "Muy bien, digamos simplemente a la IA que deje de ser aleatoria. Apaguemos la parte de 'lanzar dados' de su cerebro para que siempre dé la misma respuesta".

Los investigadores probaron esto. Configuraron la IA para que fuera 100% determinista (sin aleatoriedad).

  • ¿Se volvió consistente? Sí.
  • ¿Se convirtió en un juez mejor? No.

De hecho, cuando obligaron a la IA a dejar de tirar los dados, sus calificaciones en realidad se volvieron peores en comparación con los jueces humanos. Es como obligar a un chef a usar exactamente la misma receta cada vez; podría dejar de cometer errores, pero también deja de ser creativo o adaptable, y la comida termina sabiendo peor.

El artículo sugiere que existe un compromiso: Para obtener una buena calificación que coincida con la opinión humana, la IA necesita un poco de "aleatoriedad" (variabilidad). Pero esa misma aleatoriedad hace que la IA sea inconsistente consigo misma.

La Comparación Humana: ¿Son los Humanos Mejores?

Los investigadores también observaron a jueces humanos para ver si este es un problema exclusivo de la IA.

  • Expertos Humanos: Cuando los expertos calificaron el mismo texto, estuvieron razonablemente de acuerdo entre sí, pero no perfectamente.
  • Trabajadores de Multitud: Cuando personas comunes (trabajadores de multitud) calificaron el texto, a menudo no estuvieron de acuerdo entre sí ni con los expertos.
  • La Sorpresa: En algunos casos, los jueces de IA fueron en realidad más consistentes consigo mismos de lo que lo fueron los humanos entre sí. Sin embargo, debido a que las puntuaciones de la IA eran tan volátiles, es difícil decir si la IA está realmente "en lo correcto" o simplemente tiene "suerte".

¿Por Qué Importa Esto? (La Analogía de la "Regla Rota")

Imagina que estás tratando de medir la altura de un árbol.

  • La Vieja Forma: Usas una regla que está ligeramente doblada. No es perfecta, pero es estable.
  • La Nueva Forma (Juez LLM): Usas una regla hecha de goma. A veces se estira, a veces se encoge. Incluso si mides el mismo árbol tres veces, obtienes tres números diferentes.

Si usas una regla de goma, no puedes confiar en la medición. El artículo argumenta que usar un LLM como juez es actualmente como usar una regla de goma.

  • Si ejecutas la prueba una vez, obtienes una puntuación.
  • Si la ejecutas de nuevo, obtienes una puntuación diferente.
  • Si la ejecutas una tercera vez, obtienes una tercera puntuación.

Como la puntuación cambia cada vez, no sabemos si la IA es realmente buena juzgando la calidad, o si simplemente está adivinando.

¿Qué Descubrieron en Diferentes Tareas?

Los investigadores probaron tres tipos diferentes de "juegos" que la IA tenía que jugar:

  1. Verdadero o Falso (SummaC): ¿Es el resumen factualmente correcto? (Elección binaria).
    • Resultado: Los jueces de IA fueron inconsistentes, pero los modelos más nuevos y grandes fueron ligeramente mejores.
  2. La Reseña de 1 a 5 Estrellas (SummEval): Califica el resumen en "Coherencia", "Fluidez", etc.
    • Resultado: La IA fue muy inconsistente, especialmente en "Fluidez" (qué tan suave suena el texto). Curiosamente, la IA a veces fue mejor juzgando la fluidez de lo que los humanos fueron para ponerse de acuerdo entre sí.
  3. La Batalla Real (MT-Bench): ¿Cuál de dos chatbots dio una mejor respuesta?
    • Resultado: Esta fue la tarea más difícil. Los jueces de IA fueron extremadamente volátiles aquí, a menudo cambiando de opinión sobre qué chatbot era mejor.

La Conclusión: Cómo Arreglar la Ruleta

El artículo ofrece algunos consejos prácticos para las personas que quieren usar jueces de IA:

  1. No confíes en una sola ejecución: Si le pides a una IA que califique algo, no tomes solo la primera respuesta. Pídele que lo califique tres veces y toma el promedio o la mayoría de votos. Esto suaviza el efecto de la "ruleta" y da una puntuación más cercana a lo que diría un humano.
  2. No apagues la aleatoriedad: Aunque la aleatoriedad causa inconsistencia, apagarla por completo hace que la IA sea peor para coincidir con las opiniones humanas. Necesitas un poco de caos para obtener la respuesta correcta.
  3. Verifica tu propia consistencia: Antes de confiar en un juez de IA, debes verificar si está de acuerdo consigo mismo. Si no puede estar de acuerdo consigo mismo, probablemente tampoco pueda estar de acuerdo contigo.

Resumen

El artículo revela que los jueces de IA son actualmente poco fiables porque dan respuestas diferentes a la misma pregunta cada vez que se les pregunta. Son como una ruleta en lugar de una balanza estable. Aunque los modelos de IA más nuevos son ligeramente más consistentes, aún luchan por ser fiables. La mejor solución por ahora es pedirle a la IA que juegue el juego varias veces y promediar los resultados, en lugar de confiar en un solo "giro" de la ruleta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →