← Últimos artículos
💬 NLP

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

Este artículo revela que los Grandes Modelos de Lenguaje utilizados como jueces automatizados exhiben una inconsistencia y falta de fiabilidad significativas, particularmente al evaluar dominios regulados como las finanzas o variando según el idioma y los criterios, lo que resalta la necesidad de una implementación cuidadosa en las evaluaciones de seguridad.

Autores originales: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

Publicado 2026-06-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has contratado a un panel de seis críticos de arte diferentes para juzgar una serie de pinturas. Quieres que se pongan de acuerdo sobre qué pinturas son "seguras" (buenas, apropiadas) y cuáles son "inseguras" (malas, dañinas). Esperas que, si les muestras la misma pintura, o incluso una versión ligeramente diferente de ella (como una foto de la pintura en un marco distinto, o una traducción de la nota del artista a otro idioma), todos den el mismo veredicto aproximadamente.

Este artículo trata precisamente de probar eso, pero en lugar de críticos de arte, los "jueces" son Modelos de Lenguaje de Gran Escala (IA), y en lugar de juzgar pinturas, están juzgando la seguridad de textos generados por IA.

Aquí está el desglose de lo que los investigadores descubrieron, utilizando analogías sencillas:

1. El problema de lo "Obvio vs. lo Sutil"

Los investigadores probaron a los jueces de IA con dos tipos de contenido "malo" muy diferentes:

  • La prueba del "Grito de Fuego" (Violencia): Pidieron a la IA que juzgara textos sobre violencia, discurso de odio o actos ilegales.
    • El resultado: Los jueces de IA fueron bastante buenos en esto. Si una pintura estaba claramente en llamas, los seis críticos coincidieron: "Esto es inseguro".
  • La prueba del "Consejo Financiero" (Dominios Regulados): Pidieron a la IA que juzgara textos donde una IA da consejos sobre temas como puntajes crediticios, solicitudes de visa o consejos médicos.
    • El resultado: Los jueces de IA fueron pésimos en esto. Es como pedirle a seis críticos que juzguen una pintura que es casi una obra maestra pero tiene un fallo diminuto y sutil. Un crítico dice: "Es segura, solo un poco arriesgada", mientras que otro dice: "Es peligrosa, ¡deséchenla!". No pudieron ponerse de acuerdo sobre qué significaba siquiera "seguro" en estos escenarios complejos del mundo real.

2. El problema del "Espejo Mágico" (Autoconsistencia)

Los investigadores tomaron una respuesta de IA única y se la mostraron a los jueces en diferentes "espejos":

  • Traducción: Mostraron el texto en inglés, luego en francés, luego en hindi, etc.

  • Parafraseo: Reescribieron el texto para que sonara más formal, más casual o para cambiar el orden de las oraciones, sin cambiar el significado real.

  • El resultado: Los jueces fueron inconsistentes. Si un juez decía: "Esta frase en inglés es segura", podía mirar exactamente la misma frase traducida al hindi y decir: "¡Espera, esta versión en hindi es insegura!". O bien, podían mirar una versión parafraseada y cambiar de opinión.

  • La metáfora: Imagina a un guardia de seguridad que detiene a una persona con una camisa roja pero deja pasar a la misma persona con una camisa azul, aunque sean la misma persona exactamente. Los jueces de IA son fácilmente engañados por cómo se "visten" las palabras, no por lo que las palabras realmente dicen.

3. El problema del "Jurado" (Consistencia Cruzada)

Los investigadores también preguntaron: "Si ponemos a los seis jueces de IA en una habitación juntos, ¿estarán de acuerdo entre sí?".

  • El resultado: No. Incluso mirando el mismo texto en el mismo idioma, los jueces a menudo daban respuestas opuestas.
  • La metáfora: Imagina un jurado donde una persona vota "Culpable", otra "No culpable" y una tercera "Tal vez". Todos están mirando la misma evidencia, pero tienen libros de reglas internos completamente diferentes para lo que cuenta como un crimen. El artículo encontró que para temas complejos (como el asesoramiento financiero), el "jurado" suele estar en total caos.

4. La trampa del "Falso Acuerdo"

El artículo señala una ilusión estadística truculenta.

  • A veces, todos los jueces dicen "Seguro" el 99% de las veces. Si solo cuentas los votos de "Sí", parece que hay un acuerdo perfecto (100% de consistencia).
  • El truco: Pero si solo están diciendo "Seguro" porque son perezosos o tienen un sesgo, y no están pensando realmente en los detalles específicos, eso no es un acuerdo real. Los investigadores utilizaron matemáticas especiales (como una puntuación de "corrección por azar") para eliminar este falso acuerdo.
  • La metáfora: Es como un grupo de amigos adivinando la respuesta a una pregunta de trivia. Si la respuesta es "Sí" el 99% de las veces, y todos responden "Sí", parecen genios. Pero si la pregunta es en realidad difícil y solo están adivinando la respuesta más común, no están de acuerdo en el razonamiento. El artículo muestra que cuando se mira más de cerca, los jueces de IA en realidad están en desacuerdo un montón.

La Conclusión

El artículo concluye que, si bien los jueces de IA son capaces de detectar peligros obvios y ruidosos (como la violencia), son poco fiables e inconsistentes cuando juzgan consejos matizados del mundo real (como finanzas o leyes).

Si utilizas una IA para actuar como guardián de seguridad para temas complejos, no puedes confiar en que sea consistente. Podría aprobar una respuesta peligrosa solo porque la estructura de la oración cambió ligeramente, o podría rechazar una respuesta segura solo porque fue traducida a un idioma diferente. El "jurado" de los modelos de IA está actualmente demasiado dividido para ser confiable en decisiones de alto riesgo sin la supervisión humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →