LLM Evaluators are Biased across Languages
Este artículo demuestra que los evaluadores de LLM multilingües exhiben un sesgo consistente y estadísticamente significativo en el que las lenguas de menores recursos reciben puntuaciones más altas y superan los filtros de seguridad con mayor facilidad que las lenguas de mayores recursos, un fallo crítico que permanece sin ser detectado por las métricas estándar de precisión por pares a pesar del alto grado de acuerdo de los evaluadores en las clasificaciones relativas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde cada vez que le haces una pregunta a un robot súper inteligente, este te responde en tu propio idioma. Estos robots, llamados Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés), son como enciclopedias digitales que pueden escribir historias, resolver problemas matemáticos y charlar sobre cualquier cosa. Pero, ¿cómo sabemos si están haciendo un buen trabajo? Necesitamos un árbitro. En el mundo de la IA, estos árbitros son llamados "evaluadores". Pueden ser otros robots entrenados para dar puntuaciones o instrucciones de tipo humano que piden a la propia IA que se califique a sí misma. Por lo general, comprobamos si estos árbitros son justos viendo si pueden elegir correctamente la "mejor" respuesta entre dos opciones, algo así como un juez decidiendo qué pintura es más bonita entre dos. Esto se llama "exactitud de pares" (pairwise accuracy). Si el árbitro elige al ganador correcto el 90% de las veces, asumimos que está haciendo un gran trabajo y que su puntuación es justa sin importar el idioma en el que se esté hablando.
Sin embargo, hay un problema oculto con esta suposición. El hecho de que un árbitro pueda decirte cuál de dos pinturas es mejor no significa que esté usando la misma regla para medirlas. En el mundo real, un restaurante de 4 estrellas en Tokio puede ser considerado una obra maestra culinaria, mientras que un restaurante de 4 estrellas en Nueva York puede ser visto como simplemente "aceptable". Las estrellas significan cosas distintas dependiendo de dónde te encuentres. Este artículo, titulado "Los evaluadores de LLM tienen sesgos entre idiomas", investiga si nuestros árbitros de IA sufren de la misma confusión cultural. Los investigadores querían saber: si una IA da una respuesta perfecta en inglés, ¿da esa misma respuesta con la misma puntuación exacta si se traduce al hindi, al farsi o al ucraniano? ¿O el idioma en sí cambia la puntuación, incluso si el significado permanece exactamente igual?
El equipo organizó un experimento masivo para averiguarlo. Tomaron el mismo conjunto de instrucciones y respuestas y lo tradujeron a 23 idiomas diferentes, que iban desde idiomas ampliamente hablados como el inglés y el español hasta otros como el hebreo y el hindi. Luego, pidieron a ocho tipos diferentes de evaluadores de IA —algunos que solo reciben una instrucción para dar una puntuación y otros que han sido entrenados especialmente para dar un número de "recompensa"— que calificaran estas respuestas idénticas.
Los resultados fueron impactantes. Los evaluadores no estaban usando la misma regla. Aunque el contenido era semánticamente idéntico (es decir, significaba exactamente lo mismo), las puntuaciones variaban drásticamente según el idioma. El sesgo era enorme: en una escala del 1 al 5, la diferencia entre los idiomas con las puntuaciones más altas y los de las más bajas era de aproximadamente 0.5 puntos. Esa es una brecha masiva en el mundo de la calificación.
Aquí está el giro que hace que esto sea tan complicado: los evaluadores seguían pareciendo perfectos en el papel. Cuando los investigadores comprobaron la "exactitud de pares" (¿eligió el árbitro la mejor respuesta?), las puntuaciones eran increíblemente altas, a menudo por encima del 90%. Los árbitros eran consistentes al decir "la Respuesta A es mejor que la Respuesta B". Pero eran terribles siendo consistentes sobre qué tan buena era realmente la Respuesta A. Es como un juez que siempre elige correctamente al ganador de una carrera, pero le da 100 puntos si corre en francés y solo 50 si corre en alemán.
El artículo descubrió un patrón claro: los evaluadores estaban siendo sorprendentemente generosos con los idiomas de bajos recursos (idiomas con menos datos disponibles en línea, como el hindi o el hebreo) y más estrictos con los idiomas de altos recursos como el inglés. Es como si los jueces de IA pensaran: "No estoy cien por ciento seguro de cómo se ve una respuesta perfecta en este idioma, así que le daré una puntuación alta para estar seguro". Por el contrario, para el inglés, se sentían muy seguros y estrictos, exigiendo un estándar más alto a las respuestas.
Esto no es solo un juego de números; tiene consecuencias en el mundo real. Muchos sistemas de IA utilizan un "umbral global" para decidir qué es seguro mostrar a los usuarios. Por ejemplo, si un filtro de seguridad está configurado para bloquear cualquier cosa con una puntuación inferior a cierto número, el sesgo significa que el contenido dañino en idiomas de bajos recursos tiene muchas más probabilidades de filtrarse. El artículo encontró que, bajo una única regla global, la tasa de aceptación del contenido podía variar hasta en un 43 por ciento entre idiomas. En un ejemplo específico, una pregunta dañina en inglés fue bloqueada correctamente, pero la misma pregunta exacta en ucraniano fue permitida porque el evaluador le dio una puntuación más alta.
Los investigadores también investigaron por qué sucede esto. Sospecharon que podría deberse a que la IA tiene menos certeza sobre los idiomas de bajos recursos. Descubrieron que cuando la IA tenía menos confianza (medida por lo sorprendida que estaba por el texto), tendía a dar puntuaciones más altas. Sin embargo, demostraron que la incertidumbre no era toda la historia. Incluso después de contabilizar qué tan confundida estaba la IA, el idioma en sí seguía prediciendo la puntuación. Esto significa que el sesgo es un problema profundo y estructural en la forma en que se construyen estos modelos, no es solo un caso de "no conozco bien este idioma".
El artículo concluye que no podemos confiar simplemente en las puntuaciones brutas de estos evaluadores de IA a través de diferentes idiomas. Si bien podemos solucionar parte del problema ajustando las puntuaciones para cada idioma, esto crea una nueva vulnerabilidad: si alguien mezcla idiomas en un solo comando (cambio de código o code-switching), el sistema podría confundirse sobre qué regla de idioma aplicar y permitir que el contenido dañino se filtre. Los autores sugieren que, en lugar de solo verificar si los evaluadores pueden elegir al "ganador", necesitamos construir sistemas que estén calibrados para ser justos y consistentes en todos los idiomas, asegurando que una respuesta de 5 estrellas en hindi sea verdaderamente tan valiosa como una de 5 estrellas en inglés.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.