SCOPE: A Dataset of Stereotyped Prompts for Counterfactual Fairness Assessment of LLMs
El artículo presenta SCOPE, un conjunto de datos a gran escala que contiene más de 240.000 pares de prompts contrapuestos generados bajo diversas intenciones comunicativas y cubriendo múltiples dimensiones de sesgo y grupos demográficos, diseñado para evaluar sistemáticamente la equidad y la consistencia de los modelos de lenguaje grandes frente a estereotipos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¡Claro que sí! Imagina que las Inteligencias Artificiales (como los chatbots que usamos hoy) son como cocineros muy talentosos pero inexpertos que han aprendido a cocinar leyendo millones de libros y recetas de internet. El problema es que, a veces, estos libros contienen prejuicios antiguos o estereotipos (como pensar que "los hombres son malos para la cocina" o que "las mujeres no saben conducir").
Si le pides al chef: "¿Qué plato recomiendas para una mujer?" y luego le pides: "¿Qué plato recomiendas para un hombre?", el chef podría darte respuestas muy diferentes, aunque la pregunta sea esencialmente la misma. Eso es injusto.
Aquí es donde entra el SCOPE, el nuevo "libro de pruebas" creado por los investigadores.
¿Qué es SCOPE? (La analogía del "Espejo Mágico")
Imagina que tienes un espejo mágico que puede cambiar solo una pequeña cosa en una foto: el color de la camisa de la persona, o su nombre, o su origen, pero mantiene todo lo demás exactamente igual (la expresión, el fondo, la acción).
SCOPE es un inmenso archivo digital que contiene 241,280 de estas "fotos" (o preguntas). Están organizadas en 120,640 pares gemelos.
- El Paredón 1: "¿Qué opinas sobre la facilidad de empleo para los hombres?"
- El Paredón 2 (El gemelo): "¿Qué opinas sobre la facilidad de empleo para las mujeres?"
La única diferencia es la palabra "hombres" o "mujeres". Todo lo demás es idéntico.
¿Por qué es tan especial este archivo?
Antes, los científicos tenían que inventar estas preguntas a mano, como si dibujaran con un lápiz muy pequeño. Tenían pocas preguntas y siempre las hacían de la misma forma (como si siempre preguntaran lo mismo con la misma voz).
SCOPE es diferente porque es enorme y diverso:
- Habla de todo: Tiene preguntas sobre 1,438 temas diferentes (desde el trabajo hasta la salud, pasando por el transporte).
- Habla de todos: Incluye 1,536 grupos de personas diferentes (no solo "hombres y mujeres", sino también personas de diferentes religiones, edades, nacionalidades, o con discapacidades).
- Cambia de voz: Aquí está la parte genial. Las preguntas no son solo preguntas aburridas. Las han escrito de 4 formas distintas para ver si el robot se comporta diferente según cómo le hables:
- Pregunta: "¿Qué opinas de...?"
- Recomendación: "¿Qué me sugieres para...?"
- Instrucción: "Dime cómo hacer..."
- Aclaración: "Explícame por qué..."
¿Para qué sirve esto? (Los 3 Juegos de Prueba)
Los investigadores usan SCOPE para jugar a tres juegos con las Inteligencias Artificiales:
El Juego de la Justicia (Fairness):
Le das al robot el par gemelo. Si le responde con un tono amable a los "hombres" pero con un tono despectivo o estereotipado a las "mujeres", ¡BINGO! Hemos encontrado un prejuicio. El archivo nos permite detectar esto de forma automática y masiva.El Juego de la Estabilidad (Robustez):
Imagina que el robot es un barco. Si cambias ligeramente el viento (la identidad de la persona), ¿el barco se tambalea o sigue recto? SCOPE ayuda a ver si el robot se vuelve loco o inconsistente solo porque cambiamos una palabra sobre la identidad de alguien.El Juego de la Intención:
A veces, un robot puede ser neutral si le preguntas algo, pero si le pides una recomendación, empieza a juzgar. SCOPE permite ver si el robot tiene "dos caras" dependiendo de cómo le hables.
En resumen
Los autores de este paper (un equipo de universidades italianas) han creado una herramienta gigante y muy organizada para que los desarrolladores de Inteligencia Artificial puedan "limpiar" sus robots.
Es como tener un manual de pruebas de choque para coches, pero en lugar de chocar coches contra paredes, chocamos preguntas contra la inteligencia artificial para ver si se rompe o si trata a todos los pasajeros (las personas) con el mismo respeto, sin importar quién sean.
Gracias a SCOPE, podemos asegurarnos de que la tecnología del futuro no repita los errores y prejuicios del pasado.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.