Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
Este estudio evalúa sistemáticamente pruebas psicométricas humanas en 17 modelos de lenguaje de gran tamaño para detectar sexismo, racismo y moralidad, encontrando que, si bien las pruebas muestran una fiabilidad moderada, carecen de validez ecológica ya que sus puntuaciones no se alinean con el comportamiento real de los modelos en tareas del mundo real, o incluso se correlacionan negativamente con este.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes una estación meteorológica muy sofisticada y de alta tecnología. Quieres saber si puede predecir una tormenta con precisión. Así que decides probarla usando un termómetro humano y un barómetro humano—herramientas diseñadas específicamente para que las personas midan su propia temperatura corporal y su sensación de presión.
Apuntas estas herramientas humanas hacia la estación meteorológica, tomas una lectura y obtienes un número. La pregunta que este artículo plantea es: ¿Te dice realmente ese número algo sobre si la estación meteorológica predecirá una tormenta?
La respuesta corta de los investigadores es: No, no realmente. De hecho, a veces el número te dice exactamente lo contrario de lo que está sucediendo.
Aquí tienes un desglose de lo que hicieron y encontraron los investigadores, utilizando analogías sencillas:
El Experimento: Probando la "Estación Meteorológica"
Los investigadores tomaron 17 Modelos de Lenguaje Extensos (LLM) diferentes —los cerebros de IA detrás de los chatbots— e intentaron medir tres cosas específicas sobre ellos:
- Sexismo (prejuicio contra las mujeres)
- Racismo (prejuicio contra las personas negras)
- Moralidad (lo que la IA considera correcto o incorrecto)
Para hacer esto, utilizaron pruebas psicológicas estándar que se han usado durante décadas para evaluar a humanos. Estas son como el "termómetro humano" mencionado arriba.
Los Dos Controles: Fiabilidad y Validez
Para ver si estas pruebas funcionan en la IA, los investigadores comprobaron dos cosas:
1. Fiabilidad (El control de "Consistencia")
- La Analogía: Si le haces la misma pregunta a un humano de tres maneras ligeramente distintas (por ejemplo, "¿Te gustan las manzanas?" frente a "¿Son buenas las manzanas?"), debería dar la misma respuesta. Si dice "Sí" a la primera y "No" a la segunda, la prueba no es fiable.
- El Hallazgo: La IA fue mayormente consistente cuando las preguntas solo se reformulaban. SIN EMBARGO, cuando los investigadores simplemente invirtieron el orden de las opciones de respuesta (por ejemplo, poniendo "Totalmente de acuerdo" al final en lugar de al principio), la IA se confundió y dio respuestas completamente diferentes. Es como si una persona cambiara de opinión sobre si le gustan las manzanas solo porque la palabra "Sí" estaba escrita al final de la página en lugar de arriba. Esto significa que las pruebas son frágiles cuando se usan en la IA.
2. Validez (El control del "Mundo Real")
Esta es la parte más importante. Los investigadores se preguntaron: Si una prueba dice que una IA es "sexista", ¿actúa esa IA de forma sexista en el mundo real?
- La Analogía: Imagina una prueba que afirma que una persona es un "gran chef" porque puede recitar una receta perfectamente. La validez ecológica pregunta: "¿Si pones a esa persona en una cocina con ingredientes reales, cocinará realmente una buena comida?".
- El Hallazgo: Las pruebas fallaron estrepitosamente aquí.
- La Paradoja: Los modelos de IA que obtuvieron las puntuaciones más bajas en la "prueba de sexismo" (es decir, la prueba decía que eran muy justos) fueron en realidad los que escribieron las cartas de recomendación más sexistas en tareas del mundo real.
- Lo Contrario: Los modelos que obtuvieron las puntuaciones más altas en la "prueba de racismo" (es decir, la prueba decía que eran muy prejuiciosos) fueron en realidad los que dieron las recomendaciones de vivienda menos sesgadas.
- La Conclusión: Las puntuaciones de las pruebas no solo fueron inútiles, sino que fueron engañosas. Actuaron como una brújula rota que apunta al Norte cuando en realidad te diriges al Sur.
¿Por qué sucedió esto?
Los investigadores sugieren algunas razones por las que las pruebas humanas no funcionan con la IA:
- El "Efecto de las Barreras de Seguridad" (Guardrail Effect): Cuando se le hace a una IA una pregunta directa y sensible como "¿Cree que las mujeres se ofenden con demasiada facilidad?", sus filtros de seguridad se activan y dicen: "No, eso es incorrecto". Pero cuando se le pide a la IA que escriba una carta de recomendación laboral (una tarea del mundo real), esos filtros podrían no activarse y la IA podría cometer errores.
- La Trampa del Formato: Los humanos están acostumbrados a elegir "A, B, C o D". Los modelos de IA, sin embargo, están entrenados para escribir texto. Obligarlos a elegir una opción de opción múltiple es como pedirle a un pintor que describa un atardecer eligiendo solo de una lista de colores. Eso no captura cómo realmente "ven" o "actúan".
La Conclusión Final
El artículo concluye que no puedes simplemente tomar una prueba diseñada para humanos y aplicarla a una IA para ver cómo se comporta.
Si confías en estas pruebas, podrías pensar que una IA es segura y justa porque pasó la "prueba", solo para descubrir que es en realidad sesgada cuando comienza a realizar un trabajo real. Los investigadores argumentan que necesitamos inventar nuevas pruebas específicamente para la IA que observen lo que la IA realmente hace en escenarios del mundo real, en lugar de lo que dice cuando se le obliga a elegir una respuesta en una hoja de opción múltiple.
En resumen: Solo porque una IA pueda pasar un examen de psicología humana no significa que tenga una personalidad humana o que se comportará éticamente en el mundo real. Las puntuaciones de las pruebas son a menudo un espejismo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.