LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios
Este artículo evalúa los sesgos de género, raza y edad en cuatro de los principales modelos de lenguaje de gran tamaño de 2024 a través de escenarios ocupacionales y de criminalidad, revelando desviaciones significativas respecto a los datos del mundo real y demostrando que los esfuerzos actuales de mitigación de sesgos a menudo crean nuevas compensaciones de equidad conocidas como la "paradoja de la mitigación de sesgos".
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes cuatro asistentes digitales muy inteligentes y muy cultos (Modelos de Lenguaje Extensos, o LLM) llamados Gemini, Claude, GPT y Llama. Estos asistentes han leído casi todo en internet, desde artículos de noticias hasta novelas, y ahora se les pide que escriban historias cortas para nosotros.
Este artículo es como un juego de "encuentra las diferencias". Los investigadores pidieron a estos cuatro asistentes que escribieran historias sobre dos cosas específicas:
- Trabajos: "Escribe una historia sobre una enfermera", "Escribe una historia sobre un bombero", etc.
- Crímenes: "Escribe una historia sobre alguien que cometió un robo", "Escribe una historia sobre alguien que condujo ebrio", etc.
Luego, los investigadores revisaron las historias para ver: ¿Quiénes son los personajes? ¿Son hombres o mujeres? ¿Cuál es su raza? ¿Qué edad tienen? Finalmente, compararon las respuestas de los asistentes con los hechos del mundo real (como las estadísticas oficiales del gobierno de EE. UU. sobre quiénes ocupan realmente esos trabajos o cometen esos delitos).
Aquí está lo que encontraron, explicado de forma sencilla:
1. Las historias de trabajos: "La sobrecorrección"
Cuando se les pidió escribir sobre trabajos, los asistentes generalmente acertaron con los estereotipos "fáciles". Si la instrucción era "enfermera" o "recepcionista", casi siempre escribieron sobre mujeres. Si la instrucción era "bombero" o "trabajador de la construcción", casi siempre escribieron sobre hombres. Esto coincide bastante bien con la realidad.
Sin embargo, tropezaron con los trabajos de "alto estatus".
- El mundo real: Según datos del gobierno de EE. UU., aproximadamente el 69% de los directores ejecutivos (CEOs) y el 80% de los ingenieros de software son hombres.
- Los asistentes: Cuando se les pidió escribir una historia sobre un CEO o un ingeniero de software, estos asistentes escribieron sobre mujeres casi exclusivamente (a veces el 99% de las veces).
La analogía: Imagina a un director de escuela tratando de solucionar un problema donde un grupo de estudiantes siempre era elegido para el rol de capitán. Para arreglarlo, el director decide elegir solo al otro grupo para el próximo año. ¡Se pasó de la raya! El director se excedió. El artículo llama a esto "sobreindexación" (over-indexing). Los asistentes intentaron con tanto ahínco ser justos y no ser sexistas que movieron el péndulo demasiado hacia el otro lado, creando un nuevo tipo de injusticia donde los hombres ahora están subrepresentados en estos roles de alto poder.
2. Las historias de crímenes: "El espejo distorsionado"
Cuando los asistentes escribieron historias sobre crímenes (como robo, fraude o asesinato), los resultados fueron aún más mixtos en comparación con los datos reales de la policía.
- Género: El mundo real muestra que los hombres cometen la mayoría de los delitos.
- GPT fue un poco más preciso, escribiendo principalmente sobre hombres.
- Gemini y Llama se inclinaron hacia el otro lado, escribiendo principalmente sobre mujeres cometiendo delitos, a pesar de que los datos dicen que los hombres son la mayoría.
- Claude fue el más equilibrado, pero aun así tuvo algunas brechas.
- Raza: En los EE. UU. reales, las estadísticas de criminalidad muestran una mezcla específica de razas.
- La mayoría de los asistentes (excepto Gemini) escribieron historias donde los criminales eran principalmente blancos, aunque los datos reales muestran una distribución diferente. Parecían haber "sobreindexado" en personajes blancos, quizás para evitar ser racistas, pero terminaron borrando la realidad de otros grupos.
- Edad: Los asistentes generalmente acertaron con las edades de los criminales de forma más cercana a la realidad que con el género o la raza, aunque algunos todavía adivinaron los grupos de edad equivocados con demasiada frecuencia.
3. La gran conclusión
El artículo concluye que, aunque las empresas que construyen estos modelos de IA se están esforzando mucho por eliminar el sesgo (usando entrenamiento especial y retroalimentación humana), aún no lo han resuelto del todo.
El problema central: Es como intentar equilibrar una balanza.
- Si la balanza pesa más de un lado (sesgo histórico), y tratas de arreglarlo, podrías accidentalmente poner demasiado peso en el otro lado.
- El artículo encontró que cuando la IA intenta corregir el sesgo de género o racial, a menudo crea un nuevo problema donde favorece a un grupo demasiado, haciendo que los datos parezcan falsos en comparación con la realidad.
Resumen
Los investigadores probaron cuatro de los principales modelos de IA en 2024. Encontraron que, si bien la IA está mejorando, todavía tiene dificultades para decir la verdad sobre quién hace qué en nuestro mundo.
- En los trabajos, a menudo ignora a los hombres en roles de liderazgo.
- En los crímenes, a menudo ignora a los hombres y a las personas de color, o inventa una realidad que no coincide con los informes policiales.
El artículo advierte que simplemente intentar "arreglar" el sesgo no es suficiente si el arreglo crea un nuevo sesgo opuesto. El objetivo no es solo ser "diferente" del pasado, sino ser preciso respecto al presente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.