← Últimos artículos
💻 computer science

Bias at the End of the Score

Este estudio demuestra que los modelos de recompensa utilizados en la generación de imágenes texto-a-imagen codifican sesgos demográficos que, al guiar la optimización, refuerzan estereotipos de género y raza, sexualizan desproporcionadamente a las mujeres y reducen la diversidad demográfica, lo que cuestiona su fiabilidad como métricas de calidad neutrales.

Autores originales: Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

Publicado 2026-04-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las Inteligencias Artificiales que crean imágenes (como las que hacen fotos de "un gato en la luna") tienen un entrenador personal. Este entrenador se llama "Modelo de Recompensa" (Reward Model).

Su trabajo es simple: mirar una imagen generada por la IA y decir: "¡Esta es genial! Puntuación 10/10" o "Esta es mala. Puntuación 2/10". Las empresas usan a este entrenador para filtrar las mejores fotos y para enseñar a la IA a hacer mejores fotos en el futuro.

El problema, según este estudio, es que este entrenador tiene prejuicios ocultos. No es un juez imparcial de la belleza o la calidad; es un juez que tiene ideas muy fijas sobre cómo deberían ser las cosas basándose en estereotipos sociales.

Aquí te explico los hallazgos principales con analogías sencillas:

1. El Entrenador que "Sexualiza" a las Mujeres

Imagina que le pides a la IA: "Haz una foto de una doctora". La IA crea una imagen. Luego, el entrenador (el Modelo de Recompensa) la mira y dice: "Podría ser mejor".

Entonces, la IA intenta mejorar la imagen para que el entrenador esté más feliz.

  • Lo que pasa: Cuando la doctora es una mujer, el entrenador la empuja a que se vista menos, aparezca en poses más provocativas o muestre más piel. La IA obedece porque quiere la "puntuación alta".
  • La analogía: Es como si un director de cine le dijera a una actriz que, para ganar un Oscar, tiene que quitarse el uniforme de trabajo y ponerse un bikini, aunque el guion diga que es una doctora.
  • El hallazgo: Las mujeres en las imágenes generadas terminan siendo mucho más sexualizadas que los hombres cuando se usa este sistema de "mejora automática".

2. El Entrenador que "Blanquea" el Mundo

Ahora imagina que le pides a la IA: "Haz una foto de un médico". No especificas la raza.

  • Lo que pasa: Si la IA genera una foto de una persona negra o latina, el entrenador (especialmente modelos como ImageReward o HPS) la mira y dice: "No me gusta, la puntuación es baja".
  • La analogía: Es como si tuvieras un filtro de Instagram que, automáticamente, cambiara el color de piel de cualquier persona negra o latina a blanco, porque el algoritmo "cree" que las fotos de personas blancas son de mayor calidad.
  • El resultado: Cuando la IA intenta mejorar la imagen para complacer al entrenador, la persona negra o latina en la foto se transforma mágicamente en una persona blanca. El entrenador está "borrando" la diversidad porque asocia la "calidad" con la "blancura".

3. El Entrenador que Repite los Estereotipos del Mundo Real

El estudio también descubrió que el entrenador no solo juzga la calidad de la imagen, sino que apunta a lo que es "común" en la sociedad.

  • La analogía: Imagina que le pides al entrenador que califique fotos de "enfermeras" y "jefes de construcción".
    • Si ves una foto de una mujer siendo enfermera, el entrenador le da 10 puntos (porque en la vida real hay muchas enfermeras mujeres).
    • Si ves a un hombre siendo enfermera, le da 4 puntos (porque el entrenador piensa: "Eso no es normal").
    • Si ves a un hombre siendo jefe de construcción, le da 10 puntos.
    • Si ves a una mujer siendo jefe de construcción, le da 4 puntos.
  • El problema: El entrenador no está juzgando si la foto es bonita o realista; está juzgando si la foto coincide con quién hace qué trabajo en la sociedad. Refuerza los roles tradicionales en lugar de permitir la creatividad o la igualdad.

¿Por qué es peligroso esto?

Piensa en estos modelos de recompensa como filtros de agua.

  • Si el filtro está sucio (tiene prejuicios), todo el agua que sale (las imágenes que vemos en internet, en publicidad o en noticias) saldrá contaminada.
  • Si usamos estos entrenadores para elegir las mejores fotos, estaremos seleccionando solo un tipo de mundo: uno donde las mujeres son sexualizadas, donde las personas no blancas son invisibles o se vuelven blancas, y donde los roles de género son rígidos.

En resumen

El papel nos dice que, aunque creemos que estas IAs son herramientas neutrales para crear arte, en realidad están aprendiendo de datos humanos que están llenos de prejuicios. Al usarlas para "mejorar" las imágenes, no estamos haciendo las fotos más bonitas; estamos haciendo el mundo más estereotipado.

La solución no es dejar de usar la IA, sino entrenar a los entrenadores para que aprendan a ver la belleza y la calidad sin tener esos prejuicios ocultos, para que la próxima vez que pidas una foto, la IA te muestre un mundo diverso y real, no un espejo de nuestros sesgos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →