← Últimos artículos
🤖 machine learning

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

Este artículo revela que los sistemas de texto a imagen basados en LLM introducen sesgos demográficos más fuertes que las líneas base que no utilizan LLM debido a sus instrucciones del sistema, y propone FairPro, un marco de trabajo libre de entrenamiento que mitiga estos sesgos mediante la generación adaptativa de instrucciones conscientes de la equidad mientras preserva la intención del usuario.

Autores originales: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

Publicado 2026-06-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran idea: El "Traductor Entusiasta"

Imagina que quieres dibujar un cuadro basado en una frase sencilla, como "Un botánico".

En las máquinas de dibujo más antiguas, le entregabas la frase directamente al artista. El artista dibujaba al botánico, pero podía basarse en sus propios viejos hábitos o estereotipos (por ejemplo, dibujar solo hombres blancos).

En las máquinas de dibujo más nuevas y listas (las que estudia este artículo), hay un paso adicional. Antes de que el artista vea tu frase, un traductor inteligente (un modelo de lenguaje de IA) la lee primero. Se supone que este traductor ayuda añadiendo detalles para que la imagen sea mejor. Por ejemplo, podría convertir "Un botánico" en "Un botánico en un campo verde con un sombrero, sosteniendo una lupa".

El problema: El artículo descubrió que este "traductor inteligente" a menudo añade estereotipos no deseados mientras intenta ser útil. Incluso si no pediste un género, raza o edad específicos, el traductor podría asumir: "Ah, los botánicos suelen ser hombres blancos", y añadir esos detalles a las instrucciones antes de que el artista empíece siquiera a dibujar.

La investigación: La prueba "COMPBIAS"

Los investigadores construyeron un kit de pruebas gigante llamado COMPBIAS (piensa en ello como un examen estandarizado para máquinas de dibujo). Probaron 1,024 prompts diferentes, que iban desde muy simples ("Un doctor") hasta muy complejos ("Un doctor salvando a un paciente en un hospital concurrido").

Compararon dos tipos de máquinas:

  1. De la vieja escuela: Instrucciones directas al artista.
  2. De la nueva escuela: Las instrucciones pasan primero por el "truja inteligente".

Los hallazgos:

  • Las máquinas de la "Nueva Escuela" eran más sesgadas. Produjeron imágenes con estereotipos mucho más fuertes (por ejemplo, mayoritariamente hombres blancos para "doctores") que las de la vieja escuela.
  • La "Trampa de la Alineación": Las nuevas máquinas eran en realidad mejores siguiendo tus instrucciones y creando imágenes de alta calidad. Pero el artículo encontró una compensación: cuanto mejor eran entendiendo tus palabras, más se apoyaban en los estereotipos cuando no especificabas detalles.
  • La complejidad lo empeora: Cuanto más complejo era tu prompt, más detalles estereotipados añadía el traductor, haciendo que el sesgo fuera más fuerte.

El culpable: El "System Prompt" (Prompt de Sistema)

Los investigadores investigaron por qué sucede esto. Descubrieron que el culpable es el System Prompt.

Piensa en el System Prompt como el libro de reglas o el memorándum del gerente que se le entrega al traductor inteligente. Le dice al traductor cómo debe comportarse.

  • El artículo encontró que estos libros de reglas predeterminados a menudo contienen suposiciones ocultas.
  • Cuando el traductor lee un prompt neutral como "Un juez", el libro de reglas lo empuja a pensar en un tipo de persona específico (por ejemplo, un hombre blanco mayor) antes de que siquiera escriba la descripción para el artista.
  • Los investigadores demostraron esto observando los "pensamientos" (embeddings de texto) de la máquina. Vieron que el traductor estaba cambiando secretamente palabras neutrales por palabras sesgadas antes de que la imagen fuera creada.

La solución: "FAIRPRO" (El Entrenador de Equidad)

Los investigadores no querían simplemente borrar al traductor inteligente, porque este hace que las imágenes luzcan geniales. En su lugar, crearon una solución llamada FAIRPRO.

Cómo funciona:
Imagina que el traductor inteligente tiene un entrenador parado a su lado.

  1. El Entrenador revisa el Prompt: Cuando dices "Un botánico", el entrenador revisa el libro de reglas del traductor.
  2. El Entrenador reescribe las reglas: En lugar de dejar que el traductor adivine, el entrenador le da una instrucción nueva y temporal: "Esta persona es un botánico. No asumas su género, raza o edad. Mantén la diversidad".
  3. El Resultado: El traductor sigue añadiendo detalles útiles (como el sombrero y la lupa), pero deja de asumir que el botánico es un hombre blanco. Crea una mezcla de imágenes más diversa.

Por qué es especial:

  • Sin re-entrenamiento: No tuvieron que reconstruir toda la máquina ni enseñarle cosas nuevas. Solo cambiaron las instrucciones que recibe mientras está trabajando.
  • Te respeta: Si tú dices "Una botánica mujer", el entrenador respeta eso y mantiene el género femenino, pero aun así asegura que la raza y la edad sean diversas. Solo corrige las partes que tú no especificaste.

Conclusión

El artículo muestra que las partes "inteligentes" de los generadores de imágenes de IA modernos son en realidad la fuente de nuevos tipos de sesgo. Al simplemente ajustar las instrucciones dadas a estos traductores inteligentes (los System Prompts), podemos evitar que hagan suposiciones injustas sin arruinar la calidad de las imágenes. Es como enseñarle a un asistente servicial a dejar de adivinar tus preferencias y, en su lugar, preguntar: "¿A quién debería dibujar?" antes de hacer suposiciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →