← Últimos artículos
💻 computer science

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models

Este artículo presenta BAFIS, un conjunto de datos y un marco de trabajo que comprende 21.140 imágenes multilingües y retroalimentación de preferencia humana, para evaluar y revelar sesgos ocupacionales sistemáticos en cinco de los principales modelos de texto a imagen, demostrando la necesidad crítica de incorporar el juicio humano junto con las métricas establecidas para desarrollar sistemas de IA más justos.

Autores originales: Thomas Klassert, Adrian Ulges, Biying Fu

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Thomas Klassert, Adrian Ulges, Biying Fu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una máquina de pintura mágica. Escribes una descripción como "un doctor" y, al instante, pinta un cuadro. Durante mucho tiempo, la gente pensó que estas máquinas eran solo herramientas neutrales, como una cámara. Pero este artículo argumenta que estas máquinas son más bien espejos sesgados: no solo muestran la realidad, sino que muestran una versión distorsionada de ella basada en lo que han aprendido de internet.

Los autores de este artículo, Thomas, Adrian y Biying, quisieron probar cinco de las "máquinas de pintura" más populares (Midjourney, Stable Diffusion, DALL-E 3, Playground y FLUX) para ver cómo manejan los empleos y las personas. Construyeron un campo de pruebas especial llamado BAFIS (Battle-Arena for Fair Image Synthesis / Arena de Batalla para la Síntesis de Imágenes Justa).

Aquí tienes un desglose de sus hallazgos usando analogías sencillas:

1. La Arena: BAFIS

Piensa en BAFIS como una competencia de degustación a ciegas.

  • La Configuración: En lugar de dejar que una computadora califique las imágenes, pusieron a dos máquinas diferentes en una "batalla".
  • El Concurso: Un usuario ve un prompt (instrucción), por ejemplo, "una enfermera", y dos imágenes anónimas generadas por dos máquinas distintas.
  • El Voto: El usuario vota sobre tres cosas:
    1. Sesgo: ¿La imagen parece una mezcla realista de personas o solo muestra un tipo?
    2. Calidad: ¿Es la imagen bonita y clara?
    3. Alineación: ¿La imagen realmente coincide con las palabras que escribiste?
  • La Puntuación: Utilizaron un sistema de clasificación (como el ranking de ajedrez) para ver qué máquina ganaba más votos.

2. El Conjunto de Datos: Una Gran Biblioteca de Trabajos

Para asegurar que la prueba fuera justa, no se limitaron a pedir "un doctor". Crearon una enorme biblioteca de 21,140 imágenes basadas en 1,057 descripciones de trabajos diferentes.

  • Usaron dos idiomas: Inglés y Alemán.
  • Probaron diferentes formas de preguntar:
    • Directa: "Una foto de un contador varón".
    • Indirecta: "Una foto de una persona que gestiona finanzas".
    • Grupos: "Una foto de un grupo de contadores".
  • Compararon los resultados contra estadísticas del mundo real del gobierno alemán (como verificar una receta contra la lista real de ingredientes) para ver si las máquinas estaban mintiendo sobre quién ocupa esos puestos.

3. Los Hallazgos: En lo que las Máquinas se Equocaron

El Problema de Género (La división "Construcción vs. Enfermería")

Las máquinas tienen estereotipos de género muy marcados.

  • Construcción e Ingeniería: Cuando se les pedía dibujar estos trabajos, las máquinas casi siempre dibujaban hombres. Era como si pensaran que solo los hombres podían construir cosas.
  • Salud y Trabajo de Oficina: Cuando se les pedía dibujar enfermeras o trabajadores de oficina, las máquinas se inclinaban fuertemente hacia las mujeres.
  • La Sorpresa: Una máquina, DALL-E 3, fue la más equilibrada. Dibujó hombres y mujeres casi por igual, como el lanzamiento de una moneda justa. Otra máquina, FLUX, de hecho, dibujó más mujeres que hombres para algunos trabajos, lo cual es un nuevo tipo de sesgo.

El Probleismo de la Etnia (El "Muro Blanco")

Este fue el problema más grande. Sin importar qué trabajo pidieras, las máquinas dibujaban abrumadoramente rostros blancos.

  • Era como si las máquinas tuvieran una configuración predeterminada que decía: "Si no especificas una raza, haz que sean blancos".
  • Este sesgo era incluso más fuerte en alemán que en inglés. Cuando el prompt estaba en alemán, las máquinas dibujaban aún menos rostros no blancos.
  • DALL-E 3 fue la única máquina que logró mantener el porcentaje de rostros blancos por debajo del 50% en ambos idiomas, siendo la más diversa.

La Calificación "Humano vs. Robot"

Aquí es donde se pone complicado. El artículo encontró que las métricas computacionales (fórmulas matemáticas que califican la calidad de la imagen) a menudo no estaban de acuerdo con los sentimientos humanos.

  • Calidad de Imagen: Una máquina llamada FLUX fue calificada por humanos como la más bella y realista. Sin embargo, la matemática de la computadora (puntuación FID) decía que DALL-E 3 era la mejor.
  • La Conclusión: Las fórmulas matemáticas son como un robot intentando juzgar una pintura; miden píxeles pero pierden el "alma" o el sentimiento que los humanos experimentan al mirar una imagen. Los humanos prefirieron FLUX, incluso si las matemáticas decían lo contrario.

El Giro del Idioma

  • DALL-E 3 tiene un arma secreta: reescribe tu prompt. Si escribes un prompt en alemán, lo traduce y ajusta secretamente al inglés antes de pintar. Esto le ayudó a entender mejor la solicitud y a obtener puntuaciones más altas en "alineación" (coincidencia con las palabras) en las batallas en alemán.
  • Stable Diffusion 3 fue la campeona para los prompts en inglés, pero tuvo dificultades con el alemán.

4. La Conclusión

El artículo concluye que estas máquinas de pintura de IA no son neutrales. Cargan con los sesgos de los datos con los que fueron entrenadas.

  • Sobre-representan a los hombres en trabajos "difíciles" y a las mujeres en trabajos de "cuidado".
  • Casi siempre recurren por defecto a rostros blancos.
  • Las pruebas computacionales no son suficientes. Necesitamos preguntar a humanos reales lo que piensan porque las matemáticas no siempre capturan lo que nos parece "justo" o "real".

Los autores sugieren que, para solucionar esto, los desarrolladores deben escuchar más de cerca la retroalimentación humana y contrastar sus máquinas con estadísticas del mundo real, no solo con fórmulas de computadora. Construyeron BAFIS para que, en el futuro, podamos seguir exigiéndoles cuentas a estas máquinas en una "arena de batalla" para asegurar que sean más justas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →