← Últimos artículos
🤖 AI

Investigating Social Bias in Narrative Image Generation

Este artículo demuestra que los sesgos sociales en los modelos de generación de texto a imagen no solo son más prevalentes, sino también más explícitamente manifestados en formatos narrativos como guiones gráficos y cómics en comparación con las imágenes únicas, lo que resalta la necesidad crítica de evaluar estos sistemas a través de diversos contextos visuales.

Autores originales: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

Publicado 2026-08-04
📖 1 min de lectura☕ Lectura para el café

Autores originales: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Investigación del Sesgo Social en la Generación de Imágenes Narrativas

Declaración del Problema

Si bien los modelos de generación de Texto a Imagen (T2I) se despliegan cada vez más en medios, educación y diseño, persisten las preocupaciones respecto a su tendencia a reproducir sesgos sociales. Investigaciones previas han documentado extensamente que los modelos T2I asocian demografías específicas con profesiones, rasgos y roles sociales. Sin embargo, las evaluaciones de sesgo existentes se centran predominantemente en la generación de imágenes fotorrealistas de disparo único (single-shot). Este alcance limitado deja un vacío crítico: no está claro si y cómo los sesgos sociales se manifiestan en formatos visuales narrativos (como guiones gráficos o cómics), donde el significado se construye a través de la continuidad de los personajes, la secuenciación de eventos, la progresión temporal y la interacción entre los elementos visuales y textuales. Los autores postulan que los sesgos que pueden permanecer sutiles o invisibles en fotos estáticas pueden volverse explícitos o amplificados en formatos de narración secuencial.

Metodología

El estudio adapta el marco BBG (Bias Benchmark for Generation), diseñado originalmente para la generación de texto, para evaluar modelos de generación de imágenes. La metodología involucra los siguientes componentes:

  • Construcción de Prompts: Los autores seleccionaron 140 prompts semilla del conjunto de datos BBG, que cubren siete categorías de sesgo social: edad, discapacidad, género, apariencia física, raza/nacionalidad, religión y estatus socioeconómico (SES). Estos prompts fueron intencionalmente ambiguos contextualmente, dejando sin especificar atributos clave (por ejemplo, qué personaje posee un rasgo o resultado específico). El conjunto de datos incluye 70 prompts en inglés y 70 en coreano para investigar el sesgo translingüístico.
  • Modelos Evaluados: Se probaron seis modelos de estado del arte T2I:
    • Propietarios: GPT-Image-1.5, GPT-Image-2, Gemini-3.1-Flash-Image y Gemini-3-Pro-Image.
    • Código Abierto: FLUX.1-Dev y SDXL.
  • Configuraciones de Generación: Para cada prompt, los resultados se generaron en tres formatos distintos:
    1. Imagen Fotorrealista: Una única imagen estática.
    2. Guion Gráfico (Storyboard): Bocetos rudimentarios que se centran en el encuadre de la toma y la cobertura de cámara sin texto.
    3. Cómic de Cuatro Paneles: Una narrativa secuencial que integra elementos visuales con globos de texto, pies de foto y narración.
  • Protocolo de Evaluación: Cuatro autores anotaron manualmente las imágenes generadas (2.4K en total) basándose en las respuestas implícitas a las preguntas de BBG. Los resultados se etiquetaron como sesgados, contra-sesgados o neutrales. El estudio también empleó codificación temática para identificar patrones visuales y narrativos recurrentes. Se realizó un estudio de caso sobre generación de video (Sora-Pro-2 y Veo-3.1) para extender los hallazgos a medios temporales.

Resultados Clave

Hallazgos Cuantitativos

  • Los Formatos Narrativos Amplifican el Sesgo: Los modelos propietarios generaron significativamente más resultados sesgados en formatos narrativos en comparación con las fotos. En promedio, los modelos propietarios produjeron un 25.9% de resultados sesgados en la generación de fotos. Esta tasa aumentó en 9.6 puntos porcentuales (pp) en la generación de guiones gráficos y en 18.2 pp en la generación de cómics.
  • Disparidades Lingüísticas: La prevalencia del sesgo fue mayor en los prompts en coreano que en los de inglés, mostrando los entornos en coreano una tasa de salida sesgada un 7.2 pp más alta en promedio. La brecha más grande apareció en la generación de fotos (por ejemplo, Nano Banana 2 mostró un aumento de 17.4 pp).
  • Desempeño de Modelos Abiertos: Los modelos abiertos (FLUX.1-Dev y SDXL) generaron resultados neutrales en el 93.6% de los casos en promedio. Sin embargo, los autores atribuyen esto a una débil capacidad de seguimiento de instrucciones más que a una mitigación de sesgo efectiva, señalando que estos modelos a menudo fallaban al incorporar pistas demográficas o generaban contenido culturalmente desajustado.

Hallazgos Cualitativos

  • Sesgo Explícito vs. Implícito: En la generación de fotos, los sesgos suelen codificarse mediante pistas visuales sutiles (por ejemplo, ropa específica, accesorios o expresiones). En contraste, los guiones gráficos y los cómics revelan los sesgos de manera más explícita a través de la secuenciación de eventos, el posicionamiento de personajes, la resolución narrativa y los elementos textuales (por ejemplo, globos de texto que establecen estereotipos explícitamente).
  • Persistencia de Asociaciones Visuales: Las asociaciones visuales estereotípicas (por ejemplo, personas "creativas" representadas con moda casual/hippie o símbolos de bombillas) persistieron en todos los formatos, incluso cuando el estilo de salida cambiaba.
  • Estereotipos Capas: Los formatos narrativos expusieron sesgos más allá de la simple asignación de roles. Por ejemplo, el razonamiento detrás del fracaso o la dependencia de un personaje difería según el estereotipo (por ejemplo, la dependencia de una enfermera mujer enmarcada como vulnerabilidad emocional frente a la dependencia de una persona ciega enmarcada como una necesidad práctica).
  • Mitigación Superficial: Los modelos a veces intentaban evitar el sesgo introduciendo elementos anti-estereotípicos o finales moralizantes (por ejemplo, reconciliar a vecinos en conflicto). Sin embargo, los autores señalan que esto no necesariamente elimina las asociaciones subyacentes, ya que las pistas visuales sutiles aún pueden reforzar los estereotipos.
  • Desajuste Cultural: En contextos coreanos, los modelos frecuentemente fallaban en alinearse con los matices culturales, generando texto en inglés o idiomas mixtos, o produciendo imágenes occidentales o excesivamente tradicionales del este de Asia que no coincidían con el contexto cultural del prompt.

Significancia y Contribuciones

El artículo reclama tres contribuciones primarias:

  1. Primer Estudio de Sesgo Narrativo: Presenta la primera investigación sistemática del sesgo social en formatos de generación de imágenes narrativas, comparando imágenes fotorrealistas con guiones gráficos y cómics de cuatro paneles.
  2. Evidencia de Sesgo Dependiente del Formato: Demuestra que los modelos propietarios exhiben un sesgo significativamente mayor en formatos narrativos (guiones gráficos y cómics) que en la generación de imágenes únicas, lo que sugiere que las evaluaciones de imagen única son insuficientes para capturar el alcance total del sesgo del modelo.
  3. Mecanismos Cualitativos: Proporciona evidencia cualitativa sobre cómo los sesgos se manifiestan de manera diferente entre formatos—pasando de pistas visuales sutiles en fotos a una refuerzo narrativo y textual explícito en los cómics.

Los autores concluyen que los formatos de imagen narrativa sirven como una sonda más fuerte para el sesgo del modelo que la generación de fotos por sí sola. Argumentan que evaluar los sistemas T2I requiere ir más allá de los resultados de imagen única para dar cuenta de diversos formatos de generación, ya que los sesgos que son menos visibles en imágenes estáticas pueden emerger y volverse más perjudiciales en contextos de narración secuencial. El estudio también destaca la necesidad de evaluar las capacidades multilingües y transculturales, señalando que los modelos actuales a menudo fallan en fundamentar los prompts en sus contextos culturales específicos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →