← Últimos artículos
💬 NLP

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

Este artículo presenta un referente translingüístico que demuestra que el género gramatical en los idiomas de las instrucciones sesga significativamente los resultados de los modelos de texto a imagen hacia los géneros visuales correspondientes, revelando que la estructura del lenguaje en sí misma, más allá del mero contenido semántico, moldea las representaciones visuales generadas por la IA.

Autores originales: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

Publicado 2026-02-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef capaz de cocinar cualquier plato con solo leer una receta. Pero aquí está el giro: la receta no es solo una lista de ingredientes; la gramática del lenguaje que usas para escribir la receta cambia secretamente el sabor del plato, incluso si los ingredientes son exactamente los mismos.

Este artículo trata sobre un equipo de investigadores que descubrió que los modelos de IA de Texto-a-Imagen (T2I) (los "chefs") están fuertemente influenciados por el género gramatical de las palabras que usamos para describirlos, no solo por el significado de las palabras en sí.

Aquí está el desgón de sus hallazgos utilizando analogías simples:

La idea central: El "Fantasma de la Gramática"

En idiomas como el inglés o el chino, palabras como "guard" (guardia) o "gossip" (chisme/cotilla) no tienen un género intrínseco. Son neutras. Pero en idiomas como el francés, el alemán o el español, cada sustantivo tiene un género (masculino o femenino), incluso si se trata de un objeto o un concepto.

  • El experimento: Los investigadores tomaron palabras donde el género gramatical choca con el género estereotípico.
    • Ejemplo: En francés, la palabra para "guardia" (une sentinelle) es gramaticalmente femenina, aunque los guardias son estereotípicamente vistos como masculinos.
      • Ejemplo: En alemán, la palabra para "chisme" (der Tratsch) es gramaticalmente masculina, aunque el chisme se asocia estereotípicamente con las mujeres.

Le pidieron a tres modelos de IA diferentes (DALL-E 3, Ideogram y Flux) que dibujaran imágenes de estos conceptos usando tres tipos de prompts:

  1. El prompt con género: Usando la palabra en francés/alemán (ej. "A photo of a sentinelle").
  2. El prompt neutro (Inglés): Usando la palabra en inglés ("A photo of a guard").
  3. El prompt neutro (Chino): Usando la palabra en chino.

La gran revelación: La gramática es una varita mágica

Los resultados fueron sorprendentes. La IA no solo miró qué significaba la palabra; escuchó el género de la palabra.

  • El efecto masculino: Cuando la IA recibió una palabra con gramática masculina (incluso si el concepto era usualmente femenino), dibujó hombres con mucha más frecuencia.

    • Analogía: Es como si pidieras una receta "femenina" pero usaras una etiqueta de ingrediente "masculina", y el chef de repente decidiera servir un filete en lugar de una ensalada.
    • Los números: Con gramática masculina, la IA dibujó hombres el 73% de las veces. Con el inglés neutro, solo dibujó hombres el 22% de las veces. Ese es un salto masivo solo por un pequeño marcador gramatical.
  • El efecto femenino: Cuando la IA recibió una palabra con gramática femenina, dibujó mujeres con más frecuencia, pero el efecto fue un poco más mixto.

    • Los números: La gramática femenina aumentó las imágenes de mujeres al 38% (comparado con el 28% en inglés).
    • El giro: En algunos casos (especialmente con el modelo DALL-E 3), la IA hizo lo contrario de lo que la gramática sugería, probablemente porque estaba intentando tanto "corregir" los estereotipos que sobrecorrigió.

¿Por qué sucede esto?

Los investigadores encontraron dos razones principales:

  1. El "Sesgo de Alto Recurso": El efecto fue más fuerte en idiomas con muchos datos de entrenamiento (como el francés, el español y el alemán). Es como si la IA hubiera "leído" tantos libros en estos idiomas que ha aprendido a asociar las etiquetas de género gramatical con estilos visuales específicos.
  2. El "Filtro del Inglés": Cuando compararon los resultados con el inglés, el efecto era a veces más débil. Los investigadores sospechan que esto se debe a que los modelos de IA en inglés han sido fuertemente "des-sesgados" (entrenados para evitar estereotipos) específicamente para el inglés. Sin embargo, cuando compararon los resultados con el chino (que tiene menos investigación de sesgos), los efectos del género gramatical fueron aún más fuertes y claros.

Los modelos reaccionan de forma diferente

Piensa en los tres modelos de IA como tres artistas distintos:

  • Flux: El artista más sensible. Siguió las reglas del género gramatical estrictamente, dibujando hombres para palabras masculinas y mujeres para palabras femeninas casi siempre.
  • Ideogram: Un artista de punto medio. Siguió las reglas, pero no fue tan extremo.
  • DALL-E 3: El artista "rebelde". A menudo ignoraba el género gramatical o incluso hacía lo contrario, probablemente porque su entrenamiento incluyó instrucciones fuertes para evitar estereotipos de género.

El efecto secundario de la "Ambigüedad"

Una nota lateral interesante: Cuando se les dio prompts en idiomas con género, la IA produjo más imágenes que eran difíciles de clasificar (no se podía distinguir si la persona era hombre o mujer). Es como si el conflicto entre el significado de la palabra y su género gramatical confundiera a la IA, haciendo que la imagen se viera "difusa" respecto al género.

La conclusión fundamental

Este artículo demuestra que la estructura del lenguaje por sí misma moldea la realidad en la IA. No es solo qué dices (el contenido), sino cómo lo dices (la gramática) lo que cambia la imagen.

Si quieres la imagen de un "guardia", la IA podría mostrarte a un hombre en inglés, pero a una mujer en francés, simplemente porque la palabra francesa para guardia es gramaticalmente femenina. Los investigadores llaman a esto un nuevo tipo de sesgo: Sesgo de Género Gramatical.

Lo que el artículo NO dice:

  • No sugiere que debamos dejar de usar idiomas con género.
  • No ofrece una solución específica para este problema todavía (más allá de notar que el entrenamiento de los modelos debe tener en cuenta esto).
  • No afirma que esto ocurra en todos los sistemas de IA, solo en los tres modelos específicos que probaron.

En resumen, la gramática de un idioma es como un manual de instrucciones oculto para la IA, diciéndole a quién dibujar incluso antes de que mire el significado de la palabra.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →