← Últimos artículos
💻 computer science

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

Este artículo presenta INCLUDE-BENCH, el primer banco de pruebas a gran escala para evaluar los sesgos relacionados con la discapacidad en los modelos de texto a imagen, revelando que los sistemas actuales dependen sistemáticamente de estereotipos estrechos como las sillas de ruedas y exhiben una mayor alineación con las asociaciones prejuiciosas del mundo real al representar a personas con discapacidades.

Autores originales: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

Publicado 2026-07-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una máquina de arte mágica que puede dibujar cualquier cosa que describas. Dices: "Dibuja un chef" y la máquina escupe una imagen de una persona con un gorro blanco cocinando. Dices: "Dibuja a una persona con una discapacidad" y... bueno, ahí es donde la magia se vuelve un poco defectuosa.

Un equipo de investigadores de la Universidad de Utrecht decidió probar este fallo con una nueva y gigante prueba llamada INCLUDE-BENCH. No solo querían ver si las máquinas estaban "sesgadas"; querían ver cómo lo estaban, utilizando un enorme conjunto de datos de 119.680 imágenes generadas. Pidieron a 17 motores de arte diferentes (tanto de código abierto que cualquiera puede usar como dos cerrados y secretos) que dibujaran a personas con discapacidades en todo tipo de situaciones.

Aquí están sus hallazgos, servidos con una dosis de realidad.

El atajo de la "Silla de Ruedas"

¿La mayor sorpresa? Las máquinas están obsesionadas con las sillas de ruedas. Cuando los investigadores pedían una persona con "problemas de movilidad" o simplemente una persona "discapacitada" genérica, casi todos los modelos recurrían inmediatamente a la silla de ruedas. Es como si le pidieras a un chef que dibujara a un "panadero" y este solo dibujara a alguien sosteniendo un rodillo, ignorando los hornos, la harina o el pan real.

El artículo muestra que para estos prompts específicos, las máquinas son increíblemente consistentes al dibujar la silla de ruedas, pero son terribles dibujando cualquier otra cosa. Es un atajo visual. Las máquinas piensan: "Ah, ¿discapacidad? Eso significa silla de ruedas", y se detienen ahí.

El filtro de "Viejo y Triste"

Las máquinas también parecen tener un filtro extraño para la edad y el estado de ánimo. Cuando dibujaban a personas con problemas de movilidad, eran abrumadoramente mayores. Si la persona era una mujer, a menudo se la dibujaba en una casa, cocinando o limpiando. Si la persona era un hombre, a menudo estaba fuera, en un parque o un museo.

Los investigadores descubrieron que las máquinas básicamente están jugando una partida de "bingo de estereotipos". Están eligiendo las pistas más obvias y reconocibles (como una silla de ruedas o una venda en los ojos) para asegurarse de que sepas quién es la persona, pero al hacerlo, borran todos los demás detalles. No están mostrando a un grupo diverso de personas viviendo sus vidas; están mostrando un conjunto de personajes muy estrecho, muy viejo y muy específico.

El intercambio entre "Alineación y Diversidad"

Aquí hay una forma divertida de pensar en la matemática detrás de la magia. Los investigadores midieron dos cosas:

  1. Alineación: Qué tan bien coincide la imagen con las palabras que escribiste.
  2. Diversidad: Qué tan diferentes son las imágenes entre sí.

Encontraron un intercambio curioso. Las imágenes que mejor coincidían con las palabras "problemas de movilidad" o "discapacitado" (mayor alineación) eran las menos diversas. Todas se veían casi exactamente iguales: una persona mayor en una silla de ruedas.

Pero cuando pedían personas "ciegas" o "sordas", las imágenes eran un poco más diversas. Podías ver a una persona con un bastón, o a alguien con gafas de sol, o tal vez solo a alguien con aspecto pensativo. Pero incluso entonces, las máquinas seguían recurriendo a viejos trucos, como dibujar vendas en los ojos o gestos específicos con las manos.

La puntuación de "Calidez y Competencia"

Los investigadores incluso inventaron una nueva forma de puntuar las imágenes, llamada Puntuación SCM. Imagina un gráfico donde un lado es "¿Qué tan agradable parece esta persona?" (Calidez) y el otro es "¿Qué tan capaz parece?" (Competencia).

En el mundo real, la gente suele pensar en las personas con discapacidad como "amables pero no muy capaces". El artículo encontró que las máquinas de arte están copiando exactamente esta misma vibra. Las imágenes de personas en sillas de ruedas puntuaron bajo en "competencia". Parecían menos capaces que las imágenes de personas sin discapacidades. Incluso cuando los investigadores pedían a las máquinas que dibujaran a estas personas realizando actividades activas (como caminar o charlar), las máquinas seguían teniendo dificultades para hacer que parecieran capaces.

Lo que las máquinas hicieron mal (y lo que no probaron)

Es importante saber qué es lo que esta prueba no hizo. Los investigadores dijeron explícitamente que no probaron discapacidades cognitivas o intelectuales. ¿Por qué? Porque esas no siempre son visibles en una imagen. No puedes realmente "dibujar" un proceso de pensamiento de la misma manera que puedes dibujar una silla de ruedas. Así que los resultados que tenemos se refieren estrictamente a cosas que se pueden ver.

Además, el artículo no pretende haber "arreglado" el problema. No encontraron un interruptor mágico para apagar el sesgo. En su lugar, construyeron una cinta métrica gigante (INCLUDE-BENCH) para mostrarnos exactamente qué tan rota está la cinta métrica en este momento. Descubrieron que incluso cuando intentaban cambiar el contexto (pidiendo una persona en una cafetería frente a un parque), las máquinas seguían inclinándose fuertemente hacia los estereotipos.

La conclusión

El artículo sugiere que estas máquinas de arte no solo cometen errores accidentales; están reproduciendo activamente las mismas historias estrechas y estereotipadas que vemos en el mundo real. Están dando un peso excesivo a las pistas "diagnósticas" (la silla de ruedas, el bastón) e ignorando el resto del ser humano.

Los investigadores están bastante seguros de esto porque generaron casi 120.000 imágenes y las verificaron con matemáticas y herramientas de IA. No están adivinando; lo midieron. Y la medición dice: si quieres ver a una persona con una discapacidad real, diversa y capaz, aún no puedes simplemente pedírselo a la máquina. La máquina todavía está atrapada en el bucle de "silla de ruedas y vejez".

Así que, aunque la tecnología es asombrosa, todavía está aprendiendo que una persona es más que su discapacidad. Hasta entonces, la máquina de arte mágica es, principalmente, dibujando la misma vieja historia, una y otra vez.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →