← Últimos artículos
🤖 machine learning

WIDER-FAIR: An Annotated Version of the WIDER-FACE Dataset for Fairness Evaluation

Este artículo presenta WIDER-FAIR, un nuevo conjunto de datos que amplía el referente WIDER-FACE con anotaciones manuales de etnia y sexo para permitir la evaluación de la equidad, demostrando mediante experimentos que los modelos de detección de rostros exhiben disparidades de rendimiento significativas, particularmente contra las personas negras.

Autores originales: Maxime Moussi, Benoît Ronval, Siegfried Nijssen, Félicien Schiltz

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Maxime Moussi, Benoît Ronval, Siegfried Nijssen, Félicien Schiltz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un álbum de fotos gigante y caótico lleno de imágenes de multitudes, escenas callejeras y eventos. Este álbum se llama WIDER-FACE, y ha sido el "estándar de oro" para enseñar a las computadoras a detectar rostros humanos en fotos. Pero hay un inconveniente: el álbum no tiene etiquetas que indiquen quién está en las fotos. No sabes si las personas son hombres o mujeres, o cuáles son sus orígenes étnicos.

Debido a esta información faltante, es imposible verificar si la computadora está siendo justa. ¿Es buena detectando rostros de todo tipo de personas, o solo se vuelve muy buena detectando rostros que se parecen a la mayoría de las fotos con las que fue entrenada?

Entra WIDER-FAIR.

Los autores de este artículo tomaron ese álbum gigante y sin etiquetar y crearon una nueva versión anotada llamada WIDER-FAIR. Piensa en esto como contratar a un bibliotecario muy cuidadoso para que revise cada una de las fotos y añada una nota adhesiva a cada rostro. El bibliotecario anotó dos cosas para cada rostro que pudiera ver claramente:

  1. Sexo Percibido: ¿Es esta persona hombre o mujer?
  2. Etnia Percibida: ¿Parece ser la persona asiática, negra, india o blanca?

Nota: El artículo enfatiza que estas son etiquetas "percibidas" basadas en lo que el bibliotecario ve en la foto, no en la identidad real de la persona, porque no se tenía esa información de las fotos originales.

El control de calidad

Antes de confiar en este nuevo álbum anotado, los autores quisieron asegurarse de que el bibliotecario no hubiera hecho un desastre. Utilizaron algunos trucos para verificar el trabajo:

  • La prueba de "parecidos": Utilizaron un programa de computadora para agrupar rostros que se ven similares. Descubrieron que los rostros etiquetados como "negros" tendían a agruparse, y los rostros etiquetados como "blancos" también se agrupaban, tal como se esperaba. Esto sugirió que el bibliotecario fue consistente.
  • El juego de las adivinanzas: Entrenaron a una computadora simple para adivinar las etiquetas basándose en las fotos. La computadora acertó las respuestas la mayor parte del tiempo, lo que les dio confianza en que las etiquetas eran lo suficientemente precisas para ser utilizadas.

El gran experimento: ¿Qué pasa cuando ocultamos grupos?

La parte más interesante del artículo es lo que sucedió cuando intentaron enseñar a una computadora de detección de rostros (específicamente un modelo llamado YOLOv5) usando este nuevo álbum. Realizaron una serie de experimentos donde jugaban al "escondite" con los datos:

  1. La línea base: Primero, enseñaron a la computadora usando todo el álbum (todas las etnias y sexos). Descubrieron que la computadora era generalmente buena, pero tenía más dificultades con los rostros de personas negras. Era como un estudiante que estudia mucho pero sigue fallando en las preguntas sobre un capítulo específico.
  2. La prueba de "dejar uno fuera": Después, intentaron entrenar a la computadora sin ciertos grupos.
    • Cuando eliminaron los rostros asiáticos, indios o blancos de los datos de entrenamiento, el rendimiento de la computadora no cambió demasiado para los otros grupos.
    • Sin embargo, cuando eliminaron los rostros negros de los datos de entrenamiento, la capacidad de la computadora para detectar rostros negros cayó significamente. Peor aún, la brecha entre qué tan bien detectaba los rostros negros frente a otros rostros se hizo mucho más amplia.

La metáfora: Imagina a un chef aprendiendo a cocinar un estofado. Si practica con carne de res, pollo y cerdo, aprende a manejar los tres. Si le quitas el cerdo de su práctica, puede que todavía esté bien con la carne de res y el pollo. Pero si le quitas la carne de res por completo, y luego le pides que cocine un estofado de res, fracasará estrepitosamente. El artículo encontró que el grupo de "rostros negros" era el ingrediente más crítico para que la computadora aprendiera a ser justa y precisa en todos los ámbitos.

La conclusión

El artículo concluye que para construir un sistema de detección de rostros justo, no puedes simplemente lanzar un montón de fotos a una computadora y esperar lo mejor. Necesitas datos que incluyan explícitamente grupos diversos.

Los autores advierten que, debido a que un humano realizó todo el etiquetado, puede haber algunos sesgos no intencionados o errores en las notas. Sin embargo, creen que este conjunto de datos es una herramienta vital. Permite a los investigadores dejar de adivinar y comenzar a medir exactamente dónde y por qué sus modelos de detección de rostros podrían estar tratando injustamente a las personas, destacando específicamente que excluir los rostros negros de los datos de entrenamiento causa la mayor caída en la equidad.

En resumen: WIDER-FAIR es un álbum de fotos etiquetado diseñado para ayudarnos a detectar los puntos ciegos de nuestra tecnología, asegurando que los detectores de rostros funcionen para todos, no solo para algunos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →