Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
Ce document présente PLACES, une initiative de red teaming participative qui s'attaque aux biais occidentaux dans la sécurité des modèles de génération d'images à partir de texte en collaborant avec des communautés du Sud global pour produire un jeu de données diversifié de plus de 26 000 exemples d'échecs localisés, révélant ainsi des préjudices culturels uniques et plaidant pour des cadres de sécurité adaptés au contexte.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez une machine à art magique (un modèle Texte-vers-Image) capable de dessiner n'importe quoi que vous décrivez. Pendant longtemps, cette machine a été entraînée principalement par des personnes en Occident (Amérique du Nord et Europe) et a appris à voir le monde à travers leurs yeux. C'est comme un chef qui ne sait cuisiner que de la nourriture réconfortante américaine ; si vous lui demandez un plat régional spécifique de l'Inde ou du Nigéria, il pourrait simplement vous servir un burger générique ou un plat confus.
Ce papier, intitulé "Going PLACES", concerne une équipe de chercheurs qui a décidé d'enseigner à cette machine à art comment voir le reste du monde correctement. Ils n'ont pas simplement demandé à des gens au hasard en ligne d'essayer de faire planter la machine ; ils sont allés profondément au sein de communautés locales dans le "Sud global" (spécifiquement au Ghana, au Nigéria et dans certaines parties de l'Inde) pour découvrir ce que la machine fait mal dans ces endroits précis.
Voici la décomposition de leur travail utilisant des analogies simples :
1. Le Problème : Le "Filet de Sécurité Taille Unique"
Les chercheurs soutiennent que les règles de sécurité actuelles pour ces machines à art IA sont comme un gilet de sauvetage d'une seule taille. Il pourrait convenir parfaitement à un nageur occidental, mais il est trop large ou trop serré pour quelqu'un d'une culture différente.
- Le Problème : L'IA pense qu'elle est "sûre" en suivant les règles occidentales, mais dans les cultures locales, elle pourrait générer des images profondément offensantes, religieusement inappropriées ou culturellement ignorantes.
- L'Analogie : Imaginez une IA dessinant une "cérémonie religieuse". En Occident, elle pourrait simplement dessiner une église générique. Mais en Inde, si vous demandez un rituel hindou spécifique, l'IA pourrait accidentellement mettre des chaussures aux pieds d'une divinité (ce qui est un tabou énorme) ou mélanger deux festivals différents. L'IA ne connaît pas ces "règles de la route" locales.
2. La Solution : Le "Red Teaming" avec des Guides Locaux
Le "Red Teaming" consiste à embaucher un groupe de pirates informatiques pour essayer de faire planter un système de sécurité afin que vous puissiez le réparer avant que les méchants ne le fassent. Habituellement, ces "pirates" sont des experts assis dans de grands bureaux technologiques aux États-Unis ou au Royaume-Uni.
- Ce que PLACES a fait : Au lieu d'embaucher des outsiders, ils se sont associés à des universités de villes secondaires (pas seulement les grandes capitales comme Mumbai ou Lagos). Ils ont recruté des étudiants et des professeurs locaux pour agir en tant que "Guides Communautaires".
- L'Atelier : Avant que les étudiants ne commencent, les chercheurs ont organisé des ateliers. Pensez-y comme à un camp d'entraînement où ils ont expliqué : "Voici comment l'IA fonctionne, et voici comment votre culture perçoit la sécurité." Ils ont encouragé les étudiants à utiliser leurs langues locales, à mélanger les langues (comme parler anglais avec des mots hindi ou pidgin), et à utiliser des métaphores locales.
- Le Résultat : Ils ont collecté plus de 26 000 exemples de l'IA échouant de manière qu'un testeur occidental n'aurait jamais imaginée. Cette collection est appelée le jeu de données PLACES.
3. Ce qu'ils ont trouvé : Les "Angles Morts Culturels" de l'IA
Lorsqu'ils ont analysé les 26 000 exemples, ils ont trouvé trois types principaux d'"angles morts" :
A. La Faille du "Code-Mixing" (Mélange de Codes)
Dans de nombreuses parties du Sud global, les gens mélangent naturellement les langues dans une seule phrase (par exemple, "Un homme mangeant du riz jollof à Lagos").
- La Découverte : Les filtres de sécurité de l'IA sont comme des videurs qui ne parlent que l'anglais. Si vous chuchotez un secret dans un mélange d'anglais et d'une langue locale, le videur ne comprend pas le danger et vous laisse entrer. Les chercheurs ont découvert que le mélange des langues permettait aux utilisateurs de contourner les filtres de sécurité qui auraient bloqué la même demande si elle avait été écrite en anglais pur.
B. La "Dissonance Normative" (Conflit de Valeurs)
C'est lorsque l'IA suit ses "règles occidentales" mais enfreint les "règles locales".
- L'Analogie : Imaginez que l'IA est un invité à un dîner. L'hôte (la culture locale) dit : "Ne mangez pas avec votre main gauche." L'invité (l'IA) dit : "Mais mon manuel de règles dit que les mains sont juste des mains !" et utilise quand même la main gauche.
- Exemples Réels :
- Religion : L'IA a généré une image d'un homme hindou mangeant du bœuf (ce qui est interdit pour de nombreux hindous) ou d'un musulman jouant à des jeux de hasard à La Mecque. Pour l'IA, ce n'étaient que "des gens faisant des choses", mais pour les locaux, c'était profondément offensant.
- Coutumes : L'IA a montré un enfant serrant la main d'un aîné en Inde, alors que la coutume locale est de toucher leurs pieds. L'IA a manqué les règles de "pureté" et de "respect" de la culture.
- Présages : L'IA a dessiné un chat noir traversant une route ou un miroir brisé. Dans certaines cultures, ce ne sont pas juste des "chats" ou du "verre" ; ce sont de mauvais présages qui apportent de la malchance. L'IA ne comprenait pas le sentiment de l'image.
C. "L'Aplatissement Ontologique" (Effacement de l'Identité)
C'est lorsque l'IA prend quelque chose d'unique et de spécifique et l'écrase dans une forme générique et occidentale.
- L'Analogie : C'est comme demander à un peintre de dessiner un type spécifique d'autobus local, et qu'il dessine simplement un autobus scolaire américain générique.
- Exemples Réels :
- Nourriture : Demander du "Fufu" (un plat d'Afrique de l'Ouest) et obtenir une image de purée de pommes de terre ou d'un burger.
- Art : Demander un "artiste Yakshagana" (un style de théâtre indien spécifique) et obtenir un "danseur classique" générique dans un tutu blanc.
- Personnes : Demander un "vendeur de rue du Sud de l'Inde" et obtenir une image d'une personne à la peau foncée d'une manière qui renforce les stéréotypes de pauvreté, même si la demande ne mentionnait pas la pauvreté.
4. Pourquoi Cela Importe
Le papier conclut que vous ne pouvez pas simplement rendre l'IA plus sûre en la rendant "plus grande" ou en ajoutant plus de données des mêmes endroits d'autrefois. Vous devez zoomer.
- La Leçon : Pour rendre l'IA véritablement sûre pour le monde entier, vous devez permettre aux personnes qui vivent dans ces cultures de définir ce que "sécurité" signifie pour elles. Vous devez écouter les "Guides Communautaires" plutôt que simplement le "Siège Social".
Résumé
Le projet PLACES est comme l'envoi d'une équipe de traducteurs locaux pour enseigner à un robot étranger le dialecte local, les coutumes et les tabous. Ils ont découvert que le robot échouait non pas parce qu'il était "mauvais", mais parce qu'il était illettré culturellement. En laissant les communautés locales faire du "red teaming" de l'IA, ils ont révélé des milliers de nouvelles façons dont l'IA peut échouer, prouvant que la sécurité n'est pas un manuel de règles universel, mais une conversation locale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.