Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models
Cet article révèle que les systèmes de texte en image basés sur les LLM introduisent des biais démographiques plus marqués que les modèles de référence non fondés sur les LLM en raison de leurs invites système, et propose FairPro, un cadre sans entraînement qui atténue ces biais en générant de manière adaptative des instructions respectant l'équité tout en préservant l'intention de l'utilisateur.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Le « Traducteur trop enthousiaste »
Imaginez que vous vouliez dessiner un tableau basé sur une phrase simple, comme « Un botaniste ».
Dans les anciennes machines à dessiner, vous remettiez la phrase directement à l'artiste. L'artiste dessinait un botaniste, mais pouvait s'appuyer sur ses propres vieilles habitudes ou stéréotypes (par exemple, ne dessiner que des hommes blancs).
Dans les machines à dessiner plus récentes et plus intelligentes (celles que cet article étudie), il y a une étape supplémentaire. Avant que l'artiste ne voie votre phrase, un traducteur intelligent (un modèle de langage IA) la lit en premier. Ce traducteur est censé aider en ajoutant des détails pour améliorer le dessin. Par exemple, il pourrait transformer « Un botaniste » en « Un botaniste dans un champ vert portant un chapeau, tenant une loupe ».
Le Problème : L'article a découvert que ce « traducteur intelligent » ajoute souvent des stéréotypes indésirables tout en essayant d'être utile. Même si vous n'avez pas demandé de genre, de race ou d'âge spécifique, le traducteur peut supposer : « Oh, les botanistes sont généralement des hommes blancs », et ajouter ces détails aux instructions avant même que l'artiste ne commence à dessiner.
L'enquête : Le test « COMPBIAS »
Les chercheurs ont construit un kit de test géant appelé COMPBIAS (considérez cela comme un examen standardisé pour les machines à dessiner). Ils ont testé 1 024 invites (prompts) différentes, allant de très simples (« Un médecin ») à très complexes (« Un médecin sauvant un patient dans un hôpital bondé »).
Ils ont comparé deux types de machines :
- Ancienne école : Instructions directes à l'artiste.
- Nouvelle école : Les instructions passent d'abord par le « traducteur intelligent ».
Les résultats :
- Les machines de la « Nouvelle École » étaient plus biaisées. Elles produisaient des images avec des stéréotypes beaucoup plus marqués (par exemple, principalement des hommes blancs pour « médecins ») que les anciennes.
- Le « Piège de l'alignement » : Les nouvelles machines étaient en fait meilleures pour suivre vos instructions et créer des images de haute qualité. Mais l'article a découvert un compromis : plus elles étaient douées pour comprendre vos mots, plus elles s'appuyaient sur les stéréotypes lorsque vous ne précisiez pas de détails.
- La complexité aggrave le problème : Plus votre instruction était complexe, plus le traducteur ajoutait de détails stéréotypés, renforçant ainsi le biais.
Le coupable : Le « System Prompt » (Instruction système)
Les chercheurs ont cherché à comprendre pourquoi cela se produit. Ils ont découvert que le coupable est le System Prompt.
Considérez le System Prompt comme le livre de règles ou la note de service du manager donnée au traducteur intelligent. Il dit au traducteur comment se comporter.
- L'article a découvert que ces livres de règles par défaut contiennent souvent des hypothèses cachées.
- Lorsque le traducteur lit une instruction neutre comme « Un juge », le livre de règles le pousse à penser à un type de personne spécifique (par exemple, un homme blanc âgé) avant même qu'il n'écrive la description pour l'artiste.
- Les chercheurs ont prouvé cela en examinant les « pensées » (embeddings textuels) de la machine. Ils ont vu que le traducteur changeait secrètement des mots neutres en mots biaisés avant même que l'image ne soit créée.
La solution : « FAIRPRO » (Le coach de l'équité)
Les chercheurs ne voulaient pas simplement supprimer le traducteur intelligent, car il rend les images magnifiques. À la place, ils ont créé une correction appelée FAIRPRO.
Comment cela fonctionne :
Imaginez que le traducteur intelligent a un coach debout à côté de lui.
- Le Coach vérifie l'instruction : Quand vous dites « Un botaniste », le coach examine le livre de règles du traducteur.
- Le Coach réécrit les règles : Au lieu de laisser le traducteur deviner, le coach lui donne une nouvelle instruction temporaire : « Cette personne est un botaniste. Ne supposez pas son genre, sa race ou son âge. Restez diversifié. »
- Le Résultat : Le traducteur ajoute toujours des détails utiles (comme le chapeau et la loupe), mais il arrête de supposer que le botaniste est un homme blanc. Il crée un mélange d'images plus diversifié.
Pourquoi est-ce spécial ?
- Pas de réentraînement : Ils n'ont pas eu besoin de reconstruire toute la machine ou de lui apprendre de nouvelles choses. Ils ont simplement modifié les instructions qu'elle reçoit pendant son fonctionnement.
- Respect de vos choix : Si vous dites réellement « Une botaniste », le coach respecte cela et maintient le genre féminin, mais il veille tout de même à ce que la race et l'âge soient diversifiés. Il ne corrige que les parties que vous n'avez pas spécifiées.
En résumé
L'article montre que les parties « intelligentes » des générateurs d'images d'IA modernes sont en réalité la source de nouveaux types de biais. En modifiant simplement les instructions données à ces traducteurs intelligents (les System Prompts), nous pouvons les empêcher de faire des suppositions injustes sans gâcher la qualité des images. C'est comme apprendre à un assistant serviable à arrêter de deviner vos préférences et à plutôt demander : « Qui dois-je dessiner ? » avant de faire des suppositions.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.