Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS)
Cet article introduit le Middle East Cultural Sensitivity Score (MECSS) pour démontrer que les grands modèles de langage, y compris ceux développés au Moyen-Orient, reproduisent systématiquement des biais orientalistes structurels à travers le « Said-washing » et le cadrage du savoir occidental comme étant universel, révélant ainsi que les mesures d'équité standard échouent à détecter ces distorsions épistémiques profondes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Lorsque nous demandons à un ordinateur d'expliquer une culture, nous supposons souvent que nous obtenons un résumé neutre de faits. Mais les systèmes qui répondent à ces questions ne sont pas des pages blanches. Ils sont construits sur de vastes bibliothèques de textes écrits principalement par des personnes en Occident, en anglais, et ils apprennent à parler en imitant les modèles trouvés dans ces bibliothèques. Cela signifie que lorsqu'un utilisateur interroge l'intelligence artificielle sur le Moyen-Orient, l'ordinateur ne se contente pas de récupérer des informations ; il construit un récit basé sur les présupposés ancrés dans ses données d'entraînement. Depuis des décennies, des chercheurs décrivent une manière spécifique de raconter des histoires sur l'Orient, connue sous le nom d'orientalisme. Il ne s'agit pas seulement d'être impoli ou d'utiliser des stéréotypes. C'est une habitude structurelle plus profonde de l'écriture qui traite l'Occident comme l'observateur normal et actif, et l'Orient comme un objet passif et mystérieux qui doit être expliqué par des règles occidentales. Cela suppose que les idées occidentales sont des vérités universelles, tandis que les idées locales ne sont que des « particularités culturelles ». La question que les chercheurs se posent désormais est de savoir si l'intelligence artificielle moderne, devenue une source d'information primaire pour des centaines de millions de personnes, ne répète pas discrètement ces vieux schémas, même lorsqu'elle essaie d'être polie.
Un chercheur s'est donné pour mission de mesurer ce biais invisible dans deux modèles de langage de grande taille différents. L'un était un système puissant développé aux États-Unis, et l'autre était un modèle construit aux Émirats arabes unis, entraîné avec une quantité significative de contenu en arabe. Le chercheur voulait tester une idée pleine d'espoir : que la construction d'une intelligence artificielle au Moyen-Orient, utilisant des langues locales et des données régionales, produirait naturellement une vision plus juste et moins biaisée de la région. Pour trouver la réponse, il a créé un nouvel outil de mesure appelé le Score de Sensibilité Culturelle du Moyen-Orient. Au lieu de simplement rechercher des insultes évidentes ou des mots méchants, cet outil examinait la structure même des phrases générées par les modèles. Il vérifiait sept habitudes spécifiques, telles que le fait de traiter l'ensemble du Moyen-Orient comme un bloc unique et indifférencié, de décrire les populations locales comme des victimes passives plutôt que comme des décideurs actifs, et d'utiliser les théories politiques occidentales comme le moyen par défaut d'expliquer les événements tout en traitant le savoir local comme quelque chose nécessitant une justification spéciale.
Le chercheur a mené 280 conversations, posant aux modèles un large éventail de questions sur la politique, la culture et l'histoire. Il a ensuite analysé les réponses pour voir à quelle fréquence les modèles tombaient dans ces pièges structurels. Les résultats ont montré que les deux modèles, quel que soit leur lieu de création, reproduisaient ces schémas biaisés de manière systématique. Le modèle américain présentait certes un certain biais, mais le modèle construit aux Émirats arabes unis affichait en réalité un score plus élevé sur l'échelle du biais, ce qui signifie qu'il reproduisait les schémas problématiques plus fréquemment et plus intensément. Cette conclusion remet en question l'hypothèse selon laquelle le simple changement de la localisation des développeurs ou l'ajout de langues locales aux données d'entraînement suffirait à régler le problème. Le chercheur a constaté que le modèle des Émirats arabes unis, malgré ses origines régionales, s'appuyait encore lourdement sur les cadres occidentaux pour expliquer le monde, les traitant comme le prisme standard à travers lequel tout doit être perçu.
L'une des découvertes les plus frappantes fut un phénomène que le chercheur a nommé le « Said-washing ». Cela se produit lorsqu'un modèle commence une réponse en affirmant explicitement que la région est diverse et complexe, pour ensuite enchaîner immédiatement avec une généralisation qui ignore cette complexité même. Par exemple, un modèle pourrait dire : « Bien sûr, le Moyen-Orient possède de nombreuses cultures et histoires différentes », pour ensuite procéder immédiatement à la description de la « société moyen-orientale » comme une entité unique et unifiée possédant un ensemble unique de motivations. Ce schéma est apparu dans près de 88 % des conversations avec le modèle américain et dans environ 63 % des conversations avec le modèle des Émirats arabes unis. Cela suggère que les modèles ont appris à simuler l'apparence de la sensibilité sans réellement changer la structure sous-jacente de leur pensée. Ils peuvent utiliser les bons mots pour paraître équitables, mais la façon dont ils organisent l'information reste profondément ancrée dans les vieilles manières coloniales de voir le monde.
L'étude a également révélé que le biais ne concernait pas seulement ce que les modèles disaient, mais aussi la façon dont ils organisaient le monde. Les deux modèles traitaient systématiquement les cadres analytiques occidentaux comme la manière par défaut et non marquée de comprendre la réalité, tandis qu'ils traitaient le savoir non occidental comme quelque chose de particulier nécessitant une explication spéciale. Ce fut la conclusion la plus constante pour les deux systèmes, apparaissant dans presque chaque conversation. Le chercheur a noté que la différence de performance des modèles pouvait être en partie due à leur taille, car le modèle américain était nettement plus grand et plus avancé que celui des Émirats arabes unis. Les modèles plus petits ont tendance à produire des textes plus simples et moins nuancés, ce qui peut ressembler aux généralisations larges que le chercheur mesurait. Cependant, le fait que les deux modèles convergent vers le même niveau élevé de biais concernant l'utilisation des cadres occidentaux suggère que le problème est plus profond que la simple taille de l'ordinateur ou la localisation des développeurs.
En fin de compte, l'article conclut que le biais n'est pas une erreur simple qui peut être corrigée en ajoutant plus de langues ou en déplaçant les serveurs dans un autre pays. Le problème est épistémologique, c'est-à-dire qu'il concerne la nature même des connaissances que les modèles ont apprises. Les données d'entraînement elles-mêmes sont remplies de perspectives occidentales qui traitent le Moyen-Orient comme un objet à étudier plutôt que comme un sujet doté de sa propre agence. Pour changer cela véritablement, le chercheur soutient que les données d'entraînement doivent être transformées pour inclure un volume beaucoup plus important de travaux écrits par des universitaires de la région, dans leurs propres langues et en utilisant leurs propres traditions intellectuelles. Tant que les données ne changeront pas, ces systèmes continueront de générer des réponses qui sonnent avec confiance et autorité, mais qui renforcent discrètement une vision du monde où l'Occident est le narrateur et le reste du monde n'est que l'histoire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.