← Derniers articles
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

En utilisant une approche postcoloniale et la méthode DiAlign, cette étude démontre que les grands modèles de langage privilégient systématiquement l'anglais américain par rapport à l'anglais britannique à travers les corpus d'entraînement, les tokenizers et les générations, perpétuant ainsi une injustice épistémique et une homogénéisation linguistique.

Auteurs originaux : Mir Tafseer Nayeem, Davood Rafiei

Publié 2026-04-07
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Mir Tafseer Nayeem, Davood Rafiei

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🍽️ Le Cuisinier Robotique et son Préjugé Invisible

Imaginez que les grands modèles de langage (comme ChatGPT ou Claude) sont des cuisiniers robots ultra-intelligents. Leur travail est de préparer des réponses pour tout le monde, partout dans le monde.

Le problème que cette étude révèle, c'est que ce cuisinier a un goût très particulier : il adore cuisiner avec des ingrédients américains, mais il trouve les ingrédients britanniques (et ceux des anciennes colonies britanniques) un peu "bizarres" ou difficiles à utiliser. Même si on lui demande de cuisiner à la mode britannique, il continue d'ajouter du beurre américain et de la vanille américaine.

Voici comment les chercheurs ont découvert ce secret, en trois étapes :

1. Le Stock de Provisions (Les Données d'Entraînement) 📚

Pour apprendre à cuisiner, le robot a lu des milliards de livres et de pages web.

  • L'analogie : Imaginez que le robot a rempli son garde-manger avec des livres. Mais si vous regardez dans ce garde-manger, vous voyez que 70 à 80 % des livres parlent d'Amérique (avec des mots comme color, elevator, vacation).
  • La découverte : Les livres britanniques (avec colour, lift, holiday) sont là, mais ils sont noyés dans la masse. Le robot a donc appris que "l'anglais normal", c'est l'anglais américain. C'est comme si un chef apprenait à cuisiner uniquement avec des recettes de New York, puis s'étonnait que les gens de Londres ne mangent pas de bagels.

2. Le Couteau de Cuisine (Le "Tokenizer") 🔪

Avant de cuisiner, le robot doit couper les mots en petits morceaux (des "tokens") pour les comprendre. C'est comme utiliser un couteau pour couper des légumes.

  • L'analogie : Le couteau du robot est tranchant pour les légumes américains, mais émoussé pour les légumes britanniques.
    • Pour un mot américain comme color, le couteau fait un seul coup net : color.
    • Pour le mot britannique colour, le couteau doit faire plusieurs coups : col + our.
  • Le problème : Cela demande plus d'effort au robot. C'est comme si vous deviez payer plus cher ou utiliser plus de temps pour cuisiner un plat britannique. Le robot, étant paresseux et efficace, préfère naturellement les mots qui demandent moins d'effort (les mots américains).

3. Le Plat Final (La Génération) 🍽️

Quand on demande au robot de préparer un plat (de répondre à une question), il sort l'assiette.

  • L'analogie : Même si vous lui dites : "S'il te plaît, fais-moi un plat à la mode britannique", il va quand même mettre du ketchup au lieu de la sauce tomate, et des frites au lieu de chips.
  • La réalité : L'étude a montré que même quand on force le robot à parler anglais britannique, il glisse souvent vers l'anglais américain. C'est son "goût par défaut".

🌍 Pourquoi est-ce important ? (La Leçon)

Imaginez que ce robot est utilisé dans des écoles, des hôpitaux ou des tribunaux partout dans le monde (au Nigeria, en Inde, au Canada, en Australie).

  • L'injustice : Si un élève au Nigeria écrit un devoir avec l'orthographe britannique (qui est la norme dans son pays), le robot pourrait le corriger en disant "C'est faux, c'est américain". C'est comme si un professeur disait à un étudiant français que le mot "voiture" est faux parce que le robot préfère le mot "car" (en anglais).
  • L'homogénéisation : Le monde entier commence à parler et à écrire comme les États-Unis, non pas parce que c'est mieux, mais parce que le robot a été entraîné ainsi. C'est une perte de diversité culturelle.

💡 Que proposent les chercheurs ?

Les auteurs ne disent pas "fermez les robots". Ils disent : "Réparons le robot !"

  1. Équilibrer le garde-manger : Ajouter plus de livres et de sites web britanniques et des pays du Commonwealth dans les données d'entraînement.
  2. Aiguiser le couteau : Modifier la façon dont le robot coupe les mots pour qu'il ne pénalise pas les versions britanniques.
  3. Vérifier le goût : Utiliser un nouvel outil (appelé DIALIGN dans l'article) pour tester si le robot a un préjugé avant de le lancer dans la vraie vie.

En résumé : Ce papier nous dit que nos intelligences artificielles ne sont pas neutres. Elles ont hérité des déséquilibres du monde réel (la puissance américaine vs l'histoire britannique) et les amplifient. Pour avoir une IA juste pour tout le monde, il faut s'assurer qu'elle respecte toutes les variétés de l'anglais, pas seulement celle de New York.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →