Same question, different history: language, national identity, and credit in large language models
Cette étude démontre que les grands modèles de langage fonctionnent comme des systèmes distribués de mémoire culturelle où la langue de la requête agit systématiquement comme un commutateur pour activer différents récits nationaux, provoquant une mise en avant plus fréquente des prétendants historiques au statut inférieur lorsque les questions sont posées dans leurs langues associées, tandis que les figures anglophones dominantes restent stables dans toutes les langues.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un bibliothécaire magique et super intelligent qui a lu presque tous les livres, articles et sites web jamais écrits. Vous posez une question simple au bibliothécaire : « Qui a inventé la radio ? »
Si vous posez la question en anglais, le bibliothécaire dit : « Guglielmo Marconi. »
Si vous posez la question en russe, le bibliothécaire dit : « Alexander Popov. »
Si vous posez la question en chinois, le bibliothécaire dit : « Bi Sheng » (pour l'imprimerie).
Vous pourriez penser que le bibliothécaire est confus ou qu'il ment. Mais selon cet article, le bibliothécaire n'est pas confus. Le bibliothécaire agit en réalité comme un caméléon. La réponse change non pas parce que le bibliothécaire change d'avis, mais parce que la langue que vous utilisez pour poser la question agit comme un interrupteur qui active une « mémoire nationale » spécifique à l'intérieur de la machine.
Voici une décomposition de ce que les chercheurs ont découvert, en utilisant des analogies simples :
1. L'effet « Caméléon »
Les chercheurs ont testé 11 chatbots différents (comme ceux qui sont derrière ChatGPT) avec 21 différends litiges historiques (comme « Qui a inventé le téléphone ? »). Ils ont posé les mêmes questions dans 12 langues différentes.
Ils ont découvert que l'IA ne fait pas que récupérer des faits ; elle récupère des histoires.
- L'interrupteur : Lorsque vous posez une question dans une langue spécifique (comme le russe), l'IA puise dans la « version russe » de l'histoire stockée dans ses données d'entraînement. Dans cette version, Popov est le héros.
- Le résultat : Si vous posez la question en russe, Popov apparaît dans la réponse 85 % du temps. Si vous posez la question dans n'importe quelle autre langue, il n'apparaît qu'environ 48 % du temps.
- L'exception : Pour les figures très célèbres et puissantes (comme Alexander Graham Bell ou les frères Wright), l'IA donne la même réponse quelle que soit la langue utilisée. Ce sont les « célébrités mondiales » de l'histoire qui apparaissent partout. Mais pour les « héros locaux » d'autres nations, l'IA ne les montre que si vous parlez leur langue.
2. Le « Nationalisme Banal »
Les auteurs appellent cela le « nationalisme banal ».
Pensez à un drapeau accroché sur un bâtiment. Vous ne le remarquez pas tous les jours ; il fait simplement partie du décor. Mais il vous rappelle constamment : « Ceci est notre pays. »
L'IA fait la même chose, mais de manière invisible. Elle ne brandit pas de drapeau et ne chante pas d'hymne. Elle répond simplement à votre question. Mais en répondant en russe et en nommant un héros russe, elle renforce subtilement l'idée que « Ceci est l'histoire russe ». C'est une façon subtile et quotidienne de dire : « Nous nous souvenons des nôtres. »
3. L'« Effaceur » vs le « Surligneur »
Les chercheurs ont examiné la fréquence à laquelle l'IA ignorait complètement l'autre côté de l'histoire (appelé « effacement »).
- L'Effaceur : Parfois, l'IA dira : « Bell a inventé le téléphone », et ne dira rien sur l'inventeur italien, Meucci. Cela arrive plus souvent lorsqu'il y a un prétendant anglophone puissant (comme Bell) et un rival plus faible.
- Le Surligneur : Cependant, si vous interrogez l'IA sur les deux personnes (« Qui a inventé le téléphone, Bell ou Meucci ? »), l'IA est beaucoup moins susceptible d'effacer la seconde personne. Le simple fait de mettre le nom dans la question agit comme un filet de sécurité, forçant l'IA à reconnaître l'existence de cette personne.
4. La connexion « Mémorielle »
L'étude a trouvé un lien étroit entre la façon dont un pays « célèbre » un inventeur (avec des statues, des jours fériés ou des leçons scolaires) et la fréquence à laquelle l'IA le mentionne.
- L'analogie : Imaginez une place de village. Si un pays construit une grande statue d'un inventeur, cet inventeur est « bruyant » dans les données d'entraînement de l'IA. Lorsque vous posez la question dans la langue de ce pays, l'IA entend clairement cette voix forte.
- La surprise : Même pour les inventeurs sans aucune statue ou jour férié, l'IA les mentionne plus souvent si vous posez la question dans leur langue maternelle. Cela suggère que l'IA capte le « bruit » général de cette langue — les nouvelles, les histoires et les discussions quotidiennes — et pas seulement les monuments officiels.
5. L'illusion « Universelle »
L'article soutient que nous considérons souvent ces outils d'IA comme des bibliothèques neutres et universelles. Nous pensons : « Si je pose la même question, je devrais obtenir la même vérité. »
L'étude montre que ce n'est pas le cas. L'IA est plutôt comme un guide de voyage qui parle différents dialectes.
- Si vous parlez anglais, le guide vous montre la version « Mondiale/Anglaise » de l'histoire.
- Si vous parlez portugais, le guide vous montre la version « Brésilienne/Portugaise ».
Le danger n'est pas que l'IA mente ; c'est qu'elle présente ces différentes versions comme si elles étaient les seules versions. Si vous posez la question en anglais, vous pourriez ne jamais savoir qu'un autre pays possède une histoire totalement différente sur l'invention de l'avion, car l'IA n'a pas mentionné cette version.
Résumé
L'article conclut que ces modèles d'IA ne sont pas seulement des « machines à faits ». Ce sont des machines à mémoire qui façonnent subtilement la façon dont nous nous souvenons de l'histoire. Elles agissent comme un miroir numérique : si vous les regardez dans votre propre langue, vous voyez vos propres héros nationaux. Si vous les regardez dans une autre langue, vous pourriez voir un autre ensemble de héros, ou vous pourriez ne rien voir du tout concernant votre histoire locale.
La langue que vous utilisez pour poser la question ne change pas seulement les mots de la réponse ; elle change quelle version du passé l'IA décide de vous montrer.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.