Convergence in Science, Divergence in Religion: Calibrated Framing Differences Across Wikipedia's Language Editions
Cet article introduit une métrique de distance de cadrage calibrée pour démontrer que, si les concepts scientifiques sont décrits avec une grande cohérence à travers les différentes éditions linguistiques de Wikipédia, les concepts religieux présentent la plus grande divergence, même après avoir pris en compte les différences d'alignement des familles de langues et les biais d'encodage.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une bibliothèque où chaque livre traitant d'un même sujet est écrit par un groupe de personnes différent, dans une langue différente, sans jamais s'être consultés. C'est Wikipédia. Avec des éditions en plus de 300 langues, elle constitue l'un des plus grands projets collaboratifs de l'humanité, pourtant ses chapitres ne sont pas les traductions d'un texte maître unique. Au lieu de cela, un éditeur turc, un éditeur coréen et un éditeur polonais peuvent tous écrire sur le « pèlerinage » ou la « censure », en s'appuyant sur leurs propres sources locales, leurs histoires culturelles et leurs valeurs communautaires. Cela crée une opportunité unique pour les chercheurs : si nous observons comment ces différentes communautés décrivent une même idée, pouvons-nous voir où leurs perspectives convergent et où elles divergent ? Cette question se situe à l'intersection du langage, de la culture et de la technologie. Cela importe car le texte que nous écrivons aujourd'hui devient souvent les données d'entraînement des systèmes d'intelligence artificielle de demain. Si ces systèmes apprennent d'une bibliothèque où la définition de la « démocratie » ou du « sacrifice » varie selon la langue, les machines qu'ils construiront pourraient bien finir par raconter des versions différentes de l'histoire à différentes personnes.
Un chercheur s'est donné pour mission de mesurer cette divergence, non pas en comptant combien de faits manquent dans une langue par rapport à une autre, mais en mesurant à quel point la présentation de ces mêmes faits diffère. Il a rassemblé 2 799 articles de vingt langues différentes, couvrant un large éventail de sujets. Pour s'assurer de comparer des pommes avec des pommes, il a ancré son étude sur 150 concepts spécifiques, tels que le « karma », la « démocratie », la « mécanique quantique » et le « réfugié », en utilisant une base de données mondiale pour garantir que chaque édition linguistique traitait bien le même concept central. Il a également inclus un ensemble de concepts neutres, comme les éléments chimiques et les couleurs de base, qui servent de groupe de contrôle. L'objectif était de voir si la manière dont les gens écrivent sur la religion ou la politique diffère davantage d'une langue à l'autre que la manière dont ils écrivent sur la science établie.
Le chercheur a été confronté à un obstacle de taille : les outils informatiques utilisés pour comparer le texte ne sont pas parfaits. Ces outils, appelés encodeurs de phrases, traduisent les mots en points mathématiques dans un espace vaste pour mesurer la similitude. Cependant, ces outils fonctionnent parfois mieux pour certaines paires de langues que pour d'autres. Par exemple, l'outil peut naturellement considérer que le français et l'espagnol sont plus proches que le hindi et le chinois, simplement en raison de la manière dont il a été entraîné, et non à cause d'une réelle différence culturelle. Si le chercheur s'était contenté de mesurer la distance brute entre les articles, il aurait pu confondre ces particularités techniques avec des écarts culturels. Pour y remédier, il a créé une « distance calibrée ». Il a d'abord mesuré la distance entre les articles neutres et non controversés pour chaque paire de langues. Cela lui a donné une base, un point zéro qui tenait compte du biais naturel de l'outil. Il a ensuite soustrait cette base de la distance des sujets réels étudiés. Cet ajustement a permis d'éliminer le bruit technique, ne laissant que les différences réelles dans la manière dont les communautés décrivent leurs sujets.
Les résultats ont révélé un schéma clair et frappant. En ce qui concerne la religion, les différentes éditions linguistiques étaient nettement plus divergentes que la base neutre. Des concepts comme le « sacrifice », le « clergé » et le « martyr » présentaient les écarts de description les plus larges. De même, des termes politiquement chargés comme la « censure » et le « réfugié » étaient décrits de manière très différente selon les langues. En revanche, les articles sur la science et la technologie étaient les plus alignés. Des sujets tels que l'« évolution », l'« ADN » et la « mécanique quantique » étaient décrits avec une cohérence remarquable dans les vingt langues, souvent même plus étroitement que les concepts de contrôle neutres. Cela suggère que si les connaissances scientifiques tendent à converger vers une compréhension mondiale partagée, les récits culturels et religieux restent profondément ancrés dans les contextes locaux.
L'étude a également révélé que cette divergence n'est pas répartie uniformément parmi tous les sujets politiques. Si la « censure » a provoqué une rupture, des concepts comme la « démocratie » et les « droits de l'homme » étaient décrits de manière assez similaire à travers les langues. Cela indique que la fracture ne concerne pas la politique dans son ensemble, mais des idées spécifiques et sensibles qui touchent aux dynamiques de pouvoir locales et à l'identité. Le chercheur a testé ses conclusions à l'aide de trois modèles informatiques différents pour s'assurer que les résultats n'étaient pas l'artéfact d'un outil spécifique. Bien que la taille exacte des différences ait légèrement varié selon le modèle, le classement est resté le même : la religion était le domaine le plus divergent, et la science le plus aligné.
L'un des enseignements les plus importants est que les familles de langues ne racontent pas toute l'histoire. On pourrait s'attendre à ce que des langues issues de la même famille, comme le français et l'espagnol, présentent des concepts plus similaires que des langues éloignées comme le hindi et le chinois. Bien que cela fût vrai pour les données brutes, non calibrées, l'effet a largement disparu une fois que le chercheur a ajusté les biais techniques des outils informatiques. Cela signifie que les différences de présentation ne sont pas simplement une question d'héritage linguistique ; ce sont de véritables choix culturels faits par les éditeurs. L'étude a également souligné que la communauté Wikipédia chinoise est unique. Comme la version continentale du site est bloquée en Chine, l'édition chinoise analysée dans cette étude reflète les perspectives des éditeurs de Taïwan, de Hong Kong et des communautés de l'étranger, plutôt qu'un point de vue national unifié.
En fin de compte, cette recherche offre une nouvelle façon de regarder la base de connaissances mondiale. Elle montre que si l'humanité s'accorde sur les faits du monde physique, nous racontons encore des histoires très différentes sur nos croyances et nos luttes. Les données suggèrent que si l'intelligence artificielle est entraînée sur ce matériel, elle héritera probablement de ces divergences, offrant potentiellement des récits historiques ou culturels différents selon la langue parlée par l'utilisateur. En calibrant ses mesures pour éliminer le bruit technique, le chercheur a fourni une carte plus claire de l'endroit où se situent ces différences, séparant les artéfacts de la machine des véritables variations de la culture humaine. Le code et les données de cette étude sont désormais disponibles pour que d'autres puissent les utiliser, garantissant que les futures investigations sur la façon dont nous formulons notre monde puissent s'appuyer sur un fondement de clarté plutôt que de confusion.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.