TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs
Cet article présente TreeProbe, le premier benchmark conçu pour évaluer le biais culturel dans les grands modèles de langage en testant leur adhérence au cadre théorique structuré de la médecine tibétaine, révélant que les modèles actuels présentent souvent une dérive épistémique systématique vers les paradigmes biomédicaux dominants ou la médecine traditionnelle chinoise.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous pénétrez dans une bibliothèque géante et de haute technologie où les livres sont écrits par des robots super intelligents. Ces robots, appelés Modèles de Langage Étendus (LLM), ont lu presque tout ce qui se trouve sur Internet. Ils sont incroyables pour répondre à des questions, écrire des histoires et même prétendre être des médecins. Mais il y a un piège : la plupart des livres qu'ils ont lus étaient écrits en anglais et basés sur la science occidentale. Ainsi, lorsque vous leur posez une question sur un système médical issu d'une culture différente — comme la médecine tibétaine, qui possède sa propre façon unique de concevoir le corps et la maladie — les robots s'embrouillent. Au lieu d'utiliser les règles tibétaines, ils passent accidentellement aux règles occidentales ou même aux règles de la médecine chinoise, tel un chef qui ne sait faire que des pizzas et qui essaie soudainement de faire des sushis mais en utilisant de la pâte à pizza. Ce document porte sur la création d'un test spécial pour voir exactement comment et pourquoi ces robots commettent cette erreur, et à quel point ils « dérivent » de la vérité.
Les chercheurs derrière cette étude, dirigés par Jin Zhang et une équipe d'universités de Chine et du Tibet, ont créé un nouvel outil appelé TreeProbe. Considérez la médecine tibétaine comme un arbre géant et ancien aux racines profondes. Le document utilise l'« Arbre de la Médecine », un cadre classique issu des textes tibétains, pour construire un test comprenant 4 719 questions couvrant 467 maladies différentes. Ils n'ont pas seulement posé des questions de culture générale simples aux robots ; ils leur ont demandé d'expliquer pourquoi une maladie survient, comment la diagnostiquer en utilisant les « trois humeurs » tibétaines (un concept similaire à l'équilibre des énergies), et comment la traiter avec des régimes ou des herbes spécifiques.
L'équipe a découvert que même les robots les plus intelligents d'aujourd'hui sont encore en difficulté. Lors des tests, les meilleurs modèles n'ont réussi qu'environ 60 % des questions à choix multiples. Mais la véritable histoire n'est pas seulement qu'ils ont répondu faux ; c'est comment ils se sont trompés. Les robots n'ont pas simplement deviné au hasard ; ils ont systématiquement dérivé vers d'autres systèmes médicaux. Certains modèles, comme celui d'Anthropic (Claude), avaient tendance à basculer vers une pensée biomédicale occidentale, tandis que d'autres, comme certains modèles chinois, dérivaient vers la médecine traditionnelle chinoise (MTC). C'est comme si les robots avaient un « paramètre par défaut » qui l'emporte sur les connaissances tibétaines spécifiques qu'ils sont censés utiliser.
Les chercheurs ont également découvert que les robots sont doués pour jouer la comédie. Ils peuvent écrire des phrases tibétaines fluentes qui semblent grammaticalement parfaites, mais le conseil médical à l'intérieur est souvent erroné ou mélangé à d'autres systèmes. C'est comme un robot qui parle un français parfait mais qui vous donne une recette de plat allemand alors que vous avez demandé un plat français. L'étude suggère que cela se produit parce que les robots ont été entraînés sur des données où les idées médicales occidentales et chinoises sont beaucoup plus fréquentes que les idées tibétaines. Lorsque le robot est bloqué, il revient à ce qu'il connaît le mieux, effaçant accidentellement la logique unique de la médecine tibétaine.
En résumé, TreeProbe agit comme un outil de diagnostic pour les robots eux-mêmes. Il nous montre que pour rendre l'IA véritablement équitable et utile pour tout le monde, nous ne pouvons pas nous contenter de lui donner plus de données ; nous devons lui apprendre à respecter et à comprendre différentes manières de connaître le monde. Le document ne prétend pas avoir résolu le problème pour l'instant, mais il fournit la première carte claire des endroits où les robots se perdent, aidant les développeurs à construire une IA meilleure et plus consciente des cultures à l'avenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.