← Nieuwste papers
💬 NLP

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

Dit artikel introduceert TreeProbe, de eerste benchmark die is ontworpen om culturele bias in grote taalmodellen te evalueren door hun naleving van het gestructureerde theoretische kader van de Tibetaanse geneeskunde te testen, waarbij wordt onthuld dat huidige modellen vaak een systematische epistemische drift vertonen naar dominante biomedische of Traditionele Chinese Geneeskunde-paradigma's.

Oorspronkelijke auteurs: Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, hypermoderne bibliotheek binnenloopt waar de boeken zijn geschreven door superintelligente robots. Deze robots, genaamd Large Language Models (LLM's), hebben bijna alles op het internet gelezen. Ze zijn geweldig in het beantwoorden van vragen, het schrijven van verhalen en zelfs in het doen alsof ze artsen zijn. Maar hier is de crux: de meeste boeken die ze hebben gelezen, waren geschreven in het Engels en gebaseerd op de westerse wetenschap. Dus wanneer je ze iets vraagt over een medisch systeem uit een andere cultuur — zoals de Tibetaanse geneeskunde, die haar eigen unieke manier van denken over het lichaam en ziekte heeft — raken de robots in de war. In plaats van de Tibetaanse regels te gebruiken, schakelen ze per ongeluk over naar de westerse regels of zelfs naar de regels van de Chinese geneeskunde, zoals een chef die alleen pizza kan maken en plotseling probeert sushi te maken maar daarvoor pizzadeeg gebruikt. Dit artikel gaat over het bouwen van een speciale test om precies te zien hoe en waarom deze robots deze fout maken, en hoeveel ze "afdwalen" van de waarheid.

De onderzoekers achter deze studie, onder leiding van Jin Zhang en een team van universiteiten uit China en Tibet, hebben een nieuw hulpmiddel ontwikkend genaamd TreeProbe. Denk aan de Tibetaanse geneeskunde als een gigantische, eeuwenoude boom met diepe wortels. Het artikel gebruikt de "Boom van de Geneeskunde", een klassiek kader uit Tibetaanse teksten, om een test te bouwen met 4.719 vragen die 467 verschillende ziekten beslaan. Ze vroegen de robots niet alleen simpele weetjes; ze vroegen hen uit te leggen waarom een ziekte ontstaat, hoe men deze diagnosticeert met behulp van de Tibetaanse "drie humoren" (een concept dat vergelijkbaar is met het balanceren van energieën), en hoe men deze behandelt met specifieke diëten of kruiden.

Het team kwam erachter dat zelfs de slimste robots van vandaag nog steeds worstelen. Bij de tests behaalden de beste modellen slechts ongeveer 60% van de meerkeuzevragen correct. Maar het echte verhaal is niet alleen dat ze vragen fout hadden; het is hoe ze ze fout hadden. De robots gokten niet zomaar willekeurig; ze dwaalden consequent af naar andere medische systemen. Sommige modellen, zoals die van Anthropic (Claude), hadden de neiging om over te schakelen naar het westerse biomedische denken, terwijl andere, zoals sommige Chinese modellen, afdwaalden naar de Traditionele Chinese Geneeskunde (TCM). Het is alsof de robots een "standaardinstelling" hebben die de specifieische Tibetaanse kennis die ze zouden moeten gebruiken, overschrijft.

De onderzoekers ontdekten ook dat de robots goed zijn in het klinken als de expert. Ze kunnen vloeiende Tibetaanse zinnen schrijven die grammaticaal perfect lijken, maar het medische advies in de tekst is vaak foutief of vermengd met andere systemen. Het is also als een robot die perfect Frans spreekt, maar je een recept voor een Duits gerecht geeft wanneer je om een Frans gerecht vroeg. De studie suggereert dat dit gebeurt omdat de robots zijn getraind op data waarin westerse en Chinese medische ideeën veel gebruikelijker zijn dan Tibetaanse. Wanneer de robot vastloopt, valt hij terug op wat hij het beste kent, waardoor de unieke logica van de Tibetaanse geneeskunde per ongeluk wordt uitgewist.

Kortom, TreeProbe fungeert als een diagnostisch hulpmiddel voor de robots zelf. Het laat ons zien dat om AI werkelijk eerlijk en nuttig te maken voor iedereen, we niet alleen meer data kunnen voeren; we moeten het de AI leren om verschillende manieren van de wereld begrijpen te respecteren. Het artikel beweert niet dat het het probleem al heeft opgelost, maar het biedt de eerste duidelijke kaart van waar de robots de weg kwijtraken, wat ontwikkelaars helpt bij het bouwen van betere, meer cultureel bewuste AI in de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →