← Nieuwste papers
💬 NLP

LLMs Infer Cultural Context but Fail to Apply It When Responding

Dit artikel introduceert de CAPRI-dataset om aan te tonen dat hoewel grote taalmodellen culturele context kunnen afleiden en relevante conventies kunnen herinneren, ze er vaak in falen deze kennis toe te passen om cultureel aangepaste reacties te genereren, tenzij ze expliciet tot dat toe worden geleid.

Oorspronkelijke auteurs: Yisong Miao, Jian Zhu, Vered Shwartz

Gepubliceerd 2026-06-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yisong Miao, Jian Zhu, Vered Shwartz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde bibliothecaris hebt die bijna elk boek ter wereld heeft gelezen. Deze bibliothecaris weet veel over verschillende landen: ze weten dat mensen in Frankrijk Celsius gebruiken voor temperatuur, dat mensen in de VS Fahrenheit gebruiken, en dat telefoonnummers er anders uitzien in Japan dan in Brazilië.

Dit artikel onthult echter een grappige en frustrerende tekortkoming in de manier waarop deze bibliothecaris werkt. Ze kennen de feiten, maar ze vergeten ze te gebruiken tijdens het gesprek met jou.

Hier is de uitsplitsing van het onderzoek met eenvoudige analogieën:

1. De Test: Het "Culturele Detective" Spel

De onderzoekers creëerden een spel genaamd CAPRI (Cultural and Pragmatic Response Inference). Stel je een chatbot voor die praat met een gebruiker. De gebruiker geeft subtiele hints over waar hij of zij vandaan komt, zoals het noemen van een specifieke Franse website (Fnac.com) of het gebruiken van een Frans telefoonnummerformaat.

De chatbot heeft twee taken:

  1. De Aanwijzing Detecteren: Begrijpen: "Oh, deze gebruiker is waarschijnlijk Frans."
  2. Het Antwoord Aanpassen: Wanneer de gebruiker vraagt: "Wat is de temperatuur?" (terwijl er een afbeelding van een thermometer wordt getoond), moet de bot "40°C" zeggen (Franse stijl) in plaats van "104°F" (Amerikaanse stijl).

2. Het Probleem: De "Weterwetende" Die Niet Luistert

De onderzoekers testten de slimste AI-modellen die beschikbaar zijn. Dit is wat ze ontdekten:

  • Het Detective-gedeelte (Taak 1): De AI is geweldig in dit. Als je het zelfs maar één of twee aanwijzingen geeft, raadt het bijna 100% van de tijd correct het land van de gebruiker. Het kent de feiten.
  • Het Aanpassingsgedeelte (Taak 2): Dit is waar het misgaat. Ondanks dat de AI weet dat de gebruiker Frans is, negeert de AI deze kennis vaak en geeft toch het antwoord in Amerikaanse eenheden (Fahrenheit).

De Analogie: Het is als een ober die weet dat je vegetariër bent (omdat je hebt gezegd dat je geen vlees eet), maar wanneer je een burger bestelt, brengt hij je nog steeds een biefstuk omdat hij op "automatische piloot" staat en de verbanden tussen jouw identiteit en je bestelling niet legt.

3. De Oplossing: "Hardop Denken"

De onderzoekers probeerden een truc om dit op te lossen. Ze vroegen de AI om hardop na te denken voordat hij antwoord geeft. Ze zeiden: "Bepaal eerst waar de gebruiker vandaan komt. Bepaal daarna welke eenheid je moet gebruiken op basis daarvan."

Toen ze dit deden, werd de AI veel beter. Het was alsoord de ober te vertellen: "Stop en denk na: Wacht, deze persoon is een vegetariër. Ik moet de biefstuk vervangen door een salade." Zodra de AI werd gedwongen om te pauzeren en stap voor stap te redeneren, begon hij eindelijk cultureel passende antwoorden te geven.

4. De "Standaardinstelling" Bias

Het paper keek ook naar wat er gebeurt als de AI geen enkele aanwijzing heeft (geen telefoonnummers, geen genoemde websites).

  • Land-gok: Als de AI het land moet raden zonder hints, gokt het meestal de Verenigde Staten.
  • Eenheid-gok: Maar hier is de wending: Hoewel de AI de VS als land gokt, gebruikt het vaak nog steeds het metrieke stelsel (Celsius, kilometers), wat de VS niet gebruikt.

Het is alsof de AI een "standaardpersoonlijkheid" heeft die een mix is van een Amerikaan die spreekt als een Europeaan. Het is niet echt neutraal; het heeft zijn eigen verborgen vooroordelen gebaseerd op waar het model is gebouwd en op welke data het is getraind.

5. Subjectieve Zaken (Tijd en "Sommige")

De onderzoekers testten ook "vage" concepten die geen strikte regels hebben, zoals hoe laat het is (is 18:00 uur "avond" of "middag"?) of hoeveel eieren er in een mandje zitten ("een paar" versus "sommige").

  • Het Goede Nieuws: Naarmate de AI meer aanwijzingen krijgt, begint hij zijn antwoorden aan te passen om bij verschillende culturen te passen.
  • Het Slechte Nieuws: Zonder aanwijzingen leunen de "standaard" antwoorden van de AI vaak naar de cultuur van het bedrijf dat het model heeft gebouwd (bijv. een Chinees model neigt naar Chinese interpretaties, een Amerikaans model naar Amerikaanse).

De Kernboodschap

Het paper concludeert dat huidige AI-modellen lijken op encylopediën die nog niet hebben geleerd om goede gesprekspartners te zijn. Ze slaan culturele feiten op in één deel van hun brein en het vermogen om die te gebruiken in een ander deel, maar ze koppelen de twee niet automatisch aan elkaar.

Om hen echt behulpzaam te maken, kunnen we niet alleen vertrouwen op het feit dat ze cultuur "kennen"; we moeten hen expliciet leren om te pauzeren, na te denken over met wie ze praten, en vervolgens hun antwoord aan te passen. Tot die tijd kunnen ze wel weten dat je Frans bent, maar zullen ze je nog steeds de temperatuur in Fahrenheit vertellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →