← Nieuwste papers
💬 NLP

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

Dit paper introduceert CulturALL, een uitgebreid benchmark voor het evalueren van de multilinguale en multiculturele competentie van grote taalmodellen op realistische, contextrijke taken, waarbij blijkt dat zelfs de beste modellen slechts 44,48% nauwkeurigheid bereiken.

Oorspronkelijke auteurs: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova
Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🌍 De Kern: Een Reisgids voor AI, niet alleen een Woordenboek

Stel je voor dat een Large Language Model (LLM) – zoals de slimme chatbots die we vandaag de dag gebruiken – een reusachtige bibliotheek is. Tot nu toe hebben we deze bibliotheken getest op twee manieren:

  1. Meertaligheid: "Kun je dit boek in het Spaans lezen?" (Ja, dat kan de AI).
  2. Cultuurkennis: "Weet je wie de koning van Spanje is?" (Ja, dat staat in de encyclopedie).

Maar het paper CulturALL zegt: "Dat is te makkelijk! Dat is net als een reiziger die alleen de woorden 'ja' en 'nee' kent, maar niet weet hoe je een treinkaartje koopt of hoe je je gedraagt bij een lokale maaltijd."

CulturALL is een nieuwe, zware test die kijkt of een AI niet alleen weet, maar ook begrijpt en redeneert in de echte wereld.


🧩 De Drie Delen van de Test

De auteurs vergelijken de test met drie niveaus van een vraag:

  1. Vraag 1 (Alleen taal): "Wat is een roos?"
    • De AI: "Een bloem." (Dit is makkelijk, gewoon vertalen).
  2. Vraag 2 (Taal + Cultuur): "Wanneer is het Qixi-festival?"
    • De AI: "7 juli." (Dit vereist feitelijke kennis over een Chinese traditie).
  3. Vraag 3 (De echte uitdaging: Taal + Cultuur + Context): "Ik run een bloemenwinkel. Welke bloem moet ik eind augustus 2025 promoten?"
    • De AI: Hier moet de AI nu redeneren.
      • Eerst begrijpen: Het is een Chinese vraag.
      • Dan weten: Eind augustus is het in China vaak nog heet, maar naderen de herfstmaanden. Misschien is er een specifiek festival?
      • Dan combineren: Welke bloem past bij dat festival én bij het weer?
      • Resultaat: De AI moet de stukjes puzzel in elkaar zetten, net als een mens die een situatie inschat.

De metafoor:

  • De oude tests waren als een quizshow (Wie weet het meeste feiten?).
  • De CulturALL-test is als een realityshow (Kun je overleven in een vreemd land zonder dat je de taal of de ongeschreven regels kent?).

🛠️ Hoe hebben ze deze test gemaakt? (Mensen + Robots)

Het maken van zo'n test is lastig. Als je alleen robots gebruikt, maken ze fouten. Als je alleen mensen gebruikt, duurt het eeuwen.

De auteurs hebben een samenwerking bedacht:

  • De Mensen (De Experts): Dit zijn native sprekers uit 51 verschillende regio's (zoals Vietnam, Rusland, Brazilië). Zij zorgen voor de "ziel" van de test. Ze bedenken situaties die echt gebeuren, zoals "Hoe vraag ik een visum aan voor Hong Kong?" of "Welke cadeautjes zijn gepast voor een bruiloft in Kazachstan?".
  • De Robots (De Werkpaarden): De AI helpt de mensen door voorbeelden te genereren en te vertalen, zodat het proces sneller gaat.

Het resultaat is een gigantische puzzel van 2.610 vragen in 14 talen, verdeeld over 16 thema's (van reizen en eten tot geloof en werk).


📉 Wat zijn de resultaten? (De AI is nog niet klaar)

Toen ze de slimste AI's van de wereld (zoals Gemini, GPT-5 en Claude) op deze test lieten, was het resultaat schokkend:

  • De beste AI haalde slechts 44,48% goed.
    • Vergelijking: Stel je voor dat je een examen doet en je haalt net geen 50%. Dat is niet voldoende om een piloot of arts te worden.
  • Open-source modellen (gratis AI's) deden het veel slechter dan de dure, gesloten modellen.
  • Zoeken op het internet hielp: AI's die toegang hadden tot Google (web search) deden het beter, maar zelfs dan faalden ze vaak bij de moeilijkste vragen.
  • De "Hard" vragen: Bij de allerlastigste vragen (waar zelfs de slimste menselijke experts even moeten nadenken) scoorde de beste AI maar 18%.

De les: AI's zijn goed in feiten uit hun hoofd, maar slecht in het toepassen van die feiten in een complexe, culturele situatie. Ze missen de "buikgevoelens" van een cultuur.


🏁 Conclusie in één zin

CulturALL is de eerste "rijbewijstest" voor AI's die laat zien dat ze, ondanks hun enorme kennis, nog vaak de verkeerde kant op rijden als ze in een vreemd land moeten navigeren. Ze moeten nog veel leren over hoe mensen écht denken en handelen in hun eigen culturen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →