← Nieuwste papers
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

Deze paper introduceert GreekMMLU, een nieuw, volledig in het Grieks samengesteld meerdaadstaken-benchmark met 21.805 vragen uit authentieke bronnen om de prestaties van taalmodellen in het Grieks nauwkeuriger te evalueren dan tot nu toe mogelijk was.

Oorspronkelijke auteurs: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt vol met boeken in het Grieks. Nu hebben we deze superslimme computerhersenen, de zogenaamde "Large Language Models" (LLMs), die alles kunnen lezen en begrijpen. Maar er is een groot probleem: deze computers zijn vooral getraind op Engelse boeken. Als je ze in het Grieks iets vraagt, doen ze alsof ze het begrijpen, maar vaak missen ze de echte nuances, de cultuur en de specifieke manier waarop Grieken praten.

Het is alsof je iemand vraagt om een Grieks gerecht te koken, maar je geeft ze alleen een recept in het Engels. Ze kunnen de ingrediënten vertalen, maar ze missen de geur van de olijfolie en de juiste smaak van de oregano.

Wat hebben de onderzoekers gedaan?

De auteurs van dit papier hebben een nieuwe "keuring" bedacht, genaamd GreekMMLU. Het is als een gigantisch examen voor die computerhersenen, maar dan volledig in het Grieks en gebaseerd op echte Griekse situaties.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Geen vertalingen, maar origineel werk

Tot nu toe waren de meeste tests voor het Grieks gewoon Engelse examens die door een computermachine waren vertaald. Dat is als het nemen van een rijbewijstest in Nederland, maar dan vertaald naar het Grieks. De regels zijn misschien wel vertaald, maar ze passen niet bij de Griekse wegen of de lokale cultuur.

GreekMMLU is anders. De onderzoekers hebben 21.805 echte vragen verzameld uit:

  • Schoolboeken (van de basisschool tot de universiteit).
  • Vakexamens (voor artsen, ingenieurs, etc.).
  • Overheidstests (zoals het rijbewijs of examens voor overheidsbanen).

Het is alsof je een spiegel hebt gemaakt van de echte Griekse samenleving, in plaats van een spiegel die alleen naar Amerika kijkt.

2. Een "Gymzaal" voor AI

Stel je voor dat GreekMMLU een enorme gymzaal is met 45 verschillende sporten:

  • STEM: Wiskunde, natuurkunde, biologie (de zware gewichten).
  • Geesteswetenschappen: Geschiedenis, mythologie, literatuur (de danslessen).
  • Sociale Wetenschappen: Economie, politiek, recht (de strategie-spellen).
  • Specifiek Grieks: Vragen over Griekse mythologie, tradities en geschiedenis (de speciale Griekse dans).

De vragen variëren van "Wat is 2+2?" tot "Leg uit hoe de Griekse democratie werkt in de Byzantijnse tijd."

3. De testresultaten: Wie is de kampioen?

De onderzoekers hebben meer dan 80 verschillende AI-modellen op deze "gymzaal" laten trainen en testen. Wat bleek?

  • De "Grote Jongens" winnen: De duurste, gesloten modellen (zoals die van Google en OpenAI) doen het het beste. Ze zijn als Olympische atleten die al jaren in de gym hebben getraind.
  • De "Open" modellen hebben moeite: De gratis, open-source modellen doen het vaak minder goed, alsof ze pas net beginnen met trainen.
  • Speciale training is cruciaal: Modellen die specifiek zijn getraind op het Grieks (zoals Llama-Krikri of Meltemi) doen het veel beter dan algemene modellen die "alle talen een beetje" kennen. Het is het verschil tussen een toerist die een paar woorden Grieks kent en een lokale gids die de stad als zijn broekzak kent.
  • Cultuur telt: Bij vragen over Griekse mythologie of geschiedenis zakten de algemene modellen vaak door de vloer. Ze wisten de namen van de goden niet, omdat die niet in hun Engelse training zaten.

4. Waarom is dit belangrijk?

Voorheen dachten we: "Als een AI Engels goed kan, kan hij wel Grieks." Dit papier zegt: "Nee, dat klopt niet."

Het is alsof je denkt dat iemand die goed piano kan spelen, ook goed viool kan spelen. Misschien wel, maar je moet het instrument wel leren bespelen. GreekMMLU laat zien dat we AI-modellen specifiek moeten "trainen" op de Griekse taal en cultuur, anders blijven ze steken in vertalingen en missen ze de ziel van de taal.

Kortom:
De onderzoekers hebben een eerlijke, echte en moeilijke test gemaakt voor AI in het Grieks. Ze hebben bewezen dat als je wilt dat een computer echt "Grieks" denkt en spreekt, je hem niet zomaar een vertaalprogramma kunt geven. Je moet hem laten studeren met echte Griekse boeken, examens en verhalen. En nu hebben ze een scorebord (een "leaderboard") gemaakt waar iedereen kan zien welke AI het beste is in het Grieks.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →