← Nieuwste papers
💬 NLP

Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark

In deze studie wordt het DemosQA-dataset gepresenteerd en worden elf monolinguale en meertalige grote taalmodellen geëvalueerd op hun prestaties bij het beantwoorden van vragen in het Grieks, met als doel de kloof in onderzoek naar minder vertegenwoordigde talen te dichten.

Oorspronkelijke auteurs: Charalampos Mastrokostas, Nikolaos Giarelis, Nikos Karacapilidis

Gepubliceerd 2026-02-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Charalampos Mastrokostas, Nikolaos Giarelis, Nikos Karacapilidis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt met boeken in alle talen ter wereld. De meeste boeken zijn in het Engels, en de slimste bibliothecarissen (de kunstmatige intelligenties of 'LLMs') hebben vooral die Engelse boeken gelezen. Ze zijn dus heel goed in het beantwoorden van vragen in het Engels, maar als je ze in het Grieks iets vraagt, kunnen ze soms verward raken, of antwoorden die niet helemaal kloppen met de Griekse cultuur en geschiedenis.

Dit onderzoek is als een Griekse taal-expeditie om te kijken of die slimme bibliothecarissen ook echt goed Grieks spreken, en of we ze kunnen helpen om dat beter te doen.

Hier is wat de onderzoekers hebben gedaan, vertaald naar alledaagse taal:

1. Het Probleem: De "Engelse" Brillen

De meeste slimme AI's zijn getraind op talen als Engels, Chinees of Spaans. Voor talen als het Grieks (een taal met een eigen alfabet en ingewikkelde grammatica) is er minder data.

  • De analogie: Het is alsof je iemand vraagt om een Grieks gerecht te koken, maar je geeft ze alleen een recept in het Engels. Ze kunnen het misschien proberen, maar het smaakt niet authentiek. Soms vergeten ze zelfs belangrijke culturele details.

2. De Oplossing: Een Nieuw Spelbord (DemosQA)

De onderzoekers hebben een nieuw, speciaal bordspel bedacht genaamd DemosQA.

  • Wat is het? In plaats van vragen te halen uit saaie schoolboeken of vertaalde teksten, hebben ze gekeken naar wat gewone mensen op sociale media (Reddit) vragen en hoe de community daarop reageert.
  • De analogie: Stel je voor dat je wilt weten hoe Grieken echt praten en denken. Je kunt niet alleen naar de krant kijken (dat is vaak formeel), maar je moet meekijken in de kantine of op het plein. DemosQA is die kantine: een verzameling van echte vragen over het dagelijks leven, geschiedenis en politiek, met de beste antwoorden die door de mensen zelf zijn geselecteerd (via 'likes').
  • Waarom is dit belangrijk? Het vangt de "ziel" van de taal in plaats van alleen de grammatica.

3. De Test: De Slimste Spelers

De onderzoekers hebben 11 verschillende AI-modellen uitgenodigd om dit nieuwe spel te spelen.

  • De spelers: Er waren twee soorten teams:
    1. De "Griekse" teams: AI's die speciaal zijn getraind op het Grieks (zoals Llama Krikri en Meltemi).
    2. De "Wereldwijd" teams: AI's die veel talen spreken, maar misschien niet zo diep in het Grieks zitten (zoals Gemma of Mistral).
    3. De "Gouden Standaard": Een heel dure, geheime AI van een groot bedrijf (GPT-4o mini), die we als maatstaf gebruiken.

Ze hebben deze modellen getest op 6 verschillende soorten vragen, variërend van medische kennis tot algemene kennis en sociale media-vragen.

4. De Resultaten: Wie wint er?

Hier zijn de belangrijkste bevindingen, vertaald in een verhaal:

  • De dure AI wint vaak, maar niet altijd: De geheime AI (GPT-4o mini) was over het algemeen de beste, vooral bij moeilijke vragen over wetgeving of geneeskunde.
  • De Griekse teams verrassen: De open-source modellen die specifiek voor het Grieks zijn gemaakt (Llama Krikri), deden het verrassend goed. Op vragen over het dagelijks leven en sociale media (zoals in DemosQA) waren ze net zo goed als de dure AI!
  • De wereldwijde teams: De modellen die veel talen spreken, deden het vaak minder goed op specifieke Griekse onderwerpen. Ze misten soms de culturele nuance.
  • De trucjes (Prompting): Hoe je de AI een vraag stelt, maakt veel uit.
    • Voor de dure AI werkt een simpele instructie het beste ("Beantwoord deze vraag").
    • Voor de open-source modellen werkt het beter als je ze een rol geeft ("Je bent een Griekse expert...").
    • Soms helpt het om ze te vragen om stap voor stap na te denken, maar dat kan ook leiden tot "hallucinaties" (dromen die niet waar zijn), vooral bij de kleinere modellen.

5. De Grootste Les: Hardware is niet alles

Een van de coolste dingen aan dit onderzoek is dat ze een slimme truc hebben gebruikt om de AI's op gewone computers te laten draaien.

  • De analogie: Normaal gesproken heb je een gigantische, dure supercomputer nodig om deze AI's te laten werken. De onderzoekers hebben de AI's echter "geperst" (zoals een koffer die je heel strak inpakt) zodat ze op een gewone laptop met een goede videokaart kunnen werken, zonder dat ze veel minder slim worden. Dit maakt het voor iedereen mogelijk om mee te doen.

Conclusie

Dit onderzoek laat zien dat je niet per se de duurste, geheimste AI nodig hebt om het Grieks goed te begrijpen. Met de juiste data (zoals DemosQA) en de juiste instellingen, kunnen openbare, gratis modellen het net zo goed doen als de dure concurrenten op veel gebieden.

Het is een bewijs dat je de "ziel" van een taal kunt vangen als je kijkt naar wat gewone mensen zeggen, en dat we AI's kunnen maken die niet alleen Engels spreken, maar ook de cultuur van het Griekenland echt begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →