OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
Dit artikel introduceert OMGEval, de eerste open-source meertalige generatieve evaluatiebenchmark met 804 rigoureus geverifieerde, cultureel gelokaliseerde open vragen in vijf talen om de meertalige capaciteiten van grote taalmodellen te beoordelen en te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, alwetende bibliothecaris hebt gebouwd die elke taal ter wereld kan spreken. Je wilt testen of deze bibliothecaris werkelijk slim is in alle culturen, of dat ze slechts een "lokale expert" is die alleen de cultuur van de Verenigde Staten begrijpt.
Dit artikel introduceert OMGEval, wat in essentie een multiculturele "rijbewijs"-test is voor deze AI-bibliothecarissen (Large Language Models).
Hier is de opbouw van wat de auteurs hebben gedaan, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Amerikaanse TV"-bias
De meeste huidige tests voor AI zijn als het kijken naar een tv-programma dat alleen in het Engels wordt uitgezonden en praat over Amerikaanse feestdagen, eten en geschiedenis.
- Het probleem: Als je een AI vraagt: "Wat is het traditionele eten voor Thanksgiving?", zal het correct "kalkoen" zeggen. Maar als je een Chinees spreekende vraagt: "Wat is het traditionele eten voor het Drakenbootfestival?", kan een AI die alleen op Amerikaanse data is getraind, in de war raken of een foutief antwoord geven omdat het de lokale cultuur niet begrijpt.
- De claim van het artikel: De meeste bestaande tests zijn te veel gericht op het Engels. Ze controleren niet of de AI begrijpt dat het in Rusland bij Pasen specifieke taarten worden gegeten, of dat er in Spanje specifieke lekkernijen zijn voor Allerheiligen.
2. De Oplossing: OMGEval (De "Lokale Gids"-test)
De auteurs hebben een nieuwe test ontwikkeld genaamd OMGEval. In plaats van alleen Engelse vragen te vertalen naar andere talen (wat is alsozien als het zetten van Engelse ondertiteling onder een Russische film), hebben ze de vragen herschreven om ze in de lokale cultuur te laten passen.
- De analogie: Stel je een testvraag voor over "Zomervakantie".
- De oude manier (Vertaling): "Waar gaan Amerikanen naartoe voor de zomervakantie?" (Antwoord: Hawaï).
- De OMGEval-manier (Lokalisatie): "Waar gaan Chinezen naartoe voor de zomervakantie?" (Antwoord: Sanya).
- Waarom dit belangrijk is: Beide vragen gaan over "plekken voor de zomervakantie", maar de culturele context is anders. OMGEval zorgt ervoor dat de AI het lokale verhaal kent, en niet alleen het Amerikaanse verhaal.
3. Hoe ze het hebben gebouwd
Het team heeft niet simpelweg een robot gebruikt om dingen te vertalen; ze hebben een team van menselijke experts (taalkundigen) ingezet om te fungeren als culturele redacteuren.
- Het proces: Ze namen 804 open vragen (zoals raadsels, feiten of creatieve schrijfopdrachten) en pasten deze aan voor 5 talen: Chinees, Russisch, Frans, Spaans en Arabisch.
- De "Menselijke Touch": Als een vraag een specifieke Amerikaanse beroemdheid noemde, vervingen ze die door een beroemde lokale figuur. Als een vraag een specifieke Amerikaanse feestdag noemde, vervingen ze die door een lokaal festival. Ze deden dit om ervoor te zorgen dat de AI werd getest op zijn vermogen om die specifieke cultuur te begrijpen, en niet alleen op zijn vermogen om woorden te vertalen.
4. Hoe ze de AI beoordeelden
Omdat mensen niet direct duizenden antwoorden in vijf talen kunnen lezen, gebruikten ze GPT-4 (een zeer geavanceerde AI) als de scheidsrechter.
- Het spel: Ze vroegen de AI-modellen om de vragen te beantwoorden. Vervolgens vroegen ze GPT-4 om twee antwoorden naast elkaar te leggen en te beslissen welk antwoord beter was.
- De controle: Ze lieten ook echte mensen een kleine steekproef beoordelen om te controleren of de "AI-scheidsrechter" eerlijk was. De resultaten lieten zien dat de AI-scheidsrechter zeer nauwkeurig was (ongeveer 90% overeenstemming met mensen).
5. De Resultaten: Wie slaagde voor de test?
Ze testten verschillende AI-modellen, inclusief grote commerciële modellen (zoals GPT-4) en open-source modellen (gratis modellen die iedereen kan downloaden).
- De winnaar: GPT-4 was het enige model dat consistent boven de 50% scoorde (wat betekent dat het de baseline vaker dan de helft van de tijd versloeg). Het was de "sterleerling".
- De strijd: De open-source modellen (zoals Guanaco, Phoenix en anderen) hadden het aanzienlijk moeilijk.
- De kloof: Terwijl GPT-4 culturele nuances goed kon afhandelen, maakten de open-source modellen vaak feitelijke fouten of misten ze de culturele context. Bijvoorbeeld, wanneer gevraagd werd naar de eerste film van een beroemde Chinese regisseur, gaven sommige open-source modellen het verkeerde jaar of de verkeerde filmtitel, terwijl GPT-4 het goed had.
- De les: Er is een enorme kloof tussen de top-tier commerciële modellen en de open-source modellen als het gaat om het begrijpen van verschillende culturen. De open-source modellen zijn als studenten die het tekstboek hebben bestudeerd, maar faalden om het lokale dialect te begrijpen.
Samenvatting
OMGEval is een nieuwe, eerlijkere test die controleert of AI-modellen de diverse culturen van de wereld begrijpen, en niet alleen de Amerikaanse versie van de wereld. Het artikel laat zien dat hoewel de beste AI (GPT-4) hier vrij goed in is, veel andere modellen nog steeds worstelen met het begrijpen van de lokale "smaak" van verschillende talen en culturen. De auteurs hopen dat deze test de gemeenschap zal helpen om in de toekomst betere, meer cultureel bewuste AI te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.