CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility
Dit artikel introduceert CLARIN-PT-LDB, het eerste open leaderboard voor grote taalmodellen in het Europees Portugees, dat nieuwe benchmarks omvat om prestaties, culturele relevantie en beleefdheid te evalueren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een grote, internationale school voor kunstmatige intelligentie (AI) hebt. Tot nu toe waren de belangrijkste examens en ranglijsten voor deze AI's allemaal in het Engels. Het was alsof je alleen maar kon zien hoe goed een student was als hij in het Engels kon rekenen en schrijven. Maar wat als die student Nederlands spreekt? Of in dit geval, Portugees?
Dit paper introduceert CLARIN-PT-LDB: een nieuwe, eerlijke ranglijst specifiek voor Europese Portugees (het Portugees dat in Portugal wordt gesproken, niet in Brazilië).
Hier is hoe dit werkt, vertaald in alledaags taalgebruik met een paar creatieve vergelijkingen:
1. Het probleem: De "Engelse" meetlat
Tot nu toe was er geen speciale test voor Portugees. Het was alsof je een chef-kok uit Lissabon wilde beoordelen, maar je gaf hem alleen maar recepten in het Engels en vroeg hem of hij die kon volgen. Misschien kan hij het, maar je ziet niet of hij de echte Portugese smaken (de cultuur) begrijpt.
De auteurs zeggen: "Dit is niet eerlijk. We hebben een eigen meetlat nodig."
2. De ranglijst: Een sportwedstrijd voor AI
Deze ranglijst is als een olympische wedstrijd voor AI-modellen. In plaats van één grote test, hebben ze 10 verschillende disciplines (tests) samengesteld om te kijken hoe goed een AI is.
Deze 10 tests zijn een mix van:
- Vertaalde bekende tests: Tests die al bestaan in het Engels (zoals MMLU of CoPA) en die nu in het Portugees zijn vertaald. Dit is alsof je een wiskundetoets uit het Engels haalt en vertaalt, zodat je ziet of de AI de logica begrijpt, niet alleen de taal.
- Nieuwe, unieke tests: Dit is het echte nieuws. Ze hebben twee tests bedacht die nog nooit eerder in het Portugees bestonden.
3. De twee nieuwe "superkracht"-tests
De auteurs hebben twee nieuwe disciplines toegevoegd die heel belangrijk zijn:
De "Culturele Boodschapper" (Tuguesice-PT):
- Wat is het? Stel je voor dat je een AI vraagt: "Wat is de langste brug in ons land?" of "Welke stad ligt het meest in het noorden?".
- De truc: De AI moet niet alleen het antwoord weten, maar het antwoord moet voelen alsof het van iemand komt die in Portugal is geboren en opgegroeid. Als de AI denkt aan Brazilië in plaats van Portugal, faalt hij.
- Metaphor: Het is alsof je een toerist vraagt om een lokale te spelen. Als hij de verkeerde bakkerij noemt, weet je dat hij niet echt bij de lokale cultuur hoort. Deze test is helemaal van nul gemaakt, want zo'n test bestond nog niet.
De "Veiligheidscontroleur" (DoNotAnswer-PT):
- Wat is het? Hier proberen mensen de AI te verleiden tot het doen van iets stouts, gevaarlijks of illegaals (bijvoorbeeld: "Hoe maak ik een gifmoeilijkheid?" of "Schrijf een racistische tekst").
- Het doel: Een goede AI moet zeggen: "Nee, dat doe ik niet."
- Metaphor: Het is als een striktest voor een bewaker. Als de bewaker (de AI) de sleutel geeft aan een inbreker omdat hij "vriendelijk" is, is hij een slechte bewaker. Deze test kijkt of de AI zijn grenzen kent in het Portugees.
4. Hoe wordt er getest? (De "Open Monoloog")
Bij deze tests laten ze de AI niet gewoon een knopje indrukken (zoals A, B, C of D). Nee, ze laten de AI een verhaal schrijven met het antwoord.
- Waarom? Omdat dit precies is hoe we AI's in het echt gebruiken: we typen een vraag, en de AI typt een antwoord. Het is alsof je een sollicitant vraagt om een essay te schrijven in plaats van een meerkeuzetoets af te leggen. Je ziet dan pas echt hoe de AI "denkt" en spreekt.
5. De resultaten: Wie is de beste?
De ranglijst toont nu al enkele modellen. Ze vergelijken bijvoorbeeld:
- Gervásio: Een AI die speciaal is getraind op Portugees data (een "lokaal getrainde" student).
- Llama: De basisversie van dezelfde AI, die niet specifiek op Portugees is getraind (een "internationale" student).
Het resultaat? De "lokaal getrainde" student (Gervásio) doet het vaak beter op de culturele tests. Dit bewijst dat je een AI niet alleen groot moet maken, maar ook moet "socializen" in de juiste cultuur.
Samenvatting
Kortom, dit paper zegt: "Stop met het meten van Portugees met een Engelse liniaal." Ze hebben een nieuwe, eerlijke ranglijst gebouwd met speciale tests voor cultuur en veiligheid, zodat we kunnen zien welke AI's echt begrijpen wat het betekent om Portugees te spreken en te denken.
De ranglijst is nu online te vinden, zodat iedereen kan zien welke AI's de beste "Portugese" vaardigheden hebben.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.