Multimodal Evaluation of Russian-language Architectures
Dit artikel introduceert MERA Multi, het eerste open multimodale evaluatiekader voor Russisch-talige architecturen, met 18 cultuurspecifieke taken over tekst-, beeld-, audio- en videomodaliteiten om de capaciteiten van modellen te beoordelen en een repliceerbare methodologie voor diverse talen vast te stellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep zeer slimme, nieuwe robots hebt die afbeeldingen kunnen zien, geluiden kunnen horen, video's kunnen bekijken en tekst kunnen lezen, allemaal tegelijkertijd. Dit worden Multimodale Large Language Models (MLLM's) genoemd. Ze worden elke dag beter, maar tot nu toe hadden we alleen een manier om ze te testen als ze Engels spraken.
Als je de bekwaamheid van een robot wilde testen om de Russische cultuur, folklore of specifieke Russische grappen te begrijpen, had je geen liniaal om het mee te meten. De bestaande tests waren als proberen een Russische winter te meten met een thermometer die alleen gekalibreerd is voor de Sahara-woestijn.
Dit artikel introduceert MERA Multi, een gloednieuwe, open "examen"-ontwerp, specif으로 ontworpen om te testen hoe goed deze AI-robots de Russische taal en cultuur begrijpen via alle zintuigen: tekst, afbeeldingen, audio en video.
Hier is een uitsplitsing van wat ze hebben gedaan, gebruikmakend van enkele eenvoudige analogieën:
1. Het Probleem: De "Engelssprekende" Blinde Vlek
Beschouw de huidige AI-wereld als een enorme bibliotheek. De meeste boeken (benchmarks/tests) zijn in het Engels geschreven. Als je wilt weten of een student Russisch kan lezen, kun je hem niet gewoon een Engels boek geven en zeggen: "Lees dit." Je hebt een test nodig die in het Russisch is geschreven en de Russische context begrijpt.
- De Kloof: Eerdere tests voor het Russisch keken alleen naar tekst. Ze controleerden niet of de AI een Russische filmclip, een Russisch liedje of een foto van een Russisch straatbeeld kon begrijpen.
- De Oplossing: De auteurs bouwden MERA Multi, de eerste "Russische rijbewijstest" voor AI die alle vier de zintuigen controleert.
2. Het Examen: 18 Verschillende Taken
In plaats van slechts één grote test, creëerden ze 18 verschillende mini-examens. Stel je een sportschool voor met 18 verschillende stations:
- De "Oor" Stations (Audio): Kan de AI het verschil horen tussen een Russisch volkslied en een popliedje? Kan het een gesproken commando begrijpen zoals "Zet de verwarming aan"?
- De "Oog" Stations (Afbeelding): Kan de AI naar een afbeelding van een Russisch wiskundig probleem kijken en dit oplossen? Kan het een menu in een Russisch restaurant lezen vanuit een foto? Kan het opmerken of een afbeelding "vreemd" is (zoals een pinguïn die een auto bestuurt)?
- De "Video" Stations: Kan de AI een korte clip van een Russisch kookprogramma bekijken en de stappen in de juiste volgorde uitleggen?
- De "Brein" Stations (Redeneren): Kan de AI naar een afbeelding kijken en het verhaal erachter begrijpen, niet alleen de objecten? (bijv. "Waarom is deze persoon verdrietig?" op basis van visuele aanwijzingen).
3. De "Culturele Vertaler"
De auteurs hebben de Engelse tests niet simpelweg vertaald naar het Russisch. Dat zou zijn alsos je een grap over het Amerikaanse honkbal naar het Russisch vertaalt; dat zou voor een Russischsprekende geen zin maken.
- Van begin af aan op maat gemaakt: Ze hebben deze tests vanaf nul opgebouwd, gebruikmakend van Russische culturele referenties (zoals Sovjetfilms, Russische folklore en lokale geschiedenis).
- De "Turingtest" Twist: Sommige taken zijn ontworpen om te zien of de AI een natuurlijke, menselijke conversatie kan voeren in het Russisch, waarbij het sarcasme, idiomen en culturele nuances begrijpt, precies zoals een echt persoon dat zou doen.
4. Het Beoordelingssysteem: De "Slimme Leraar"
Hoe beoordeel je een AI die een lang, warrig antwoord geeft?
- De Menselijke Baseline: Eerst namen echte mensen de test af om een "gouden standaard"-score vast te stellen.
- De "Rechter" AI: Omdat mensen niet duizenden AI-antwoorden direct kunnen beoordelen, hebben de auteurs een speciale "Rechter-AI" getraind. Zie deze Rechter als een strenge maar eerlijke leraar. Deze kijkt niet alleen naar het exacte juiste woord; hij controleert of de betekenis correct is.
- Twee Scores: Ze geven de AI twee scores:
- Exacte Match: Heeft de AI exact het juiste woord gezegd?
- Semantische Score: Heeft de AI de bedoeling goed begrepen, zelfs als de woorden iets anders waren?
5. Het Testen Eerlijk Houden (Anti-Valsspelen)
Een groot probleem bij AI-testen is "data leakage" (gegevenslek). Dit is alsof een student de vragen van de toets uit het hoofd leert voordat het examen begint, omdat de vragen van de toets per ongeluk zijn gebruikt om de student te onderwijzen.
- Watermerken: De auteurs hebben onzichtbare "watermerken" op hun testgegevens geplaatst (zoals een verborgen handtekening in een schilderij) om te volgen of een AI-model de testgegevens stiekem heeft geleerd tijdens hun training.
- Lekdetectie: Ze hebben een "leugendetector"-tool gebouwd die kan zien of een model de testvragen eerder heeft gezien. Als een model probeert te valsspelen, kan het systeem dit betrappen.
6. De Resultaten: Wie is Geslaagd?
Ze hebben meer dan 50 verschillende AI-modellen getest (zowel gratis/open-source als betaalde/gesloten modellen).
- De Winnaars: De beste presteerders waren "Omni-modellen" (modellen die alles proberen te doen) uit de Qwen-familie. Zij scoorden het hoogst over het algemeen omdat ze goed waren in alle verschillende stations, en niet alleen in één.
- De Specialisten: Sommige modellen waren geweldig in slechts één ding (zo zoals alleen audio begrijpen) maar faalden bij de andere onderdelen.
- De Realiteitscheck: Zelfs de beste modellen worstelen nog steeds met complexe Russische culturele nuances en moeilijke redeneertaken. Er is nog steeds een grote kloof tussen hoe goed mensen presteren en hoe goed AI presteert.
Samenvatting
MERA Multi is een uitgebreid, cultureel bewust "rapportcijfer" voor Russischsprekende AI. Het bewijst dat om een taal echt te begrijpen, een AI ook de cultuur, de geschiedenis en de context moet begrijpen, en niet alleen de woordenboekdefinities. Het biedt een eerlijke, transparante manier voor onderzoekers om te zien welke AI-modellen daadwerkelijk slim zijn en welke modellen slechts aan het gokken zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.