← Nieuwste papers
💬 NLP

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

Dit artikel introduceert VMMU, een Vietnamese benchmark bestaande uit 2.500 multimodale vragen over zeven taken die zijn ontworpen om het vermogen van vision-language modellen om echte visueel-tekstuele redenering te vertonen buiten het Engels te evalueren, waarbij wordt onthuld dat huidige modellen voornamelijk worstelen met multimodale gronding in plaats van OCR, ondanks sterke taal-specifieke prestaties.

Oorspronkelijke auteurs: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Gepubliceerd 2026-01-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, meertalige robotassistent hebt. Je wilt zien of hij een Vietnamese student kan helpen bij het oplossen van een lastig huiswerkprobleem dat in een afbeelding komt. De afbeelding is niet zomaar een foto; het is een pagina uit een tekstboek of een rijexamen die Vietnamese tekst combineert met diagrammen, grafieken en verkeersborden.

Het papier introduceert een nieuwe "test" genaamd VMMU om te kijken hoe goed deze robots zijn in deze specifieke taak. Hier is de uitsplitsing van wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. De Test: Een "Multitask" Hindernisbaan

Zie VMMU als een sportschool voor AI, maar in plaats van gewichten te heffen, moeten de robots 2.548 verschillende puzzels oplossen. Deze puzzels beslaan zeven gebieden: Wiskunde, Natuurkunde, Scheikunde, Biologie, Geografie, Rijtesten en IQ-testen.

De crux? De vragen staan niet alleen getypt op een scherm. Ze zijn ingebed in afbeeldingen. Om het antwoord te vinden, moet de robot:

  • De Vietnamese woorden in de afbeelding lezen (zoals het lezen van een bord).
  • Het visuele deel van de afbeelding bekijken (zoals een grafiek of een kaart).
  • De twee combineren om tot het antwoord te komen.

2. De Grote Verrassing: Lezen is niet het Probleem

De onderzoekers vroegen zich eerst af: "Faalt de robot omdat hij geen Vietnamees kan lezen?"
Ze testten het vermogen van de robots om simpelweg de tekst binnen de afbeeldingen te transcriberen (hardop voor te lezen).

  • Het resultaat: De robots waren eigenlijk uitstekend in het lezen van de Vietnamese tekst. Ze hadden het bijna 95% van de tijd goed.
  • De analogie: Stel je een student voor die elk woord op een pagina perfect kan lezen, maar de wiskundevraag nog steeds fout heeft omdat hij niet begrijpt hoe de getallen zich tot de afbeelding verhouden. Het probleem is niet de ogen; het is het brein.

3. De Echte Strijd: De Punten Verbindingen

Wanneer de robots de volledige problemen probeerden op te lossen (lezen + kijken + redeneren), daalden hun scores aanzienlijk.

  • Het resultaat: Zelfs de slimste commerciële robots kregen slechts ongeveer 66% van de antwoorden goed.
  • De "Denk"-factor: De onderzoekers vonden een groot verschil tussen "snelle" robots en "denkende" robots.
    • Snelle Robots: Zij gokken snel en kregen ongeveer 50–70% goed.
    • Denkende Robots: Deze modellen pauzeren om de stappen door te "denken". Zij scoorden veel hoger (73–86%).
  • De analogie: Het is als het verschil tussen een student die het eerste antwoord dat in hem opkomt eruit roept, versus een student die stopt, een diagram tekent en de logica stap voor stap doorloopt. De "denkende" robots deden het veel beter.

4. Het "Rommel" Probleem

De onderzoekers merkten op dat wanneer de tekst en de afbeelding dicht op elkaar gepropt zaten in één rommelige afbeelding, de robots in de war raakten.

  • Het experiment: Ze haalden de tekst uit de afbeelding en gaven deze aan de robot als een schone lijst, terwijl ze de afbeelding apart overhandigden.
  • Het result resultaat: De robots werden beter in het oplossen van het probleem.
  • De analogie: Het is alsof je een puzzel probeert op te lossen terwijl iemand instructies naar je roept vanuit de andere kant van de kamer. Als ze je de instructies op een schoon stuk papier geven en je de puzzelstukjes laten bekijken, doe je het veel beter. De robots hadden moeite om de "ruis" van de tekst te negeren wanneer deze gemengd was met de afbeelding.

5. Vertaling Helpt Niet

De onderzoekers vroegen zich af: "Begrijpen de robots het Vietnamees misschien niet goed genoeg? Wat als we de vraag naar het Engels vertalen?"

  • Het resultaat: Nee. Het vertalen van de vraag naar het Engels maakte de robots juist slechter.
  • De analogie: Stel je een rijexamen voor waarbij de borden in het Vietnamees zijn, maar de instructies in het Engels. De robot raakt in de war omdat het bord "Stop" in het Vietnamees zegt, maar de Engelse instructie niet overeenkomt met de visuele context. De robot heeft de volledige Vietnamese context nodig om de puzzel op te lossen.

6. De "Gok" Gewoonte

Ten slotte probeerden ze de afbeelding volledig te verwijderen en alleen de tekstvraag aan de robot te geven.

  • Het resultaat: De scores van de robots daalden, maar ze daalden niet naar nul. Ze kregen nog steeds ongeveer 51% goed (vergeleken met een willekeurige gok van 25%).
  • De analogie: Het blijkt dat de robots als studenten zijn die de "trucjes" van de test uit hun hoofd hebben geleerd. Zelfs zonder de afbeelding kunnen ze het juiste antwoord raden op basis van de bewoording van de vraag, door gebruik te maken van patronen die ze eerder hebben gezien. Ze "zien" het antwoord niet echt; ze zijn gewoon goed in het raden.

De Kern van het Verhaal

De conclusie van het paper is dat huidige AI-modellen uitstekend zijn in het lezen van Vietnamese tekst in afbeeldingen, maar dat ze nog steeds worstelen met het verbinden van die tekst met het visuele bewijs en het redeneren door het probleem. Ze moeten leren om dieper te "denken" en de rommelige realiteit van gemengde tekst en afbeeldingen aan te kunnen, in plaats van alleen te vertrouwen op shortcuts of gokwerk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →