← Nieuwste papers
🤖 AI

M3VerseM^3-Verse: A "Spot the Difference" Challenge for Large Multimodal Models

Dit artikel introduceert M3VerseM^3-Verse, een uitgebreide benchmark die is ontworpen om het vermogen van grote multimodale modellen om redeneringen te voeren over dynamische veranderingen in objecttoestanden binnen consistente ruimtelijke contexten via gekoppelde videoobservaties te evalueren en te verbeteren, waarbij huidige beperkingen worden blootgelegd en een effectieve baseline voor multi-staatperceptie wordt voorgesteld.

Oorspronkelijke auteurs: Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het "Vind het Verschil"-spel voor AI

Stel je voor dat je een klassiek "Vind het Verschil"-spel speelt met twee afbeeldingen. Je kijkt naar Afbeelding A, dan naar Afbeelding B, en je moet ontdekken wat er veranderd is. Misschien is een kat van de bank naar de vloer verplaatst, of is een kopje omgegooid.

Nu stel je je voor dat je een computer leert dit spel te spelen, maar in plaats van twee statische afbeeldingen, laat je haar twee korte video's van een kamer zien. In de eerste video is de kamer opgeruimd. In de tweede video heeft iemand het meubilair verplaatst en enkele objecten verzet. De computer moet beide video's bekijken en vragen beantwoorden zoals: "Waar is de rode vaas heen gegaan?" of "Is de lamp aan gegaan?"

Dit is precies waar het artikel M3-Verse over gaat. De auteurs hebben een nieuwe, zeer moeilijke test ontwikkeld om te zien of moderne AI-modellen (zogenaamde Large Multimodal Models, of LMM's) echt goed zijn in het volgen van veranderingen in de tijd, of dat ze gewoon gokken.

Het Probleem: AI is Goed in "Nu", maar Slecht in "Toen versus Nu"

Het artikel stelt dat AI, hoewel het geweldig is in het bekijken van een enkele foto en het beschrijven ervan (bijvoorbeeld zeggen: "Dat is een hond op een tapijt"), moeite heeft wanneer het wordt gevraagd om twee verschillende momenten in de tijd te vergelijken.

  • Huidige AI: Het is als een toerist die een foto van een kamer maakt, wegkijkt, en vervolgens probeert te onthouden wat er veranderd is wanneer ze weer terugkijkt. Ze vergeten vaak de details.
  • Menselijke Intelligentie: Wij vergelijken de natuur van nature het verleden met het heden. Als een vogel uit een boom vliegt, merken we het verschil direct op. Het artikel stelt dat AI deze "biologische" vaardigheid mist om subtiele veranderingen tussen twee verschillende scènes te detecteren.

De Oplossing: Een Nieuwe Test genaamd M3-Verse

Om dit op te lossen, bouwden de onderzoekers M3-Verse, een enorme testset met twee delen:

  1. Het Simulatielab (M3-Verse-Sim): Ze gebruikten een videospel-engine (AI2-THOR) om 270 virtuele kamers te creëren. Ze programmeerden robots om rond te lopen, verplaatsten vervolgens stiekem objecten (zoals het openen van een la of het verplaatsen van een stoel) en namen de "voor"- en "na"-video's op. Ze genereerden bijna 3.000 vragen over deze veranderingen.
    • Analogie: Denk hieraan als een perfect gecontroleerd videospelniveau waar de regels streng zijn en elk detail bekend is.
  2. De Reële Wereld (M3-Verse-Real): Ze filmden 29 echte kamers in daadwerkelijke huizen en kantoren. Mensen verplaatsten fysiek objecten en filmden de veranderingen. Ze maakten 552 vragen voor deze.
    • Analogie: Dit is de rommelige, reële versie waar het licht verandert, camera's trillen en dingen niet perfect op elkaar aansluiten.

De test vraagt de AI om vier dingen te doen:

  • Ruimtelijk Begrip: Waar bevindt het object zich?
  • Temporeel Begrip: Wat gebeurde eerst, en wat gebeurde daarna?
  • Attribuutherkenning: Veranderde de kleur of vorm?
  • Redeneren: Waarom veranderde het, of wat betekent dat?

De Resultaten: AI Houdt het Moeilijk

De onderzoekers testten 16 van de slimste beschikbare AI-modellen (waaronder grote namen zoals GPT-5 en Gemini). De resultaten waren verrassend:

  • Mensen: Scoren ongeveer 90%. Wij zijn hier goed in.
  • Top AI-modellen: Scoren tussen 30% en 47%. Zelfs de beste modellen zijn nauwelijks beter dan willekeurig gokken bij de moeilijkste vragen.
  • Het Kloof: Het artikel noemt dit een "schokkende prestatiekloof". Huidige AI is nog niet slim genoeg om betrouwbaar te volgen hoe een scène van het ene moment op het andere verandert.

De Diagnose: Waarom faalt de AI?

De onderzoekers zeiden niet zomaar "AI faalde". Ze probeerden uit te vinden waarom met een slimme truc genaamd de Text-Oracle Probe.

  • Het Experiment: Ze namen de video's, lieten een AI elke enkele frame in tekst beschrijven (zoals een gedetailleerd transcript), en vroegen vervolgens een tekst-only AI om de vragen te beantwoorden op basis alleen van die tekst.
  • De Ontdekking: Toen de AI niet de ruwe video hoefde te verwerken, maar alleen de tekstbeschrijving kon lezen, steeg haar score flink.
  • De Conclusie: De "ogen" van de AI (de visuele encoder) werken eigenlijk prima; ze kan de veranderingen zien. Het probleem zit in haar "brein" (het redenerende deel). Wanneer de informatie verspreid ligt over een lange video, vergeet de AI de belangrijke details. Het is alsof je een boek leest waar de belangrijke aanwijzingen begraven liggen in duizenden pagina's saai tekst; de AI raakt verdwaald in de ruis en vergeet de aanwijzing.

De Conclusie

Het artikel concludeert dat we een nieuwe generatie AI nodig hebben die niet alleen afbeeldingen "ziet", maar ze echt kan onthouden en vergelijken in de tijd.

  • Huidige Staat: AI is als een camera die prachtige foto's maakt, maar een vreselijk geheugen heeft.
  • Toekomstig Doel: We hebben AI nodig die meer werkt als een menselijke detective, in staat om een mentale kaart van een kamer vast te houden, te kijken hoe deze verandert, en het verschil te ontdekken tussen de "voor"- en "na"-toestanden.

De auteurs hebben deze test (M3-Verse) aan het publiek vrijgegeven zodat andere onderzoekers het kunnen gebruiken om betere, meer "bewuste" AI-systemen te bouwen die onze dynamische, veranderende wereld kunnen begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →