← Nieuwste papers
💻 computer science

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

Dit paper introduceert VideoReasonBench, een benchmark voor visueel gecentreerd complex videoredeneren die aantoont dat de meeste multimodale LLMs hierin tekortschieten, terwijl modellen met uitgebreide denkprocessen zoals Gemini-2.5-Pro aanzienlijk betere prestaties leveren.

Oorspronkelijke auteurs: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

Gepubliceerd 2026-03-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

VideoReasonBench: De "Schaakpartij" voor Videobots

Stel je voor dat je een robot hebt die heel goed kan praten en lezen, maar als je hem een filmpje laat zien, kijkt hij er alleen naar alsof het een statische foto is. Hij ziet de beelden, maar hij begrijpt niet wat er gebeurt terwijl de tijd voorbijgaat.

Dit is precies het probleem dat onderzoekers van Peking University en Moonshot AI hebben opgelost met hun nieuwe test: VideoReasonBench.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Kijk-en-vertel" Valstrik

Tot nu toe waren de tests voor videobots vaak te makkelijk. Ze vroegen dingen als: "Wat voor auto is dat?" of "Hoeveel mensen lopen er?". Een slimme bot kan dat vaak beantwoorden door gewoon naar één frame te kijken of door zijn algemene kennis te gebruiken, zonder echt naar het filmpje te kijken.

Het is alsof je iemand een raadsel geeft: "Ik heb een appel in mijn hand. Ik doe hem in mijn zak. Wat heb ik nu?" Iedereen weet het antwoord. Maar wat als het raadsel is: "Ik heb een appel, ik doe hem in mijn zak, ik wissel van zak, ik schud mijn broek, en dan doe ik hem in een andere zak. Welke zak zit de appel nu in?" Dat vereist echt nadenken en onthouden van elke stap.

2. De Oplossing: Een Videobordspel

De onderzoekers hebben een nieuwe testbedacht die lijkt op een slepende puzzel (zoals de 15-puzzel) of een kopjes-en-munten spel.

  • Het spel: Je ziet een bord met nummers of munten. Soms zijn ze zichtbaar, soms bedekt.
  • De actie: In het filmpje worden de nummers verplaatst, munten onder kopjes geschoven, of bestanden in een computermap verplaatst.
  • De twist: Je ziet niet alles. Soms zie je alleen het begin, en moet je raden waar alles eindigt. Soms zie je alleen het eind, en moet je raden hoe het begon. Soms moet je voorspellen wat er gebeurt als je nog één stap verder gaat.

Het is als kijken naar een magiër die een bal onder drie kopjes verplaatst. Als je niet elke beweging nauwkeurig volgt, ben je de bal kwijt.

3. De Test: Drie Niveaus van Slimheid

De test meet drie soorten intelligentie, die steeds moeilijker worden:

  1. Niveau 1: Het Onthouden (De Fotograaf)
    • Vraag: "Hoeveel keer ging de rode cirkel naar links?"
    • Uitdaging: Je moet precies tellen wat je ziet.
  2. Niveau 2: Het Afleiden (De Detective)
    • Vraag: "Waar zit de munt nu, als hij onder kopje A zat en we hebben twee keer geschud?"
    • Uitdaging: Je moet de bewegingen in je hoofd nabouwen om te weten wat er niet zichtbaar is.
  3. Niveau 3: Het Voorspellen (De Profeet)
    • Vraag: "Als we nu nog drie keer schudden, waar zit de munt dan?"
    • Uitdaging: Je moet een toekomstige situatie berekenen op basis van wat je hebt gezien.

4. De Resultaten: Wie is de Slimste?

Toen ze 18 van de slimste AI-modellen (zoals GPT-4o, Qwen, en verschillende versies van Gemini) deze test lieten doen, was het resultaat schokkend:

  • De meeste bots faalden: De meeste modellen scoorden minder dan 10%. Ze waren als een kind dat probeert een schaakpartij te spelen zonder de regels te kennen. Ze keken naar het filmpje, maar konden de bewegingen niet volgen.
  • De "Denkers" wisten het: Het model Gemini-2.5-Pro (een model dat is uitgerust met een "denk-motor" die eerst lang nadenkt voordat het antwoordt) scoorde 56%.
    • De analogie: De andere bots waren als iemand die snel een gokje waagt. Gemini-2.5-Pro was als iemand die een whiteboard pakt, elke stap uitschrijft, de logica controleert, en dan pas het antwoord geeft.

5. De Belangrijkste Les: "Denktijd" is Cruciaal

Het meest interessante ontdekking was dit:

  • Op de oude, makkelijke tests hielp "lang nadenken" (meer denk-tijd) nauwelijks.
  • Op deze nieuwe, moeilijke test was "lang nadenken" absoluut noodzakelijk. Zonder die extra denk-tijd zakte de score van de beste bots enorm.

Het bewijst dat om echt complexe video's te begrijpen, een AI niet alleen moet "kijken", maar moet "redeneren". Het moet een verhaal in zijn hoofd bouwen van begin tot eind, net als een mens die een film volgt en zich afvraagt: "Wacht, waar was die sleutel weer gebleven?"

Kortom: VideoReasonBench is de nieuwe "rijpe appel" voor AI. Het laat zien dat we nog ver weg zijn van echte video-intelligentie, maar dat modellen die leren om stap-voor-stap na te denken, de eerste echte doorbraken laten zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →