← Nieuwste papers
💻 computer science

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

Dit artikel introduceert TOC-Bench, een strikt gefilterde en door mensen geverifieerde benchmark die is ontworpen om de onderbelichte vaardigheid van Video Large Language Models te evalueren om temporale objectconsistentie te handhaven over verduisteringen, staatveranderingen en interacties heen, en onthult dat huidige modellen ondanks algemene vooruitgang in video-interpretatie aanzienlijk worstelen met identiteitsgevoelig redeneren en gebeurtenisordening.

Oorspronkelijke auteurs: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een film bekijkt met een vriend die deze nog nooit heeft gezien. Je vraagt hen: "Is de rode bal verdwenen omdat hij achter de bank is gerold, of heeft hij de kamer volledig verlaten?"

Als je vriend een standaard AI-videomodel is, zouden ze misschien zeggen: "Ik zag een rode bal, en later zag ik een bank, dus hij moet achter de bank zijn." Ze zijn goed in het herkennen van objecten in afzonderlijke momentopnamen. Maar als je vraagt: "Hoe vaak heeft de bal gebouncen voordat hij zich verstopte?" of "Bounce de bal voor of na dat de hond binnenkwam?", raken ze vaak in de war. Ze hebben moeite om het verhaal van die specifieke bal in de loop van de tijd consistent te houden, vooral wanneer hij wordt verstopt of later terugkomt.

Dit artikel introduceert een nieuwe test genaamd TOC-Bench (Temporal Object Consistency Benchmark) om precies te zien hoe goed deze AI's als "filmkijkers" zijn in het volgen van objecten naarmate de tijd vordert.

Het Probleem: De "Amnesische" Kijker

Huidige AI-modellen zijn als een persoon die een uitstekend geheugen heeft voor afzonderlijke foto's, maar lijdt aan amnesie tussen hen in. Ze kunnen je vertellen wat er in een foto te zien is, maar ze verliezen vaak het overzicht van:

  • Identiteit: Is de persoon die na het verstoppen weer verschijnt, dezelfde persoon, of een andere?
  • Continuïteit: Verliet het object de kamer, of werd het slechts geblokkeerd van zicht?
  • Tellen: Hoe vaak sprong de kat op en neer?
  • Volgorde: Breekte het kopje voor of na het blaffen van de hond?

Bestaande tests vragen voornamelijk brede vragen zoals "Wat gebeurt er in deze video?" of "Wie is de hoofdpersoon?". Ze controleren niet of de AI het reisverhaal van een specifiek object door het hele verhaal kan volgen.

De Oplossing: Een Notitieboek van een Detective (TOC-Bench)

De auteurs bouwden een speciale testsuite genaamd TOC-Bench. Denk hierbij aan een "notitieboek van een detective" voor video-AI.

  1. De Ground Truth (De Kaart): Voordat de AI vragen kreeg, gebruikten de onderzoekers speciale tools om een perfecte "kaart" van de video te maken. Ze volgden elk object (zoals een rode bal of een persoon) frame-per-frame, en noteerden precies wanneer ze verschenen, verdwenen, werden verstopt of met anderen interactie hadden.

  2. De Vragen (De Raadsels): Ze genereerden duizenden vragen die uitsluitend gebaseerd waren op deze kaart. Bijvoorbeeld: "Tel hoe vaak de rode bal achter de blauwe doos werd verstopt."

  3. De "Shortcut"-filter (De Valstrik): Dit is het slimme deel. De onderzoekers wilden ervoor zorgen dat de AI niet kon valsspelen. Ze gebruikten een drie-stappenfilter om elke vraag te verwijderen die beantwoord kon worden door:

    • Gewoon de vraag te lezen (taaltrucs).
    • Naar slechts één enkel frame te kijken (trucs met statische afbeeldingen).
    • Naar de frames in willekeurige volgorde te kijken (tijd negeren).

    Als een vraag opgelost kon worden zonder de video in de juiste volgorde te bekijken, werd deze weggegooid. Dit zorgt ervoor dat de AI moet begrijpen hoe de tijd verloopt en wat de geschiedenis van het object is om het antwoord correct te krijgen.

De Resultaten: Een Realiteitscheck

De onderzoekers testten 23 verschillende AI-modellen (zowel gratis als dure) op deze nieuwe test. De resultaten waren verrassend:

  • De Kloof: Mensen scoorden ongeveer 89% correct. Het beste AI-model scoorde slechts 47%.
  • De Zwakke Plekken: De AI's waren vreselijk in:
    • Tellen: "Hoe vaak gebeurde dit?" (Ze gokten vaak op 2 terwijl het 4 was).
    • Volgorde: "Wat gebeurde er eerst?" (Ze verwarden de tijdlijn vaak).
    • Hallucinaties: Als ze werden gevraagd naar een object dat nooit in de video bestond, verzon de AI vaak vol vertrouwen een verhaal erover, in plaats van te zeggen: "Dat object is er niet."

De Grote Conclusie

Het artikel concludeert dat goed zijn in "algemeen videobegrip" (zoals het beschrijven van een scène) niet betekent dat een AI goed is in "temporale objectconsistentie" (het bijhouden van het verhaal van een specifiek object in de loop van de tijd).

Stel het je zo voor: je kunt een vriend hebben die de naam van elke acteur kent en wat ze dragen in een scène, maar als je hen vraagt te volgen wie tijdens een 10-minuten durend ruzie een geheim briefje aan wie heeft doorgegeven, zouden ze falen. TOC-Bench bewijst dat huidige AI-modellen nog steeds "amnesici" zijn als het gaat om het volgen van de specifieke reis van objecten door de tijd.

De auteurs hopen dat deze test ontwikkelaars zal helpen betere AI te bouwen die een verhaal echt kan volgen, en niet alleen momentopnamen herkent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →