← Nieuwste papers
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

Het artikel introduceert EgoCoT-Bench, een fijnmazige benchmark voor egocentrische video's met 3.172 verifieerbare vraag-antwoordparen met expliciete stap-voor-stap rationale-annotaties, ontworpen om de gefundeerde, op handelingen gerichte redeneercapaciteiten van multimodale grote taalmodellen te evalueren en te verbeteren.

Oorspronkelijke auteurs: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een video bekijkt van iemand die kookt, vanuit hun eigen perspectief (alsof ze een GoPro op hun voorhoofd dragen). Je ziet handen die een mes, een pan en een lepel grijpen. Stel je nu voor dat je een superslimme AI-robot vraagt: "Waar staat het zoutvaatje nadat de kok het neerzet?"

De robot zou kunnen zeggen: "Het staat op het aanrecht." En dat zou juist kunnen zijn! Maar hier zit de adder onder het gras: Heeft de robot het zoutvaatje daadwerkelijk zien verplaatsen naar die plek, of heeft het gewoon geraden?

Dit is het probleem dat het artikel EgoCoT-Bench probeert op te lossen.

Het Probleem: De "Gelukkige Gok"-robot

Op dit moment zijn veel AI-modellen als studenten die het antwoordboekje uit het hoofd hebben geleerd, maar de wiskunde niet begrijpen. Ze kunnen naar een video kijken en het juiste antwoord geven op een vraag, maar hun uitleg (hun "redenering") kan verzonnen, inconsistent zijn, of gebaseerd op dingen die in de video niet echt hebben plaatsgevonden.

In de wereld van "Egocentrische" (Eerste-Persoon) video's is dit extra moeilijk omdat:

  • Handen het zicht vaak blokkeren.
  • Voorwerpen verdwijnen en weer verschijnen.
  • De camera schudt en wild beweegt.

Bestaande tests voor AI controleren alleen of het eindantwoord correct is. Dit artikel zegt: "Dat is niet genoeg! We moeten controleren of het verhaal van de AI over wat er gebeurd is, daadwerkelijk overeenkomt met de video."

De Oplossing: EgoCoT-Bench (De "Waarheidsdetective"-test)

De auteurs hebben een nieuwe, supergedetailleerde test ontwikkeld genaamd EgoCoT-Bench. Denk hierbij aan een "rijexamen" voor AI, maar in plaats van een auto te besturen, moet de AI een video begrijpen van iemand die taken uitvoert met hun handen.

Hoe ze het hebben opgebouwd:

  1. De Kaart (STSG): In plaats van alleen naar de video te kijken, hebben ze eerst een "kaart" van de video gemaakt. Deze kaart traceert elk voorwerp, elke hand en elke seconde tijd, als een gedetailleerd script van een toneelstuk.
  2. De Vragen: Ze hebben deze kaart gebruikt om 3.172 vragen te maken. Dit zijn niet zomaar vragen als "Welke kleur heeft de kop?". Het zijn lastige vragen zoals: "De hand pakte het blauwe kopje om 1:00, daarna het rode kopje om 1:05. Welk kopje lag om 1:03 op tafel?"
  3. Het Bewijs: Elke vraag wordt geleverd met een "bonnetje". De test bevat de exacte tijd, de locatie en het visuele bewijs dat nodig is om het antwoord te geven. Op deze manier kunnen we controleren of de redenering van de AI overeenkomt met het bonnetje.

De 4 Soorten Uitdagingen

De test is verdeeld in vier hoofdcategorieën, als levels in een videospel:

  1. De Actie Opmerken (Grounding & Perceptie): "Wat raakt de hand op dit moment?" (Kan de AI zien wat er nu gebeurt?)
  2. De Tijdmachine (Retrospectie): "Waar was de lepel voordat de hand hem oppakte?" (Kan de AI het verleden onthouden?)
  3. De Waarzegger (Voorspelling & Causale Inferentie): "De hand houdt het deksel vast. Wat gaat er als volgende gebeuren?" of "Waarom is de koffie gemorst?" (Kan de AI de toekomst raden of de oorzaak verklaren?)
  4. Het Grote Geheel (Hoogwaardige Redenering): "Is de kok klaar met het maken van het broodje, of is er nog één stap nodig?" (Kan de AI het algehele doel begrijpen?)

Wat Er Gebeurde Toen Ze De AI Testten

De auteurs namen de slimste beschikbare AI-modellen (zoals GPT-5, Qwen en LLaVA) en legden ze deze test voor. Hier is wat ze ontdekten:

  • Het "Gelukkige Gok"-Fenomeen: Veel modellen kregen het juiste antwoord (bijvoorbeeld: "Het flesje staat op het plankje"), maar toen ze om waarom werden gevraagd, was hun uitleg verkeerd. Ze zouden kunnen zeggen: "Omdat ik een flesje zag", terwijl de video eigenlijk liet zien dat het flesje na het tijdstip van de vraag werd verplaatst.
  • Het Kloof: Zelfs de beste AI-modellen scoorden ongeveer 60-70% correct. Mensen scoorden bijna 96%. Dit betekent dat er nog steeds een enorme kloof bestaat tussen menselijk begrip en AI-begrip als het gaat om het kijken naar handen die dingen verplaatsen.
  • Het Moeilijkste Deel: De AI was goed in het raden van wat er als volgende gebeurt, maar slecht in het volgen van de geschiedenis van een voorwerp (zoals het volgen van een specifiek label op een shirt terwijl het wordt uitgetrokken).

De Conclusie

Het artikel introduceert een nieuwe manier om AI te beoordelen. In plaats van alleen een cijfer te geven op basis van het eindantwoord, beoordelen ze nu ook de redenering.

Ze ontdekten dat veel AI's "schijnbaar correct" zijn: ze krijgen het juiste antwoord om de verkeerde redenen. Dit is gevaarlijk omdat, als je een AI vraagt om een robot in een keuken te helpen, en de AI het juiste antwoord raadt maar een verkeerd idee heeft over waar het mes zich bevindt, de robot misschien iets snijdt dat hij niet zou moeten snijden.

EgoCoT-Bench is een hulpmiddel om AI te dwingen te stoppen met gokken en te beginnen met aandacht te besteden aan het daadwerkelijke bewijs in de video, stap voor stap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →