From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models
Dit artikel stelt een nieuw raamwerk voor egocentrische actieherkenning voor dat visuele perceptie ontkoppelt van symbolische redenering door video's om te zetten in Temporale Actiegrafen, waarbij wordt aangetoond dat het inzetten van Vision-Language Modellen als symbolische redeneerders via in-context leren op gestructureerde graafrepresentaties de directe pixelgebaseerde inferentie over diverse modelfamilies heen aanzienlijk overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, goed onderlegde bibliothecaris (de AI) probeert te leren hoe hij moet herkennen wat een persoon aan het doen is in een video die vanuit hun eigen ogen is opgenomen (zoals een GoPro op een hoofd). De video zit vol met handen die bekers pakken, brood snijden en koffie inschenken.
Het probleem is dat als je de bibliothecaris alleen de ruwe videoframes laat zien (de plaatjes), hij overweldigd raakt. Hij is geweldig in het lezen van boeken en het begrijpen van verhalen, maar hij is niet erg goed in het kijken naar films. Hij ziet bijvoorbeeld een hand die een mes vasthoudt en een brood, maar hij worstelt ermee om te bepalen of de persoon het brood aan het snijden is of het gewoon stil aan het vasthouden. Hij raakt in de war door de kleine, snelle veranderingen tussen de ene seconde en de volgende.
De oplossing van het artikel: "TAG" (Temporal Action Graphs)
De auteurs stellen een slimme workaround voor. In plaats van de bibliothecaris de hele film direct te laten kijken, treden zij op als vertaler. Ze breken de video af in een gestructureerd "verhaal" of een "recept" dat de bibliothecaris gemakkelijk kan lezen. Ze noemen dit proces TAG.
Zo werkt het, stap voor stap, met behulp van een analogie:
1. De "Snapshot" Vertaler (Visuele Perceptie)
Stel je voor dat de video een lange, versnelde film is. De auteurs laten niet alles tegelijk zien. In plaats daarvan hakken ze de film in kleine, overlappende fragmenten (zo met 4 frames tegelijk).
- De Taak: Ze vragen de AI om naar deze kleine fragmenten te kijken en een eenvoudige zin te schrijven die beschrijft wat er gebeurt.
- De Analogie: Het is als een bewaker die een beveiligingscamera bekijkt. In plaats van de hele dag te proberen te onthouden, schrijft de bewaker elke paar seconden een korte notitie: "Hand reikt naar beker," dan "Hand grijpt beker," dan "Hand tilt beker op."
2. Notities omzetten in een "Recept" (Symbolische Redenering)
Zodra de AI deze zinnen heeft geschreven, nemen de auteurs die zinnen en zetten ze om in een strikte, gestructureerde lijst van feiten, een Graph.
- De Taak: Ze zetten de zin "Hand grijpt beker" om in een formeel triplet:
(Hand) --[grijpt]--> (Beker). - De Analogie: Denk hierbij aan het omzetten van een slordig handgeschreven boodschappenlijstje in een nette, georganiseerde spreadsheet. De slordige lijst zegt: "Haal wat melk, misschien eieren, oh en die rode appel ook." De spreadsheet zegt:
Item: Melk, Actie: Kopen.Item: Appel, Kleur: Rood, Actie: Kopen. - Waarom dit helpt: De AI is een meester in het lezen en begrijpen van deze gestructureerde lijsten (spreadsheets), omdat hij getraind is op miljarden tekstdocumenten. Hij is veel beter in staat om te redeneren over "Als A B grijpt, dan gebeurt C" wanneer dit als tekst is geschreven, dan wanneer het verborgen zit in een wazige videopixel.
3. De "Laat zien en vertel"-les (In-Context Learning)
Dit is de grootste truc van het artikel. Normaal gesproken, als je een AI een nieuwe taak wilt leren, moet je hem opnieuw trainen (wat duur en traag is). Maar omdat de video nu slechts een tekstlijst is, gebruiken de auteurs In-Context Learning.
- De Taak: Voordat ze de AI vragen de actie voor een nieuwe video te raden, laten ze hem een paar voorbeelden zien van andere video's die al zijn omgezet in deze tekstlijsten, samen met de juiste antwoorden.
- De Analogie: Stel je voor dat je een toets maakt. In plaats van je alleen de vraag te geven, fluistert de leraar: "Herinner je die keer dat we iemand water zagen schenken? Hier is de lijst met feiten voor dat. Kijk nu naar deze nieuwe lijst met feiten. Wat zijn ze aan het doen?"
- Het Resultaat: Het artikel laat zien dat het tonen van slechts één of twee van deze tekstgebaseerde voorbeelden de AI aanzienlijk slimmer maakt in het raden van de actie. Als ze de AI de ruwe video-voorbeelden hadden getoond voor deze "Laat zien en vertel"-methode, zou het geheugen van de AI direct vol zitten omdat video's enorm groot zijn. Tekstlijsten zijn klein, waardoor de AI veel voorbeelden gemakkelijk kan onthouden.
Wat hebben ze ontdekt?
De auteurs hebben dit getest op twee beroemde video-datasets (EGTEA en Epic-Kitchens) met behulp van 11 verschillende AI-modellen van diverse groottes.
- De "Vertaler" wint: In bijna alle gevallen presteerde de AI beter wanneer hij de tekstlijst (de graph) las dan wanneer hij de ruwe video probeerde te bekijken.
- De "Eén Voorbeeld" Boost: Het toevoegen van slechts één of twee tekstvoorbeelden aan de prompt maakte de AI nog beter, en versloeg vaak de ruwe video-aanpak met een grote marge.
- De Beperking: Het systeem is niet perfect. Als de eerste stap (de bewaker die de notities schrijft) een fout maakt — zoals zeggen "snijden" terwijl de persoon eigenlijk aan het "wassen" is — dan zal het uiteindelijke antwoord fout zijn. Het systeem is slechts zo goed als de beschrijving die het creëert.
De Kernboodschap
Het artikel betoogt dat huidige AI-modellen als briljante lezers zijn die slecht zijn in het kijken naar films. In plaats van de AI te dwingen de film te kijken, moeten we de film vertalen naar een verhaal dat zij kunnen lezen. Door de video om te zetten in een gestructureerde tekstuele "graph", ontsluiten we het natuurlijke vermogen van de AI om te redeneren, waardoor het complexe acties zoals "snijden", "schenken" of "grijpen" kan begrijpen zonder dat het opnieuw getraind hoeft te worden op miljoenen uren aan video.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.