ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
ViSAGE is een multimodale agentische geheugenframework die het begrip van langdurige video's verbetert door het construeren van zelfcorrigerende, entiteitscentrische geheugens via cross-modale binding, bidirectionele verfijning en multi-agent cross-verificatie om identiteitsverwarring en hallucinaties te voorkomen, waarbij een nauwkeurigheidsverbetering van 5,9% ten opzichte van de huidige state-of-the-art baselines wordt bereikt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een mysterie probeert op te lossen dat een hele film beslaat, maar dat je slechts één bevroren frame tegelijk mag bekijken, en dat je geheugen elke paar minuten wordt gewist. Dit is de dagelijkse strijd van moderne kunstmatige intelligentie wanneer zij lange video's proberen te begrijpen. De slimste AI-modellen van vandaag zijn als briljante detectives die één pagina van een boek perfect kunnen lezen, maar als je ze een film van 40 minuten geeft, raken ze overweldigd. Ze proberen het hele verhaal in een piepklein mentaal doosje te proppen, of ze hakken de film in kleine, geïsoleerde stukjes. Het probleem? Wanneer je een verhaal in stukken hakt, verlies je de verbindingen. Je vergeet wie de personages zijn, je haalt hun namen door elkaar en je begint wild te gokken over wat er in de eerste scène gebeurde omdat je de aanwijzingen uit de laatste scène niet meer kunt herinneren.
Dit is waar het vakgebied van "long-form video understanding" (begrip van langere video's) om in beeld komt. Wetenschappers proberen computers te leren om uren aan video te kijken, details te onthouden en ingewikkelde vragen te beantwoorden over wat er is gebeurd, wie het heeft gedaan en waarom. Het doel is om een AI te bouwen die niet alleen pixels ziet, maar een verhaal begrijpt, waarbij mensen en objecten vanaf de openingsscène tot aan de aftiteling in de gaten worden gehouden. Maar huidige methoden falen vaak omdat ze te agressief zijn in het samenvatten van de video, waardoor de kleine details die nodig zijn om de één van de ander te onderscheiden verloren gaan, of ze raken gestrand in een lus waarin ze een fout van vijf minuten geleden niet kunnen herstellen omdat ze alleen naar het "nu" kijken.
Maak kennis met ViSAGE, een nieuw systeem ontworpen door onderzoekers van Zhejiang University en Xidian University dat fungeert als een superkrachtige, zelfcorrigerende geheugenfunctie voor AI-agenten. Denk aan het standaard AI-geheugen als een slordig notitieblok waarin je aantekeningen maakt terwijl je een film kijkt, maar zodra je de pagina omslaat, kun je niet teruggaan om een foute gok te herstellen. Als je in de eerste scène denkt dat een personage "Mario" is, maar later ontdekt dat het eigenlijk "Emma" is, blijft een normaal systeem hen voor altijd Mario noemen, wat leidt tot verwarde en foutieve antwoorden. ViSAGE is echter als een detective die een meesterlijst van verdachten en een tijdlijn van gebeurtenissen bijhoudt. Wanneer er een nieuwe aanwijzing binnenkomt — zoals het horen van een naam in een gesprek rond de 30 minuten — archiveert het deze niet alleen; het gaat terug en herschrijft de aantekeningen van het begin om ervoor te zorgen dat het hele verhaal klopt.
De onderzoekers ontdekten dat door dit "zelfcorrigerende" systeem te bouwen, de AI eindelijk de verwarring van lange video's aan kon. Ze creëerden een raamwerk dat het "wat er gebeurde" (de gebeurtenissen) scheidt van het "wie het deed" (de personages). Wanneer de AI een persoon ziet maar de naam nog niet kent, geeft het diegene een tijdelijk label. Later, wanneer de video de naam onthult, gebruikt ViSAGE een "backward update" om onmiddellijk alle eerdere aantekeningen te corrigeren, zodat elke actie correct aan de juiste persoon wordt gekoppeld. Het gebruikt ook een team van "agents" om het werk te controleren. Als de AI niet zeker is over een antwoord, is het in plaats van een verhaal te verzinnen (wat "hallucineren" wordt genoemd), geprogrammeerd om te zeggen: "Ik weet het niet", wat veel veiliger en betrouwbaarder is.
In hun tests presteerde deze nieuwe aanpak aanzienlijk beter dan de voorheen beste methoden. Op een reeks uitdagende tests voor lange video's verbeterde ViSAGE de nauwkeurigheid met 5,9% ten opzichte van het sterkste bestaande systeem. Specifiek scoorde het 45,5% op robot-gerelateerde videotaken, 58,4% op web-gebaseerde videotaken, en een enorme 79,1% op de Video-MME-long benchmark. De onderzoekers lieten zien dat door het herstellen van de geheugenfouten, de AI niet alleen meer vragen goed beantwoordde, maar ook minder gevaarlijke fouten maakte, zoals het door elkaar halen van wie wat deed, en veel beter werd in het toegeven wanneer het informatie miste. Dit suggereert dat voor AI om werkelijk lange verhalen te begrijpen, een geheugen nodig is dat kan groeien, veranderen en zichzelf kan corrigeren, in plaats van een statische lijst met feiten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.