← Nieuwste papers
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN is een meerstaps agentische pijplijn die automatisch hoogwaardige, gestructureerde videoredeneringsdata met Chain-of-Thought-sporen genereert via hiërarchische verfijning en domeinaanpassing, waardoor de prestaties van fijngefineerde Vision Language-modellen op complexe gebeurtenisredeneringsbenchmarks aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Gepubliceerd 2026-05-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren hoe een complex filmscène te begrijpen, zoals een verkeersongeval of een gevecht in een magazijn. Als je de robot alleen de ruwe video toont en vraagt: "Wat is er gebeurd?", kan de robot in de war raken, details missen of dingen verzinnen (hallucineren).

Het artikel introduceert MAVEN, een slim systeem dat is ontworpen om te fungeren als een super-georganiseerde "scriptschrijver" en "leraar" voor deze robots. In plaats van de robot alleen de video te geven, breekt MAVEN de video eerst op in een gestructureerd verhaal en gebruikt daarna dat verhaal om trainingsvragen te maken.

Hier is hoe MAVEN werkt, uitgelegd via eenvoudige analogieën:

1. Het driedelige "Inzoomen"-proces

De meeste systemen proberen een hele video in één keer te beschrijven, zoals een toerist die snel een samenvatting geeft van een vakantie. Ze missen vaak de kleine, belangrijke details. MAVEN doet het anders, met een drie-staps "zoom"-aanpak:

  • Fase 1: De wijdopname (Globale context): Eerst kijkt het naar de hele scène. Regent het? Is het dag of nacht? Hoe ziet de straat eruit? Dit zet de toon.
  • Fase 2: De tijdlijn (Dichte gebeurtenissen): Vervolgens maakt het een tijdlijn van de belangrijkste gebeurtenissen, waarbij het exact noteert wanneer dingen begonnen en stopten.
  • Fase 3: De close-up (Fijne details): Tot slot zoomt het in op kleine, korte clips om subtiele details te vangen, zoals iemand die om zich heen kijkt of een klein object wordt opgepakt.

2. De "Meesterblauwdruk" (MSTED)

Dit is het belangrijkste deel. In plaats van direct over te gaan op het stellen van vragen, combineert MAVEN al deze drie beschrijvingen tot één perfecte "Meesterblauwdruk" genaamd de MSTED.

Denk hierbij aan een detective die een compleet dossier schrijft voordat hij een getuige ondervraagt.

  • Waarom dit belangrijk is: Als de robot probeert het antwoord direct uit de video te raden, kan het feiten verzinnen. Maar als de robot gedwongen wordt eerst de "Meesterblauwdruk" te lezen, kan het alleen antwoorden op basis van wat er expliciet in staat. Het kan niets verzinnen, omdat de blauwdruk de enige bron van waarheid is die het mag gebruiken.

3. De "Slimme Redacteur" (Agent-gestuurde aanpassing)

Normaal gesproken moet je, als je een robot over een nieuw onderwerp wilt leren (bijvoorbeeld van verkeerscamera's wisselen naar magazijnbeveiliging), alle instructies voor de robot handmatig herschrijven. Dat kost veel menselijke tijd.

MAVEN heeft een ingebouwde "Slimme Redacteur" (een AI-agent).

  • Hoe het werkt: Je geeft de redacteur gewoon een beschrijving van de nieuwe wereld (bijvoorbeeld: "Dit is een magazijn met hoge planken en vorkheftrucks") en enkele voorbeeldvragen.
  • De magie: De redacteur herschrijft automatisch alle instructies voor de drie bovenstaande fasen. Het bedenkt: "Oh, in een magazijn moet ik zoeken naar dingen die onder shirts verborgen zijn, niet alleen naar auto's die op rood rijden." Dit gebeurt zonder dat een mens de code hoeft aan te raken.

4. De "Kwaliteitscontrole-lus"

Als mensen de antwoorden controleren en fouten vinden, zegt MAVEN niet zomaar "oeps". Het treedt op als een detective die zijn eigen falen onderzoekt.

  • Het vraagt: "Hebben we het detail in de videobeschrijving gemist? Of hebben we gefaald in het stellen van de juiste vraag?"
  • Als de beschrijving slecht was, corrigeert het de beschrijvingsprompts.
  • Als de structuur verkeerd was (bijvoorbeeld: de videofragmenten waren te kort en sneden een gebeurtenis doormidden), voegt het daadwerkelijk een nieuwe stap toe aan de pijplijn om het structurele probleem op te lossen.

Wat hebben ze bereikt?

Het team gebruikte MAVEN om meer dan 5.300 verkeersvideo's te labelen (zowel van straatcamera's als van auto-dashcams). Vervolgens gebruikten ze deze data om een robotmodel te trainen dat Cosmos-Reason2 heet.

  • Het resultaat: De getrainde robot werd ongelooflijk goed in redeneren. Op een privétest versloeg het toonaangevende modellen zoals Gemini 2.5 Pro en Gemini 3.1 Flash.
  • De verrassing: Hoewel ze het alleen trainden op video's van straatcamera's (CCTV), presteerde het net zo goed als de grote modellen bij dashcam-tests. Dit suggereert dat de robot heeft geleerd hoe het moet redeneren over gebeurtenissen, en niet alleen heeft gememoriseerd hoe auto's eruitzien.
  • Veelzijdigheid: Ze lieten zien dat het systeem werkt op magazijnvideo's en beelden van openbare veiligheid (zoals gevechten in tunnels), alleen door de "Slimme Redacteur" de instructies te laten aanpassen. Dit bewijst dat het verschillende werelden aankan zonder menselijke her-engineering.

Kortom: MAVEN is een systeem dat rommelige video omzet in een perfect, gestructureerd verhaal, dat verhaal gebruikt om robots te leren logisch na te denken, en dat beschikt over een zichzelf corrigerende redacteur die zich automatisch kan aanpassen aan nieuwe omgevingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →