MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
MAVEN ist eine mehrstufige, agentenbasierte Pipeline, die durch hierarchische Verfeinerung und Domänenanpassung automatisch hochwertige, strukturierte Video-Reasoning-Daten mit Chain-of-Thought-Spuren generiert und dadurch die Leistung feinabgestimmter Vision-Language-Modelle auf Benchmarks für komplexe Ereignisreasoning erheblich steigert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen einem Roboter beizubringen, eine komplexe Filmszene zu verstehen, wie etwa einen Verkehrsunfall oder einen Kampf in einem Lagerhaus. Wenn Sie dem Roboter lediglich das Rohvideo zeigen und fragen: „Was ist passiert?", könnte er verwirrt sein, Details übersehen oder sich Dinge ausdenken (halluzinieren).
Die Arbeit stellt MAVEN vor, ein intelligentes System, das als super-organisierter „Drehbuchautor" und „Lehrer" für diese Roboter fungiert. Anstatt dem Roboter einfach nur das Video zu geben, zerlegt MAVEN das Video zunächst in eine strukturierte Geschichte und nutzt diese Geschichte dann, um Trainingsfragen zu erstellen.
So funktioniert MAVEN, erklärt durch einfache Analogien:
1. Der dreistufige „Hineinzoom"-Prozess
Die meisten Systeme versuchen, ein ganzes Video auf einmal zu beschreiben, wie ein Tourist, der einen schnellen Urlaubsrückblick gibt. Oft werden dabei kleine, wichtige Details übersehen. MAVEN geht anders vor und verwendet einen dreistufigen „Zoom"-Ansatz:
- Stufe 1: Die Totale (Globaler Kontext): Zuerst betrachtet es die gesamte Szene. Regnet es? Ist es Tag oder Nacht? Wie sieht die Straße aus? Dies setzt den Rahmen.
- Stufe 2: Der Zeitstrahl (Dichte Ereignisse): Als Nächstes erstellt es einen Zeitstrahl der Hauptereignisse und notiert genau, wann Dinge begannen und endeten.
- Stufe 3: Die Nahaufnahme (Feine Details): Schließlich zoomt es auf winzige, kurze Clips, um subtile Details zu erfassen, wie etwa einen Blick, den eine Person umherwirft, oder ein kleines Objekt, das aufgehoben wird.
2. Der „Master-Blueprint" (MSTED)
Dies ist der wichtigste Teil. Anstatt direkt Fragen zu stellen, kombiniert MAVEN alle drei dieser Beschreibungen zu einem einzigen, perfekten „Master-Blueprint", der MSTED genannt wird.
Stellen Sie sich dies wie einen Detektiv vor, der vor der Befragung eines Zeugen eine vollständige Akte erstellt.
- Warum das wichtig ist: Wenn der Roboter versucht, die Antwort direkt aus dem Video zu erraten, könnte er Fakten erfinden. Wenn der Roboter jedoch gezwungen wird, zuerst den „Master-Blueprint" zu lesen, kann er nur basierend auf dem antworten, was dort explizit geschrieben steht. Er kann sich nichts ausdenken, da der Blueprint die einzige erlaubte Quelle der Wahrheit ist.
3. Der „Smart Editor" (Agentengesteuerte Anpassung)
Normalerweise müssen Sie, wenn Sie einem Roboter ein neues Thema beibringen wollen (etwa den Wechsel von Verkehrskameras zu Lagerhausüberwachung), alle Anweisungen für den Roboter manuell umschreiben. Das kostet viel menschliche Zeit.
MAVEN verfügt über einen integrierten „Smart Editor" (ein KI-Agent).
- Wie es funktioniert: Sie geben dem Editor einfach eine Beschreibung der neuen Welt (z. B. „Dies ist ein Lagerhaus mit hohen Regalen und Gabelstaplern") sowie einige Beispiel Fragen.
- Die Magie: Der Editor schreibt automatisch alle Anweisungen für die oben genannten drei Stufen um. Er erkennt: „Ah, in einem Lagerhaus muss ich nach Dingen suchen, die unter Hemden versteckt sind, nicht nur nach Autos, die bei Rot fahren." Dies geschieht, ohne dass ein Mensch den Code anfassen muss.
4. Die „Qualitätskontroll-Schleife"
Wenn Menschen die Antworten überprüfen und Fehler finden, sagt MAVEN nicht einfach „oops". Es agiert wie ein Detektiv, der sein eigenes Versagen untersucht.
- Es fragt: „Haben wir das Detail in der Videobeschreibung übersehen? Oder haben wir versagt, die richtige Frage zu stellen?"
- Wenn die Beschreibung schlecht war, korrigiert es die Beschreibungs-Prompts.
- Wenn die Struktur falsch war (z. B. waren die Videosegmente zu kurz und schnitten ein Ereignis in zwei Hälften), fügt es tatsächlich einen neuen Schritt zur Pipeline hinzu, um das strukturelle Problem zu beheben.
Was wurde erreicht?
Das Team nutzte MAVEN, um über 5.300 Verkehrsvideos (sowohl von Straßenkameras als auch von Fahrzeug-Dashcams) zu labeln. Anschließend nutzten sie diese Daten, um ein Robotermodell namens Cosmos-Reason2 zu trainieren.
- Das Ergebnis: Der trainierte Roboter wurde unglaublich gut im logischen Schließen. Bei einem privaten Test schlug er Spitzenmodelle wie Gemini 2.5 Pro und Gemini 3.1 Flash.
- Die Überraschung: Obwohl es nur mit Videos von Straßenkameras (CCTV) trainiert wurde, schnitt es bei Dashcam-Tests genauso gut ab wie die großen Modelle. Dies deutet darauf hin, dass der Roboter gelernt hat, wie man über Ereignisse logisch schließt, und nicht nur, wie Autos aussehen, auswendig gelernt hat.
- Vielseitigkeit: Sie zeigten, dass das System auf Lagerhausvideos und Aufnahmen zur öffentlichen Sicherheit (wie Kämpfe in Tunneln) funktioniert, indem sie einfach den „Smart Editor" die Anweisungen anpassen ließen. Dies beweist, dass es verschiedene Welten ohne menschliche Neukonfiguration bewältigen kann.
Kurz gesagt: MAVEN ist ein System, das unordentliche Videos in eine perfekte, strukturierte Geschichte verwandelt, diese Geschichte nutzt, um Robotern beizubringen, logisch zu denken, und über einen selbstkorrigierenden Editor verfügt, der sich automatisch an neue Umgebungen anpassen kann.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.