← Derniers articles
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN est un pipeline agentique multi-étapes qui génère automatiquement des données de raisonnement vidéo structurées et de haute qualité avec des traces de chaîne de pensée grâce à un raffinement hiérarchique et une adaptation de domaine, améliorant considérablement les performances des modèles de langage visuel affinés sur des benchmarks de raisonnement d'événements complexes.

Auteurs originaux : Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot comment comprendre une scène de film complexe, comme un accident de la circulation ou une bagarre dans un entrepôt. Si vous montrez simplement au robot la vidéo brute et lui demandez : « Que s'est-il passé ? », il risque de se perdre, de manquer des détails ou d'inventer des choses (halluciner).

L'article présente MAVEN, un système intelligent conçu pour agir comme un « scénariste » et un « enseignant » ultra-organisés pour ces robots. Au lieu de simplement fournir la vidéo au robot, MAVEN décompose d'abord la vidéo en une histoire structurée, puis ensuite utilise cette histoire pour créer des questions d'entraînement.

Voici comment MAVEN fonctionne, expliqué par des analogies simples :

1. Le processus « Zoom » en trois étapes

La plupart des systèmes tentent de décrire une vidéo entière d'un seul coup, comme un touriste donnant un résumé rapide de ses vacances. Ils manquent souvent les petits détails importants. MAVEN procède différemment, en utilisant une approche de « zoom » en trois étapes :

  • Étape 1 : Le plan large (Contexte global) : D'abord, il observe l'ensemble de la scène. Pleut-il ? Est-ce le jour ou la nuit ? À quoi ressemble la rue ? Cela pose le décor.
  • Étape 2 : La chronologie (Événements denses) : Ensuite, il crée une chronologie des événements principaux, notant exactement quand les choses ont commencé et se sont arrêtées.
  • Étape 3 : Le gros plan (Détails fins) : Enfin, il zoome sur de tout petits clips courts pour saisir des détails subtils, comme une personne jetant un coup d'œil autour d'elle ou un petit objet étant ramassé.

2. Le « Plan Maître » (MSTED)

C'est la partie la plus importante. Au lieu de passer directement à la formulation de questions, MAVEN prend ces trois descriptions et les combine en un seul, parfait « Plan Maître » appelé MSTED.

Pensez-y comme un détective rédigeant un dossier complet avant d'interroger un témoin.

  • Pourquoi c'est important : Si le robot tente de deviner la réponse directement à partir de la vidéo, il risque d'inventer des faits. Mais si le robot est contraint de lire le « Plan Maître » d'abord, il ne peut répondre que sur la base de ce qui est explicitement écrit là. Il ne peut pas inventer de choses car le plan est la seule source de vérité qu'il a le droit d'utiliser.

3. Le « Éditeur Intelligent » (Adaptation pilotée par agent)

Habituellement, si vous voulez enseigner à un robot un nouveau sujet (comme passer des caméras de circulation à la sécurité d'entrepôt), vous devez réécrire manuellement toutes les instructions pour le robot. Cela prend beaucoup de temps humain.

MAVEN possède un « Éditeur Intelligent » intégré (un agent IA).

  • Comment ça marche : Vous donnez simplement à l'éditeur une description du nouveau monde (par exemple : « C'est un entrepôt avec des étagères hautes et des chariots élévateurs ») et quelques exemples de questions.
  • La Magie : L'éditeur réécrit automatiquement toutes les instructions pour les trois étapes ci-dessus. Il comprend : « Ah, dans un entrepôt, je dois chercher des choses cachées sous des chemises, pas seulement des voitures roulant à contre-sens ». Il fait cela sans qu'un humain ait besoin de toucher au code.

4. La « Boucle de Contrôle Qualité »

Si des humains examinent les réponses et trouvent des erreurs, MAVEN ne dit pas simplement « oups ». Il agit comme un détective enquêtant sur sa propre défaillance.

  • Il se demande : « Avons-nous manqué le détail dans la description de la vidéo ? Ou avons-nous échoué à poser la bonne question ? »
  • Si la description était mauvaise, il corrige les invites de description.
  • Si la structure était incorrecte (par exemple, si les segments vidéo étaient trop courts et coupaient un événement en deux), il ajoute réellement une nouvelle étape au pipeline pour résoudre le problème structurel.

Qu'ont-ils accompli ?

L'équipe a utilisé MAVEN pour étiqueter plus de 5 300 vidéos de circulation (provenant à la fois de caméras de rue et de caméras de bord). Ils ont ensuite utilisé ces données pour entraîner un modèle robotique appelé Cosmos-Reason2.

  • Le Résultat : Le robot entraîné est devenu incroyablement doué pour le raisonnement. Lors d'un test privé, il a battu des modèles de premier plan comme Gemini 2.5 Pro et Gemini 3.1 Flash.
  • La Surprise : Même s'ils ne l'ont entraîné que sur des vidéos de caméras de rue (CCTV), il a performé aussi bien que les grands modèles sur les tests de caméras de bord. Cela suggère que le robot a appris comment raisonner sur les événements, et non pas seulement à mémoriser à quoi ressemblent les voitures.
  • Polyvalence : Ils ont montré le système fonctionnant sur des vidéos d'entrepôt et des images de sécurité publique (comme des bagarres dans des tunnels) simplement en laissant l'« Éditeur Intelligent » adapter les instructions, prouvant qu'il peut gérer différents mondes sans réingénierie humaine.

En bref : MAVEN est un système qui transforme une vidéo désordonnée en une histoire parfaite et structurée, utilise cette histoire pour enseigner aux robots comment penser logiquement, et dispose d'un éditeur auto-correcteur capable de s'adapter automatiquement à de nouveaux environnements.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →