← Últimos artigos
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN é um pipeline agênico multiestágio que gera automaticamente dados de raciocínio sobre vídeo estruturados e de alta qualidade com rastros de Cadeia de Pensamento por meio de refinamento hierárquico e adaptação de domínio, impulsionando significativamente o desempenho de Modelos de Linguagem e Visão ajustados finamente em benchmarks de raciocínio sobre eventos complexos.

Autores originais: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Publicado 2026-05-22
📖 4 min de leitura☕ Leitura rápida

Autores originais: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender uma cena complexa de filme, como um acidente de trânsito ou uma briga em um armazém. Se você apenas mostrar o vídeo bruto ao robô e perguntar: "O que aconteceu?", ele pode ficar confuso, perder detalhes ou inventar coisas (alucinar).

O artigo apresenta o MAVEN, um sistema inteligente projetado para atuar como um "roteirista" e "professor" superorganizado para esses robôs. Em vez de apenas alimentar o robô com o vídeo, o MAVEN decompõe o vídeo em uma história estruturada primeiro e, então, usa essa história para criar perguntas de treinamento.

Veja como o MAVEN funciona, explicado por meio de analogias simples:

1. O Processo de "Zoom" em Três Estágios

A maioria dos sistemas tenta descrever um vídeo inteiro de uma só vez, como um turista dando um resumo rápido de férias. Eles frequentemente perdem os pequenos detalhes importantes. O MAVEN faz isso de maneira diferente, usando uma abordagem de "zoom" em três etapas:

  • Estágio 1: A Plano Geral (Contexto Global): Primeiro, ele observa a cena inteira. Está chovendo? É dia ou noite? Como é a rua? Isso define o cenário.
  • Estágio 2: A Linha do Tempo (Eventos Densos): Em seguida, ele cria uma linha do tempo dos principais eventos, anotando exatamente quando as coisas começaram e terminaram.
  • Estágio 3: O Close-Up (Detalhes Finos): Finalmente, ele dá zoom em pequenos clipes curtos para capturar detalhes sutis, como uma pessoa olhando ao redor ou um pequeno objeto sendo pegado.

2. O "Projeto Mestre" (MSTED)

Esta é a parte mais importante. Em vez de pular direto para fazer perguntas, o MAVEN pega todas as três descrições e as combina em um único "Projeto Mestre" perfeito, chamado MSTED.

Pense nisso como um detetive escrevendo um dossiê completo do caso antes de entrevistar uma testemunha.

  • Por que isso importa: Se o robô tentar adivinhar a resposta diretamente do vídeo, ele pode inventar fatos. Mas se o robô for forçado a ler o "Projeto Mestre" primeiro, ele só pode responder com base no que está explicitamente escrito ali. Ele não pode inventar coisas porque o projeto é a única fonte de verdade que ele tem permissão para usar.

3. O "Editor Inteligente" (Adaptação Orientada por Agente)

Geralmente, se você quiser ensinar um robô sobre um novo tópico (como mudar de câmeras de trânsito para segurança de armazém), você precisa reescrever manualmente todas as instruções para o robô. Isso consome muito tempo humano.

O MAVEN possui um "Editor Inteligente" embutido (um agente de IA).

  • Como funciona: Você apenas fornece ao editor uma descrição do novo mundo (por exemplo: "Este é um armazém com prateleiras altas e empilhadeiras") e algumas perguntas de exemplo.
  • A Magia: O editor reescreve automaticamente todas as instruções para os três estágios acima. Ele descobre: "Ah, em um armazém, preciso procurar coisas escondidas sob camisas, não apenas carros passando em vermelho". Ele faz isso sem que um humano precise tocar no código.

4. O "Loop de Controle de Qualidade"

Se humanos revisarem as respostas e encontrarem erros, o MAVEN não diz apenas "ops". Ele age como um detetive investigando sua própria falha.

  • Ele pergunta: "Nós perdemos o detalhe na descrição do vídeo? Ou falhamos em fazer a pergunta certa?"
  • Se a descrição foi ruim, ele corrige os prompts de descrição.
  • Se a estrutura estava errada (por exemplo, os trechos de vídeo eram muito curtos e cortavam um evento ao meio), ele realmente adiciona uma nova etapa ao pipeline para corrigir o problema estrutural.

O Que Eles Conseguiram?

A equipe usou o MAVEN para rotular mais de 5.300 vídeos de trânsito (tanto de câmeras de rua quanto de câmeras de bordo de carros). Eles então usaram esses dados para treinar um modelo robótico chamado Cosmos-Reason2.

  • O Resultado: O robô treinado ficou incrivelmente bom em raciocínio. Em um teste privado, ele superou modelos de ponta como Gemini 2.5 Pro e Gemini 3.1 Flash.
  • A Surpresa: Embora eles o tenham treinado apenas com vídeos de câmeras de rua (CCTV), ele performou tão bem quanto os grandes modelos em testes de câmeras de bordo. Isso sugere que o robô aprendeu como raciocinar sobre eventos, e não apenas memorizou como os carros parecem.
  • Versatilidade: Eles mostraram o sistema funcionando em vídeos de armazém e filmagens de segurança pública (como brigas em túneis) apenas permitindo que o "Editor Inteligente" adaptasse as instruções, provando que ele pode lidar com diferentes mundos sem reengenharia humana.

Em resumo: O MAVEN é um sistema que transforma vídeos bagunçados em uma história perfeita e estruturada, usa essa história para ensinar robôs a pensar logicamente e possui um editor de auto-correção que pode se adaptar automaticamente a novos ambientes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →