MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
MAVEN es una tubería agéntica multi-etapa que genera automáticamente datos de razonamiento visual de alta calidad y estructurados con trazas de Cadena de Pensamiento mediante refinamiento jerárquico y adaptación de dominio, potenciando significativamente el rendimiento de los Modelos de Lenguaje Visual ajustados finamente en benchmarks de razonamiento de eventos complejos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot a comprender una escena de película compleja, como un accidente de tráfico o una pelea en un almacén. Si solo le muestras al robot el video crudo y le preguntas: "¿Qué pasó?", podría confundirse, perder detalles o inventar cosas (alucinar).
El artículo presenta MAVEN, un sistema inteligente diseñado para actuar como un "guionista" y "profesor" súper organizado para estos robots. En lugar de simplemente alimentar al robot con el video, MAVEN descompone el video en una historia estructurada primero, y luego utiliza esa historia para crear preguntas de entrenamiento.
Así es como funciona MAVEN, explicado mediante analogías simples:
1. El proceso de "acercamiento" en tres etapas
La mayoría de los sistemas intentan describir un video completo de una sola vez, como un turista dando un resumen rápido de unas vacaciones. A menudo se pierden los detalles pequeños e importantes. MAVEN lo hace de manera diferente, utilizando un enfoque de "acercamiento" en tres pasos:
- Etapa 1: La toma amplia (Contexto global): Primero, observa toda la escena. ¿Está lloviendo? ¿Es de día o de noche? ¿Cómo se ve la calle? Esto establece el escenario.
- Etapa 2: La línea de tiempo (Eventos densos): A continuación, crea una línea de tiempo de los eventos principales, anotando exactamente cuándo comenzaron y terminaron las cosas.
- Etapa 3: El primer plano (Detalles finos): Finalmente, hace un acercamiento a pequeños clips breves para captar detalles sutiles, como una persona mirando a su alrededor o un objeto pequeño siendo recogido.
2. El "Plano Maestro" (MSTED)
Esta es la parte más importante. En lugar de saltar directamente a hacer preguntas, MAVEN toma las tres descripciones y las combina en un único "Plano Maestro" perfecto llamado MSTED.
Piensa en esto como un detective que escribe un expediente completo del caso antes de entrevistar a un testigo.
- Por qué importa: Si el robot intenta adivinar la respuesta directamente desde el video, podría inventar hechos. Pero si se obliga al robot a leer el "Plano Maestro" primero, solo puede responder basándose en lo que está escrito explícitamente allí. No puede inventar cosas porque el plano es la única fuente de verdad que se le permite usar.
3. El "Editor Inteligente" (Adaptación impulsada por agentes)
Por lo general, si quieres enseñarle a un robot sobre un tema nuevo (como cambiar de cámaras de tráfico a seguridad de almacenes), tienes que reescribir manualmente todas las instrucciones para el robot. Eso requiere mucho tiempo humano.
MAVEN tiene un "Editor Inteligente" integrado (un agente de IA).
- Cómo funciona: Solo le das al editor una descripción del nuevo mundo (por ejemplo, "Este es un almacén con estanterías altas y montacargas") y algunas preguntas de ejemplo.
- La Magia: El editor reescribe automáticamente todas las instrucciones para las tres etapas anteriores. Deduce: "Ah, en un almacén, necesito buscar cosas ocultas bajo camisas, no solo coches saltándose los semáforos en rojo". Lo hace sin que un humano necesite tocar el código.
4. El "Bucle de Control de Calidad"
Si los humanos revisan las respuestas y encuentran errores, MAVEN no solo dice "ups". Actúa como un detective investigando su propio fallo.
- Pregunta: "¿Perdimos el detalle en la descripción del video? ¿O fallamos al hacer la pregunta correcta?"
- Si la descripción era mala, corrige las indicaciones de descripción.
- Si la estructura estaba mal (por ejemplo, los fragmentos de video eran demasiado cortos y cortaban un evento por la mitad), realmente agrega un nuevo paso al flujo de trabajo para solucionar el problema estructural.
¿Qué lograron?
El equipo utilizó MAVEN para etiquetar más de 5.300 videos de tráfico (tanto de cámaras de calle como de cámaras de salpicadura de coches). Luego utilizaron estos datos para entrenar un modelo de robot llamado Cosmos-Reason2.
- El Resultado: El robot entrenado se volvió increíblemente bueno razonando. En una prueba privada, superó a modelos de primer nivel como Gemini 2.5 Pro y Gemini 3.1 Flash.
- La Sorpresa: Aunque solo lo entrenaron con videos de cámaras de calle (CCTV), funcionó tan bien como los grandes modelos en las pruebas de cámaras de salpicadura. Esto sugiere que el robot aprendió cómo razonar sobre los eventos, no solo a memorizar cómo se ven los coches.
- Versatilidad: Mostraron que el sistema funciona con videos de almacenes y grabaciones de seguridad pública (como peleas en túneles) simplemente permitiendo que el "Editor Inteligente" adapte las instrucciones, demostrando que puede manejar diferentes mundos sin necesidad de reingeniería humana.
En resumen: MAVEN es un sistema que convierte videos desordenados en una historia perfecta y estructurada, utiliza esa historia para enseñar a los robots a pensar lógicamente, y cuenta con un editor autocorrector que puede adaptarse automáticamente a nuevos entornos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.