← Últimos artículos
💬 NLP

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL es un modelo fundacional de streaming eficiente y nativo de códec que aprovecha un tokenizador consciente del movimiento y una arquitectura de sistema dual para lograr una comprensión multimodal en tiempo real con un consumo de tokens significativamente reducido e inferencia más rápida, al tiempo que iguala o supera a modelos de vanguardia más grandes tanto en tareas de razonamiento estático como dinámico.

Autores originales: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, J
Publicado 2026-07-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo un partido de fútbol en vivo en tu teléfono. La cámara recorre el campo, la multitud ruge y los jugadores corren de un lado a otro. Ahora, imagina a un robot superinteligente tratando de entender ese juego en tiempo real. La mayoría de los robots actuales son como un estudiante que insiste en leer cada palabra de un libro de texto de 500 páginas, incluso las partes que solo dicen "la hierba es verde" por centésima vez. Se quedan estancados en las partes aburridas y estáticas del video, desperdiciando toda su capacidad cerebral y tiempo, mientras se pierden el gol de verdad. Esto es un poco una paradość: son genios resolviendo acertijos complejos pero terribles simplemente observando una escena en movimiento de manera eficiente.

Este artículo, escrito por el equipo de Microsoft Mage, presenta un nuevo tipo de cerebro robótico llamado Mage-VL. Está diseñado para romper esta regla actuando más como un ojo humano. En lugar de mirar cada fotograma de un video, Mage-VL solo presta atención a las partes que realmente están cambiando o moviéndose. Piensa en ello como un guardia de seguridad que solo mira los sensores de movimiento; si nada se mueve, no desperdicia energía mirando el pasillo vacío. Al hacer esto, el robot puede entender videos mucho más rápido y con menos potencia de cómputo, permitiéndole charlar contigo sobre un partido en vivo a medida que sucede, en lugar de esperar hasta que termine el juego para dar un resumen.

La magia de observar de forma "nativa de códec"

El ingrediente secreto de Mage-VL es algo que los autores llaman un enfoque nativo de códec. En el mundo de la transmisión de video (como cuando ves Netflix o YouTube), las computadoras usan un truco llamado "compresión" para ahorrar espacio. No envían cada fotograma de un video; envían una imagen completa (un "I-frame") y luego solo envían los pequeños fragmentos que cambian durante los siguientes segundos (los "P-frames"). Así es como tu teléfono puede transmitir una película sin consumir todos tus datos.

Mage-VL fue construido para hablar este lenguaje de forma nativa. En lugar de forzar el video en una cuadrícula rígida de imágenes estáticas, utiliza las mismas señales de movimiento que la compresión de video usa para decidir qué es importante. Si un jugador está corriendo, el robot hace zoom en el jugador. Si la multitud en el fondo está simplemente parada, el robot la ignora por completo. Esto es como un fotógrafo que solo toma una foto cuando algo interesante sucede, en lugar de tomar 30 fotos por segundo de un bodegón.

El resultado es un aumento masivo de eficiencia. El artículo muestra que Mage-VL puede reducir el número de "tokens visuales" (las pequeñas piezas de la imagen que la computadora tiene que procesar) en más de un 75%. Es como leer un libro donde solo tienes que leer los capítulos emocionantes, saltándote el relleno aburrido, pero aun así entiendes la historia completa perfectamente.

Un cerebro con dos sistemas

Para manejar este video en streaming, Mage-VL utiliza un ingenioso cerebro de dos partes inspirado en cómo piensan los humanos.

  1. Sistema 1 (El Reflejo): Este es un guardián superrápido y ligero. Observa el flujo de video y pregunta: "¿Está pasando algo interesante ahora mismo?". Si la respuesta es no, permanece en silencio. Si la respuesta es sí (como cuando se marca un gol), despierta instantáneamente la segunda parte del cerebro.
  2. Sistema 2 (El Razonador): Esta es la parte del pensamiento pesado y robusto. Una vez que la puerta se abre, se sumerge profundamente para descifrar exactamente qué sucedió y generar una respuesta.

Esto significa que el robot no pierde tiempo pensando en las partes aburridas del video. Se mantiene callado durante el medio tiempo o cuando la cámara solo recorre el estadio, y luego interviene con un comentario en el segundo en que un jugador patea el balón.

Lo que encontraron (y lo que no encontraron)

El equipo entrenó este modelo desde cero utilizando alrededor de 560 millones de imágenes no etiquetadas y 100 millones de fotogramas de video no etiquetados. Eso suena a mucho, pero comparado con otros modelos gigantes que necesitan miles de millones de pares de imagen-texto, es en realidad bastante pequeño. Sorprendentemente, descubrieron que no se necesita un conjunto de datos masivo a escala web para construir un gran cerebro visual. El método de entrenamiento personalizado de Mage-VL le permitió igualar o incluso superar a modelos mucho más grandes en tareas de comprensión de video.

Aquí están algunos de los descubrimientos clave que hicieron:

  • Velocidad: Mage-VL es increíblemente rápido. Puede procesar video hasta 3.5 veces más rápido en tiempo real en comparación con los modelos estándar, sin dejar de dar las respuestas correctas.
  • No necesidad de entrenamiento de "video largo": Descubrieron que no necesitaban entrenar específicamente el modelo en videos largos para que fuera bueno respondiendo preguntas sobre ellos. Al entrenarlo con descripciones detalladas de clips cortos y usando su inteligente método de "códec", el modelo aprendió a entender videos largos por sí mismo.
  • El movimiento ayuda al razonamiento espacial: Encontraron que entrenar el modelo en videos con movimiento realmente lo hizo mejor para entender formas 3D estáticas y relaciones espaciales. Parece que ver cómo se mueven las cosas ayuda al robot a entender cómo encajan en el espacio.
  • IA ayudando a la IA: El equipo utilizó un sistema de IA para ayudar a escribir mejores datos de entrenamiento. Hicieron que una IA revisara los subtítulos que generaba, corrigiera los errores y mejorara los prompts, creando un ciclo que hizo que los datos fueran de una calidad mucho mayor.

La conclusión

Mage-VL es un paso significativo hacia la creación de una IA que realmente pueda "observar" y "escuchar" el mundo en tiempo real. Demuestra que no es necesario forzar el camino a través de cada píxel de un video para entenderlo. Al ser inteligentes sobre qué mirar —imitando la forma en que la compresión de video funciona y cómo los ojos humanos se enfocan en el movimiento— el modelo se vuelve más rápido, más barato de ejecutar y más receptivo.

Aunque el artículo señala que el modelo aún tiene trabajo por hacer en tareas de razonamiento complejo y problemas matemáticos, demuestra con éxito que un modelo más pequeño y eficiente puede superar a gigantes mucho más grandes y lentos cuando se trata de comprender el mundo dinámico y en movimiento que nos rodea. Es un movimiento de "leer todo" hacia "observar lo que importa".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →