LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
El artículo presenta LLaVA-OneVision-2, un modelo de visión y lenguaje de próxima generación que logra un rendimiento de vanguardia en tareas de anclaje espacial, temporal y en video, aprovechando una estrategia novedosa de tokenización de flujo de códec, un sistema de coordenadas 3D RoPE unificado y supervisión abierta a gran escala.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que intentas describir una película de 30 minutos a un amigo, pero solo tienes tiempo suficiente para mostrarle 30 imágenes.
La mayoría de los modelos de IA actuales (como los anteriores a este nuevo) juegan a lo seguro: eligen 30 imágenes espaciadas uniformemente. Una imagen cada minuto. Si algo emocionante ocurre entre el minuto 10 y el minuto 11, la IA lo pierde por completo porque no estaba mirando en ese segundo exacto. Es como intentar entender un partido de fútbol de ritmo rápido solo mirando el marcador cada minuto; te perderías el gol.
LLaVA-OneVision-2 es un nuevo tipo de "superobservador" que cambia las reglas. En lugar de ver la película como una serie de instantáneas estáticas, trata el video como un archivo digital comprimido (el tipo que usa tu teléfono para ahorrar espacio).
Así es como funciona, usando analogías simples:
1. La brújula del "costo en bits"
Cuando comprimes un video (como convertir una película sin procesar en un MP4), la computadora tiene que trabajar más para describir las partes del video donde las cosas se mueven rápido o cambian drásticamente (como un accidente de coche o un bailarín girando). Gasta más "energía digital" (bits) en esas partes. Gasta muy poca energía en las partes aburridas donde no pasa nada (como una pared estática).
LLaVA-OneVision-2 lee este "mapa de energía".
- La vieja forma: "Miraré el video durante 1 segundo, luego saltaré 1 segundo, luego miraré de nuevo".
- La nueva forma: "Veo que el archivo de video está usando mucha energía ahora mismo porque la acción es intensa. ¡Me centraré allí! Veo que la energía es baja por aquí; saltaré esta parte".
Concentra su "energía mental" (tokens) exactamente donde ocurre la acción, en lugar de distribuirla uniformemente.
2. El "detective de movimiento"
El modelo también busca "residuos". Imagina que ves un video de una persona caminando. El fondo (la habitación) permanece igual. El modelo se da cuenta: "No necesito volver a explicar la habitación en cada fotograma". Solo presta atención a las partes que cambiaron (la persona en movimiento).
Crea un "lienzo visual" que es un collage de las partes móviles más importantes, unidas de manera eficiente. Esto le permite ver un video de 15 minutos sin abrumarse, porque ignora las partes aburridas y repetitivas y se enfoca en la "historia".
3. La prueba de la "cuerda de saltar"
Para demostrar que esto funciona, los investigadores crearon una nueva prueba llamada JumpScore. Imagina un video de alguien saltando la cuerda. Salta arriba y abajo cientos de veces. Para una IA normal, cada salto se ve exactamente igual. Es difícil decir cuál salto específico está preguntando el usuario.
- La IA antigua se confundió y adivinó al azar, obteniendo una puntuación de aproximadamente 30 sobre 100.
- LLaVA-OneVision-2 detectó los pequeños momentos de una fracción de segundo cuando la cuerda golpeaba el suelo o los pies de la persona cambiaban de posición. Obtuvo una puntuación de 75 sobre 100.
No solo vio "saltar"; vio el momento exacto en que ocurrió el salto.
4. El "navegador espacial"
El modelo también se volvió muy bueno entendiendo el espacio. Si le preguntas: "Señala el espacio vacío entre la taza de café y la computadora portátil", puede hacerlo con alta precisión. Incluso puede rastrear objetos que se mueven a través de un video (como un gato corriendo por una habitación) y mantenerlos bajo su mirada sin perderlos de vista, incluso si el gato queda parcialmente oculto.
El panorama general
Los investigadores no solo construyeron un cerebro más grande; construyeron una forma más inteligente de mirar.
- Antes: La IA era como un turista que tomaba una foto cada minuto de una caminata, esperando no perderse la vista.
- Ahora: La IA es como un guía que sabe exactamente dónde está la vista, por lo que solo se detiene a tomar una foto cuando el paisaje realmente cambia.
El resultado es un modelo que entiende videos largos, encuentra momentos específicos en acciones rápidas y razona sobre el espacio mucho mejor que los modelos anteriores, todo mientras usa la misma cantidad de potencia de computación. Han hecho disponible todo su código, datos y el propio modelo para que cualquiera lo use gratis.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.