Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere
El artículo propone **ONCE**, un marco de trabajo de compresión de tokens de video tipo plug-in que traslada el costoso proceso de compresión fuera de línea mediante el aprendizaje de un libro de códigos global sensible a la frecuencia una sola vez, permitiendo una compresión en línea eficiente y agnóstica al modelo que reduce significativamente la latencia de inferencia mientras mantiene un rendimiento competitivo en los bancos de pruebas de comprensión de video.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de enseñarle a un robot superinteligente cómo entender películas. Para lograrlo, descompones cada fotograma de la película en miles de diminutos "píxeles" digitales de significado, llamados tokens. El robot entonces lee esta lista masiva de tokens como si fuera una oración para comprender qué está pasando. El problema es que las películas son largas y están llenas de repetición. Si un personaje se queda quieto en una habitación durante diez segundos, el robot se ve obligado a leer el mismo token de "parado en una habitación" miles de veces seguidas. Es como leer un libro donde la palabra "el" se repite un millón de veces solo para rellenar espacio; esto desperdicia la capacidad cerebral del robot y lo hace increíblemente lento para responder preguntas. Los científicos han intentado solucionar esto enseñando al robot a saltarse las partes aburridas o a fusionar las similares mientras ve la película, pero esto generalmente requiere que el robot haga cálculos matemáticos adicionales para cada película que ve, lo cual sigue siendo muy lento y costoso.
Este artículo presenta una nueva forma de manejar esto llamada ONCE. En lugar de hacer que el robot realice el trabajo duro de clasificar y saltar partes cada vez que ve un nuevo video, los investigadores decidieron hacer el trabajo pesado antes de que el robot vea una película. Crearon un "Libro de Códigos Global" (Global Codebook), que es esencialmente un índice gigante y prefabricado de los patrones visuales más comunes encontrados en miles de horas de video. Piensa en ello como una biblioteca donde cada libro ya está clasificado en el estante perfecto. Cuando llega una nueva película, el robot no necesita descubrir cómo organizarla desde cero; simplemente busca los patrones en su índice prefabricado, toma los "estantes" relevantes y los promedia. Esto permite que el robot procese videos mucho más rápido porque solo está realizando una búsqueda rápida en lugar de un cálculo complejo. Los investigadores descubrieron que este método funciona increíblemente bien, especialmente cuando se les obliga a usar muy pocos tokens, manteniendo al robot rápido sin que olvide lo que está viendo.
El Problema: El Cerebro Abrumado del Robot
Los Modelos de Lenguaje de Gran Escala para Video (Video-LLMs) son como detectives superpoderosos que pueden ver un video y responder preguntas sobre él. Para hacerlo, convierten el video en una larga cadena de tokens digitales. Pero aquí está el truco: si le entregas al detective una película de dos horas, la cadena de tokens se vuelve tan larga que abruma la memoria del detective.
Peor aún, las películas están llenas de redundancia. Si una escena muestra a un gato sentado en un sofá durante cinco minutos, el codificador de video genera miles de tokens que todos dicen "gato en el sofá". El detective tiene que leer cada uno de ellos, aunque sean todos iguales. Los métodos existentes intentan solucionar esto haciendo que el detective "pode" (corte) o "fusione" (combine) estos tokens mientras ve el video. Pero esto es como pedirle al detective que se detenga y reorganice sus notas por cada película que ve. Toma tiempo y energía extra cada vez, y las reglas para organizar camban dependiendo de qué detective (modelo) estés usando.
La Solución: ONCE y el "Libro de Códigos Global"
Los autores de este artículo, Jiayang He y su equipo, propusieron un enfoque diferente. Se preguntaron: "¿Qué pasaría si hiciéramos la organización una vez para todos, en lugar de pedirle al detective que lo haga cada vez?".
Construyeron un sistema llamado ONCE (Compresión de Tokens de Video de Offline-a-Online). Así es como funciona, usando una analogía sencilla:
Imagina que eres un bibliotecario que tiene que clasificar millones de libros.
- La Forma Antigua (Métodos Existentes): Cada vez que llega un nuevo cargamento de libros, tienes que detenerte, leer cada libro, decidir cuáles son similares y luego agruparlos físosicamente antes de poder estanterlos. Esto toma mucho tiempo para cada cargamento.
- La Forma de ONCE: Antes de que lleguen nuevos libros, dedicas tiempo a estudiar una colección masiva de libros que ya tienes. Creas un "Índice Maestro" (el Libro de Códigos Global) que enumera cada tipo común de libro que has visto (por ejemplo, "Héroe de Acción", "Programa de Cocina", "Documental de Naturaleza"). También creas una regla: "Si un libro parece un 'Documental de Naturaleza', ponlo en el Contenedor A".
Ahora, cuando llega un nuevo cargamento de libros (un nuevo video), no necesitas leerlos todos cuidadosamente. Solo echas un vistazo rápido a cada libro, revisas tu "Índice Maestro" para ver a qué contenedor pertenece y lo dejas caer. Luego, tomas todos los libros del Contenedor A y los resumes en una sola nota. Esto es increíblemente rápido porque no estás reinventando las reglas de clasificación para cada nuevo cargamento; simplemente estás usando las reglas que aprendiste una vez.
Cómo Funciona en Detalle
- Aprendizaje Offline (La parte del "Una Vez"): Los investigadores tomaron un enorme conjunto de datos de videos (LLaVA-Video-178K) y analizaron los patrones visuales. No eligieron patrones al azar; se aseguraron de capturar patrones de diferentes momentos en el video (estratificación temporal) y los ponderaron según la frecuencia con la que aparecían. Luego utilizaron una técnica matemática llamada "transporte óptimo" para ajustar un Libro de Códigos Global de 8,192 "prototipos" (o palabras clave) representativos. Este libro de códigos actúa como un mapa del mundo visual.
- Compresión Online (La parte del "En Todas Partes"): Cuando llega un nuevo video, el sistema no entrena nada nuevo. Simplemente observa los tokens visuales del video y pregunta: "¿A cuál de mis 8,192 prototipos se parece esto?". Selecciona los prototipos más frecuentes que aparecen en el video, reasigna todos los tokens del video a estos prototipos y luego los promedia. Esto convierte miles de tokens en un número mucho más pequeño y manejable (como 256 o 512) sin perder el significado central.
Lo Que Encontraron
El equipo probó ONCE en cuatro diferentes evaluaciones de comprensión de video (MVBench, EgoSchema, Video-MME y LongVideoBench) utilizando dos modelos de IA diferentes (LLaVA-OneVision-7B y Qwen3.5-9B).
- Velocidad: Los resultados fueron impactantes. ONCE redujo la cantidad de trabajo que el modelo de lenguaje tenía que hacer en aproximadamente un 96% en términos de precomputación (FLOPs de prefill). En términos del mundo real, esto hizo que el sistema funcionara 2.96 veces más rápido en promedio en comparación con ejecutarlo sin compresión.
- Precisión: Usualmente, cuando haces que un sistema sea más rápido eliminando datos, este se vuelve más tonto. Pero ONCE fue sorprendentemente inteligente. Cuando el presupuesto de tokens era muy ajustado (solo se permitían 32, 64 o 128 tokens), ONCE obtuvo incluso puntajes más altos que otros métodos de compresión. Fue particularmente bueno en tareas como contar eventos o reconocer cambios de estado.
- Eficiencia: El sistema logró estas aceleraciones sin necesidad de reentrenar el modelo de IA principal. El libro de códigos se aprendió una vez y luego se reutilizó para todo.
Lo Que Descartaron
El artículo argumenta explícitamente contra la idea de que la compresión debe hacerse de forma "online" (durante la reproducción del video) para cada video individual. Demostraron que realizar el trabajo pesado durante la inferencia (mientras se ve el video) es ineficiente y redundante. También demostraron que simplemente elegir tokens al azar o usar un conjunto fijo de tokens para cada video no funciona tan bien como su método, el cual selecciona dinámicamente los prototipos correctos para el video específico mientras mantiene fijas las reglas de agrupación.
Además, encontraron que el "Libro de Códigos Global" no solo almacena ejemplos de entrenamiento; aprende una estructura reutilizable. Incluso cuando se probó con videos que nunca había visto (una prueba de estrés con videos públicos), el libro de códigos funcionó mejor que las agrupaciones aleatorias, lo que sugiere que realmente capturó la "gramática" subyacente de los patrones visuales.
La Conclusión
Los autores sugieren que ONCE ofrece una nueva forma de pensar en la IA de video: en lugar de hacer que la IA trabaje más duro para cada nuevo video, podemos enseñarle un lenguaje universal de patrones visuales una vez, y luego dejar que hable ese lenguaje con fluidez y rapidez cada vez que lo necesite. Aunque el método todavía requiere un libro de códigos separado para diferentes modelos de IA (porque ellos "ven" las cosas de manera distinta), los resultados sugieren que este enfoque de "aprender una vez, comprimir en todas partes" es una forma poderosa de hacer que la IA de video sea más rápida y eficiente sin sacrificar su capacidad de entender lo que sucede en la pantalla. El artículo concluye que este es un paso prometedor hacia hacer que la comprensión de videos largos sea práctica para el uso diario.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.