← Últimos artículos
💻 computer science

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

Este artículo propone **STC** (Streaming Token Compression), un marco jerárquico y plug-and-play que acelera los modelos de lenguaje de video en streaming mediante la reutilización de características en la etapa de codificación (STC-Cacher) y la reducción de tokens irrelevantes antes de la etapa de procesamiento del LLM (STC-Pruner), logrando una reducción significativa en la latencia con una pérdida mínima de precisión.

Autores originales: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

Publicado 2026-02-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo un partido de fútbol en vivo a través de una aplicación de inteligencia artificial que debe comentarlo en tiempo real. Para que la IA "entienda" lo que pasa, tiene que procesar miles de imágenes (fotogramas) por segundo.

El problema es que esto es agotador y lento. Es como si un comentarista tuviera que analizar cada milímetro de la imagen, cada brizna de césped y cada vez que el cielo cambia de color, aunque nada importante esté pasando. Esto hace que la IA se "trabe" o tarde demasiado en responder.

Este artículo presenta una solución llamada STC (Streaming Token Compression). Para entenderlo, vamos a usar una analogía: "El Asistente de Cine Inteligente".


1. El problema: El exceso de detalles innecesarios

Imagina que estás viendo una película de una persona caminando por un parque. El fondo (los árboles, el cielo, el banco) no cambia casi nada de un segundo a otro. Si la IA intenta procesar cada detalle del fondo en cada fotograma, está perdiendo el tiempo. Es como si un pintor intentara redibujar exactamente el mismo árbol 60 veces por segundo.

2. La solución parte 1: STC-Cacher (El "Bloc de Notas" del Pintor)

En lugar de redibujar todo, el STC-Cacher actúa como un pintor muy listo que tiene un bloc de notas.

  • ¿Cómo funciona? Cuando llega un nuevo fotograma, el pintor mira su bloc de notas (la memoria) y dice: "Ah, este árbol es igual al que dibujé hace un segundo, no voy a gastar pintura en él".
  • La magia: Solo gasta energía y "pintura" (computación) en lo que se mueve: el balón, los jugadores o la gente corriendo. Lo que es estático, simplemente lo "copia y pega" de su memoria.
  • Resultado: Ahorra muchísimo trabajo en la etapa de "visión" (ViT), haciendo que la IA sea mucho más rápida.

3. La solución parte 2: STC-Pruner (El "Editor de Noticias" de alto nivel)

Una vez que la imagen ha sido procesada, la IA tiene una montaña gigante de información (llamada "tokens"). Si le pasas toda esa montaña al "cerebro" de la IA (el LLM), este se satura y tarda una eternidad en pensar.

Aquí entra el STC-Pruner, que actúa como un editor de noticias muy eficiente.

  • ¿Cómo funciona? El editor tiene dos brújulas:
    1. La Brújula del Pasado (Temporal): "¿Esto que veo es algo nuevo o ya lo vi hace un momento?"
    2. La Brújula del Presente (Espacial): "¿Esto es importante dentro de esta imagen o es solo ruido de fondo?"
  • La magia: El editor descarta todo lo que sea repetitivo o irrelevante. Si la IA ve un cielo azul constante, el editor dice: "Esto no aporta nada nuevo a la historia, bórralo". Solo deja pasar los "titulares": el gol, la tarjeta roja o el cambio de clima.
  • Resultado: El cerebro de la IA recibe solo la "esencia" de la historia, lo que permite que responda casi instantáneamente.

En resumen: ¿Qué hemos logrado?

Gracias a este sistema de "copiar y pegar lo viejo" (Cacher) y "resumir lo importante" (Pruner), los investigadores lograron que la IA sea:

  1. Mucho más rápida: Reduce el tiempo de espera en la parte de procesamiento de video en un 24.5% y en la parte de "pensamiento" en un 45.3%.
  2. Igual de inteligente: A pesar de "borrar" tanta información, la IA mantiene casi el 99% de su precisión. Es como si leyeras un resumen perfecto de un libro: no te pierdes nada importante, pero terminas mucho más rápido.

En pocas palabras: STC enseña a la IA a dejar de mirar lo obvio y centrarse solo en lo que realmente importa, permitiendo que pueda "ver" y "hablar" sobre videos en tiempo real sin quedarse congelada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →