← Últimos artículos
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

El artículo propone EarlyTom, un marco sin entrenamiento que realiza compresión de tokens visuales en etapas tempranas dentro del codificador de visión para reducir significativamente la latencia hasta el primer token y los costos computacionales, manteniendo al mismo tiempo una precisión comparable a las líneas base de tokens completos.

Autores originales: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

Publicado 2026-05-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que intentas describir una película de 30 minutos a un amigo muy inteligente, pero muy ocupado (la IA). Tu amigo necesita ver toda la película primero antes de poder responder tus preguntas.

El Problema: El "Inicio Lento"
Actualmente, cuando la IA intenta entender un video, actúa como un estudiante que insiste en leer cada página de un libro de texto antes de responder una sola pregunta.

  • La Vieja Forma: La IA ve cada fotograma individual del video, lo descompone en miles de piezas diminutas (tokens) y luego entrega esa pila masiva a su "cerebro" (el Modelo de Lenguaje Grande) para procesarlo.
  • El Cuello de Botella: El documento descubrió que el mayor retraso no es el tiempo de pensamiento de la IA; es el tiempo dedicado simplemente a ver y organizar el video desde el principio. Es como pasar 40 minutos ordenando una baraja de cartas antes de empezar siquiera a jugar el juego. Incluso cuando otros métodos intentaron descartar algunas cartas más tarde, la ordenación inicial seguía siendo lenta.

La Solución: EarlyTom (El "Editor Inteligente")
Los autores crearon un nuevo método llamado EarlyTom. Piensa en EarlyTom como un editor de cine súper eficiente que interviene mientras se está viendo el video, no después.

En lugar de esperar a que el video esté completamente procesado para decidir qué guardar, EarlyTom edita el video durante el proceso de visualización. Utiliza dos trucos principales:

1. El Truco de la "Fusión" (Compresión Temporal)
Imagina ver un video donde una persona está de pie hablando durante 10 segundos. El video tiene 300 fotogramas de esa misma persona.

  • Vieja Forma: La IA procesa los 300 fotogramas individualmente.
  • EarlyTom: Nota: "Oye, estos 300 fotogramas son casi idénticos". En lugar de procesarlos todos, los fusiona en un solo fotograma de resumen de alta calidad. Es como resumir un monólogo de 10 minutos en una sola frase antes de pasarlo. Esto ocurre dentro del lente de la cámara (el codificador de visión), por lo que el trabajo pesado se realiza mucho más rápido.

2. El Truco del "Foco" (Selección Espacial)
Ahora imagina que la IA tiene que mirar a una multitud de personas en un video.

  • La Trampa: El documento descubrió que la IA tiene un hábito extraño llamado "Hundimiento de Atención". Es como un foco que se queda atascado en unos pocos puntos específicos (como una pared en blanco o un logotipo) y brilla demasiado en ellos, ignorando la acción real que ocurre en otros lugares. Si solo eliges los puntos "más brillantes", podrías perder la acción importante.
  • La Solución de EarlyTom: Divide a la multitud en dos grupos:
    • El Grupo "En Movimiento": Para las partes del video donde las cosas cambian (acción), selecciona los detalles más importantes a nivel global.
    • El Grupo "Estático": Para las partes donde las cosas están estáticas, utiliza un enfoque de "ventana" local para asegurarse de que no se distraiga con el foco atascado. Asegura que la IA vea una vista equilibrada de la escena sin sesgarse por esos puntos atascados.

El Resultado: Velocidad Sin Perder Inteligencia
Al realizar esta edición tempranamente en el proceso, EarlyTom logra dos cosas increíbles:

  1. Inicio Súper Rápido: Reduce el tiempo que tarda en obtener la primera respuesta (Tiempo-Hasta-El-Primer-Token) hasta en 2.65 veces. Si la vieja forma tardaba 900 milisegundos, esta tarda unos 336 milisegundos.
  2. Menos Trabajo: Reduce la potencia de computación total necesaria hasta en un 61%.

La Conclusión
El documento afirma que EarlyTom permite que la IA de video sea increíblemente rápida y eficiente sin necesidad de volver a entrenarse ni perder su capacidad de entender el video con precisión. Demuestra que no necesitas ver cada fotograma individual para entender la historia; solo necesitas saber cuándo dejar de mirar y empezar a pensar.

En resumen: EarlyTom es una herramienta sin entrenamiento que edita el video mientras se está viendo, haciendo que la IA de video sea más rápida y barata de ejecutar, manteniendo al mismo tiempo sus respuestas tan inteligentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →