← Últimos artículos
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

Este artículo presenta el primer estudio sistemático de las técnicas de compresión de tokens para modelos de lenguaje de gran escala multimodales eficientes, categorizando los métodos existentes tanto por sus modalidades objetivo (imagen, video y audio) como por sus mecanismos subyacentes para consolidar el progreso actual y guiar la investigación futura.

Autores originales: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Publicado 2026-02-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente superinteligente (un Modelo de Lenguaje Grande Multimodal, o MLLM) que puede leer texto, mirar imágenes, ver videos y escuchar audio. Este asistente es increíblemente talentoso, pero tiene un problema importante: se siente abrumado cuando le das demasiada información a la vez.

Piensa en la información que recibe el asistente como un flujo de "tokens" (pequeños fragmentos de datos).

  • Un prompt de texto es como una carta corta.
  • Una foto de alta resolución es como una carta que ha sido ampliada hasta convertirse en un mural gigante y detallado.
  • Un video es como una biblioteca de miles de esos murales, cambiando cada segundo.
  • El audio es como un flujo continuo de ondas sonoras a alta velocidad.

Cuando alimentas al asistente con una película de 90 minutos, no solo ve "una película". Ve 54 millones de tokens. Eso es como intentar leer una biblioteca de libros en un solo suspiro. El cerebro del asistente (su mecanismo de "auto-atención") tiene que comparar cada uno de los tokens con todos los demás. Las matemáticas para esto se vuelven tan pesadas, tan rápido, que la computadora se queda sin memoria o tarda una eternidad en responder.

La Solución: Compresión de Tokens
Este artículo es una guía masiva (un estudio de revisión) sobre cómo enseñar a este asistente a ser más eficiente sin perder su inteligencia. Los autores llaman a esto Compresión de Tokens.

Piensa en la compresión de tokens como empacar una maleta para un viaje.

  • El Problema: Tienes una maleta llena de ropa, pero el 80% son duplicados (como 50 camisetas blancas idénticas) o cosas que no necesitas (como un abrigo pesado de invierno para un viaje a la playa).
  • El Objetivo: Quieres meter todo lo importante en una bolsa más pequeña para que puedas viajar más rápido, sin dejar atrás las cosas que realmente necesitas.

El artículo organiza todos los métodos actuales para "empacar" estos datos en dos formas principales de ver el problema: ¿Qué tipo de datos son? y ¿Cómo los empacamos?

1. Empacar por Tipo de Dato (El "Qué")

Diferentes tipos de datos tienen diferentes tipos de "desorden" (redundancia).

  • Imágenes (La Foto Estática):
    • El Desorden: Una foto de un cielo azul tiene millones de píxeles azules que son exactamente iguales.
    • La Solución: En lugar de enviar cada uno de los millones de píxeles azules, la computadora los agrupa. Dice: "Toda esta área es solo cielo azul", y envía un solo token para representar todo ese parche.
  • Video (La Imagen en Movimiento):
    • El Desorden: En un video de una persona hablando, el fondo (una pared o un árbol) permanece exactamente igual durante 10 segundos mientras la persona se mueve ligeramente.
    • La Solución: La computadora se da cuenta de que: "No necesitamos enviar el fondo 30 veces por segundo". Mantiene el fondo una vez y solo envía actualizaciones para las partes que se mueven. Es como enviar un "registro de cambios" en lugar de reenviar toda la escena en cada fotograma.
  • Audio (La Onda Sonora):
    • El Desorden: Una grabación de una voz suele tener largas pausas, silencios o un zumbido de fondo que no añade significado.
    • La Solución: La computadora recorta los silencios y fusiona sonidos similares, manteniendo solo las partes donde la voz está hablando realmente o la música está cambiando.

2. Empacar por Método (El "Cómo")

El artículo agrupa las técnicas utilizadas para realizar este empaque en cuatro estrategias principales:

  • El "Rayo Encogedor" (Basado en Transformación):
    Imagina tomar una foto de alta resolución y simplemente encogerla. Pierdes algo de detalle, pero mantienes la forma y los colores generales. Esto se hace reduciendo matemáticamente los datos (como mediante el agrupamiento o el promedio) para acortar la lista de tokens.
  • El "Juego de Agrupar" (Basado en Similitud):
    Imagina que tienes un montón de 1,000 piezas de Lego rojas. En lugar de listar las 1,000, dices: "Aquí hay una pieza roja, y hay otras 999 exactamente iguales". La computadora encuentra tokens que se ven o suenan muy similares y los fusiona en un único token "representativo".
  • El "Foco de Luz" (Basado en Atención):
    Imagina a un profesor mirando un salón de clases. El profesor solo se interesa por los estudiantes que levantan la mano (los tokens importantes) e ignora a los que están durmiendo al fondo. La computadora observa sus propios "puntajes de atención" (cuánto le importa cada pieza de datos) y desecha los tokens que de todos modos está ignorando.
  • La "Guía de Preguntas" (Basado en Consulta):
    Imagina que estás buscando una aguja específica en un pajar. En lugar de mirar cada brizna de paja, preguntas: "¿Dónde está la aguja?". La computadora utiliza tu pregunta (la consulta o query) para filtrar todo lo que no coincida con lo que estás preguntando, manteniendo solo los tokens relevantes.

Por qué esto es importante

Los autores explican que esto no es solo para hacer que las computadoras funcionen más rápido. Es para hacerlas utilizables.

  • Sin compresión, una película de 90 minutos es imposible de procesar para los modelos actuales en tiempo real.
  • Con compresión, el modelo puede "ver" la película, entender la trama y responder preguntas sobre ella, todo mientras utiliza una fracción de la memoria.

El Problema (Desafíos)

El artículo también advierte que esto no es magia. Si empacas la maleta demasiado apretada:

  • Podrías perder los detalles: Si comprimes demasiado una foto, podrías pasar por alto un cartel pequeño pero importante en el fondo.
  • Rompe el flujo: En un video, si fusionas demasiados fotogramas, el movimiento podría verse entrecortado o confuso.
  • Es difícil de integrar: Algunos de estos trucos de "empaque" son difíciles de usar con los chips de computadora más rápidos disponibles hoy en día porque requieren que la computadora se detenga y calcule las cosas de manera diferente.

En Resumen:
Este papel es un mapa para investigadores. Dice: "Tenemos un problema: nuestra IA se está ahogando en demasiados datos. Aquí hay todas las formas diferentes en las que estamos intentando enseñarle a filtrar, agrupar y encoger esos datos para que realmente pueda funcionar en el mundo real". Organiza estos métodos según si están observando imágenes, videos o sonidos, y por los trucos matemáticos específicos que utilizan para realizar la tarea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →