← Últimos artículos
🤖 machine learning

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

AsymVLM es un marco de inferencia eficiente para modelos de visión-idioma que aprovecha las propiedades distintivas de las modalidades visual y textual mediante la aplicación de una poda agresiva y adaptativa a los tokens de visión espacialmente redundantes y una expulsión basada en umbrales temporales a los tokens de texto, logrando ahorros de hasta un 54% en FLOPs mientras supera a los métodos más avanzados en tareas de comprensión de documentos y gráficos.

Autores originales: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Publicado 2026-05-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo Visión-Lenguaje (VLM) como un asistente altamente inteligente pero ligeramente abrumado. Le muestras una imagen (como un documento complejo o un gráfico) y le haces una pregunta. Para entender la imagen, el asistente la descompone en miles de piezas de rompecabezas diminutas llamadas "tokens de visión". Para entender tu pregunta y formular una respuesta, utiliza un conjunto más pequeño de "tokens de texto".

El problema es que la "memoria de trabajo" del asistente (su memoria GPU) se satura. Intenta retener cada pieza de rompecabezas y cada palabra que genera, lo que lo hace lento y costoso de ejecutar.

Los métodos existentes intentan solucionar esto tratando las piezas de la imagen y las palabras exactamente igual: simplemente desechan un porcentaje fijo de todo (por ejemplo, "eliminar el 50% de las piezas de rompecabezas y el 50% de las palabras"). Los autores de este artículo, AsymVLM, argumentan que esto es como intentar organizar una biblioteca tirando la mitad de los libros y la mitad de los marcadores sin pensar en lo que realmente hacen.

Así es como funciona AsymVLM, utilizando analogías sencillas:

1. Los Dos Problemas Diferentes

El artículo señala que las piezas de imagen y las palabras son fundamentalmente diferentes:

  • Tokens de Visión (Las Piezas de Rompecabezas): Todos son independientes. Si eliminas una pieza del cielo de una foto, la pieza del árbol junto a ella no le importa. Son "espacialmente redundantes", lo que significa que muchas piezas son simplemente ruido de fondo.
  • Tokens de Texto (La Historia): Estos son una reacción en cadena. La Palabra 2 depende de la Palabra 1, y la Palabra 3 depende de la Palabra 2. Si eliminas una palabra en medio de una oración, el resto de la historia podría no tener sentido.

2. La Solución: Una Estrategia de Dos Frentes

En lugar de usar una sola regla para todo, AsymVLM utiliza dos estrategias diferentes adaptadas a cada tipo de token.

Estrategia A: El "Editor Inteligente" para Imágenes (Poda de Tokens de Visión)

Antes de que el asistente empiece a pensar, AsymVLM actúa como un editor inteligente que observa la foto.

  • La Vieja Forma: "Eliminar el 50% de los píxeles al azar" o "Eliminar los que parecen menos importantes para la pregunta".
  • La Forma de AsymVLM: Utiliza un Puntaje Aprendido. Imagina a un entrenador que ha visto miles de partidos y sabe exactamente qué jugadores (tokens) ayudan realmente a ganar el partido. Este puntaje no solo mira la imagen; observa cómo la imagen se conecta con la pregunta específica que hiciste.
  • El "Presupuesto Adaptativo": Esta es la parte más ingeniosa. El artículo señala que algunas preguntas requieren un escaneo completo de la imagen (por ejemplo, "¿Cuántas manzanas hay en este huerto?"), mientras que otras solo necesitan un punto diminuto (por ejemplo, "¿Cuál es el precio de la manzana roja?").
    • Si la pregunta es específica de un área pequeña, la "brecha" entre las piezas importantes y las no importantes es enorme. El sistema dice: "Genial, podemos ser agresivos y tirar el 75% de la imagen".
    • Si la pregunta necesita toda la imagen, la "brecha" es pequeña. El sistema dice: "De acuerdo, mantén el 90% de la imagen solo por seguridad".
    • Analogía: Es como hacer una maleta. Si vas a la playa por un día, haces una maleta ligera. Si vas de viaje por un mes, haces una maleta más grande. AsymVLM ajusta el "empaque" según el viaje específico, en lugar de usar el mismo tamaño de maleta para todos.

Estrategia B: El "Conserje de Memoria" para Texto (Expulsión de Tokens de Texto)

Una vez que el asistente comienza a generar una respuesta, escribe palabras una por una. Si la conversación se alarga, la memoria se llena.

  • La Vieja Forma: Los métodos estándar para IA solo de texto (como H2O o StreamingLLM) intentan eliminar las palabras más antiguas o menos "importantes" para hacer espacio para las nuevas.
  • La Forma de AsymVLM: Los autores se dieron cuenta de que en estos asistentes visuales, la conversación suele ser corta y la imagen es el contexto más importante.
    • Establecen un presupuesto fijo. El asistente sigue escribiendo hasta alcanzar un límite (por ejemplo, 500 palabras).
    • Una vez que alcanza el límite, comienza a eliminar las palabras generadas más antiguas (las que ya no son necesarias para la siguiente oración inmediata), pero nunca elimina la imagen original ni la pregunta original.
    • Analogía: Imagina que le cuentas una historia a un amigo. No necesitas recordar la primera oración que dijiste hace 10 minutos para terminar la oración actual. AsymVLM actúa como un conserje que limpia los borradores viejos e irrelevantes del pizarrón para hacer espacio para la nueva oración, pero deja el prompt original y la foto clavados en la pared para siempre.

3. Los Resultados: Más Rápido y Más Inteligente

El artículo afirma que al tratar estos dos tipos de datos de manera diferente, AsymVLM logra:

  • Aceleraciones Masivas: Ahorra hasta un 54% de la potencia de computación (FLOPs) necesaria para ejecutar el modelo. Esto se debe a que elimina físicamente las piezas de imagen innecesarias antes de que comience la matemática pesada, en lugar de simplemente ignorarlas durante la matemática.
  • Mejor Precisión: En tareas como leer documentos o entender gráficos, en realidad tiene un rendimiento 2–3% mejor que los métodos anteriores. Esto se debe a que mantiene las piezas de imagen específicas que responden a la pregunta y desecha el resto, mientras que otros métodos podrían eliminar accidentalmente la pieza crucial.
  • Eficiencia de Memoria: Reduce la memoria necesaria para ejecutar el modelo, permitiendo que quepa en chips de computadora más pequeños y económicos que no podían manejar el modelo completo sin podar.

Resumen

AsymVLM es un sistema que se da cuenta de que "una talla no sirve para todos". Utiliza un filtro inteligente y adaptativo para recortar la grasa de las imágenes según la pregunta específica, y un conserje cuidadoso para gestionar la memoria del texto sin perder el contexto original. El resultado es un Modelo Visión-Lenguaje que es más rápido, utiliza menos memoria y es sorprendentemente más preciso al leer documentos y gráficos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →