← Últimos artículos
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

Este artículo presenta TOPS, un método de poda de tokens visuales que no requiere entrenamiento y es agnóstico al modelo, el cual construye conjuntos de preservación óptimos basados en la relevancia de la tarea, la cobertura de información y la diversidad semántica para mejorar significativamente la eficiencia de la inferencia de los MLLM manteniendo o incluso mejorando el rendimiento.

Autores originales: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Publicado 2026-06-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante de libros (los tokens visuales) que un robot superinteligente (el Modelo de Lenguaje de Gran Escala Multimodal) necesita leer para responder a una pregunta. El problema es que la biblioteca es tan enorme que el robot se siente abrumado, tarda una eternidad en leer y gasta toda su energía simplemente pasando las páginas.

Durante mucho tiempo, la gente intentó ayudar al robot diciéndole: "¡Simplemente salta las páginas aburridas!". Pero los métodos antiguos eran un poco torpes:

  • El método de "Atención" era como un robot que solo miraba las páginas con las fuentes más grandes y negritas. A menudo omitía detalles importantes solo porque estaban escritos en letra pequeña, o seguía leyendo el mismo párrafo cinco veces porque parecía similar.
  • El método de "Diversidad" era como un robot que intentaba elegir páginas que se vieran diferentes entre sí. Podría elegir una página sobre un gato y una página sobre un coche, pero podría descartar accidentalmente la página que realmente responde a la pregunta específica del usuario.

Presentamos TOPS: El Bibliotecario Inteligente

El artículo presenta un nuevo método llamado TOPS (Conjuntos de Preservación Óptima de Tokens). En lugar de simplemente adivinar qué páginas conservar, TOPS actúa como un bibliotecario altamente organizado, basado en principios fundamentales, que hace tres preguntas específicas antes de decidir qué se queda en el estante:

  1. "¿Es esta página relevante para la pregunta?" (Relevancia de la Tarea)
    • Analogía: Si el usuario pregunta "¿De qué color es el coche?", el bibliotecario sabe inmediatamente que debe conservar la página que tiene el coche y desechar la página que trata sobre el cielo.
  2. "¿Esta página cubre terreno nuevo?" (Cobertura de Información)
    • Analogía: Si ya tenemos una página que describe la pintura roja del coche, no necesitamos una segunda página que diga exactamente lo mismo. Necesitamos una página que nos diga algo nuevo, como el número de la matrícula del coche.
  3. "¿Es esta página única respecto a las otras que elegimos?" (Diversidad Semántica)
    • Analogía: No queremos una pila de cinco páginas que digan "El coche es rojo". Queremos una página que diga "Rojo", una que diga "Rápido" y otra que diga "Viejo". Esto asegura que obtengamos una imagen completa sin repeticiones.

Cómo funciona en la vida real

El artículo muestra que TOPS no necesita ser enseñado (es "libre de entrenamiento"). Puede conectarse a diferentes cerebros de robots (como LLaVA, Qwen o InternVL) y funciona instantáneamente.

  • La "Limpieza de Dos Etapas": Imagina que el robot está leyendo un video largo.
    • Etapa 1: TOPS realiza un barrido rápido, desechando la basura obvia (como fotogramas en blanco o tomas borrosas) antes de que el robot comience a pensar profundamente.
    • Etapa 2: Mientras el robot lee, TOPS vigila de cerca la conversación. Si el robot comienza a hablar de un detalle específico, TOPS se asegura de que las páginas visuales más relevantes sigan allí, refinando la selección para que sea perfecta para esa pregunta específica.

Los Resultados: Menos es Más

El artículo afirma que, al usar este enfoque inteligente de tres preguntas, TOPS puede desechar hasta el 90% de las páginas visuales (tokens) y el robot sigue respondiendo a las preguntas tan bien como si hubiera leído todo.

  • La Estadística Mágica: En un modelo específico (LLaVA-NeXT), TOPS eliminó el 77.8% de los datos visuales pero, de hecho, mejoró ligeramente el rendimiento del robot (100.6%).
  • ¿Por qué? El artículo sugiere que, al obligar al robot a ignorar el "relleno" y las páginas redundantes, en realidad evita que el robot se confunda o invente hechos (alucinaciones). Es como limpiar un escritorio desordenado; a veces, tener menos papeles te ayuda a encontrar el correcto más rápido y a pensar con más claridad.

En Resumen

TOPS es una nueva forma de hacer que los modelos de IA sean más rápidos y más inteligentes mediante el uso de un editor más estricto y astuto. En lugar de simplemente elegir las pistas visuales más "ruidosas" o "diferentes", construye un conjunto compacto y perfecto de pistas que son relevantes para la pregunta, cubren toda la información necesaria y no se repiten entre sí. El resultado es un robot que piensa más rápido, utiliza menos memoria y da mejores respuestas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →