← Últimos artículos
🤖 AI

OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning

OccamToken es un marco libre de entrenamiento y adaptable al presupuesto que mejora la eficiencia de la inferencia de modelos de visión y lenguaje al sustituir la clasificación absoluta de tokens frágil por una prueba de evidencia relativa anclada en registros, lo que permite una compresión extrema de tokens (por ejemplo, reducir 2.880 tokens a ~40) mientras se preserva más del 93% de la precisión original.

Autores originales: Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: Demasiado Ruido en la Cocina

Imagina que eres un chef (la IA) intentando cocinar una comida basándote en el pedido de un cliente (la pregunta de texto) y una pila masiva de ingredientes (la imagen).

En la IA moderna, cuando muestras una imagen, la computadora la descompone en miles de trozos diminutos llamados "tokens". Si tienes una foto de alta resolución, es como tener una pila de 2.880 ingredientes. El chef tiene que mirar cada uno de ellos antes de empezar a cocinar. Esto requiere una cantidad enorme de tiempo y energía (potencia de computación), incluso si la mayoría de esos ingredientes son solo ruido de fondo, como un grano de polvo en la encimera o un parche borroso de cielo.

La Vieja Forma: La Regla de los "Top 10"

Anteriormente, para ahorrar tiempo, la gente intentaba tirar los ingredientes "menos importantes". Usaban una regla como: "Mantén los 100 ingredientes más interesantes y tira el resto".

El artículo argumenta que esta regla está rota por dos razones:

  1. El Efecto del "Bebé Gritón": A veces, un ingrediente aburrido (como una pared vacía) obtiene accidentalmente una puntuación de "importancia" muy alta solo por cómo la computadora calcula las cosas. Este ruido fuerte ahoga los ingredientes importantes pero silenciosos (como un pequeño detalle en una foto), haciendo que la computadora piense que las cosas aburridas son en realidad las más importantes.
  2. El Problema de "Talla Única": Una regla fija (como "mantener 100") no funciona para cada imagen.
    • Si preguntas: "¿Hay un gato?" en una foto de un bosque, solo necesitas revisar unos pocos puntos. Mantener 100 puntos es un desperdicio.
    • Si preguntas: "¿Cuál es la textura de la tela?" en una foto de un suéter, podrías necesitar mirar muchos más puntos. Mantener solo 100 podría significar que te pierdes la respuesta.

La Nueva Solución: OccamToken

Los autores crearon un nuevo método llamado OccamToken. En lugar de preguntar: "¿Cuáles son los top 100?", preguntan: "¿Es este ingrediente más útil que nuestro 'Bote de Referencia'?".

Así es como funciona, paso a paso:

1. El "Bote de Referencia" (El Token de Registro)

Imagina que tienes un bote especial en la encimera que contiene una muestra genérica y promedio de "todo lo que hay en la cocina". No sabe nada sobre gatos o suéteres específicos; solo sostiene la "vibra de fondo" de la habitación.

  • Por qué ayuda: En el sistema antiguo, el "Bebé Gritón" (el ruido aburrido) se llevaría toda la atención. Pero en este nuevo sistema, el "Bote de Referencia" absorbe ese ruido. Actúa como una esponja para las señales inútiles y fuertes.
  • El Resultado: Ahora, la computadora puede ver claramente qué ingredientes son realmente especiales, porque el ruido ha sido silenciado.

2. Etapa 1: La "Limpieza de la Imagen" (Poda de Redundancia)

Antes de que el chef incluso lea el pedido del cliente, el personal de la cocina hace un barrido rápido.

  • Comparan cada ingrediente con el Bote de Referencia.
  • Si un ingrediente se ve igual que el fondo genérico del bote, se tira.
  • Analogía: Si la foto es de una calle concurrida, el personal tira los 2.000 tokens que son solo "cielo" o "pavimento borroso" porque el Bote de Referencia ya sabe cómo se ve eso. Mantienen los tokens que se ven diferentes al bote (los coches, las personas).
  • Beneficio: Esto sucede automáticamente para cada imagen. Una foto simple se limpia mucho; una foto compleja se limpia menos.

3. Etapa 2: La Verificación del "Pedido del Cliente" (Poda de Relevancia)

Ahora el chef lee la pregunta específica: "¿El hombre a la izquierda está de pie?".

  • El chef mira los ingredientes restantes.
  • Los compara con el Bote de Referencia nuevamente, pero esta vez preguntan: "¿Este ingrediente ayuda a responder la pregunta específica mejor que el fondo genérico?".
  • Analogía: Si la pregunta es sobre un hombre, el chef mantiene los tokens que muestran al hombre y el suelo sobre el que está de pie. Si la pregunta es sobre un gato en la esquina, el chef mantiene esos tokens y tira al hombre.
  • Beneficio: La cantidad de ingredientes mantenidos cambia según la pregunta. Una pregunta simple podría necesitar solo 10 tokens; una pregunta difícil podría necesitar 50.

Los Resultados: Menos Trabajo, Mismo Sabor

El artículo probó esto en varios modelos de IA (como LLaVA y Qwen).

  • La Afirmación: Lograron tirar el 98.6% de los ingredientes (bajando de 2.880 tokens a unos 40) y aún así obtener la respuesta correcta el 93% de las veces.
  • La Analogía: Es como darse cuenta de que no necesitas probar cada grano de arroz en una olla para saber que está salada. Solo necesitas probar las cucharadas correctas.
  • Sin Entrenamiento Necesario: La mejor parte es que no tuvieron que volver a enseñarle al chef cómo cocinar. Solo cambiaron las reglas de cómo el chef selecciona los ingredientes. Funciona "listo para usar".

Resumen

OccamToken es un filtro inteligente que evita que la IA pierda tiempo mirando ruido de fondo aburrido. En lugar de usar una regla rígida de "mantener los top 100", utiliza un "Bote de Referencia" para averiguar qué es realmente nuevo y útil para la pregunta específica que se está haciendo. Esto hace que la IA sea más rápida y barata de ejecutar sin hacerla "más tonta".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →