← Últimos artículos
💬 NLP

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

El artículo propone SaMer, un marco de fusión de tokens consciente de los objetos que comprime significativamente los tokens del lado de la imagen para la recuperación de visión y lenguaje mediante la preservación de evidencia crítica a nivel de objeto durante el entrenamiento, reduciendo así los costos de almacenamiento y mejorando el rendimiento de la recuperación sin requerir cuadros delimitadores de verdad de campo durante la inferencia.

Autores originales: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva de fotos y quieres encontrar la imagen que muestra "un gato con un sombrero". En los viejos tiempos, las computadoras miraban toda la foto y le daban una única "puntuación de vibra". Pero eso es como juzgar una pizza entera solo por su olor; podrías perderte la rebanada específica con el pepperoni que tanto te apetece.

La IA moderna intenta ser más inteligente. Divide cada foto en cientos de piezas de rompecabezas diminutas (llamadas "tokens") y guarda los detalles de cada pieza por separado. Cuando haces una pregunta, la computadora revisa cada una de esas piezas del rompecabezas para encontrar la mejor coincidencia. Esto es genial para encontrar detalles específicos, pero es una pesadilla de almacenamiento. Imagina intentar cargar una biblioteca de 1,000 piezas de rompecabezas diminutas por cada foto en tu teléfono. Ocupa demasiado espacio y hace que la búsqueda sea dolorosamente lenta.

Entonces, los investigadores se preguntaron: ¿Importan todos esos tokens visuales por igual?

La respuesta, según este artículo, es un rotundo "No". Pero aquí está la parte difícil: si simplemente desechas las piezas "aburridas" o amalgamas las piezas que se ven similares, podrías accidentalmente pegar una pieza de "gato" a una de "perro" porque ambas tienen pelo. Si haces eso, tu computadora ya no podrá encontrar el "gato" específico que pediste. Es como mezclar un bloque de Lego rojo y uno azul para crear uno púrpura; ahora ya no puedes construir un castillo rojo.

La Solución: SaMer (Fusión con Conciencia Semántica)

Los autores proponen un nuevo método llamado SaMer. Piensa en SaMer como un bibliotecario superinteligente que organiza las piezas del rompecabezas antes de que siquiera hagas una pregunta.

  1. El Truco de Entrenamiento: Mientras la computadora está aprendiendo, SaMer utiliza una hoja de trucos secreta (etiquetas de objetos) para ver dónde están los objetos reales. Utiliza esto para enseñarle al sistema: "¡Oye, no pegues la oreja del gato a la cola del perro, aunque se vean similares!". Fuerza al sistema a mantener los diferentes objetos separados, incluso cuando los está comprimiendo.
  2. La Fusión Mágica: En lugar de eliminar el 93% de las piezas del rompecabezas, SaMer las mezcla suavemente en 64 "centroides" súper representativos. Estos no son simples promedios aleatorios; son resúmenes cuidadosamente elaborados que mantienen intacta la identidad de los objetos originales.
  3. El Resultado: Cuando pides "un gato", el sistema aún puede señalar directamente al resumen del "gato", ignorando el resumen del "perro", a pesar de que el resumen del "perro" esté sentado justo al lado de él.

Los Números (La Prueba)

El artículo no solo supone; probaron esto con datos reales. Esto es lo que encontraron:

  • Ahorro Masivo de Espacio: Al usar solo 64 tokens en lugar de los miles originales, redujeron el almacenamiento necesario para el sistema ColPali en un 16.09×. Eso es como encoger una biblioteca de 263.7 GB a solo 16.4 GB.
  • Impulso de Velocidad: Debido a que hay menos piezas para comparar, la búsqueda se volvió mucho más rápida. En un conjunto de datos, la velocidad (Consultas Por Segundo) saltó 4.3×, y en otro, fue casi 9.1× más rápida.
  • Mejor Precisión: Sorprendentemente, hacer la biblioteca más pequeña en realidad la hizo mejor para encontrar la foto correcta. En el conjunto de datos Flickr30K, la tasa de éxito (R@1) subió de 77.0 a 82.4. En MSCOCO, aumentó de 47.4 a 51.6.

Lo que Descartaron

Los autores fueron muy cuidadosos al decir qué es lo que no funciona. Demostraron que simplemente desechar piezas (poda o pruning) o simplemente mezclar todo basándose en cómo se ven los colores (agrupación basada solo en características o feature-only pooling) causa que la computadora pierda el rastro de objetos específicos. Si solo mezclas parches que se ven similares sin saber que pertenecen a diferentes objetos, pierdes la capacidad de distinguirlos más tarde. SaMer sugiere que la clave no es solo reducir el número de tokens, sino preservar la evidencia que las futuras preguntas necesitan para seleccionar.

¿Qué tan seguros están?

Los autores midieron esto en conjuntos de datos del mundo real como Flickr30K, MSCOCO, ImageCoDe y DocVQA. Encontraron que SaMer superó consistentemente a otros métodos de compresión. También midieron qué tan bien el sistema podía señalar la parte exacta de la imagen mencionada en el texto (localización o grounding). SaMer demostró que preservó mucho mejor la "evidencia a nivel de frase" que otros métodos, con una puntuación "BoxMass" (una medida de qué tan bien la relevancia se mantiene dentro del objeto correcto) que saltó de 41.3 a 54.2.

La Conclusión

El artículo sugiere que para que la IA busque imágenes de manera eficiente, no necesitamos borrar información; necesitamos organizarla mejor. Al fusionar los tokens de una manera que respete los límites de los objetos, SaMer demuestra que puedes reducir una base de datos de imágenes masiva en 16 veces sin perder los detalles, y de hecho, encontrar las cosas mejor que antes. Es una victoria para la velocidad, una victoria para el almacenamiento y una victoria para la precisión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →