← Últimos artículos
🤖 machine learning

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken es un embedding aprendible ligero y único que recupera eficientemente tokens visuales relevantes para la consulta de un caché KV pre-llenado, mejorando significativamente el rendimiento de los modelos de lenguaje-visión en tareas de recuperación de imágenes y videos de contexto largo mientras permanece computacionalmente factible en una sola GPU.

Autores originales: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

Publicado 2026-07-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando encontrar una aguja específica en un enorme y caótico pajar. Ahora, imagina que en lugar de un simple montón de heno, este pajar es una gigantesca biblioteca de miles de libros, y le estás pidiendo a un robot bibliotecario superinteligente que lea toda la biblioteca para encontrar la única frase que responde a tu pregunta. Este es el mundo de los "Modelos de Visión y Lenguaje" (VLM, por sus siglas en inglés), una rama de la inteligencia artificial que intenta comprender tanto las imágenes como el texto de forma conjunta.

Durante mucho tiempo, estos robots han sido excelentes analizando una sola foto o un clip corto. Pero cuando les das un video de una hora entera o una pila de cien fotos, se sienten abrumados. Es como pedirle a un humano que lea mil libros a la vez; su cerebro (o, en este caso, la memoria de la computadora) no puede retenerlo todo, y empiezan a confundirse con el ruido. Podrían mirar la página equivocada o perderse la pista por completo porque están intentando procesarlo todo al mismo tiempo. La gran pregunta que los científicos se han estado haciendo es: ¿Cómo enseñamos a estos robots a ser mejores "buscando" en su propia memoria? ¿Cómo ayudamos a que ignoren las partes aburridas y se enfoquen en el momento o la imagen exacta que importa, sin necesidad de una supercomputadora del tamaño de una casa para lograrlo?

Aquí es donde entra una nueva idea llamada ReToken. Piensa en un Modelo de Visión y Lenguaje como un detective que ha sido entrenado para resolver crímenes observando la evidencia. Por lo general, cuando le haces al detective una pregunta como "¿Dónde está el coche rojo?", el detective observa toda la evidencia (las imágenes) e intenta adivinar cuál es importante basándose en cuánta atención le presta. Los investigadores en este artículo descubrieron que este método de "atención" es, de hecho, bastante poco fiable para videos y grandes colecciones de imágenes. Es como si el detective se distrajera con un objeto brillante en el fondo y perdiera de vista el coche rojo por completo.

El equipo descubrió que la forma actual de búsqueda del robot está algo rota. Lo probaron y encontraron que, cuando el robot intenta elegir el fotograma correcto de un video usando sus señales de "atención" estándar, solo acierta aproximadamente el 5% de las veces. Básicamente, está adivinando a ciegas. También notaron algo extraño: la "atención" del robot está entrenada para predecir la siguiente palabra en una oración, no para encontrar imágenes específicas. Por lo tanto, no es muy bueno siendo un bibliotecario.

Para solucionar esto, los autores inventaron ReToken. Imagina que tienes un único "botón de búsqueda" mágico que puedes pegar a tu pregunta. En lugar de pedirle al robot que escanee toda la biblioteca, le entregas este botón especial. Este botón es una pequeña pieza de código aprendible que el robot es entrenado para usar específicamente para cazar la imagen correcta. Funciona mirando el "contenido" de las imágenes (lo que los autores llaman el espacio de "valor") en lugar de solo las "etiquetas" o "claves" que el robot suele utilizar.

Aquí está el truco de magia: los investigadores entrenaron este único "botón de búsqueda" en un pequeño conjunto de preguntas sobre imágenes. Le enseñaron a ignorar el ruido y a fijarse en el fotograma exacto que responde a la pregunta. Una vez entrenado, este pequeño token se convirtió en un recuperador súper eficiente. Cuando se le hace una pregunta al robot sobre un video largo, este token actúa como un puntero láser, encontrando instantáneamente los pocos fotogramas relevantes entre miles e ignorando el resto.

Los resultados fueron sorprendentemente sólidos. Cuando probaron esto en un desafío de "Pajar Visual" (encontrar una imagen relevante entre muchas), el robot usando ReToken mejoró su precisión en más de 13 puntos en comparación con su mejor versión anterior. Lo que es aún más impresionante, lo entrenaron solo con imágenes estáticas, pero cuando le dieron un video largo para que lo viera, ¡aún así funcionó! El conocimiento se transfirió perfectamente, mejorando las puntuaciones de comprensión de video en 8 puntos en un benchmark difícil llamado LVBench.

¿La mejor parte? Esta solución es increíblemente ligera. No requiere reconstruir todo el robot ni utilizar una supercomputadora masiva. Todo el proceso, desde el entrenamiento hasta la visualización de un video largo, cabe en una sola tarjeta gráfica de alto rendimiento (una H100). Los autores sugieren que este enfoque simple de un solo token podría ser la clave para crear una IA que realmente pueda comprender horas de video o colecciones masivas de imágenes sin perderse en los detalles. Es un pequeño cambio que ayuda al robot a ver el bosque a través de los árboles, demostrando que, a veces, no necesitas un cerebro más grande; solo necesitas una mejor forma de mirar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →