← Últimos artículos
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo es un marco de trabajo eficiente en el entrenamiento que aprovecha un Modelo de Visión-Lenguaje preentrenado como un codificador intrínseco para comprimir tokens visuales en un conjunto compacto de tokens de memoria, logrando un rendimiento y una estabilidad superiores a través de diversas proporciones de compresión sin requerir un reentrenamiento extensivo o módulos externos.

Autores originales: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

Publicado 2026-08-10
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo robot superinteligente que puede mirar una foto y contarte una historia sobre ella. Este robot es increíblemente talentoso, pero tiene un cerebro diminuto y muy costoso. Cuando le muestras una foto de alta definición, el robot intenta mirar cada uno de los píxeles, convirtiendo la imagen en una lista masiva de miles de pequeñas notas llamadas "tokens". Es como intentar leer una enciclopedia entera solo para decidir si una imagen muestra un gato o un perro. Este proceso es tan pesado que hace que el robot sea lento, hambriento de memoria y difícil de usar en teléfonos comunes o en situaciones de tiempo real. Los científicos han intentado enseñar al robot a ser más eficiente, generalmente tirando a la basura las notas "aburridas" (lo que a veces hace que el robot pierda detalles importantes) o construyendo una máquina nueva y pesada para ayudarlo a resumir (lo cual es caro y difícil de entrenar). La gran pregunta es: ¿Podemos hacer que el robot resuma la imagen por sí mismo, usando su propia capacidad cerebral existente, sin necesidad de una revisión masiva?

Esto es exactamente lo que los investigadores detrás de VisCo se propusieron resolver. Se dieron cuenta de que el cerebro del robot (un Modelo de Lenguaje-Visión) ya es un maestro en comprender imágenes; solo que no se le ha pedido que las resuma de manera eficiente antes. En lugar de construir una nueva herramienta o borrar notas a ciegas, VisCo trata el cerebro del robot como una máquina de compresión autónoma. Introducen un pequeño conjunto de "tokens de memoria" —piensa en ellos como unos pocos post-its en los que el robot puede escribir— y le piden al robot que lea toda la imagen y condense toda esa información en esas pocas notas. La magia ocurre porque el robot utiliza su propia "atención" interna (cómo se enfoca en diferentes partes de una imagen) para determinar qué es lo más importante, capa por capa, desde texturas simples hasta significados complejos.

El artículo concluye que este enfoque cambia las reglas del juego. Mientras que otros métodos fracasan estrepitosamente cuando se les obliga a usar muy pocas notas (como intentar describir una ciudad entera con solo una palabra), VisCo se mantiene sorprendentemente fuerte. En sus pruebas, incluso cuando comprimieron la imagen a un solo token, VisCo mantuvo aproximadamente el 85% de su inteligencia original, superando con creces a otros métodos que cayeron a alrededor del 35-50%. Lo que es aún más genial, los investigadores descubrieron que estos "post-its de memoria" no son solo una versión más pequeña de la imagen original; de hecho, capturan nuevas formas de ver la imagen que a veces pueden hacer al robot incluso más inteligente que antes. Es una forma ligera y eficiente de permitir que el robot haga más con menos, sin necesidad de reentrenar todo su cerebro desde cero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →