← Últimos artículos
💻 computer science

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP es un marco de poda de tokens visuales impulsado por texto y previo a los LLM que utiliza un pipeline de dos etapas para identificar tokens relevantes para la instrucción y mejorar la diversidad semántica, logrando retener más del 99.5% de la precisión mientras reduce la latencia de inferencia en más de 2x para los Grandes Modelos de Lenguaje-Visión.

Autores originales: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio, pero en lugar de unos pocos pistas, te entregan una biblioteca que contiene millones de libros, todos abiertos a la vez. Así es esencialmente como funcionan los modernos "Modelos de Lenguaje y Visión de Gran Escala" (LVLM, por sus siglas en inglés). Estos son programas informáticos superinteligentes que pueden mirar una imagen y responder preguntas sobre ella, como un detective digital. Para hacer esto, descomponen la imagen en miles de diminutas piezas digitales llamadas "tokens". Piensa en estos tokens como piezas individuales de un rompecabezas. El problema es que la computadora intenta leer cada una de las piezas del rompecabezas, incluso las que son solo cielo azul o un suelo vacío, antes siquiera de mirar tu pregunta. Esto hace que el proceso sea increíblemente lento y hambriento de potencia de cómputo, como intentar leer una enciclopedia entera solo para averiguar de qué color es el collar del gato.

Durante mucho tiempo, los científicos intentaron acelerar esto ya sea descartando piezas del rompecabezas al azar (lo que a veces borraba el collar del gato) o esperando hasta que la computadora ya hubiera comenzado a leer todo el libro antes de decidir qué omitir (lo cual era demasiado tarde para ahorrar tiempo). La gran pregunta era: ¿Podríamos enseñarle a la computadora a mirar primero la pregunta, y luego elegir solo las piezas específicas necesarias para responderla, sin ralentizar todo el sistema?

Aquí es donde entra un nuevo método llamado CRISP. Piensa en CRISP como un bibliotecario supereficiente que trabaja antes de que el detective comience a leer. En lugar de volcar toda la biblioteca sobre la mesa, CRISP escucha primero tu pregunta. Si preguntas "¿De qué color es el bolso?", CRISP escanea instantáneamente la imagen y toma solo las piezas del rompecabezas que muestran el bolso y el área inmediata a su alrededor. Pero no se detiene ahí; también toma algunas piezas extra para asegurarse de que el contexto del fondo (como la calle o la persona que lo sostiene) no se pierda.

Los investigadores detrás de CRISP descubrieron que este enfoque de "preguntar primero, luego mirar" es mucho más inteligente que los antiguos métodos de "mirar primero, luego preguntar". En sus pruebas, demostraron que CRISP podía descartar hasta el 88.9% de las piezas visuales del rompecabezas (reduciendo la imagen de cientos de tokens a solo 64 o 128) manteniendo la precisión de la computadora casi exactamente igual a si hubiera mirado la imagen completa. De hecho, en algunas pruebas, fue tan bueno encontrando las pistas correctas que incluso redujo las "alucinaciones", esos momentos en los que una IA inventa cosas que no están ahí.

El artículo argumenta explícitamente en contra de dos formas comunes de hacer esto hoy en día. Una forma es simplemente elegir las piezas de una imagen que parezcan más "importantes" independientemente de la pregunta (agnóstica al texto), lo cual los autores dicen que es como quedarse mirando fijamente una pintura antes de saber qué es lo que se está buscando. La otra forma es esperar hasta que la computadora esté en lo profundo de su proceso de pensamiento para empezar a eliminar piezas, lo cual los autores dicen que desperdicia demasiada energía porque la computadora ya ha hecho el trabajo duro de leer todo. CRISP rechaza ambos, demostrando que puedes ser rápido y listo al mismo tiempo al realizar la poda antes de que comience el pensamiento pesado.

Los resultados son medidos y bastante específicos. En un modelo popular llamado LLaVA-1.5, CRISP mantuvo el 99.5% del rendimiento original utilizando solo 128 tokens en lugar de los 576 habituales. En un modelo más nuevo, LLaVA-NeXT, mantuvo el 96.9% del rendimiento con solo 320 tokens. Quizás lo más impresionante es que esta aceleración no solo ahorró precisión; redujo el tiempo para obtener una respuesta en más de la mitad. Los autores sugieren que este método es una solución práctica y lista para usar para hacer que estas computadoras inteligentes de lectura de imágenes sean mucho más rápidas y baratas de ejecutar, especialmente en dispositivos que no tienen una gran cantidad de potencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →