CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference
CRISP est un cadre de l'élagage de jetons visuels piloté par le texte et pré-LLM qui utilise un pipeline à deux étapes pour identifier les jetons pertinents par rapport à l'instruction et améliorer la diversité sémantique, atteignant plus de 99,5 % de rétention de précision tout en réduisant la latence d'inférence de plus de 2x pour les grands modèles de langage-vision.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de résoudre un mystère, mais qu'au lieu de quelques indices, on vous remet une bibliothèque contenant des millions de livres, tous ouverts en même temps. C'est essentiellement ainsi que fonctionnent les modernes « Grands Modèles de Vision-Langage » (LVLM). Ce sont des programmes informatiques super intelligents capables de regarder une image et de répondre à des questions à son sujet, comme un détective numérique. Pour ce faire, ils décomposent l'image en des milliers de minuscules morceaux numériques appelés « tokens ». Voyez ces tokens comme des pièces de puzzle individuelles. Le problème est que l'ordinateur essaie de lire chaque pièce du puzzle, même celles qui ne sont que du ciel bleu ou un sol vide, avant même d'avoir regardé votre question. Cela rend le processus incroyablement lent et gourmand en puissance informatique, comme essayer de lire une encyclopédie entière juste pour savoir de quelle couleur est le collier du chat.
Pendant longtemps, les scientifiques ont tenté d'accélérer cela soit en jetant des pièces de puzzle de manière aléatoire (ce qui supprimait parfois le collier du chat), soit en attendant que l'ordinateur ait déjà commencé à lire tout le livre avant de décider quoi ignorer (ce qui était trop tard pour gagner du temps). La grande question était : pourrions-nous apprendre à l'ordinateur à regarder la question d'abord, puis à ne choisir que les pièces de puzzle spécifiques nécessaires pour y répondre, sans ralentir tout le système ?
C'est ici qu'intervient une nouvelle méthode appelée CRISP. Voyez CRISP comme un bibliothécaire super efficace qui travaille avant même que le détective ne commence sa lecture. Au lieu de déverser toute la bibliothèque sur la table, CRISP écoute d'abord votre question. Si vous demandez : « De quelle couleur est le sac à main ? », CRISP scanne instantanément l'image et ne saisit que les pièces du puzzle qui montrent le sac à main et la zone immédiate autour de celui-ci. Il ne s'arrête pas là, cependant ; il saisit également quelques pièces supplémentaires pour s'assurer que le contexte de l'arrière-plan (comme la rue ou la personne qui le tient) ne soit pas perdu.
Les chercheurs derrière CRISP ont découvert que cette approche « demander d'abord, puis regarder » est bien plus intelligente que les anciennes méthodes « regarder d'abord, puis demander ». Dans leurs tests, ils ont montré que CRISP pouvait éliminer jusqu'à 88,9 % des pièces de puzzle visuelles (réduisant l'image de centaines de tokens à seulement 64 ou 128) tout en conservant la précision de l'ordinateur presque exactement la même que s'il avait regardé l'image entière. En fait, sur certains tests, il était si doué pour trouver les bons indices qu'il a même réduit les « hallucinations » — ces moments où une IA invente des choses qui n'existent pas.
L'article argumente explicitement contre deux façons courantes de procéder aujourd'hui. Une façon consiste à choisir simplement les pièces les plus « importantes » d'une image, quel que soit le sujet (text-agnostic), ce que les auteurs considèrent comme le fait de fixer un tableau avant de savoir ce que l'on cherche. L'autre façon consiste à attendre que l'ordinateur soit profondément engagé dans son processus de réflexion pour commencer à supprimer des pièces, ce que les auteurs disent gaspiller de l'énergie car l'ordinateur a déjà fait le travail difficile de tout lire. CRISP rejette les deux, prouvant que l'on peut être rapide et intelligent à la fois en effectuant l'élagage avant que la réflexion intense ne commence.
Les résultats sont mesurés et très précis. Sur un modèle populaire appelé LLaVA-1.5, CRISP a conservé 99,5 % de la performance originale en utilisant seulement 128 tokens au lieu des 576 habituels. Sur un modèle plus récent, LLaVA-NeXT, il a conservé 96,9 % de la performance avec seulement 320 tokens. Peut-être plus impressionnant encore, ce gain de vitesse n'a pas seulement préservé la précision ; il a réduit de plus de moitié le temps nécessaire pour obtenir une réponse. Les auteurs suggèrent que cette méthode est une solution pratique et prête à l'emploi pour rendre ces ordinateurs de lecture d'images intelligents beaucoup plus rapides et moins coûteux à exploiter, en particulier sur des appareils qui ne disposent pas de quantités massives d'énergie.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.