← Derniers articles
💻 computer science

UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models

UniPrune est un cadre unifié de l'élagage progressif des jetons visuels qui combine de manière synergique l'élagage de l'importance-diversité sémantique au stade de l'encodeur avec l'abandon en forme de pyramide au stade du LLM, optimisé par l'Allocation de Budget Sensible à l'Information et les mécanismes de Continuité de l'Information Inter-Stades, afin d'atteindre une efficacité et une performance supérieures dans les modèles de langage-vision de type LLaVA, même à des taux de compression extrêmes.

Auteurs originaux : Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

Publié 2026-08-31
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les systèmes d'intelligence artificielle modernes capables de voir et de parler deviennent remarquablement performants, pourtant ils imposent une lourde charge de calcul. Ces modèles de vision-langage fonctionnent en convertissant d'abord une image en une longue séquence de petits fragments numériques, souvent appelés jetons (tokens), qui représentent différentes parties de l'image. Une photographie standard peut être décomposée en des centaines de ces morceaux. Le système traite ensuite l'ensemble de cette séquence aux côtés du texte, un peu comme un humain lisant une phrase tout en regardant un diagramme. Le problème est que les opérations mathématiques requises pour connecter ces morceaux augmentent de manière exponentielle à mesure que le nombre de pièces augmente. Si une image génère 576 jetons, l'ordinateur doit effectuer un travail massif pour comprendre comment ils se rapportent les uns aux autres, même si beaucoup de ces jetons représentent des détails d'arrière-plan sans importance, comme un mur blanc ou une étendue de ciel. Cette inefficacité rend difficile l'exécution de ces systèmes puissants sur du matériel standard ou leur utilisation pour des tâches en temps réel, comme l'analyse vidéo.

Les chercheurs ont longtemps tenté de résoudre ce problème en supprimant les pièces inutiles avant que le système ne commence son travail. Certaines méthodes agissent comme un filtre dès le début, écartant les jetons uniquement sur la base de l'aspect visuel de l'image. D'autres attendent que le système ait commencé à traiter le texte et l'image ensemble, supprimant les morceaux qui semblent non pertinents par rapport à la question spécifique posée. Cependant, les deux approches présentent un angle mort. Les filtres précoces rejettent souvent des détails importants car ils ignorent ce que l'utilisateur demande, tandis que les filtres tardifs gaspillent de l'énergie à traiter l'image entière avant même de pouvoir supprimer quoi que ce soit. Une nouvelle étude introduit une approche unifiée qui combine les forces de ces deux méthodes, créant un chemin plus efficace pour ces systèmes intelligents.

Les chercheurs, dirigés par Jianhua Cui et Meizhou Ding, ont développé un cadre appelé UniPrune, qui traite la réduction de jetons comme un voyage en deux étapes plutôt que comme un événement unique. Imaginez que vous essayez de préparer une valise pour un voyage sans connaître encore la météo exacte. Vous ne mettriez pas simplement tout dedans en espérant que cela fonctionne, et vous ne décideriez pas non plus de ce qu'il faut garder après avoir déjà fait votre valise. Au lieu de cela, vous pourriez d'abord regrouper les articles similaires et ne garder que les plus représentatifs, puis, une fois votre destination connue, faire une sélection finale plus précise. C'est essentiellement ce que fait UniPrune. Il effectue d'abord un nettoyage large des données d'image en utilisant les motifs visuels, puis, au fur et à mesure que le système commence à comprendre le contexte d'une question, il effectue un second nettoyage, plus tranché.

La première étape de ce processus intervient juste après le balayage de l'image et avant que le modèle de langage ne soit impliqué. Le système regroupe les jetons visuels en grappes basées sur leur similitude, un peu comme si l'on triait un tas de photos mélangées par sujet général. À partir de chaque groupe, il conserve le jeton le plus important et écarte les autres. Cela élimine les redondances évidentes, comme plusieurs jetons représentant la même zone de ciel bleu. Cependant, les chercheurs ont réalisé que couper simplement le nombre de jetons de moitié à ce stade pourrait être risqué. Si le système coupe trop agressivement et trop tôt, il pourrait perdre un jeton crucial pour répondre à une question spécifique plus tard. Pour résoudre cela, ils ont introduit une stratégie de budgisation dynamique. Au lieu d'utiliser une règle fixe pour déterminer combien de jetons conserver à cette première étape, le système mesure la complexité de l'image. Une image simple avec un sujet clair reçoit un budget plus serré, tandis qu'une scène complexe et chargée est autorisée à conserver plus de jetons. Cela garantit que le système conserve suffisamment de détails pour gérer des questions difficiles sans gaspiller d'énergie pour des questions simples.

Une fois cette sélection initiale effectuée, les jetons restants sont transmis au grand modèle de langage, qui commence à les traiter aux côtés du texte. Ici, le système emploie une seconde stratégie de réduction qui fonctionne comme une pyramide. À mesure que les données progressent à travers les couches profondes du modèle, le système supprime progressivement davantage de jetons. La logique est qu'à mesure que le modèle comprend mieux l'image dans le contexte de la question, il devient plus clair quels éléments d'information ne sont plus nécessaires. Les chercheurs ont découvert que la manière la plus efficace de répartir le travail entre ces deux étapes n'est pas de diviser les jetons de manière égale, mais de suivre un équilibre mathématique spécifique. Ils ont découvert que le nombre idéal de jetons à conserver après la première étape est approximativement la racine carrée du produit du nombre de départ et du nombre cible final. Cette règle empirique, qu'ils appellent un budget sensible à l'information, permet au système de trouver un compromis optimal où il économise suffisamment de puissance de calcul sans sacrifier la précision des réponses.

Pour s'assurer que la première étape ne supprime pas accidentellement des jetons qui auraient été utiles à la seconde étape, les chercheurs ont ajouté une troisième couche d'intelligence. Ils ont analysé la façon dont les jetons visuels interagissent entre eux à l'intérieur même de l'encodeur d'image. Ils ont découvert que certains jetons agissent comme des intégrateurs globaux, connectant les informations à travers toute l'image, tandis que d'autres ne sont que des détecteurs locaux. En accordant un poids supplémentaire à ces intégrateurs globaux lors de la première coupe, le système garantit que les jetons transmis au modèle de langage constituent une base de haute qualité. Cette « continuité inter-étapes » signifie que la seconde étape dispose d'un meilleur point de départ, lui permettant de prendre des décisions plus intelligentes sur ce qu'il faut supprimer plus tard.

Les résultats des tests de ce cadre sur deux grandes familles de modèles de vision-langage ont été frappants. Lorsque les chercheurs ont poussé les systèmes à leurs limites extrêmes, ne conservant qu'une infime fraction des jetons originaux — parfois seulement 24 sur 576 — la nouvelle méthode a nettement surpassé les techniques existantes. Les méthodes à étape unique, qui tentent de réaliser toute la coupe en une seule fois, ont vu leur précision chuter brutalement dans ces conditions. En revanche, l'approche à deux étapes d'UniPrune a maintenu des performances élevées, répondant correctement à des questions sur des objets et des scènes que d'autres méthodes avaient manquées. Par exemple, sur un test standard de compréhension visuelle, la nouvelle méthode a conservé plus de 90 % des performances du modèle complet non compressé, tout en utilisant qu'une fraction de la puissance de calcul.

Au-delà de la précision, l'étude a également mesuré les avantages pratiques pour l'exécution de ces modèles sur du matériel réel. En réduisant le nombre de jetons tôt dans le processus, le système a considérablement abaissé la mémoire de pointe requise pour faire fonctionner le modèle. C'est un facteur critique pour le déploiement de ces technologies sur des appareils aux ressources limitées. Les chercheurs ont calculé que la nouvelle méthode réduisait le travail computationnel total de plus de la moitié par rapport à l'exécution du modèle sans aucune réduction, et encore plus par rapport aux méthodes qui attendent la fin pour couper les jetons. La surcharge ajoutée par les nouveaux mécanismes de budgisation et de notation intelligente était négligeable, représentant moins de un pour cent du temps total, ce qui signifie que les gains d'efficacité sont presque entièrement nets.

L'étude suggère que la clé d'une intelligence artificielle efficace ne réside pas seulement dans la réduction des coûts, mais dans la compréhension de l'endroit et du moment où couper. En reconnaissant que la redondance visuelle prend deux formes différentes — l'une basée sur l'image elle-même et l'autre sur la tâche à accomplir — les chercheurs ont créé un système qui gère les deux. Les conclusions indiquent qu'une approche unifiée à plusieurs étapes est supérieure à une tentative de résolution en une seule étape. Ce travail trace une voie claire pour rendre les modèles de vision-langage puissants plus rapides et plus accessibles, prouvant qu'avec la bonne stratégie, nous pouvons éliminer l'excès sans perdre l'essence même de l'intelligence de ces systèmes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →