← Derniers articles
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

Cet article introduit TOPS, une méthode d'élagage de jetons visuels sans entraînement et agnostique au modèle qui construit des ensembles de préservation optimaux basés sur la pertinence à la tâche, la couverture d'information et la diversité sémantique afin d'améliorer significativement l'efficacité de l'inférence des MLLM tout en maintenant ou en améliorant même les performances.

Auteurs originaux : Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Publié 2026-06-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque géante de livres (les jetons visuels) qu'un robot super intelligent (le Modèle de Langage Multimodal de Grande Taille) doit lire pour répondre à une question. Le problème est que la bibliothèque est si vaste que le robot est submergé, met un temps infini à lire et épuise toute son énergie rien qu'en tournant les pages.

Pendant longtemps, on a essayé d'aider le robot en lui disant : « Saute simplement les pages ennuyeuses ! » Mais les anciennes méthodes étaient un peu maladroites :

  • La méthode de l'« Attention » était comme un robot qui ne regardait que les pages avec les polices les plus grandes et les plus grasses. Elle oubliait souvent des détails importants simplement parce qu'ils étaient écrits en petits caractères, ou elle continuait à lire le même paragraphe cinq fois parce qu'il se ressemblait.
  • La méthode de la « Diversité » était comme un robot essayant de choisir des pages qui se ressemblaient peu. Il pouvait choisir une page sur un chat et une page sur une voiture, mais il pouvait accidentellement jeter la page qui répondait réellement à la question spécifique de l'utilisateur.

Entrez en scène : TOPS, le Bibliothécaire Intelligent

Le papier présente une nouvelle méthode appelée TOPS (Token Optimal Preservation Sets). Au lieu de simplement deviner quelles pages garder, TOPS agit comme un bibliothécaire hautement organisé, fondé sur des principes fondamentaux, qui pose trois questions spécifiques avant de décider ce qui reste sur l'étagère :

  1. « Cette page est-elle pertinente pour la question ? » (Pertinence de la tâche)
    • Analogie : Si l'utilisateur demande : « De quelle couleur est la voiture ? », le bibliothécaire sait immédiatement qu'il doit garder la page avec la voiture et jeter la page sur le ciel.
  2. « Cette page apporte-t-elle de nouvelles informations ? » (Couverture de l'information)
    • Analogie : Si nous avons déjà une page décrivant la peinture rouge de la voiture, nous n'avons pas besoin d'une seconde page qui dit exactement la même chose. Nous avons besoin d'une page qui nous dit quelque chose de nouveau, comme le numéro de plaque d'immatriculation de la voiture.
  3. « Cette page est-elle unique par rapport aux autres que nous avons choisies ? » (Diversité sémantique)
    • Analogie : Nous ne voulons pas une pile de cinq pages qui disent toutes « La voiture est rouge ». Nous voulons une page qui dit « Rouge », une qui dit « Rapide » et une qui dit « Vieille ». Cela garantit que nous obtenons une image complète sans répétition.

Comment cela fonctionne dans la réalité

Le papier montre que TOPS n'a pas besoin d'être enseigné (il est « sans entraînement »). Il peut être branché sur différents cerveaux de robots (comme LLaVA, Qwen ou InternVL) et fonctionne instantanément.

  • Le « Nettoyage en deux étapes » : Imaginez que le robot lit une longue vidéo.
    • Étape 1 : TOPS effectue un balayage rapide, jetant les déchets évidents (comme les images vides ou floues) avant même que le robot ne commence à réfléchir profondément.
    • Étape 2 : Pendant que le robot lit, TOPS garde un œil attentif sur la conversation. Si le robot commence à parler d'un détail spécifique, TOPS s'assure que les pages visuelles les plus pertinentes sont toujours présentes, affinant la sélection pour qu'elle soit parfaite pour cette question spécifique.

Les résultats : Moins, c'est plus

Le papier affirme qu'en utilisant cette approche intelligente à trois questions, TOPS peut jeter jusqu'à 90 % des pages visuelles (jetons) et le robot répondra aux questions aussi bien que s'il avait tout lu.

  • La statistique magique : Sur un modèle spécifique (LLaVA-NeXT), TOPS a supprimé 77,8 % des données visuelles mais a en fait amélioré légèrement les performances du robot (100,6 %).
  • Pourquoi ? Le papier suggère qu'en forçant le robot à ignorer le « superflu » et les pages redondantes, il l'empêche en réalité de s'embrouiller ou d'inventer des faits (hallucinations). C'est comme nettoyer un bureau encombré ; parfois, avoir moins de papiers aide à trouver le bon plus rapidement et à réfléchir plus clairement.

En résumé

TOPS est une nouvelle façon de rendre les modèles d'IA plus rapides et plus intelligents en étant un éditeur plus strict et plus intelligent. Au lieu de simplement choisir les indices visuels les plus « bruyants » ou les plus « différents », il construit un ensemble compact et parfait d'indices qui sont pertinents pour la question, couvrent toutes les informations nécessaires et ne se répètent pas. Le résultat est un robot qui pense plus vite, utilise moins de mémoire et donne de meilleures réponses.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →