← Derniers articles
🤖 AI

OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning

OccamToken est un cadre sans entraînement et adaptatif aux budgets qui améliore l'efficacité de l'inférence des modèles vision-langage en remplaçant le classement absolu fragile des tokens par un test d'évidence relative ancré dans des registres, permettant une compression extrême des tokens (par exemple, réduire 2 880 tokens à environ 40) tout en préservant plus de 93 % de la précision originale.

Auteurs originaux : Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Publié 2026-05-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Gros Problème : Trop de Bruit dans la Cuisine

Imaginez que vous êtes un chef (l'IA) essayant de préparer un repas basé sur la commande d'un client (la question textuelle) et un énorme tas d'ingrédients (l'image).

Dans l'IA moderne, lorsque vous montrez une image, l'ordinateur la décompose en milliers de tout petits morceaux appelés "tokens". Si vous avez une photo haute résolution, c'est comme avoir un tas de 2 880 ingrédients. Le chef doit regarder chacun d'entre eux avant de commencer à cuisiner. Cela prend énormément de temps et d'énergie (puissance de calcul), même si la plupart de ces ingrédients ne sont que du bruit de fond, comme un grain de poussière sur le comptoir ou une tache floue de ciel.

L'Ancienne Méthode : La Règle du "Top 10"

Auparavant, pour gagner du temps, on essayait de jeter les ingrédients "les moins importants". On utilisait une règle du type : "Gardez les 100 ingrédients les plus intéressants et jetez le reste."

Le papier soutient que cette règle est défaillante pour deux raisons :

  1. L'Effet "Bébé qui Crie" : Parfois, un ingrédient ennuyeux (comme un mur blanc) reçoit accidentellement un "score d'importance" très élevé simplement à cause de la façon dont l'ordinateur calcule les choses. Ce bruit fort étouffe les ingrédients importants mais discrets (comme un petit détail dans une photo), amenant l'ordinateur à penser que les choses ennuyeuses sont en fait les plus importantes.
  2. Le Problème du "Taille Unique" : Une règle fixe (comme "gardez 100") ne fonctionne pas pour chaque image.
    • Si vous demandez, "Y a-t-il un chat ?" dans une photo de forêt, vous n'avez besoin de vérifier que quelques endroits. Garder 100 endroits est gaspilleur.
    • Si vous demandez, "Quelle est la texture du tissu ?" dans une photo de pull, vous pourriez avoir besoin de regarder beaucoup plus d'endroits. Ne garder que 100 pourrait signifier que vous manquez la réponse.

La Nouvelle Solution : OccamToken

Les auteurs ont créé une nouvelle méthode appelée OccamToken. Au lieu de demander, "Quels sont les 100 meilleurs ?", ils demandent : "Cet ingrédient est-il plus utile que notre 'Pot de Référence' ?"

Voici comment cela fonctionne, étape par étape :

1. Le "Pot de Référence" (Le Token Registre)

Imaginez que vous avez un pot spécial sur le comptoir contenant un échantillon générique et moyen de "tout ce qui se trouve dans la cuisine". Il ne connaît pas les chats ou les pulls spécifiques ; il détient simplement l'"ambiance de fond" de la pièce.

  • Pourquoi cela aide : Dans l'ancien système, le "Bébé qui Crie" (le bruit ennuyeux) volait toute l'attention. Mais dans ce nouveau système, le "Pot de Référence" absorbe ce bruit. Il agit comme une éponge pour les signaux inutiles et bruyants.
  • Le Résultat : Maintenant, l'ordinateur peut clairement voir quels ingrédients sont réellement spéciaux, car le bruit a été étouffé.

2. Étape 1 : Le "Nettoyage de l'Image" (Élagage de la Redondance)

Avant même que le chef ne lise la commande du client, le personnel de cuisine fait un balayage rapide.

  • Ils comparent chaque ingrédient au Pot de Référence.
  • Si un ingrédient ressemble exactement au fond générique du pot, il est jeté.
  • Analogie : Si la photo est d'une rue animée, le personnel jette les 2 000 tokens qui ne sont que du "ciel" ou de la "chaussée floue" parce que le Pot de Référence sait déjà à quoi cela ressemble. Ils gardent les tokens qui ressemblent différemment du pot (les voitures, les gens).
  • Avantage : Cela se produit automatiquement pour chaque image. Une photo simple est fortement nettoyée ; une photo complexe est moins nettoyée.

3. Étape 2 : La Vérification de la "Commande du Client" (Élagage de la Pertinence)

Maintenant, le chef lit la question spécifique : "L'homme à gauche est-il debout ?"

  • Le chef regarde les ingrédients restants.
  • Il les compare à nouveau au Pot de Référence, mais cette fois, il se demande : "Cet ingrédient aide-t-il à répondre à la question spécifique mieux que le fond générique ?"
  • Analogie : Si la question porte sur un homme, le chef garde les tokens montrant l'homme et le sol sur lequel il se tient. Si la question porte sur un chat dans le coin, le chef garde ces tokens et jette l'homme.
  • Avantage : Le nombre d'ingrédients conservés change en fonction de la question. Une question simple pourrait ne nécessiter que 10 tokens ; une question difficile pourrait en nécessiter 50.

Les Résultats : Moins de Travail, Même Goût

Le papier a testé cela sur plusieurs modèles d'IA (comme LLaVA et Qwen).

  • L'Affirmation : Ils ont réussi à jeter 98,6 % des ingrédients (passant de 2 880 tokens à environ 40) et ont toujours obtenu la bonne réponse 93 % du temps.
  • L'Analogie : C'est comme réaliser que vous n'avez pas besoin de goûter chaque grain de riz dans une casserole pour savoir qu'il est salé. Vous avez juste besoin de goûter les bonnes cuillerées.
  • Aucun Entraînement Nécessaire : La meilleure partie est qu'ils n'ont pas eu à réapprendre au chef comment cuisiner. Ils ont simplement changé les règles de sélection des ingrédients par le chef. Cela fonctionne "prêt à l'emploi".

Résumé

OccamToken est un filtre intelligent qui empêche l'IA de perdre du temps à regarder le bruit de fond ennuyeux. Au lieu d'utiliser une règle rigide "gardez le top 100", il utilise un "Pot de Référence" pour déterminer ce qui est réellement nouveau et utile pour la question spécifique posée. Cela rend l'IA plus rapide et moins coûteuse à exécuter sans la rendre "plus bête".

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →